Локальная транскрипция речи в текст для OpenClaw с использованием Parakeet TDT 0.6b v3.

Локальная настройка транскрипции для OpenClaw
Сообщество разработчиков адаптировало модель NVIDIA Parakeet TDT 0.6b v3 для локального преобразования речи в текст в рамках OpenClaw. Модель работает через вывод ONNX на CPU, что исключает затраты на API и поддерживает 25 европейских языков.
Техническая реализация
Решение использует репозиторий GitHub (groxaxo/parakeet-tdt-0.6b-v3-fastapi-openai), который предоставляет Docker-контейнер для развёртывания на CPU. Контейнер предоставляет совместимую с OpenAI конечную точку API по адресу http://127.0.0.1:5092/v1.
Поддерживаемые языки включают: болгарский (bg), хорватский (hr), чешский (cs), датский (da), голландский (nl), английский (en), эстонский (et), финский (fi), французский (fr), немецкий (de), греческий (el), венгерский (hu), итальянский (it), латышский (lv), литовский (lt), мальтийский (mt), польский (pl), португальский (pt), румынский (ro), словацкий (sk), словенский (sl), испанский (es), шведский (sv), русский (ru) и украинский (uk).
Интеграция с OpenClaw
Разработчик предоставляет скрипт на Python для транскрипции:
#!/home/openclaw/.local/share/pipx/venvs/openai/bin/python
import sys
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:5092/v1",
api_key="sk-no-key-required"
)
audio_file = open(sys.argv[1], "rb")
transcript = client.audio.transcriptions.create(
model="parakeet-tdt-0.6b-v3",
file=audio_file,
response_format="text"
)
print(transcript)
Этот скрипт можно настроить в файле openclaw.json OpenClaw:
"tools": {
"media": {
"audio": {
"enabled": true,
"models": [
{
"type": "cli",
"command": "/home/openclaw/.local/bin/transcribe",
"args": ["{{MediaPath}}"],
"timeoutSeconds": 60
}
]
}
}
}Кроме того, OpenClaw можно настроить для прямого использования совместимой с OpenAI конечной точки API с именем модели и фиктивным ключом API из скрипта.
Примечания по развёртыванию
Разработчик протестировал это на виртуальной машине ARM64 Ubuntu Linux на Mac Mini с M4 Pro, отметив, что она должна работать достаточно быстро на любом приличном совместимом с Intel CPU. Docker-контейнер собирается в соответствии с инструкциями README в репозитории GitHub.
📖 Прочитать полный источник: r/openclaw
👀 Смотрите также

Альтернативные ИИ-агенты для программирования после удаления плана Claude
Пользователь Reddit протестировал несколько альтернатив AI-агентам для программирования после того, как Claude прекратил свой план для кодинга, включая Kimi (20$/месяц), Minimax (10$/месяц), Z.AI GLM (10$/месяц), Stepfun (6-10$/месяц), Mistral (15$/месяц) и Arcee Trinity (API-основанный).
GLiGuard: открытая модель контроля безопасности с 300 миллионами параметров обещает ускорение в 16 раз по сравнению с LLM-фильтрами
Fastino Labs выпускает GLiGuard — энкодер-модель с 300 млн параметров, которая выполняет несколько задач безопасности за один проход, сравниваясь или превосходя модели в 23–90 раз больше, работая при этом до 16 раз быстрее.

Два месяца с Spec-Kit от GitHub и Claude Code: что работает, что нет
Разработчик делится практическими заметками об использовании инструментария Spec-Driven Development от GitHub с Claude Code, охватывая пятифазовый рабочий процесс, проблемы рассинхронизации, компромиссы по накладным расходам и советы по настройке.

Обратная инженерия Apple Neural Engine для обучения моделей MicroGPT
Разработчик реверс-инженерировал приватные API нейронного движка Apple, чтобы создать конвейер обучения для модели MicroGPT с 110 млн параметров, достигнув энергоэффективности 6,6 TFLOPS/ватт на аппаратном обеспечении Mac с чипом M4.