Transcripción local de voz a texto para OpenClaw utilizando Parakeet TDT 0.6b v3

Configuración local de transcripción para OpenClaw
Un desarrollador de la comunidad ha adaptado el modelo Parakeet TDT 0.6b v3 de NVIDIA para la transcripción local de voz a texto dentro de OpenClaw. El modelo se ejecuta mediante inferencia ONNX en CPU, eliminando los costos de API y admitiendo 25 idiomas europeos.
Implementación técnica
La solución utiliza un repositorio de GitHub (groxaxo/parakeet-tdt-0.6b-v3-fastapi-openai) que proporciona un contenedor Docker para implementación en CPU. El contenedor expone un endpoint de API compatible con OpenAI en http://127.0.0.1:5092/v1.
Los idiomas admitidos incluyen: búlgaro (bg), croata (hr), checo (cs), danés (da), neerlandés (nl), inglés (en), estonio (et), finés (fi), francés (fr), alemán (de), griego (el), húngaro (hu), italiano (it), letón (lv), lituano (lt), maltés (mt), polaco (pl), portugués (pt), rumano (ro), eslovaco (sk), esloveno (sl), español (es), sueco (sv), ruso (ru) y ucraniano (uk).
Integración con OpenClaw
El desarrollador proporciona un script de Python para la transcripción:
#!/home/openclaw/.local/share/pipx/venvs/openai/bin/python
import sys
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:5092/v1",
api_key="sk-no-key-required"
)
audio_file = open(sys.argv[1], "rb")
transcript = client.audio.transcriptions.create(
model="parakeet-tdt-0.6b-v3",
file=audio_file,
response_format="text"
)
print(transcript)
Este script se puede configurar en el archivo openclaw.json de OpenClaw:
"tools": {
"media": {
"audio": {
"enabled": true,
"models": [
{
"type": "cli",
"command": "/home/openclaw/.local/bin/transcribe",
"args": ["{{MediaPath}}"],
"timeoutSeconds": 60
}
]
}
}
}Alternativamente, OpenClaw se puede configurar para usar directamente el endpoint de API compatible con OpenAI con el nombre del modelo y la clave API ficticia del script.
Notas de implementación
El desarrollador probó esto en una máquina virtual Ubuntu ARM64 en un Mac Mini con M4 Pro, señalando que debería ejecutarse razonablemente rápido en cualquier CPU compatible con Intel decente. El contenedor Docker se construye siguiendo las instrucciones del README en el repositorio de GitHub.
📖 Read the full source: r/openclaw
👀 Ver también

HyperResearch: El conjunto de habilidades de código abierto de Claude Code lo convierte en un agente de investigación profunda
HyperResearch convierte Claude Code en un pipeline de investigación profunda de 16 pasos con almacenamiento persistente de conocimiento, verificación de hechos y sesiones web autenticadas. Instalación de código abierto con un solo comando, supera a OpenAI y Google en DeepResearch Bench.

Operaciones de Fundador en Claude: 19 Habilidades Reutilizables para Startups en Etapa Temprana
Un fundador que vendió su primera startup publicó 19 prompts de habilidades compatibles con Claude para funciones como posicionamiento, precios, prospección y redacción, basados en sus propios SOP y flujos de trabajo de Notion.

Mentor de Carreras Multi-Agente Desarrollado con Ollama y MCP para IA Local
Un desarrollador construyó un sistema de IA de 5 agentes que analiza currículums y genera informes de inteligencia profesional usando Ollama con llama3 localmente. El sistema encadena las salidas de los agentes para que cada uno se base en el contexto anterior, con MCP manejando la integración de herramientas.
Encuesta de servidores de memoria Markdown local para agentes de IA: Mem0, Hindsight, Zep y el recién llegado Engram
Un usuario probó ~20 sistemas de memoria local para agentes que almacenan memorias como archivos editables. Engram (de Obsidian68) fue el único que cumplió con todos los requisitos: completamente local, almacenamiento en Markdown, deduplicación inteligente, decaimiento de importancia y servidor independiente.