Construyendo un sistema multiagente controlado por voz sobre Claude Code

Un desarrollador en r/ClaudeAI creó un proyecto de fin de semana que añade control por voz a Claude Code en macOS, con palabra de activación, bucle de voz WebRTC y un sistema de orquestación multiagente. Lo que empezó como un truco de conveniencia se convirtió en un sistema donde un agente principal descompone tareas, recluta subagentes y los ejecuta en paralelo con pases de QA automáticos.
Cómo funciona
- Palabra de activación: "Yabby" inicia el bucle de voz. El desarrollador eligió una palabra personalizada para evitar conflictos con Siri u otros asistentes.
- Bucle de voz: WebRTC maneja la transmisión de audio en tiempo real. El sistema usa la API Realtime de Anthropic para conversión de voz a texto y texto a voz; la latencia objetivo es inferior a 300 ms, pero la API a veces causa retrasos.
- Agente principal: Recibe la solicitud de voz, realiza una fase de descubrimiento, crea un plan de proyecto y recluta un pequeño equipo (gerente + 2-3 subagentes) para ejecutar los pasos.
- Ejecución en paralelo: Los subagentes se ejecutan en paralelo cuando es posible, secuencialmente en caso contrario. Cada agente tiene su propia sesión CLI de Claude Code con un hilo separado: las conversaciones no se mezclan.
- Auto-QA: Cuando un subagente termina, se activa un pase de revisión con un debounce de 5 segundos para evitar acumulaciones. Durante las pruebas, un agente detectó un error escrito por otro agente, un comportamiento emergente que el desarrollador no esperaba.
- Modal de aprobación del plan: Antes de que cualquier agente ejecute, aparece un modal para que el usuario revise el plan. Esto evita que el sistema ejecute acciones no verificadas.
Puntos problemáticos
- Verificación del hablante: Usa similitud de coseno en embeddings de voz. El umbral es difícil de ajustar: demasiado estricto rechaza al usuario si tiene resfriado; demasiado permisivo permite que cualquiera en la sala active comandos.
- Problemas de configuración regional: El francés era la configuración regional predeterminada porque el código estaba escrito así. El desarrollador lo está solucionando poco a poco.
- Ciclo de vida de tareas en segundo plano: Cuando el proceso CLI principal de Claude Code termina, las tareas en segundo plano mueren silenciosamente. El desarrollador escribió un vigilante de PID a nivel de SO con un script shell de contabilidad para rastrear qué servidores de larga duración han fallado.
- Sobreplanificación: El agente principal a veces produce un plan de proyecto de cuatro fases para solicitudes triviales como renombrar un archivo.
Preguntas abiertas
El desarrollador aún está averiguando cómo reducir la verbosidad en la fase de QA, si dejar que los subagentes recluten sus propios subagentes (delegación recursiva) y cómo mantener la latencia de voz por debajo de 300 ms cuando la API Realtime se vuelve inestable. También le intriga cómo el modo de voz oficial de Anthropic (implementado para el 5% de los usuarios) manejará la coordinación multiagente.
📖 Lee la fuente completa: r/ClaudeAI
👀 Ver también

LLMock: Servidor de simulación basado en HTTP para pruebas deterministas de LLM entre procesos
LLMock es un servidor HTTP real que simula las API de OpenAI, Claude y Gemini, permitiendo a los desarrolladores ejecutar pruebas deterministas en múltiples procesos sin acceder a las API reales. Admite transmisión SSE, llamadas a herramientas, enrutamiento por predicados y registro de solicitudes sin dependencias.

Presentamos Lean Collab: Un Orquestador de Múltiples Agentes para Tareas de LLM de Larga Duración.
Lean Collab es un orquestador de código abierto diseñado para gestionar tareas de LLM de larga duración utilizando subagentes paralelos y coordinados.

Puntos de Referencia de Rendimiento de LLM Local en Mac Mini con OpenClaw y LM Studio
Un usuario de Reddit publicó cifras de rendimiento para ejecutar el modelo Unsloth gpt-oss-20b-Q4_K_S.gguf localmente en un Mac Mini con 32 GB de RAM, logrando 34 tokens/segundo con un tiempo de 0.7 segundos para el primer token usando OpenClaw 2026.3.8 y LM Studio 0.4.6+1.

Títulos de artículos de Pokémon Showdown: Agentes de IA creados con APIs de LLM gratuitas y llamadas a herramientas
Un sistema que usa Llama 3, Qwen, Gemma a través de niveles gratuitos de API para jugar de forma autónoma batallas de Pokémon Showdown con llamadas a herramientas estructuradas, compatible con modos humano vs IA e IA vs IA.