Qwen3.5 35B-A3B MoE ejecuta un flujo de trabajo agencial de 27 pasos localmente en hardware de gama media.

Demostración de flujo de trabajo agéntico local
Un desarrollador en r/LocalLLaMA reportó ejecutar exitosamente un flujo de trabajo agéntico complejo localmente usando Qwen3.5 35B-A3B MoE. El modelo ejecutó una cadena de procesamiento de video de 27 pasos de forma autónoma en hardware de gama media.
Detalles del flujo de trabajo
La tarea involucró procesar un video desde un solo comando en lenguaje natural:
- Subir un video
- Transcribir con Whisper
- Editar los subtítulos
- Incrustar subtítulos nuevamente en el video con estilo personalizado
El flujo de trabajo consistió en 27 llamadas secuenciales a herramientas incluyendo: extract_audio, transcribe, read_file, edit_file, burn_subtitles, más pasos de verificación. El modelo planificó, ejecutó, verificó cada paso y se autocorrigió cuando fue necesario.
Especificaciones técnicas
Hardware:
- Estación de trabajo móvil Lenovo ThinkPad P53
- Procesador Intel i7-9850H
- Quadro RTX 3000 (6GB VRAM)
- 48GB RAM DDR4 2666MT/s
Pila de software:
- Implementación completamente local con llama.cpp + whisper.cpp
- No se usaron APIs en la nube
Configuración del modelo:
- Qwen3.5 35B-A3B MoE con cuantización Q4_K_M
- Arquitectura MoE con ~3B parámetros activos por token
- Cabe y ejecuta en 6GB VRAM con capas descargadas
- Base de conocimiento completa de 35B parámetros
Resultados de rendimiento
El flujo de trabajo completo se ejecutó en aproximadamente 10 minutos, con la mayor parte del tiempo dedicado a inferencia. El desarrollador notó cero errores y cero intervención humana requerida durante la cadena de 27 pasos. La arquitectura MoE hizo esto factible en hardware de gama media manteniendo bajo el conteo de parámetros activos mientras conservaba la capacidad completa del modelo.
Esto demuestra que los flujos de trabajo agénticos locales se están volviendo prácticos en hardware de nivel consumidor, particularmente con modelos MoE que equilibran el conteo de parámetros activos para velocidad contra el conteo total de parámetros para capacidad.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Patrones Prácticos de Configuración de OpenClaw de Implementaciones en el Mundo Real
Un usuario de Reddit comparte información sobre la configuración de OpenClaw para más de 10 usuarios no técnicos, revelando que las implementaciones exitosas suelen incluir 1-2 aplicaciones de mensajería, 5-10 flujos de trabajo simples, operación local en Mac y la clonación de voz como un factor clave de adopción.

El usuario de OpenClaw pasa de configuraciones complejas de agentes a una automatización práctica, ahorrando de 8 a 10 horas semanales.
Un desarrollador que ejecutó OpenClaw durante un mes abandonó los elaborados sistemas multiagente y se centró en automatizar la gestión de sitios web a través de GitHub. La configuración actual produce 30 publicaciones en 4 semanas, reduciendo el trabajo semanal de 8-10 horas a aproximadamente 20 minutos diarios para revisión.

Freelancer no técnico utiliza MaxClaw y MiniMax Agent para ampliar servicios.
Un estratega de redes sociales sin conocimientos de programación utiliza MiniMax Agent para crear páginas de destino y MaxClaw para gestionar briefs de clientes e investigación de contenido, aumentando las tarifas de proyecto de $1,500 a $3,200.

Depurando un BadUSB de Pi Zero 2W con Claude Code: Solucionando un error 'imposible'
Un desarrollador reconstruyó un kit BadUSB para Pi Zero 2W con Claude Code, que diagnosticó un bug de señal errónea, confirmó empíricamente limitaciones de hardware y arregló un no-op silencioso en Python en menos de 4 horas.