O Qwen3.5 35B-A3B MoE executa um fluxo de trabalho agente de 27 etapas localmente em hardware de médio porte.

Demonstração de fluxo de trabalho agêntico local
Um desenvolvedor no r/LocalLLaMA relatou executar com sucesso um fluxo de trabalho agêntico complexo localmente usando o Qwen3.5 35B-A3B MoE. O modelo executou uma cadeia de processamento de vídeo de 27 etapas de forma autônoma em hardware de médio porte.
Detalhes do fluxo de trabalho
A tarefa envolveu processar um vídeo a partir de um único prompt em linguagem natural:
- Carregar um vídeo
- Transcrever com Whisper
- Editar as legendas
- Inserir legendas de volta no vídeo com estilo personalizado
O fluxo de trabalho consistiu em 27 chamadas de ferramentas sequenciais incluindo: extract_audio, transcribe, read_file, edit_file, burn_subtitles, além de etapas de verificação. O modelo planejou, executou, verificou cada etapa e se autocorrigiu quando necessário.
Especificações técnicas
Hardware:
- Estação de trabalho móvel Lenovo ThinkPad P53
- Processador Intel i7-9850H
- Quadro RTX 3000 (6GB VRAM)
- 48GB DDR4 2666MT/s RAM
Pilha de software:
- Implementação totalmente local com llama.cpp + whisper.cpp
- Nenhuma API de nuvem utilizada
Configuração do modelo:
- Qwen3.5 35B-A3B MoE com quantização Q4_K_M
- Arquitetura MoE com ~3B parâmetros ativos por token
- Cabe e executa em 6GB VRAM com camadas descarregadas
- Base de conhecimento completa de 35B parâmetros
Resultados de desempenho
O fluxo de trabalho completo foi executado em aproximadamente 10 minutos, com a maior parte do tempo gasto em inferência. O desenvolvedor observou zero erros e zero intervenção humana necessária durante a cadeia de 27 etapas. A arquitetura MoE tornou isso viável em hardware de médio porte mantendo a contagem de parâmetros ativos baixa, enquanto preservava toda a capacidade do modelo.
Isso demonstra que fluxos de trabalho agênticos locais estão se tornando práticos em hardware de nível consumidor, particularmente com modelos MoE que equilibram a contagem de parâmetros ativos para velocidade contra a contagem total de parâmetros para capacidade.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Infraestrutura Agêntica: Substituindo o Splunk por Agentes Claude Code para Monitoramento de Servidores
Um desenvolvedor implanta sessões Claude Code como serviços — roteador, monitores, coletor do painel — conectados via hub WebSocket. Vigilantes são bash baratos; o LLM acorda a cada 5 min para ciclo de drenagem. Os blocos do painel são consultas em linguagem natural armazenadas em cache no SQLite.

Testando o Claude Sonnet com um Jogo de Tabuleiro Estratégico: Desafios de Adesão às Regras
Um desenvolvedor testou o Claude Sonnet jogando OFMOS® Essential, um jogo de tabuleiro estratégico patenteado sobre gestão de portfólio de produtos, usando um sistema de prompts estruturado com regras, representação do tabuleiro e gerenciamento de turnos. O modelo entendeu as regras e acompanhou as pontuações, mas frequentemente fez movimentos ilegais devido à falta de geração de movimentos restrita.

Utilizador descobre diagnóstico de encefalopatia hipóxico-isquémica através de conversa com Claude
Um jovem de 22 anos de São Paulo usou o Claude para identificar encefalopatia hipóxico-isquêmica após 22 anos de diagnóstico incorreto. A IA ajudou a conectar complicações no parto com sintomas cognitivos persistentes que não se encaixavam no autismo.

O desenvolvedor de jogos usa o OpenClaw para coleta automatizada de feedback e refatoração de código.
Um desenvolvedor de jogos executa o OpenClaw como um serviço em segundo plano em um MacBook para gerenciar dois projetos: Heretical (um jogo na Steam) e Duskland (um projeto em TypeScript). O sistema utiliza modelos Claude via Discord e Telegram, com arquivos de memória em Markdown armazenados localmente.