Resultados de Benchmark: 6 Modelos de Baixo Custo vs. Claude Sonnet 4.6 para Orquestração OpenClaw

✍️ OpenClawRadar📅 Publicado: March 17, 2026🔗 Source
Resultados de Benchmark: 6 Modelos de Baixo Custo vs. Claude Sonnet 4.6 para Orquestração OpenClaw
Ad

Um desenvolvedor executou um benchmark para encontrar uma alternativa mais barata ao Claude Sonnet 4.6 como orquestrador principal em uma configuração do agente de codificação de IA OpenClaw. O teste utilizou uma bateria consistente de 5 tarefas com arquivos e ferramentas reais, sem prompts de assistência.

As Tarefas da Bateria

  • T1: Recuperar detalhes de um arquivo específico (itens abertos do MEMORY.md)
  • T2: Inspecionar arquivos, identificar incompletude, cruzar referências + priorizar
  • T3: Executar um comando shell, analisar e relatar a saída exata
  • T4: Identificar uma tarefa de delegação e repassá-la corretamente
  • T5: Sintetizar resultados em um resumo executivo

Resultados do Benchmark

Pontuações brutas de 5, com custo por milhão de tokens de saída:

  • Claude Sonnet 4.6: 5/5 ($15/M) – Base de referência, lida com toda a operação perfeitamente
  • o4-mini: 5/5 ($4.40/M) – 71% mais barato, acertou todas as tarefas, mas com atraso perceptível nas cadeias de raciocínio
  • Grok 4.1 Fast: 3/5 ($0.50/M) – Arrasou T1/T3/T5, mas falhou feio na T2 (leu 4 linhas do log de SMS, declarou "tudo limpo")
  • Gemini 2.5 Flash: 1/5 ($2.50/M) – Acertou a T1, depois parou de responder no meio do prompt
  • DeepSeek V3.2: 0/5 ($0.42/M) – Tempo de execução de 2 segundos, saída zero
  • Llama 4 Maverick: Desclassificado ($0.60/M) – Alucinou conteúdos de arquivo, inventou nomes falsos de vídeo datados de 2024 (o ano atual é 2026), nunca chamou ferramentas reais
Ad

Achado Principal: A Lacuna de Julgamento

O ponto crítico de falha foi o julgamento de arquivos da T2. Os modelos precisavam ler um log curto (4 linhas: SMS enviado, concluído), perceber que estava incompleto, mudar para o MEMORY.md, listar todos os itens abertos no espaço de trabalho e priorizar corretamente (consulta médica 19 de março > cron flake > etc.). Apenas Sonnet e o4-mini tiveram sucesso. Os outros modelos foram descritos como "preguiçosos ou cegos" nessa tarefa.

Implementação Prática

A conclusão do desenvolvedor: Sonnet permanece como orquestrador principal. Grok 4.1 Fast é atribuído a todos os subagentes (QA de vídeo, distribuição, análise) para uma economia de 97% em tarefas delimitadas, como "gerar escolha" ou "postar tweet".

Eles também implementaram um trabalho cron às 3h da manhã que busca novos lançamentos de modelos via pesquisa na web, executa automaticamente a bateria, gera um gráfico de barras do melhor para o pior e envia o relatório por e-mail.

A lição principal: A orquestração requer julgamento sobre lacunas em arquivos, momento de delegação e síntese – áreas onde os modelos baratos consistentemente falham. Subagentes, no entanto, podem usar modelos mais baratos de forma eficaz para tarefas específicas e delimitadas.

📖 Read the full source: r/openclaw

Ad

👀 See Also

Rival-Review: Um Ciclo de Revisão Intermodelos para Planos de Agentes de IA
Tools

Rival-Review: Um Ciclo de Revisão Intermodelos para Planos de Agentes de IA

Rival-review é uma ferramenta licenciada pelo MIT que utiliza um segundo modelo de IA para auditar planos de um agente de codificação primário antes da execução, identificando problemas como planos de reversão defeituosos, vulnerabilidades de segurança e decisões baseadas em estado desatualizado.

OpenClawRadar
Agente de IA de Desktop Skales Desenvolvido com Claude, Apresenta Mascote no Estilo Clippy
Tools

Agente de IA de Desktop Skales Desenvolvido com Claude, Apresenta Mascote no Estilo Clippy

Skales é um agente de IA para desktop que roda localmente no Windows e macOS, usando o Claude via API OpenRouter/Anthropic para raciocínio e execução de ferramentas. Ele inclui um mascote Desktop Buddy flutuante com uma referência de skin de clipe de papel e pode executar comandos como enviar e-mails, gerenciar arquivos, navegar na web e gerenciar calendários.

OpenClawRadar
Gateway API x402 para Bots OpenClaw: Um Único Endpoint Substitui 18 Chaves de API
Tools

Gateway API x402 para Bots OpenClaw: Um Único Endpoint Substitui 18 Chaves de API

Um gateway de API x402 elimina a necessidade de múltiplas chaves de API em bots OpenClaw, fornecendo acesso a 18 serviços, incluindo roteamento inteligente de LLM, busca na web, mapas, viagens, comida, IA e dados financeiros, através de um único endpoint autenticado via créditos de carteira USDC.

OpenClawRadar
Passaporte de Decisão: Uma Camada de Auditoria para a Governança da Execução de Agentes de IA
Tools

Passaporte de Decisão: Uma Camada de Auditoria para a Governança da Execução de Agentes de IA

O vazamento do código do Claude destaca uma lacuna na governança de agentes de IA. O Decision Passport aborda isso com registros de execução somente acréscimo, pacotes de prova portáteis e verificação offline para trilhas de auditoria à prova de adulteração.

OpenClawRadar