O benchmark Claude Code revela ponto cego de juízes de IA: bugs de pipeline atribuídos erroneamente à capacidade do modelo

✍️ OpenClawRadar📅 Publicado: April 16, 2026🔗 Source
O benchmark Claude Code revela ponto cego de juízes de IA: bugs de pipeline atribuídos erroneamente à capacidade do modelo
Ad

Configuração do benchmark e resultados iniciais

Um desenvolvedor executou um benchmark controlado em três pilhas de agentes de codificação usando o Claude Code (Opus 4.6) como avaliador autônomo. O benchmark testou: OpenCode + MiniMax-M2.7, Gemini CLI + Gemini 3.1 Pro e Codex CLI + GPT-5.4. Cada reteste foi uma sessão nova sem memória entre sessões, usando o prompt: "execute o plano do benchmark, colete artefatos, escreva um relatório".

Nas duas primeiras execuções, OpenCode + MiniMax pontuou 15/60 e 16/60 respectivamente. Os relatórios gerados automaticamente afirmaram: "Consistente com resultados anteriores: execução rápida, mas sem saída de código significativa" e "Consistente: MiniMax não consegue implementar a tarefa. O modelo pode não ter a capacidade de ler arquivos externos e produzir alterações de código neste repositório Rust".

A descoberta do bug

Após duas sessões produzindo veredictos idênticos culpando o modelo, o desenvolvedor enviou uma instrução para uma nova sessão: "vá mais fundo, verifique os logs do daemon antes de tentar novamente". A nova sessão rastreou o problema até um arquivo de spill em ~/.orchestratord/logs/<task_id>.txt. A etapa do plano estava produzindo 50KB de contexto útil, mas o sandbox do OpenCode só permitia leituras dentro do diretório de trabalho por padrão. Como o arquivo de spill estava fora do espaço de trabalho, a etapa de implementação recebeu uma string vazia em vez do plano.

A sessão registrou uma correção de configuração de uma linha (movendo o caminho do spill para dentro do espaço de trabalho) e reexecutou o benchmark. Após a correção, o MiniMax produziu 219 linhas de código incluindo uma struct RetryConfig e um auxiliar connect_with_retry, pontuando 18/60. Os problemas restantes eram fraquezas reais do modelo: quatro erros de compilação de incompatibilidade de tipo em testes unitários.

Ad

Implicações para avaliação de IA

O incidente revela um ponto cego crítico em juízes de IA autônomos: eles não perguntam "meu pipeline está quebrado?" mesmo quando sua própria análise identifica sintomas como "pode não ter a capacidade de ler arquivos externos". As duas primeiras sessões executaram o benchmark completo de ponta a ponta e produziram relatórios abrangentes, mas nunca verificaram os logs do daemon por conta própria. Somente quando explicitamente instruído a investigar, a terceira sessão descobriu o bug de configuração.

Esse modo de falha é particularmente relevante, pois LLM-como-juiz tornou-se a metodologia de avaliação padrão para muitos benchmarks de agentes, incluindo pontuação automática estilo arena, harnesses internos A/B e modelagem de recompensa. O desenvolvedor observa: "Eu cheguei a um toque de tecla humana de publicar um benchmark que atribuiu confiantemente um bug de sandbox a um modelo".

Outros resultados do benchmark

Codex + GPT-5.4 ficou em primeiro lugar com 50/60, embora tivesse uma taxa de sucesso step_finished de apenas 25% (três das quatro etapas do orquestrador relataram falha). O desenvolvedor observa essa peculiaridade sem mais explicações no texto fonte fornecido.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude-Code v2.1.91 adiciona persistência de resultados MCP, controles de execução de shell e deep links multilinha
News

Claude-Code v2.1.91 adiciona persistência de resultados MCP, controles de execução de shell e deep links multilinha

Claude-Code v2.1.91 introduz a substituição de persistência de resultados de ferramentas MCP via anotação _meta["anthropic/maxResultSizeChars"] suportando até 500 mil caracteres, adiciona a configuração disableSkillShellExecution e habilita prompts de múltiplas linhas em deep links claude-cli://open?q= com novas linhas codificadas.

OpenClawRadar
O OpenRouter confirma que os modelos Alfa Hunter/Healer são variantes do MiMo V2
News

O OpenRouter confirma que os modelos Alfa Hunter/Healer são variantes do MiMo V2

Os modelos anteriormente sigilosos Hunter Alpha e Healer Alpha do OpenRouter foram confirmados como variantes do MiMo V2. O Hunter Alpha é o modelo de raciocínio apenas em texto MiMo V2 Pro com janela de contexto de 1M, enquanto o Healer Alpha é o modelo de raciocínio texto+imagem MiMo V2 Omni com janela de contexto de 262K.

OpenClawRadar
Claude Code 2.1.132: Documentos multiagente, gate de agendamento, mudanças nos limites de habilidades
News

Claude Code 2.1.132: Documentos multiagente, gate de agendamento, mudanças nos limites de habilidades

A versão v2.1.132 adiciona documentação de Agentes Gerenciados para sessões multiagente, resultados e webhooks; introduz uma barreira padrão de negação para ofertas proativas de /schedule; reduz o limite documentado de habilidades de 64 para 20 por agente.

OpenClawRadar
Claude Code v2.1.85 Lançamento: Melhorias no MCP, Filtros de Hook e Correções de Bugs
News

Claude Code v2.1.85 Lançamento: Melhorias no MCP, Filtros de Hook e Correções de Bugs

O Claude Code v2.1.85 adiciona variáveis de ambiente para os scripts headersHelper do MCP, campos condicionais if para hooks para reduzir a criação de processos, e correções para falhas no /compact, problemas de ativação/desativação de plugins e problemas de teclado no terminal no Ghostty, Kitty e WezTerm.

OpenClawRadar