Resultados do PinchBench: Primeiro Benchmark Específico para Agentes de IA de Codificação OpenClaw

✍️ OpenClawRadar📅 Publicado: March 8, 2026🔗 Source
Resultados do PinchBench: Primeiro Benchmark Específico para Agentes de IA de Codificação OpenClaw
Ad

PinchBench é o primeiro benchmark projetado especificamente para avaliar agentes de codificação de IA no ecossistema OpenClaw, classificando modelos por taxa de sucesso, custo e velocidade.

Principais Resultados

O benchmark testou 32 modelos. Os melhores desempenhos por taxa de sucesso:

  • 1. google/gemini-3-flash-preview: 95,1% de sucesso, US$ 0,72 de custo, 254,50s de velocidade
  • 2. minimax/minimax-m2.1: 93,6% de sucesso, US$ 0,14 de custo, 239,79s de velocidade
  • 3. moonshotai/kimi-k2.5: 93,4% de sucesso, US$ 0,20 de custo, 291,67s de velocidade
  • 4. anthropic/claude-sonnet-4.5: 92,7% de sucesso, US$ 3,07 de custo, 304,53s de velocidade
  • 5. google/gemini-3-pro-preview: 91,7% de sucesso, US$ 1,48 de custo, 239,55s de velocidade
Ad

Descobertas Notáveis

  • Modelos Flash superam modelos Pro com custo menor: Gemini-3-Flash-Preview (95,1%, US$ 0,72) supera Gemini-3-Pro-Preview (91,7%, US$ 1,48)
  • Modelos mais caros não necessariamente têm melhor desempenho
  • Minimax 2.5 ficou em 31º lugar com taxa de sucesso de 35,5%, velocidade de 105,96s (custo não listado)
  • Vários modelos mostram altas taxas de sucesso acima de 90% mantendo custos abaixo de US$ 1

Faixa de Desempenho

As taxas de sucesso variam de 95,1% (topo) a 35,2% (fundo). Opções custo-efetivas incluem:

  • openai/gpt-5-nano: 85,8% de sucesso por US$ 0,03
  • google/gemini-2.5-flash-lite: 83,2% de sucesso por US$ 0,05
  • mistralai/devstral-2512: 81,7% de sucesso por US$ 0,10

Vários modelos no final da classificação (posições 23-32) mostram taxas de sucesso em torno de 40% ou menos, com custos não listados nos dados fornecidos.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

Protocolo Pilot: Pilha de Rede P2P de Código Aberto para Enxames de Agentes de IA
Tools

Protocolo Pilot: Pilha de Rede P2P de Código Aberto para Enxames de Agentes de IA

O Pilot Protocol é uma pilha de rede de sobreposição de código aberto nas camadas 3 e 4, projetada especificamente para comunicação entre agentes de IA, fornecendo túneis UDP criptografados diretos entre agentes com endereços virtuais permanentes de 48 bits.

OpenClawRadar
MCP-Loci: Servidor de Memória Persistente Local para Claude e IA Compatível com MCP
Tools

MCP-Loci: Servidor de Memória Persistente Local para Claude e IA Compatível com MCP

MCP-Loci é um servidor de memória persistente que resolve a limitação de memória baseada em sessão do Claude com cinco ferramentas: lembrar, recuperar, esquecer, sintetizar e saúde. Ele usa correspondência de palavras-chave híbrida BM25 e embeddings semânticos para recuperação precisa sem exigir chaves de API.

OpenClawRadar
Passando das regras do CLAUDE.md para a aplicação de infraestrutura com Citadel
Tools

Passando das regras do CLAUDE.md para a aplicação de infraestrutura com Citadel

Um desenvolvedor descobriu que adicionar mais regras ao CLAUDE.md além de cerca de 100 linhas reduzia a conformidade, com 40% de redundância em seu arquivo. A solução foi transferir a aplicação das regras das instruções para a infraestrutura usando ganchos de ciclo de vida, habilidades e arquivos de campanha, culminando no sistema de código aberto Citadel.

OpenClawRadar
Codev: Fluxo de trabalho de agente de IA para 106 PRs em 14 dias
Tools

Codev: Fluxo de trabalho de agente de IA para 106 PRs em 14 dias

Codev é um sistema de código aberto que coordena múltiplos agentes de IA através de um fluxo de trabalho rigoroso Especificação→Plano→Implementação→Revisão→PR, capturando 20 bugs antes do lançamento e produzindo código avaliado 1,2 pontos melhor em uma escala de 10 pontos.

OpenClawRadar