Resultados do PinchBench: Primeiro Benchmark Específico para Agentes de IA de Codificação OpenClaw

PinchBench é o primeiro benchmark projetado especificamente para avaliar agentes de codificação de IA no ecossistema OpenClaw, classificando modelos por taxa de sucesso, custo e velocidade.
Principais Resultados
O benchmark testou 32 modelos. Os melhores desempenhos por taxa de sucesso:
- 1. google/gemini-3-flash-preview: 95,1% de sucesso, US$ 0,72 de custo, 254,50s de velocidade
- 2. minimax/minimax-m2.1: 93,6% de sucesso, US$ 0,14 de custo, 239,79s de velocidade
- 3. moonshotai/kimi-k2.5: 93,4% de sucesso, US$ 0,20 de custo, 291,67s de velocidade
- 4. anthropic/claude-sonnet-4.5: 92,7% de sucesso, US$ 3,07 de custo, 304,53s de velocidade
- 5. google/gemini-3-pro-preview: 91,7% de sucesso, US$ 1,48 de custo, 239,55s de velocidade
Descobertas Notáveis
- Modelos Flash superam modelos Pro com custo menor: Gemini-3-Flash-Preview (95,1%, US$ 0,72) supera Gemini-3-Pro-Preview (91,7%, US$ 1,48)
- Modelos mais caros não necessariamente têm melhor desempenho
- Minimax 2.5 ficou em 31º lugar com taxa de sucesso de 35,5%, velocidade de 105,96s (custo não listado)
- Vários modelos mostram altas taxas de sucesso acima de 90% mantendo custos abaixo de US$ 1
Faixa de Desempenho
As taxas de sucesso variam de 95,1% (topo) a 35,2% (fundo). Opções custo-efetivas incluem:
- openai/gpt-5-nano: 85,8% de sucesso por US$ 0,03
- google/gemini-2.5-flash-lite: 83,2% de sucesso por US$ 0,05
- mistralai/devstral-2512: 81,7% de sucesso por US$ 0,10
Vários modelos no final da classificação (posições 23-32) mostram taxas de sucesso em torno de 40% ou menos, com custos não listados nos dados fornecidos.
📖 Leia a fonte completa: r/openclaw
👀 See Also

Redutor de Logs MCP Server Reduz Uso de Tokens Quando o Claude Code Lê Logs
Log Reducer é um servidor MCP que processa arquivos de log no lado do servidor antes de enviar a saída reduzida para o Claude Code, evitando logs brutos na janela de contexto. Ele aplica 19 transformações determinísticas que comprimem logs em 50-90%, com um log de 2000 linhas representando mais de 20.000 tokens removidos das sessões.

Claude Code v2.1.142: Novas flags de agentes claude, Opus 4.7 padrão e correções de bugs
Claude Code v2.1.142 adiciona oito novas flags para configurar sessões em segundo plano, alterna o modo rápido para Opus 4.7 por padrão e corrige mais de uma dúzia de bugs, incluindo timeout de ferramenta MCP, problemas do daemon durante suspensão/despertar no macOS e deadlocks em unidades de rede no Windows.

Outworked v0.3.0 adiciona suporte ao iMessage, navegador integrado e agendamento para agentes Claude Code.
A versão 0.3.0 do Outworked introduz suporte para canal iMessage na comunicação entre agentes, um navegador integrado para interação web, agendamento via cron, tunelamento para compartilhamento local e suporte aprimorado para MCP/Habilidades. O aplicativo de desktop orquestra agentes Claude Code como uma equipe para lidar com tarefas de programação, pesquisa na web e fluxos de trabalho automatizados.

Cortex: Uma Camada de Memória Local para Agentes OpenClaw com Decaimento de Ebbinghaus
Cortex é uma ferramenta de memória de código aberto desenvolvida para resolver problemas de compactação de contexto em agentes OpenClaw. Ele implementa curvas de esquecimento de Ebbinghaus para decaimento de fatos, importa primeiro de arquivos e é executado como um único binário Go de 19MB com SQLite.