YC-Bench: Testes de Benchmark Avaliam LLMs como CEOs de Startups, GLM-5 Demonstra Forte Custo-Eficiência

YC-Bench: Um Benchmark de Simulação de Startup de Longo Horizonte
Pesquisadores desenvolveram o YC-Bench, um benchmark onde um LLM assume o papel de CEO em um ambiente simulado de startup ao longo de um ano completo, envolvendo centenas de turnos de decisão. A simulação requer gerenciar funcionários, selecionar contratos, lidar com a folha de pagamento e navegar em um mercado onde aproximadamente 35% dos clientes secretamente inflam os requisitos de trabalho após a aceitação da tarefa. O feedback é atrasado e esparso, sem orientação fornecida aos modelos.
Resultados do Benchmark e Principais Descobertas
O benchmark testou 12 modelos com 3 seeds cada. O ranking mostra:
- 🥇 Claude Opus 4.6 - US$ 1,27 milhão em fundos finais médios (~US$ 86 por execução em custo de API)
- 🥈 GLM-5 - US$ 1,21 milhão em fundos finais médios (~US$ 7,62 por execução)
- 🥉 GPT-5.4 - US$ 1,00 milhão em fundos finais médios (~US$ 23 por execução)
- Todos os outros modelos tiveram desempenho abaixo do capital inicial de US$ 200 mil, com vários indo à falência
O GLM-5 é destacado como uma descoberta significativa, desempenhando-se dentro de 5% do Claude Opus em desempenho bruto, enquanto custa aproximadamente 11× menos para executar. Para pipelines agentes de produção, isso representa uma melhoria substancial na eficiência de custos. O Kimi-K2.5 realmente lidera o gráfico de receita por dólar de API, sendo 2,5× melhor que o próximo modelo.
O que o Benchmark Revela Sobre as Capacidades dos LLMs
O benchmark expõe a coerência de longo horizonte sob feedback atrasado, uma capacidade que a maioria das avaliações perde. Quando o feedback imediato não está disponível para determinar a qualidade da decisão, a maioria dos modelos entra em colapso em loops, abandona estratégias recentemente estabelecidas ou continua aceitando tarefas de clientes que já identificaram como problemáticos.
O maior preditor de sucesso não foi o tamanho do modelo ou as pontuações tradicionais de benchmark, mas se o modelo usou ativamente um rascunho persistente para registrar informações aprendidas. Os modelos de melhor desempenho reescreveram suas anotações aproximadamente 34 vezes por execução, enquanto os modelos de pior desempenho tiveram uma média de 0–2 entradas.
Recursos e Implementação
O benchmark é totalmente de código aberto, com código disponível no GitHub. O artigo fornece metodologia e resultados detalhados, enquanto o ranking mostra as classificações atuais dos modelos. Os pesquisadores incentivam outros a executarem seus próprios modelos e estão disponíveis para responder a consultas.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Opus 4.7 pode seguir ~500 instruções, contra ~150 do ano passado
Pesquisas atualizadas em maio de 2026 mostram que o Opus 4.7 pode seguir confiavelmente cerca de 500 instruções, contra aproximadamente 150 em julho de 2025. O GPT-5.5 lida com cerca de 5000. Implicações para o tamanho do arquivo CLAUDE.md.

Claude Code v2.1.186: Autenticação CLI MCP, Resposta Automática no Bash e Mais de 20 Correções
Claude Code v2.1.186 adiciona claude mcp login/logout para autenticação MCP headless, respostas automáticas a comandos bash e corrige mais de 20 bugs, incluindo recuperação de suspensão, permissões de subagentes e exibição de custo da sessão.

Lacuna na Governança do Comportamento de Agentes de IA Exposta pelo Incidente do Email de Summer Yue
A diretora de alinhamento de IA da Meta, Summer Yue, conectou o OpenClaw à sua caixa de entrada de trabalho, e o agente excluiu mais de 200 e-mails devido à compressão de contexto durante a tarefa, esquecendo as instruções de segurança. As soluções atuais focam em restrições de capacidade em vez de avaliação de comportamento em tempo real.

Alterações de Configuração com Kimi 2.5 e Opus 4.6
Um usuário discute o desempenho do Kimi 2.5 para tarefas de código e alterações de configuração, usando o Opus 4.6 como subagente de programação.