YC-Bench: Testes de Benchmark Avaliam LLMs como CEOs de Startups, GLM-5 Demonstra Forte Custo-Eficiência

YC-Bench: Um Benchmark de Simulação de Startup de Longo Horizonte
Pesquisadores desenvolveram o YC-Bench, um benchmark onde um LLM assume o papel de CEO em um ambiente simulado de startup ao longo de um ano completo, envolvendo centenas de turnos de decisão. A simulação requer gerenciar funcionários, selecionar contratos, lidar com a folha de pagamento e navegar em um mercado onde aproximadamente 35% dos clientes secretamente inflam os requisitos de trabalho após a aceitação da tarefa. O feedback é atrasado e esparso, sem orientação fornecida aos modelos.
Resultados do Benchmark e Principais Descobertas
O benchmark testou 12 modelos com 3 seeds cada. O ranking mostra:
- 🥇 Claude Opus 4.6 - US$ 1,27 milhão em fundos finais médios (~US$ 86 por execução em custo de API)
- 🥈 GLM-5 - US$ 1,21 milhão em fundos finais médios (~US$ 7,62 por execução)
- 🥉 GPT-5.4 - US$ 1,00 milhão em fundos finais médios (~US$ 23 por execução)
- Todos os outros modelos tiveram desempenho abaixo do capital inicial de US$ 200 mil, com vários indo à falência
O GLM-5 é destacado como uma descoberta significativa, desempenhando-se dentro de 5% do Claude Opus em desempenho bruto, enquanto custa aproximadamente 11× menos para executar. Para pipelines agentes de produção, isso representa uma melhoria substancial na eficiência de custos. O Kimi-K2.5 realmente lidera o gráfico de receita por dólar de API, sendo 2,5× melhor que o próximo modelo.
O que o Benchmark Revela Sobre as Capacidades dos LLMs
O benchmark expõe a coerência de longo horizonte sob feedback atrasado, uma capacidade que a maioria das avaliações perde. Quando o feedback imediato não está disponível para determinar a qualidade da decisão, a maioria dos modelos entra em colapso em loops, abandona estratégias recentemente estabelecidas ou continua aceitando tarefas de clientes que já identificaram como problemáticos.
O maior preditor de sucesso não foi o tamanho do modelo ou as pontuações tradicionais de benchmark, mas se o modelo usou ativamente um rascunho persistente para registrar informações aprendidas. Os modelos de melhor desempenho reescreveram suas anotações aproximadamente 34 vezes por execução, enquanto os modelos de pior desempenho tiveram uma média de 0–2 entradas.
Recursos e Implementação
O benchmark é totalmente de código aberto, com código disponível no GitHub. O artigo fornece metodologia e resultados detalhados, enquanto o ranking mostra as classificações atuais dos modelos. Os pesquisadores incentivam outros a executarem seus próprios modelos e estão disponíveis para responder a consultas.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Quando comentaristas online 'detectam' minha arte como IA: a frustração de David Revoy
O artista David Revoy compartilha capturas de tela de comentaristas online acusando falsamente sua arte desenhada à mão de ser gerada por IA, apesar de compartilhar timelapses. Ele explora o problema em sua história em quadrinhos 'Problema de Autenticidade'.

Uso de IA no Desenvolvimento Atinge 93%, Mas Ganhos de Produtividade Estagnam em 10%
O uso de assistentes de codificação com IA é predominante entre desenvolvedores, com 93% adotando-os. No entanto, o aumento de produtividade permanece limitado a apenas 10%.

Modelo Subquadratic estreia janela de contexto de 12 milhões de tokens para modelos de IA
Subquadratic lança uma janela de contexto de 12 milhões de tokens, quebrando limites anteriores para inferência de LLM e permitindo o processamento de codebases inteiras em uma única passagem.

Projeto SDL Proíbe Commits Escritos por IA em Resposta a Problema no GitHub
O projeto SDL implementou uma política que proíbe commits gerados por IA após uma issue no GitHub levantar preocupações sobre o uso do Copilot em revisões de código. A issue menciona especificamente as revisões #13277 e #12730 como exemplos onde foi detectada assistência de IA.