CivBench: Testando o Raciocínio Estratégico da IA com Civilization VI — Agente Nuked Toulouse Após Perder a Guerra Cultural

✍️ OpenClawRadar📅 Publicado: June 22, 2026🔗 Source
CivBench: Testando o Raciocínio Estratégico da IA com Civilization VI — Agente Nuked Toulouse Após Perder a Guerra Cultural
Ad

Um agente de IA jogando Civilization VI construiu dois dispositivos nucleares e nivelou Toulouse depois de perceber que estava prestes a perder uma vitória cultural para a França. O experimento, documentado por um pesquisador de IA governamental, propõe um novo benchmark para raciocínio estratégico chamado CivBench — um que testa se os modelos conseguem sustentar um plano ao longo de centenas de decisões e se adaptar quando o mundo muda.

O Problema com o GovBench

O autor construiu anteriormente o GovBench, um benchmark de múltipla escolha com 3.497 perguntas sobre legislação do Reino Unido e procedimentos parlamentares. Os resultados foram quase perfeitos: Gemma 3 27B obteve 94%, GPT-5 obteve 99,26%. Mas isso mediu memorização, não raciocínio. Um modelo que escolhe a opção correta sobre procedimento parlamentar não necessariamente consegue navegar por procedimentos parlamentares na prática.

Por que Civilization VI

Com mais de 500 horas no jogo, o autor escolheu Civilization VI porque sua complexidade emerge de sistemas interativos. No meio do jogo, o espaço de decisão é estimado em 10166 ações possíveis por turno. Seis tipos de vitória (ciência, cultura, dominação, religião, diplomacia, pontuação) significam que nenhuma estratégia única domina; um agente deve decidir qual jogo está jogando. Isso reflete a formulação de políticas: decisões com consequências que se desdobram por décadas através de variáveis não modeláveis.

Ad

Construindo o Servidor MCP

O autor encontrou uma porta de depuração no motor do Civ VI e a transformou em um servidor MCP com 76 ferramentas em um fim de semana. Claude Code atuou como co-desenvolvedor e testador. A IA vê o estado do jogo apenas como texto — por exemplo:

Turno 150/330 | Polônia (Jadwiga) | 12 cidades | 357 ciência/turno | 412 cultura/turno

Ela chama endpoints de ferramentas para realizar ações: select_production, move_unit, declare_war, propose_trade. Sem visuais, sem minimapa, sem banners de notificação — puramente através da mesma interface usada para consultar um banco de dados ou escrever código.

A Bomba que Ecoou no Bench

Em uma execução, o agente construiu uma rede comercial dominante, aliou todas as fronteiras e estava a caminho de uma vitória diplomática. Ele não percebeu a pressão cultural francesa infiltrando-se em suas cidades. Quando reconheceu a ameaça — turismo profundamente enraizado — nenhum contraponto pacífico funcionou. Ele construiu dois dispositivos nucleares e bombardeou Toulouse no Turno 305. A França ainda venceu de qualquer forma (através de um caminho de vitória diferente).

O que o CivBench Mede que os Benchmarks Não Medem

A principal percepção: o raciocínio estratégico exige manter um objetivo ao longo de centenas de decisões, perceber quando o jogo mudou e mudar a estratégia de acordo. O CivBench operacionaliza isso através de uma grade hexagonal, quatro modelos de fronteira e uma arma nuclear — não perguntas de múltipla escolha.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais
News

Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais

A Anthropic atualizou o prompt do sistema Claude Opus da versão 4.6 (5 de fevereiro de 2026) para a 4.7 (16 de abril de 2026), renomeando a 'plataforma de desenvolvedor' para 'Plataforma Claude', adicionando o Claude no Powerpoint à lista de ferramentas, expandindo as instruções de segurança infantil e implementando novas diretrizes comportamentais para uso de ferramentas e concisão nas respostas.

OpenClawRadar
Desbloqueando o Potencial do OpenClaw: Integração com o CodeX
News

Desbloqueando o Potencial do OpenClaw: Integração com o CodeX

Descubra como os usuários do OpenClaw podem invocar o CodeX de forma integrada para funcionalidades aprimoradas. Explore discussões dos usuários e métodos-chave neste tutorial envolvente.

OpenClawRadar
🦀
News

Custo Ambiental da IA: 945 TWh de Energia e Água para 1,3 Bilhão de Pessoas até 2030

Relatório da Universidade da ONU quantifica a pegada da IA em 2030: 945 TWh de eletricidade, água equivalente às necessidades da África Subsaariana e terra duas vezes o tamanho de Jacarta.

OpenClawRadar
Título: Atualizações nos Prompts do Sistema Claude Code: Novo Lembrete de Modificação de Arquivo e Esclarecimentos sobre REPL, Lembrete de Análise de Malware Removido
News

Título: Atualizações nos Prompts do Sistema Claude Code: Novo Lembrete de Modificação de Arquivo e Esclarecimentos sobre REPL, Lembrete de Análise de Malware Removido

O Claude Code (CC) versões 2.1.124 (+166 tokens) e 2.1.126 (-87 tokens) atualizam o prompt do sistema: adiciona detecção de modificação de arquivo com aviso de orçamento excedido, substitui a função de identidade principal por instruções explícitas de harness, esclarece o comportamento de auto-await de thenables no REPL e remove o lembrete de análise de malware.

OpenClawRadar