Sistema Multiagente de Haicai Iguala Claude Opus em Problema de Teoria dos Números Complexos com Custo 15x Menor

Configuração Experimental e Resultados
Um usuário do Reddit conduziu um teste comparativo entre duas configurações do modelo Claude em um problema desafiador de teoria dos números. O problema exigia provar que, para um número primo ímpar p, a soma 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) é congruente a -1 (mod p), usando o Pequeno Teorema de Fermat e propriedades de raízes primitivas.
Duas configurações foram testadas:
- Configuração X (Opus solo): Claude Opus 4.5 com max_tokens: 2048, sem auditor
- Configuração Y (multiagente Haiku): Gerador Haiku produz a prova completa, segundo auditor Haiku verifica cada etapa, com duas passagens se o auditor sinalizar algo, max_tokens: 1024 por chamada
Pontuação e Desempenho
Ambas as configurações marcaram 4/4 usando esta rubrica:
- Invoca corretamente o Pequeno Teorema de Fermat
- Lida corretamente com o argumento de raiz primitiva
- Soma sobre o sistema completo de resíduos válida
- Conclusão de congruência segue corretamente
O auditor Haiku retornou VERIFICADO sem discordância. Métricas de desempenho:
- Opus solo: ~8,7 segundos, pontuação 4/4
- Haiku + auditor: ~10,9 segundos, pontuação 4/4
Análise de Custo
As implicações econômicas são significativas:
- Opus solo: US$ 0,075/1000 tokens × ~800 tokens = ~US$ 0,06 por consulta
- Haiku + Haiku: US$ 0,0025/1000 tokens × ~1600 tokens = ~US$ 0,004 por consulta
Isso representa aproximadamente 15 vezes menor custo para resultados idênticos neste problema. O problema foi descrito como "genuinamente difícil" e não óbvio nos dados de treinamento como provas mais simples.
A fonte observa que em problemas limpos onde o Pequeno Teorema de Fermat faz o trabalho pesado (cada a^(p-1) ≡ 1, soma (p-1) uns, obtém p-1 ≡ -1), o padrão de auditor adiciona cerca de 17% de tempo extra para confirmar a correção. O padrão é particularmente valioso para problemas onde o gerador pode tropeçar com gagueira de quantização ou álgebra alucinada.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Jeeves: Interface de Usuário em Terminal para Navegar e Retomar Sessões de Agentes de IA
Jeeves é uma interface de usuário de terminal que permite pesquisar, visualizar e retomar sessões de agentes de IA do Claude Code, Codex e OpenCode em uma única visualização. Ele é escrito em Go e está disponível através de vários gerenciadores de pacotes, incluindo Homebrew, Nix e Go install.

Sub-rotinas de IA: Automação Determinística de Navegador com Custo Zero de Tokens
Os Subrotinas de IA do rtrvr.ai permitem que você grave tarefas do navegador uma vez como ferramentas acionáveis que são reproduzidas dentro do contexto da página da web com autenticação propagada gratuitamente, eliminando custos de inferência de LLM e não-determinismo para tarefas repetitivas.

Coordenador de Servidor para Desenvolvimento Multi-Agente Evita Sobrescritas
Um desenvolvedor criou um servidor coordenador em Node.js que gerencia bloqueio de intervalos de linhas, rastreamento de deslocamento de linhas e mensagens em tempo real entre agentes de IA trabalhando na mesma base de código. O sistema evita que os agentes sobrescrevam o trabalho uns dos outros usando bloqueio baseado em HTTP com detecção de conflitos.

Habilidade GAN para Claude Code: Ferramenta de IA Adversarial para Refinamento de Ideias
Uma habilidade do Claude Code chamada /gan usa funções adversárias de IA para criticar e melhorar ideias através de fases alternadas de Discriminador e Gerador, com recursos como modos de intensidade, saída multilíngue e seleção forçada de função desenvolvidos por meio de autoiteração.