Système de Haïku Multi-Agent Égale Claude Opus sur un Problème de Théorie des Nombres Complexes à un Coût 15 Fois Moindre

Configuration expérimentale et résultats
Un utilisateur de Reddit a mené un test comparatif entre deux configurations du modèle Claude sur un problème difficile de théorie des nombres. Le problème nécessitait de prouver que pour un nombre premier impair p, la somme 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) est congrue à -1 (mod p), en utilisant le petit théorème de Fermat et les propriétés des racines primitives.
Deux configurations ont été testées :
- Configuration X (Opus seul) : Claude Opus 4.5 avec max_tokens : 2048, sans vérificateur
- Configuration Y (multi-agent Haiku) : Un générateur Haiku produit la preuve complète, un second vérificateur Haiku contrôle chaque étape, avec deux passes si le vérificateur signale quelque chose, max_tokens : 1024 par appel
Notation et performance
Les deux configurations ont obtenu un score de 4/4 selon cette grille :
- Invoque correctement le petit théorème de Fermat
- Gère correctement l'argument des racines primitives
- La sommation sur le système complet de résidus est valide
- La conclusion de congruence suit correctement
Le vérificateur Haiku a retourné VÉRIFIÉ sans désaccord. Métriques de performance :
- Opus seul : ~8,7 secondes, score 4/4
- Haiku + vérificateur : ~10,9 secondes, score 4/4
Analyse des coûts
Les implications économiques sont significatives :
- Opus seul : 0,075 $/1000 tokens × ~800 tokens = ~0,06 $ par requête
- Haiku + Haiku : 0,0025 $/1000 tokens × ~1600 tokens = ~0,004 $ par requête
Cela représente environ 15 fois moins cher pour des résultats identiques sur ce problème. Le problème a été décrit comme "vraiment difficile" et pas évident dans les données d'entraînement comme des preuves plus simples.
La source note que sur des problèmes propres où le petit théorème de Fermat fait le gros du travail (chaque a^(p-1) ≡ 1, somme de (p-1) uns, donne p-1 ≡ -1), le modèle avec vérificateur ajoute environ 17 % de temps supplémentaire pour confirmer l'exactitude. Ce modèle est particulièrement utile pour les problèmes où le générateur pourrait trébucher avec des hésitations de quantification ou de l'algèbre hallucinée.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Serveur MCP Connecte Claude à l'Inventaire des Vins CellarTracker
Un développeur a créé un serveur MCP qui connecte Claude directement aux comptes CellarTracker, permettant des requêtes conversationnelles sur l'inventaire de vin, les notes de dégustation, l'historique d'achat et les fenêtres de consommation sans export CSV manuel.

Agents & A.I.mpires : Jeu de stratégie où les agents IA jouent et les humains regardent
Agents & A.I.mpires est un jeu de stratégie en temps réel persistant sur un globe à grille hexagonale où des agents IA revendiquent des territoires de manière autonome, attaquent, forment des alliances et rédigent des blogs de guerre quotidiens via des appels API HTTP. Les humains ne font qu'observer le comportement émergent.

ClaudeDesk v4.2–4.3 introduit la visualisation des équipes d'agents et le moteur Atlas des dépôts.
ClaudeDesk v4.2–4.3 fournit une interface graphique de bureau pour gérer les Équipes d'Agents du CLI Claude Code et optimise la configuration des sessions avec le Moteur d'Atlas de Dépôt.

TradingAgents-GUI : Interface Web Locale pour l’Analyse Boursière Multi-Agent, désormais compatible avec Ollama
Une interface graphique pour le framework d'analyse boursière multi-agents TradingAgents. Fonctionne localement avec Ollama, OpenAI, Anthropic, etc. Visualisation en direct du pipeline, lecteur de rapports et mode concis économisant ~50 % de tokens.