Multi-Agent-Haiku-System erreicht bei komplexen Zahlentheorie-Problemen Claude-Opus-Niveau bei 15-fach geringeren Kosten

Versuchsaufbau und Ergebnisse
Ein Reddit-Nutzer führte einen Vergleichstest zwischen zwei Claude-Modellkonfigurationen anhand eines anspruchsvollen zahlentheoretischen Problems durch. Das Problem erforderte den Beweis, dass für eine ungerade Primzahl p die Summe 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) kongruent zu -1 (mod p) ist, unter Verwendung des kleinen Satzes von Fermat und Eigenschaften primitiver Wurzeln.
Zwei Konfigurationen wurden getestet:
- Konfiguration X (Opus solo): Claude Opus 4.5 mit max_tokens: 2048, ohne Prüfer
- Konfiguration Y (Haiku Multi-Agent): Haiku-Generator erstellt vollständigen Beweis, zweiter Haiku-Prüfer überprüft jeden Schritt, mit zwei Durchläufen falls der Prüfer etwas beanstandet, max_tokens: 1024 pro Aufruf
Bewertung und Leistung
Beide Konfigurationen erzielten 4/4 Punkte nach diesem Bewertungsschema:
- Korrekte Anwendung des kleinen Satzes von Fermat
- Korrekte Behandlung des Arguments mit primitiven Wurzeln
- Gültige Summation über vollständiges Restsystem
- Kongruenzschluss folgt korrekt
Der Haiku-Prüfer gab VERIFIZIERT ohne Beanstandungen zurück. Leistungskennzahlen:
- Opus solo: ~8,7 Sekunden, Punktzahl 4/4
- Haiku + Prüfer: ~10,9 Sekunden, Punktzahl 4/4
Kostenanalyse
Die wirtschaftlichen Auswirkungen sind bedeutend:
- Opus solo: 0,075 US-Dollar/1000 Tokens × ~800 Tokens = ~0,06 US-Dollar pro Abfrage
- Haiku + Haiku: 0,0025 US-Dollar/1000 Tokens × ~1600 Tokens = ~0,004 US-Dollar pro Abfrage
Dies entspricht etwa 15-mal niedrigeren Kosten für identische Ergebnisse bei diesem Problem. Das Problem wurde als "echt schwierig" beschrieben und nicht wie einfachere Beweise aus Trainingsdaten offensichtlich.
Die Quelle weist darauf hin, dass bei klaren Problemen, bei denen der kleine Satz von Fermat die Hauptarbeit leistet (jedes a^(p-1) ≡ 1, Summe (p-1) Einsen, ergibt p-1 ≡ -1), das Prüfermuster etwa 17 % Zeitaufwand hinzufügt, um die Korrektheit zu bestätigen. Das Muster ist besonders wertvoll für Probleme, bei denen der Generator mit Quantisierungsstockungen oder halluzinierter Algebra stolpern könnte.
📖 Quelle vollständig lesen: r/ClaudeAI
👀 Siehe auch

Manifest Router fügt ZAI-Abonnementunterstützung für OpenClaw-Modellverwaltung hinzu
Der Manifest-Router unterstützt jetzt ZAI-Abonnements, sodass alle ZAI-Modelle in den Routing-Ebenen erscheinen und automatisch pro Anfrage das passende Modell ausgewählt wird. Das Tool befindet sich in der Beta-Phase, ist kostenlos, Open Source und enthält ein Dashboard zur Kostenverfolgung pro Agent, Nachricht und Modell.

Pepper MCP Server für iOS-Simulator-Interaktion und -Debugging
Pepper ist ein MCP-Server, der eine dylib über DYLD_INSERT_LIBRARIES in iOS-Simulator-Apps injiziert und Echtzeit-Interaktion, Bildschirmlesen, Button-Tippen, Variableninspektion und Netzwerkverkehrsüberwachung durch eine WebSocket-Brücke ermöglicht.

Open-Source-Wissensdatenbank-Server und Multi-Agent-Orchestrator für persistente KI-Speicherung
Ein Entwickler hat einen benutzerdefinierten MCP-Server auf einem privaten VPS eingerichtet, um Claude, Codex und Gemini persistenten Speicher über Sitzungen hinweg zu ermöglichen, mit einem Wissensbasisserver, der Obsidian-Vaults verarbeitet, und einem Multi-Agent-Orchestrator namens Daniel für Failover.

Claude Code-Fähigkeit kombiniert Ansätze von DeepMind Aletheia und Anthropic Harness
Eine Claude Code-Fähigkeit implementiert eine Planner→Generator→Evaluator→Reviser-Pipeline, die DeepMinds Aletheia-Mathematik-Forschungsagenten mit Anthropics Multi-Agenten-Codearchitektur synthetisiert und dabei eine blinde Voranalyse hinzufügt, bei der der Evaluator über korrekte Ansätze nachdenkt, bevor er Kandidatencode sieht.