Multi-Agent-Haiku-System erreicht bei komplexen Zahlentheorie-Problemen Claude-Opus-Niveau bei 15-fach geringeren Kosten

✍️ OpenClawRadar📅 Veröffentlicht: 7. März 2026🔗 Source
Multi-Agent-Haiku-System erreicht bei komplexen Zahlentheorie-Problemen Claude-Opus-Niveau bei 15-fach geringeren Kosten
Ad

Versuchsaufbau und Ergebnisse

Ein Reddit-Nutzer führte einen Vergleichstest zwischen zwei Claude-Modellkonfigurationen anhand eines anspruchsvollen zahlentheoretischen Problems durch. Das Problem erforderte den Beweis, dass für eine ungerade Primzahl p die Summe 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) kongruent zu -1 (mod p) ist, unter Verwendung des kleinen Satzes von Fermat und Eigenschaften primitiver Wurzeln.

Zwei Konfigurationen wurden getestet:

  • Konfiguration X (Opus solo): Claude Opus 4.5 mit max_tokens: 2048, ohne Prüfer
  • Konfiguration Y (Haiku Multi-Agent): Haiku-Generator erstellt vollständigen Beweis, zweiter Haiku-Prüfer überprüft jeden Schritt, mit zwei Durchläufen falls der Prüfer etwas beanstandet, max_tokens: 1024 pro Aufruf

Bewertung und Leistung

Beide Konfigurationen erzielten 4/4 Punkte nach diesem Bewertungsschema:

  • Korrekte Anwendung des kleinen Satzes von Fermat
  • Korrekte Behandlung des Arguments mit primitiven Wurzeln
  • Gültige Summation über vollständiges Restsystem
  • Kongruenzschluss folgt korrekt

Der Haiku-Prüfer gab VERIFIZIERT ohne Beanstandungen zurück. Leistungskennzahlen:

  • Opus solo: ~8,7 Sekunden, Punktzahl 4/4
  • Haiku + Prüfer: ~10,9 Sekunden, Punktzahl 4/4
Ad

Kostenanalyse

Die wirtschaftlichen Auswirkungen sind bedeutend:

  • Opus solo: 0,075 US-Dollar/1000 Tokens × ~800 Tokens = ~0,06 US-Dollar pro Abfrage
  • Haiku + Haiku: 0,0025 US-Dollar/1000 Tokens × ~1600 Tokens = ~0,004 US-Dollar pro Abfrage

Dies entspricht etwa 15-mal niedrigeren Kosten für identische Ergebnisse bei diesem Problem. Das Problem wurde als "echt schwierig" beschrieben und nicht wie einfachere Beweise aus Trainingsdaten offensichtlich.

Die Quelle weist darauf hin, dass bei klaren Problemen, bei denen der kleine Satz von Fermat die Hauptarbeit leistet (jedes a^(p-1) ≡ 1, Summe (p-1) Einsen, ergibt p-1 ≡ -1), das Prüfermuster etwa 17 % Zeitaufwand hinzufügt, um die Korrektheit zu bestätigen. Das Muster ist besonders wertvoll für Probleme, bei denen der Generator mit Quantisierungsstockungen oder halluzinierter Algebra stolpern könnte.

📖 Quelle vollständig lesen: r/ClaudeAI

Ad

👀 Siehe auch

Manifest Router fügt ZAI-Abonnementunterstützung für OpenClaw-Modellverwaltung hinzu
Werkzeuge

Manifest Router fügt ZAI-Abonnementunterstützung für OpenClaw-Modellverwaltung hinzu

Der Manifest-Router unterstützt jetzt ZAI-Abonnements, sodass alle ZAI-Modelle in den Routing-Ebenen erscheinen und automatisch pro Anfrage das passende Modell ausgewählt wird. Das Tool befindet sich in der Beta-Phase, ist kostenlos, Open Source und enthält ein Dashboard zur Kostenverfolgung pro Agent, Nachricht und Modell.

OpenClawRadar
Pepper MCP Server für iOS-Simulator-Interaktion und -Debugging
Werkzeuge

Pepper MCP Server für iOS-Simulator-Interaktion und -Debugging

Pepper ist ein MCP-Server, der eine dylib über DYLD_INSERT_LIBRARIES in iOS-Simulator-Apps injiziert und Echtzeit-Interaktion, Bildschirmlesen, Button-Tippen, Variableninspektion und Netzwerkverkehrsüberwachung durch eine WebSocket-Brücke ermöglicht.

OpenClawRadar
Open-Source-Wissensdatenbank-Server und Multi-Agent-Orchestrator für persistente KI-Speicherung
Werkzeuge

Open-Source-Wissensdatenbank-Server und Multi-Agent-Orchestrator für persistente KI-Speicherung

Ein Entwickler hat einen benutzerdefinierten MCP-Server auf einem privaten VPS eingerichtet, um Claude, Codex und Gemini persistenten Speicher über Sitzungen hinweg zu ermöglichen, mit einem Wissensbasisserver, der Obsidian-Vaults verarbeitet, und einem Multi-Agent-Orchestrator namens Daniel für Failover.

OpenClawRadar
Claude Code-Fähigkeit kombiniert Ansätze von DeepMind Aletheia und Anthropic Harness
Werkzeuge

Claude Code-Fähigkeit kombiniert Ansätze von DeepMind Aletheia und Anthropic Harness

Eine Claude Code-Fähigkeit implementiert eine Planner→Generator→Evaluator→Reviser-Pipeline, die DeepMinds Aletheia-Mathematik-Forschungsagenten mit Anthropics Multi-Agenten-Codearchitektur synthetisiert und dabei eine blinde Voranalyse hinzufügt, bei der der Evaluator über korrekte Ansätze nachdenkt, bevor er Kandidatencode sieht.

OpenClawRadar