マルチエージェント俳句システム、複素数理論問題でClaude Opusと同等の性能を15分の1のコストで達成

実験設定と結果
Redditユーザーが、難しい数論問題について2つのClaudeモデル構成を比較テストしました。この問題は、奇素数pに対して、和1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1)が-1 (mod p)と合同であることを、フェルマーの小定理と原始根の性質を用いて証明することを要求するものでした。
2つの構成がテストされました:
- 構成X(Opus単独): Claude Opus 4.5、max_tokens: 2048、監査役なし
- 構成Y(俳句マルチエージェント): 俳句生成器が完全な証明を生成し、2番目の俳句監査役がすべてのステップをチェックし、監査役が何かをフラグした場合は2回のパスを実行、max_tokens: 各呼び出し1024
採点とパフォーマンス
両構成は以下の採点基準で4/4を獲得しました:
- フェルマーの小定理を正しく援用
- 原始根の議論を正しく扱う
- 完全剰余系上の総和が有効
- 合同関係の結論が正しく導かれる
俳句監査役は不一致なくVERIFIEDを返しました。パフォーマンス指標:
- Opus単独: 約8.7秒、スコア4/4
- 俳句+監査役: 約10.9秒、スコア4/4
コスト分析
経済的影響は重要です:
- Opus単独: $0.075/1000トークン × 約800トークン = 1クエリあたり約$0.06
- 俳句+俳句: $0.0025/1000トークン × 約1600トークン = 1クエリあたり約$0.004
これは、同一の結果に対して約15倍低いコストを表しています。この問題は「真に難しい」とされ、単純な証明のようなトレーニングデータから明らかなものではありませんでした。
ソースでは、フェルマーの小定理が重い処理を行う(各a^(p-1) ≡ 1、和(p-1)個の1、p-1 ≡ -1を得る)クリーンな問題では、監査役パターンは正しさを確認するために約17%の時間的コストを追加すると指摘されています。このパターンは、生成器が量子化の詰まりや幻覚的な代数でつまずく可能性がある問題において特に価値があります。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

Flash-MOEベンチマーク on M5 Max: Qwen3.5-397Bで12.99 tok/s
3970億パラメータのQwen3.5モデルを、128GB RAM搭載のMacBook Pro M5 Maxでローカル実行したベンチマークでは、4ビット量子化とcache-io-split 4を使用して1秒あたり12.99トークンを達成し、元の48GBベンチマークの3倍の速度を実現しました。

開発者がローカルコーディングタスクでQwen3.5 27Bと大規模モデルを比較テスト
開発者が複数のQwen3.5およびNemotronモデルをテストし、既存の2x RTX 3090ハードウェア上での開発タスクにおいて、Qwen3.5-27B-GGUF:UD-Q6_K_XLが良好に動作することを発見しました。256kコンテキストで803 ppおよび25 tg/sをvast.ai上で達成しました。

Flash-MoE:純粋なC/MetalでMacBook Pro上で397BパラメータのQwenモデルを実行
Flash-MoEは、純粋なC/Metal推論エンジンで、3970億パラメータのMixture-of-ExpertsモデルであるQwen3.5-397B-A17Bを、48GB RAMのMacBook Proで4.4+トークン/秒で実行します。209GBのモデルは、Pythonやフレームワークなしで、カスタムMetalコンピュートシェーダーを介してSSDからストリーミングされます。

PeaDB: C++20でAIアシスタントを用いてコーディングされたRedis互換データベース
開発者がPeaDBを作成しました。これはC++20で書かれたRedis 7.2.5の互換品で、Codex、Copilot、Claudeを使用し、約147のコマンドを実装し、永続性、レプリケーション、クラスターサポートを備えています。ベンチマークではRedisに近い性能を示しています。