AI円卓会議:構造化された質問で200以上のAIモデルを比較するツール

AIラウンドテーブルは、構造化された質問に対して複数のAIモデルの回答を比較できるウェブベースのツールです。このツールは、Hacker Newsの「Car Wash Test」投稿に関する議論を受けて作成されました。
主な機能
このツールは以下の具体的な機能を提供します:
- 質問設定:ユーザーが質問を入力し、回答オプションを定義します
- モデル選択:200以上のモデルから一度に最大50個まで選択できます
- 一貫したテスト条件:すべてのモデルは、システムプロンプトなし、構造化された出力、各モデルに同じ設定という同一条件下で独立して回答します
- 議論機能:モデルが互いの推論を見て、考えを変える機会を得られる議論ラウンドを実行できます
- レビュアーモデル:レビュアーモデルが回答の完全なトランスクリプトを要約します
- アクセス:サインアップ不要、無料で利用可能
- インフラストラクチャ:すべてのモデルはOpper(制作者のスタートアップ)経由でルーティングされます
実用的な用途
この種のツールは、AIエージェントを扱う開発者が、特定の質問やシナリオにおけるモデルの性能を体系的に比較するのに役立ちます。すべてのモデルに同一の条件を提供することで、手動テストよりも客観的な比較が可能になります。議論機能により、モデルが代替的な視点にさらされたときに推論をどのように調整するかを観察でき、協調的または反復的な文脈におけるモデルの挙動を理解するのに価値があります。
制作者はコミュニティからのフィードバックを積極的に求めており、登録要件なしでツールをすぐに利用できるようにしています。
📖 Read the full source: HN AI Agents
👀 See Also

ミア:ネイティブAndroidアプリとP2Pストリーミングを備えたローカルAIワークスペースデーモン
Miaは、あなたのマシン上で動作するデーモンで、P2P接続によりネイティブAndroidアプリとペアリングし、スマートフォンから長時間実行されるAIコーディングタスクを開始・監視できるようにします。OpenCode、Claude Code、Gemini CLI、Codexエージェントをサポートし、出力をリアルタイムでデバイスに直接ストリーミングします。

ベンチマーク結果:Mac Mini M4 16GBでテストされた331個のGGUFモデル
Mac Mini M4(16GB RAM)で331のGGUFモデルをベンチマークした結果、パレート最適モデルはわずか11モデルで、すべてがMixture-of-Expertsアーキテクチャでした。Mixture-of-Expertsモデルは性能を支配し、中央値で20.0トークン/秒を達成(密モデルは4.4トークン/秒)。

パイロットシェル:Claude Codeのための構造化ワークフローレイヤー
Pilot ShellはClaude Code上にインストールするオープンソースのレイヤーで、スペック駆動のTDDワークフロー、品質フック、コンテキストエンジニアリング、トークン最適化を提供します。マルチエージェントフレームワークの複雑さはありません。

Claude Code プラグイン /verify: 計画から自動ブラウザテストを実行
/verifyは、あなたの計画を読み取り、Playwright MCPを介して実際のブラウザを起動し、各要件をチェックして、スクリーンショット付きの合格/不合格レポートを提供するオープンソースのClaude Codeプラグインです。