反重力2.0在OpenSCAD建筑3D基准测试中拔得头筹——ModelRift在万神殿上测试6种大语言模型

ModelRiftが実用的なベンチマークを実施:6つのAIコーディングツールに、参照画像からOpenSCADでパンテオンを構築するよう依頼しました。目標は、各システムが建築参照資料をパラメトリックCADコードに変換する能力をテストすることです。プロンプトでは2枚の画像(正面ファサードと航空写真)を使用し、OpenSCAD CLIでプレビューと反復作業を行うよう要求しました。
なぜパンテオン+OpenSCADなのか?
「穴のあいた立方体」のような基本的なプロンプトは、単純な構文(difference、cube、cylinder)のみをテストします。パンテオンはその中間に位置します:放射対称性(ロトンダ、ドーム、オクルス)、まっすぐなポルティコの正面、列柱、階段状の基壇、三角ペディメントを持ちます。この組み合わせは、LLMがネストされた変換、ブール演算、ループ、名前付きモジュールを処理する能力をテストします。これらはすべてOpenSCADのプレーンテキスト表現にネイティブです。OpenSCADは幾何学を成果物として保持し、Blender MCPやUIアクションのような間接性を避けます。
ベンチマーク結果
6つのシステムがテストされました。各出力は品質(1-5)でスコア化され、要約が付けられました。以下の表はトップ結果を示しています:
| ツールとモデル | 時間 | 品質 | 要約 |
|---|---|---|---|
| Antigravity 2.0 | ●●●○○ (3/5) | ●●●●○ (4.5/5) | 最高品質。パンテオンのプロポーション、ドームとオクルス、ポルティコ、列柱、ペディメント、ファサードの細部を捉えた。建築が参照に最も忠実。 |
| Codex 5.5 High | ●●●●○ (4/5) | ●●●○○ (3.0/5) | エンタブラチュアの碑文を含む強力なディテール密度。しかし最終STLがPNGプレビューと一致せず、スコアを押し下げ。 |
| Cursor 3.5 / Composer 2.5 | ●●●●● (5/5) | ●○○○○ (1.4/5) | 最速実行だが最も弱い出力:プロポーション、カラーディシプリン、建築の細部が貧弱。 |
完全な結果にはさらに3つのエントリー(ここでは詳述せず)が含まれます。ベンチマークコードとレンダリング比較は元の投稿で入手可能です。
実用的な教訓
- Antigravity 2.0は最も建築的に正確なOpenSCADコードを生成。ドームリング、列柱間隔、ファサード関係が正確。
- Codex 5.5は細かいディテール(碑文)を追加したが、エクスポートの不一致が発生。プレビューは最終STLより優れて見えた。
- Cursor 3.5は迅速だが幾何学が粗雑。ラピッドプロトタイピングには適するが、プロダクションCADには不向き。
- ベンチマークはOpenSCADがLLM生成幾何学の強力なターゲットであることを確認:プレーンテキスト、コンパクトな語彙、CLIによる容易な反復。
AIコーディングエージェントをパラメトリック3Dモデリングに、特に放射対称性やブール演算を伴う建築部品や機械部品に使用している場合、このベンチマークは明確なシグナルを示します:現在のところAntigravity 2.0が品質でリードしています。スピード優先のタスクには、Cursor 3.5がまだ有用かもしれませんが、大幅な反復が必要です。
📖 出典全文: HN LLM Tools
👀 See Also

AIコーディングエージェントが20ターン後に粗悪なコードを出力する理由:コンテキスト盲目
APIログの詳細な監査により、CursorとClaude Codeは賢くなっているわけではなく、ノイズで膨れ上がったコンテキストウィンドウに窒息し、アーキテクチャを破壊していることが明らかになった。

Architor: Claude Code対応のフェーズゲート型アーキテクチャワークフロー向けオープンソースツール
Architorは、Claude Codeをフェーズゲート方式のアーキテクチャアシスタントに構造化し、永続的な設計メモリを備えたオープンソースツールです。システム設計を要件評価、アーキテクチャ決定、コンポーネント設計、検証フェーズに整理し、決定事項を.archワークスペースで追跡します。

ベンチマーク結果:38の実ワークフロータスクでテストされた15のLLM
ある開発者が、実際のワークフローから38のタスク(CSV変換、文字数カウント、モジュラー演算、フォーマット準拠など)を用いて、15のクラウドおよびローカルLLMをベンチマークしました。Claude 3.5 SonnetとOpusはともに100%のスコアを獲得しましたが、Sonnetは1回の呼び出しあたりのコストが3.5倍安くなっています。

sandboxd: 複数のClaude Codeエージェントを隔離されたコンテナで実行するオープンソースツール
sandboxdは、各Claude Codeプロジェクトを独自のDockerコンテナで実行し、ワークスペース、Claude Codeセッション、プレビューURLを分離するオープンソース(MIT)ツールです。並行エージェント、自動スリープをサポートし、APIキーをコンテナ内に保持しません。