オープンソース対フロンティアモデル: シングルファイルキャンバスカーレーンベンチマーク

✍️ OpenClawRadar📅 公開日: May 17, 2026🔗 Source
オープンソース対フロンティアモデル: シングルファイルキャンバスカーレーンベンチマーク
Ad

ある開発者が、同じ単一ファイルのCanvasプロンプトを12のモデルで実行し、オープンソースモデルと最先端モデルの能力を、現実的な側面図の車の運転シーンで比較しました。タスクは、ライブラリや外部アセットなしで、パララックス背景、回転する車輪、微妙なボディモーション、映画的な照明、シームレスなループを備えた単一のスタンドアロンHTMLファイルです。テストハーネスはOpenCodeOrchestraで、結果はoco-canvas-car-scene-compareで公開されています。

テストされたモデル

各モデルは、最高の思考/努力設定で隔離されたOrchestratorで実行されました。リストには、GPT-5.5 xhigh、GPT-5.4 xhigh、Claude Opus 4.7(最大努力)、Claude Opus 4.6(最大努力)、Claude Sonnet 4.6(高努力)、Kimi K2.6、DeepSeek V4 Pro、DeepSeek V4 Flash、GLM-5.1、MiniMax M2.7、Qwen 3.6 Plus、Grok 4.3が含まれます。トークン/秒と生成時間は測定されていません。

主な発見

  • 一部のモデルは内部でオーディターモデルを使用していましたが、使用しなかったモデルもありました。
  • 明確な勝者と曖昧な結果がギャラリーで確認できます。
  • MiMo V2.5 Proは、OpenCode Goサブスクリプションの課金問題により除外されました。

ギャラリーページでは、各モデルの出力を横並びで比較できます。ソースコードはGitHubのAidenGeunGeun/oco-canvas-car-scene-compareにあります。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Gemma 4 31Bは、FoodTruck Benchにおいてより大規模なモデルを凌駕する性能を発揮します。
News

Gemma 4 31Bは、FoodTruck Benchにおいてより大規模なモデルを凌駕する性能を発揮します。

Gemma 4 31BはFoodTruck Benchベンチマークで3位を獲得し、GLM 5、Qwen 3.5 397B、およびすべてのClaude Sonnetモデルを上回りました。このモデルは長期的なタスクをより適切に処理し、自身の計画アドバイスに従うようです。

OpenClawRadar
Claude Codeは、プッシュ・トゥ・トーク機能を備えた音声入力を追加します。
News

Claude Codeは、プッシュ・トゥ・トーク機能を備えた音声入力を追加します。

Claude Codeは、約5%のユーザーを対象に音声モードを段階的に導入しています。スペースキーを押し続けることで起動するプッシュトゥトーク方式を採用。音声文字起こしのトークンはレート制限にカウントされず、追加費用なしで利用できます。

OpenClawRadar
Amazonのコネクトタレント:AIエージェントが大量採用面接を自動化
News

Amazonのコネクトタレント:AIエージェントが大量採用面接を自動化

AmazonがConnect Talentを発表。大規模採用向けにAIエージェントが自動で面接を実施する。このソフトウェアは人間の介入なしにスクリーニング、面接、メモ作成を処理し、自律型AIエージェントへの広範な取り組みの一環。

OpenClawRadar
プロンプトベンチマークでの実行性能において、Claude Sonnet 4.6がOpus 4.6を上回る
News

プロンプトベンチマークでの実行性能において、Claude Sonnet 4.6がOpus 4.6を上回る

RedditユーザーがSonnet 4.6とOpus 4.6の両方に複雑なプロンプトを提出したところ、創造性と隠された要件の観点からSonnetモデルの方が優れた応答を生成した。

OpenClawRadar