オープンソース対フロンティアモデル: シングルファイルキャンバスカーレーンベンチマーク

ある開発者が、同じ単一ファイルのCanvasプロンプトを12のモデルで実行し、オープンソースモデルと最先端モデルの能力を、現実的な側面図の車の運転シーンで比較しました。タスクは、ライブラリや外部アセットなしで、パララックス背景、回転する車輪、微妙なボディモーション、映画的な照明、シームレスなループを備えた単一のスタンドアロンHTMLファイルです。テストハーネスはOpenCodeOrchestraで、結果はoco-canvas-car-scene-compareで公開されています。
テストされたモデル
各モデルは、最高の思考/努力設定で隔離されたOrchestratorで実行されました。リストには、GPT-5.5 xhigh、GPT-5.4 xhigh、Claude Opus 4.7(最大努力)、Claude Opus 4.6(最大努力)、Claude Sonnet 4.6(高努力)、Kimi K2.6、DeepSeek V4 Pro、DeepSeek V4 Flash、GLM-5.1、MiniMax M2.7、Qwen 3.6 Plus、Grok 4.3が含まれます。トークン/秒と生成時間は測定されていません。
主な発見
- 一部のモデルは内部でオーディターモデルを使用していましたが、使用しなかったモデルもありました。
- 明確な勝者と曖昧な結果がギャラリーで確認できます。
- MiMo V2.5 Proは、OpenCode Goサブスクリプションの課金問題により除外されました。
ギャラリーページでは、各モデルの出力を横並びで比較できます。ソースコードはGitHubのAidenGeunGeun/oco-canvas-car-scene-compareにあります。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Gemma 4 31Bは、FoodTruck Benchにおいてより大規模なモデルを凌駕する性能を発揮します。
Gemma 4 31BはFoodTruck Benchベンチマークで3位を獲得し、GLM 5、Qwen 3.5 397B、およびすべてのClaude Sonnetモデルを上回りました。このモデルは長期的なタスクをより適切に処理し、自身の計画アドバイスに従うようです。

Claude Codeは、プッシュ・トゥ・トーク機能を備えた音声入力を追加します。
Claude Codeは、約5%のユーザーを対象に音声モードを段階的に導入しています。スペースキーを押し続けることで起動するプッシュトゥトーク方式を採用。音声文字起こしのトークンはレート制限にカウントされず、追加費用なしで利用できます。

Amazonのコネクトタレント:AIエージェントが大量採用面接を自動化
AmazonがConnect Talentを発表。大規模採用向けにAIエージェントが自動で面接を実施する。このソフトウェアは人間の介入なしにスクリーニング、面接、メモ作成を処理し、自律型AIエージェントへの広範な取り組みの一環。

プロンプトベンチマークでの実行性能において、Claude Sonnet 4.6がOpus 4.6を上回る
RedditユーザーがSonnet 4.6とOpus 4.6の両方に複雑なプロンプトを提出したところ、創造性と隠された要件の観点からSonnetモデルの方が優れた応答を生成した。