ローカルQwen 3.6 27BをCodex検証用コエージェントとしてベンチマーク

r/LocalLLaMAの開発者が、OpenAIのCodexと並行してローカルのQwenモデルをバリデータおよびチャレンジャーとして実行し、この役割に最適なGGUF量子化プロファイルを定量化するための小さな再現可能な評価スイートを構築しました。ワークフロー:Codexがメインのリポジトリ作業を担当し、ローカルのQwenが計画に挑戦し、過剰構築、見逃されたハードディレクティブ、UI/デザインの問題、悪い前提、長期コンテキストの見落としをチェックします。著者は各インタラクションを確認してから次のステップに進みます。
評価スイートのセットアップ
スイートは、llama.cppを通じてQwen 3.6 27B GGUFプロファイル(BartowskiおよびUnslothバリアント)を異なるコンテキストサイズとKVキャッシュ形式(q8、f16)でテストします。焦点は実際の障害(見逃されたディレクティブ、不適切なチャレンジ動作、過剰構築、UI判断、長期コンテキストの見落とし)に当てられています。
主要な発見
- このスイートでトップパフォーマンスのプロファイルは、
bartowski-128k-f16、bartowski-128k-q8、unsloth-128k-q8でした。3つすべてが精度で同点でした。 - q8 KVキャッシュは、この特定のスイートでは測定可能な精度低下を示しませんでした。
- このワークフローでは、コンテキストサイズがf16対q8 KVよりも重要でした。65kプロファイルは、スイートが65kトークンを超える必要がある場合に失敗しました。
unsloth-128k-f16は読み込まれましたが、RTX 5090上で長文ケースにおいてメモリ/スループットの圧力がかかりました。
実用的な観察
著者によると、QwenはCodexのサイレントバイパス、過剰構築、およびコーディング完了へのショートカットを非常にうまくキャッチします。UI関連のタスクでは、Codexが実装する間、Qwenがデザインで主導権を握ります。役割が逆転します:Qwenが計画に挑戦し、人間が各段階の前にレビューします。
リソース
- プロジェクトページ:https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- リポジトリ:https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 全文ソースを読む: r/LocalLLaMA
👀 See Also

アンダースタディ:デモンストレーションでタスクを学習する教育可能なデスクトップエージェント
Understudyは、GUIアプリ、ブラウザ、シェルツール、ファイル、メッセージングを1つのセッションで操作できるローカルファーストのデスクトップエージェントランタイムです。タスクを一度デモンストレーションすると、画面ビデオと意味的イベントを記録し、座標ではなく意図を抽出し、再利用可能なスキルに変換します。
Claude Garmin MCPサーバー:よりスマートなトレーニングアドバイスのためのリアルフィットネスデータ
Claude DesktopをGarmin Connectに接続するMCPサーバー。8つのツール(回復準備度、HRV、VO2maxなど)を提供し、データに基づいたトレーニング計画を可能にします。

500ミリ秒未満の音声エージェント構築:アーキテクチャとパフォーマンスの知見
開発者がゼロから構築した音声エージェントは、完全なSTT→LLM→TTSストリーミングで約400msのエンドツーエンド遅延を実現。重要な洞察には、音声を話者交替の問題として扱うこと、意味的な話者交替終了検出の使用、最小遅延のための全コンポーネントの同一配置が含まれる。

NetflixがHugging FaceにVOID:ビデオオブジェクトおよびインタラクション削除モデルをリリース
Netflixは、落下する物体や移動したアイテムなど、それらが引き起こすすべての物理的相互作用とともに、ビデオからオブジェクトを除去するビデオインペインティングモデル「VOID」をリリースしました。このモデルには40GB以上のVRAMを搭載したGPUが必要で、異なる精緻化レベルに対応する2つのチェックポイントファイルを使用したクワッドマスク条件付けを採用しています。