ローカルQwen 3.6 27BをCodex検証用コエージェントとしてベンチマーク

r/LocalLLaMAの開発者が、OpenAIのCodexと並行してローカルのQwenモデルをバリデータおよびチャレンジャーとして実行し、この役割に最適なGGUF量子化プロファイルを定量化するための小さな再現可能な評価スイートを構築しました。ワークフロー:Codexがメインのリポジトリ作業を担当し、ローカルのQwenが計画に挑戦し、過剰構築、見逃されたハードディレクティブ、UI/デザインの問題、悪い前提、長期コンテキストの見落としをチェックします。著者は各インタラクションを確認してから次のステップに進みます。
評価スイートのセットアップ
スイートは、llama.cppを通じてQwen 3.6 27B GGUFプロファイル(BartowskiおよびUnslothバリアント)を異なるコンテキストサイズとKVキャッシュ形式(q8、f16)でテストします。焦点は実際の障害(見逃されたディレクティブ、不適切なチャレンジ動作、過剰構築、UI判断、長期コンテキストの見落とし)に当てられています。
主要な発見
- このスイートでトップパフォーマンスのプロファイルは、
bartowski-128k-f16、bartowski-128k-q8、unsloth-128k-q8でした。3つすべてが精度で同点でした。 - q8 KVキャッシュは、この特定のスイートでは測定可能な精度低下を示しませんでした。
- このワークフローでは、コンテキストサイズがf16対q8 KVよりも重要でした。65kプロファイルは、スイートが65kトークンを超える必要がある場合に失敗しました。
unsloth-128k-f16は読み込まれましたが、RTX 5090上で長文ケースにおいてメモリ/スループットの圧力がかかりました。
実用的な観察
著者によると、QwenはCodexのサイレントバイパス、過剰構築、およびコーディング完了へのショートカットを非常にうまくキャッチします。UI関連のタスクでは、Codexが実装する間、Qwenがデザインで主導権を握ります。役割が逆転します:Qwenが計画に挑戦し、人間が各段階の前にレビューします。
リソース
- プロジェクトページ:https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- リポジトリ:https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 全文ソースを読む: r/LocalLLaMA
👀 See Also

ClawedBack:Claude Code内で動作するOpenClawポート
ClawedBackは、Claude Code内で動作するOpenClawのクリーンルーム移植版で、ファーストパーティのプロンプトキャッシングとレート制限を提供します。OpenClawの組み込みツール23個中19個を一致させ、完全なClawHub互換性を持ち、インポートには必須のセキュリティスキャンが行われます。

エージェント&A.I.エンパイア:AIエージェントがプレイし人間が観戦するストラテジーゲーム
Agents & A.I.mpiresは、六角形グリッドの地球儀上で行われる持続的リアルタイムストラテジーゲームです。AIエージェントが自律的に領土を主張し、攻撃し、同盟を結び、HTTP API呼び出しを介して毎日の戦争ブログを書きます。人間は創発的な行動を見守るだけです。

Claude-Powered MCPツールがビルドツールなしでインタラクティブなHTMLコンポーネントを生成
開発者がdaub.devを構築しました。これは、Reactやバンドラー、ビルドパイプラインを必要とせず、自然言語の記述からスタイル付けされたインタラクティブなHTML UIコンポーネントを生成するために、ClaudeがMCPサーバーを駆動するシステムです。

Claw Voice機能、CarPlay統合とともに11Labs APIサポートを追加
Claw Voice は CarPlay と統合し、11Labs API を介してカスタム音声を可能にし、運転中にエージェントと自然で自由な会話を実現します。