Claude 4.6 Opusの推論機能が、MLX量子化によりApple Silicon向けに14GBに蒸留されました。

開発者が、Claude 4.6 Opusの推論能力をApple Siliconハードウェアに持ち込むローカルAIモデルを量子化することに成功し、パフォーマンスを維持しながらメモリ使用量を大幅に削減しました。
モデルとその起源
この取り組みは、特にClaude 4.6 Opusの推論軌跡から蒸留されたバージョンのQwen 3.5 27Bを中心としています。開発者は、単にコードを自動補完するだけでなく「考える」ことができるモデルを求め、Opusの特徴を「慎重で分析的、他のモデルが見逃す微妙なアーキテクチャの欠陥を捉える」と表現しました。この蒸留版は、その「思考」の枠組みをオープンウェイトアーキテクチャにもたらします。
量子化プロセス
元のモデルはBF16形式で55.6GBあり、開発者は「ほとんどのローカル環境では非現実的」と指摘し、メモリプール全体を消費すると述べました。これに対処するため、Apple Silicon向けにモデルを量子化し、4ビット精度に変換するためにMLXを使用しました。目標は、高精度なOpusの推論能力を維持しながら、技術計画や複雑な論理の日常使用に十分な軽量化を実現することでした。
結果とパフォーマンス
- 使用量: 55GBから14GBに削減
- 速度: M4 Proで約16トークン/秒
- 推論: 完全な<think>ブロックを維持し、モデルが「自己対話」して論理を検証し、エッジケースをシミュレートし、最終回答を提示する前に自己修正できるようにする
入手可能性と要件
開発者は重みをHugging Faceにアップロードしました。このモデルは、プライベートな高層論理と技術計画を完全にオフラインで実行するために、24GB以上のRAMを搭載したMacが必要です。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

E2a: SPF/DKIM検証とWebhook/WebSocket配信を備えたAIエージェント向けオープンソースメールゲートウェイ
E2aは、AIエージェント向けの認証済みメールゲートウェイで、インバウンドメールのSPF/DKIMを検証し、webhookまたはWebSocketを介して配信します。また、ヒューマン・イン・ザ・ループの承認を備えたアウトバウンドメールをサポートします。

Claude-IDE-Bridgeがリモートサーバーで動作可能に、AI支援開発を実現
Claude-IDE-Bridgeツールは、Claude AIをVPSやクラウドマシン上のリモート開発環境に接続し、ライブ診断、開いているファイル、テスト失敗にどのデバイスからでもアクセスできるようにしました。

メルリン:ローカルファーストのLLMコンテキスト重複除去 – 最大71%のチャンク重複を測定、フリー&オープンコア
Merlinは、実際のエージェント/RAGセッションからの2200万パッセージにおいて22〜71%のチャンク重複を測定した、ローカルファーストのコンテキスト重複除去ツールです。HTTPプロキシ(Ollama/vLLM/SGLang/llama.cpp)、MCPサーバー(Claude/Cursor/OpenClaw)、またはスタンドアロンCLIとして提供されます。MITオープンコアで、毎日の使用上限があります。

ClearSpec: Claudeコードにおけるハルシネーションを軽減する仕様ジェネレーター
ClearSpecは、平易な英語の説明から構造化された仕様書を生成するツールで、GitHubリポジトリに接続して実際のファイルパスや依存関係を参照し、その仕様書をClaude Codeへのプロンプトとして使用して、より良いコンテキストを提供します。