APEX MoE Quantsアップデート:新たに25以上のモデルとI-Nanoティアをリリース

APEX 量子化戦略(MoE 対応混合精度)は、Qwen 3.5 35B-A3B 向けの初回リリース以降、大幅に拡大しました。Hugging Face コレクションには、主要ファミリーの 30 以上の MoE モデルが含まれ、新しい超圧縮 I-Nano ティアが利用可能になりました。
ユーザーフィードバックからの主な結果
- 長いコンテキストの保持: APEX I-Balanced および I-Compact バージョンは、30~50B クラスの MoE で 32k トークンを超えても一貫性を維持。均一な Q4_K では劣化が見られます。共有エキスパートとエッジ層を高精度に保つことで、長距離トークンルーティングが維持されるという仮説です。
- コーディング性能: Qwen 3.6 35B-A3B のユーザーは、I-Compact と I-Mini が実際のコードタスクで F16 に近い性能を維持し、サイズクラスの期待を上回ると報告しています。
追加された新しいモデル
ファミリー別にグループ化。ほとんどは 30~70B クラスの MoE で、I-Mini/I-Compact でコンシューマー GPU 1 枚に収まります。
- Qwen: Qwen 3.5 122B-A10B、397B-A17B、Claude 蒸留、Fernflower、TQ; Qwen 3.6 35B-A3B(heretic、Claude 4.6/4.7 蒸留); Qwen3-Coder 30B、Next。
- フロンティアサイズ(レンタル Blackwell): MiniMax-M2.5/M2.7(228B/24B アクティブ)、Mistral-Small 4 119B-2603、NVIDIA Nemotron-3-Super 120B-A12B、GLM-4.7 Flash、Step-3.5 Flash、Nemotron-3-Nano 30B-A3B、Nemotron-3-Nano-Omni(マルチモーダル)、Holo3 35B-A3B、Huihui3.5 67B-A3B。
- ハイブリッド Mamba/SSM MoE: Nemotron-3-Nano バリアント、Holo3、LFM2 24B-A2B。
- Gemma 4: gemma-4 26B-A4B-it(更新された Google チャットテンプレートで再量子化)、+Claude Opus 蒸留、+heretic、Gemopus-4 Preview。
- コミュニティマージ: Carnice MoE 35B-A3B、Carnice-Qwen3.6、Qwopus MoE 35B-A3B。
新しいティア: I-Nano (IQ2_XXS)
中間層のルーティングエキスパートを 2.06 bpw まで圧縮し、エッジ近傍は IQ2_S、エッジは Q3_K、共有エキスパートは Q5_K に。I-Mini より約 20% 小さく、スパースなエキスパート活性化により MoE でのみ有効。imatrix が必要です。
サイズ例:
- Qwen 3.5 35B-A3B: I-Mini 13 GB → I-Nano 11 GB
- Nemotron Omni 30B: I-Mini 18 GB → I-Nano 17 GB(共有エキスパートが密なため削減量は少ない)
リンク
📖 ソース全文: r/LocalLLaMA
👀 See Also

Anthropic、ChatGPT/GeminiからClaudeへの切り替えにメモリ移行機能を追加
Anthropicの新しいメモリインポート機能により、ユーザーはChatGPT、Gemini、その他のAIからClaudeへ、好み、プロジェクト、コンテキスト、作業スタイルを約2回のコピー&ペーストで転送でき、一から再トレーニングする必要がなくなります。

Claude-Code v2.1.38 リリース:主要な修正と改善点
Claude-Code v2.1.38は、VS Codeターミナルのリグレッション、Tabキーの問題、bashコマンドの権限修正に対応しています。また、ヒアドキュメントの解析とサンドボックスモードのセキュリティも改善されています。

AI心理学研究から体系的に除外されるClaudeユーザー – 方法論的ギャップ
AIチャットボットに関する数十の心理学論文をレビューしたところ、Claudeユーザーが独立したグループとして調査されたことは一度もないことが明らかになった。ChatGPT、Character.AI、Replikaのユーザーとは根本的に使用用途のプロファイルやモデル設計が異なるにもかかわらず、である。

Reddit投稿が仮想CEOエージェントのワークフローを批判、スキルベースのアプローチを提唱
r/openclawのReddit投稿では、AIエージェントのワークフローにおける一般的なパターン、すなわち「バックエンド開発者」や「成長ハッカー」といった特定の職種名を持つエージェントを作成することは不要なオーバーヘッドであると批判し、代わりに必要な時に呼び出せる再利用可能なスキルとして能力をパッケージ化することを提案しています。