CerebrasがStep-3.5-Flash-REAPモデルをリリース、メモリ使用量を40%削減

概要
Cerebrasは、大規模モデルのメモリ効率の良い圧縮版であるStep-3.5-Flash-REAPモデルをリリースしました。これらは「ポテトセットアップ」と呼ばれる環境向けに設計された小型バージョンですが、121Bパラメータモデルでも依然として相当なリソースが必要です。
主な詳細
モデルはHugging Faceで利用可能です:
Step-3.5-Flash-REAP-121B-A11Bモデルは、196Bから121Bパラメータに圧縮されており、フルモデルとほぼ同等の性能を維持しながら40%のメモリ削減を実現しています。
圧縮にはREAP(Router-weighted Expert Activation Pruning)が使用されており、「冗長なエキスパートを選択的に削除しながら、残りのエキスパートに対するルーターの独立した制御を維持する新しいエキスパート剪定手法」と説明されています。
特徴と機能
- ほぼロスレスな性能: コード生成、エージェント型コーディング、関数呼び出しタスクにおいて、完全な196Bモデルとほぼ同等の精度を維持
- 40%のメモリ削減: 196Bから121Bパラメータに圧縮され、導入コストとメモリ要件を低減
- 機能の維持: コード生成、数学と推論、ツール呼び出しを含むすべてのコア機能を保持
- ドロップイン互換性: 標準のvLLMと動作 - ソースの変更やカスタムパッチは不要
- 実世界での使用に最適化: リソースが限られた環境、ローカル導入、学術研究に特に効果的
情報源では、これらが「小型バージョン」である一方、121Bモデルでも圧縮後もかなり強力なセットアップが必要であると指摘されています。
📖 詳細情報: r/LocalLLaMA
👀 See Also

LinuxサウンドサブシステムにAIアシスト修正が殺到:IRQ、UAF、およびクワークス
Takashi Iwai 氏の最新の Linux 7.1 サウンドプルリクエストには、Claude Code や GPT-5.5 による「assisted-by」パッチが多数含まれており、HD オーディオの IRQ 処理、UAF バグ、デバイス quirks の修正が行われています。

Qwen3-30B-A3B と Qwen3.5-35B-A3B の RTX 5090 での性能比較
RTX 5090上でのQwen3-30B-A3BとQwen3.5-35B-A3Bの直接比較ベンチマークでは、30Bモデルが生成速度で35%速い一方、3.5モデルは長いコンテキストの処理に優れ、トークンスケーリングが平坦であるのに対し、30Bモデルは21%の性能低下を示しています。

AI生成コードの量がベテランエンジニアを圧倒していると調査が示す
AIユーザーはAI支援により98%多くプルリクエストをマージするが、シニアエンジニアは認知負荷とバーンアウトの増加を報告。研究によると、100行未満のPRでは欠陥検出率が87%であるのに対し、1,000行を超えるPRでは28%に低下する。
Claude Code v2.1.268:サードパーティエンドポイントのHTTP 400、WebFetchのハング、シークレット漏洩を修正
Claude Code v2.1.268がリリースされました。主にバグ修正のリリースで、2.1.265以降ANTHROPIC_BASE_URLエンドポイントで全ターンが失敗していたHTTP 400を修正し、WebFetchのタイムアウトを300秒に設定、プラグインとMCPエラーからのトークン漏洩を防止します。