ステップ3.5フラッシュの探求:高速深層推論のためのオープンソースモデル

Step 3.5 Flashは、高速かつ信頼性の高い深層推論能力を提供することに焦点を当てたオープンソースの基盤モデルです。スパースなMixture of Experts(MoE)アーキテクチャを採用し、トークンごとに1960億パラメータのうち110億パラメータのみを活性化します。この選択的な活性化により高い「知能密度」を実現し、トップクラスの独自モデルと競争できる性能を維持しながら、リアルタイムのインタラクションにも俊敏に対応できます。
深層推論と速度
このモデルは3方向マルチトークン予測(MTP-3)を組み込んでおり、1秒あたり100から300トークンを処理し、シングルストリームのコーディングタスクでは最大350トークンに達します。これは、迅速な応答性を伴う複雑な多段階推論に理想的です。
コーディングとエージェントタスクでの性能
Step 3.5 Flashは、継続的な自己改善を保証するスケーラブルな強化学習フレームワークによってサポートされたエージェントタスクで優れた性能を発揮します。SWE-bench Verifiedベンチマークで74.4%、Terminal-Bench 2.0で51.0%のスコアを達成し、洗練された長期的タスクを処理する能力を示しています。
効率的な長文脈処理
3:1のスライディングウィンドウアテンション(SWA)比率を使用して、大規模な256Kの文脈ウィンドウをサポートし、各フルアテンションレイヤーに対して3つのSWAレイヤーを統合しています。この方法は、従来の長文脈モデルと比較して計算オーバーヘッドを大幅に削減します。
ローカル展開とアクセシビリティ
簡単なローカル展開を想定して設計されたStep 3.5 Flashは、Mac Studio M4 MaxやNVIDIA DGX Sparkなどの高性能コンシューマーハードウェア上で安全に実行でき、性能を損なうことなくデータのプライバシーを確保します。
📖 完全なソースを読む: HN AI Agents
👀 See Also

Polsiaプラットフォーム、ライブファウンダー起業で繰り返されるSaaSパターンを提示
Polsiaは、ユーザーがビジネスを説明し、支払いを行うことで、プラットフォームが自律的に実行する自律型ビジネスプラットフォームです。行動科学者が72時間にわたる創業者のライブ起動を観察し、AI SDR自動化ソリューションや十分に活用されていない国際市場などの反復パターンを特定しました。

クロードオーパス4.7、ハンタウイルスワクチンに関する質問を安全リスクと判定しチャットを一時停止
Claude Opus 4.7にハンタウイルスワクチンの開発方法を尋ねると、安全フィルターが作動してチャットが一時停止され、Sonnet 4.6でも関連する予測モデリングがブロックされる。

Claude Code v2.1.116:パフォーマンスの改善、ターミナルの修正、セキュリティアップデート
Claude Code v2.1.116は、40MB以上のセッションでの/resumeコマンドが最大67%高速化、ターミナルスクロールの滑らかさ向上、MCP起動の高速化など、大幅なパフォーマンス改善を提供します。このリリースでは、ターミナル描画の問題の修正、危険なパス操作に対するセキュリティ保護の追加、スラッシュコマンドやプラグイン管理に影響する複数のバグの解決も行われています。

オープンソースAIの現状:パリティ達成も、プロダクションギャップは依然として残る
Mozillaの2026年レポートによると、オープンウェイトモデルはコーディングと一般知識でクローズドモデルと同等になり、推論コストは50分の1の$0.40/100万トークンに低下。しかし、プロダクションに到達したチームはオープン系が51%に対し、クローズド系は63%。