ステップ3.5フラッシュの探求:高速深層推論のためのオープンソースモデル

Step 3.5 Flashは、高速かつ信頼性の高い深層推論能力を提供することに焦点を当てたオープンソースの基盤モデルです。スパースなMixture of Experts(MoE)アーキテクチャを採用し、トークンごとに1960億パラメータのうち110億パラメータのみを活性化します。この選択的な活性化により高い「知能密度」を実現し、トップクラスの独自モデルと競争できる性能を維持しながら、リアルタイムのインタラクションにも俊敏に対応できます。
深層推論と速度
このモデルは3方向マルチトークン予測(MTP-3)を組み込んでおり、1秒あたり100から300トークンを処理し、シングルストリームのコーディングタスクでは最大350トークンに達します。これは、迅速な応答性を伴う複雑な多段階推論に理想的です。
コーディングとエージェントタスクでの性能
Step 3.5 Flashは、継続的な自己改善を保証するスケーラブルな強化学習フレームワークによってサポートされたエージェントタスクで優れた性能を発揮します。SWE-bench Verifiedベンチマークで74.4%、Terminal-Bench 2.0で51.0%のスコアを達成し、洗練された長期的タスクを処理する能力を示しています。
効率的な長文脈処理
3:1のスライディングウィンドウアテンション(SWA)比率を使用して、大規模な256Kの文脈ウィンドウをサポートし、各フルアテンションレイヤーに対して3つのSWAレイヤーを統合しています。この方法は、従来の長文脈モデルと比較して計算オーバーヘッドを大幅に削減します。
ローカル展開とアクセシビリティ
簡単なローカル展開を想定して設計されたStep 3.5 Flashは、Mac Studio M4 MaxやNVIDIA DGX Sparkなどの高性能コンシューマーハードウェア上で安全に実行でき、性能を損なうことなくデータのプライバシーを確保します。
📖 完全なソースを読む: HN AI Agents
👀 See Also

クラウドアプリ、ペンタゴンとの紛争後、米国App Storeで2位にランクイン
AnthropicのClaudeチャットボットアプリは、Appleの米国App Storeで無料アプリランキング2位に上昇し、2026年1月下旬にはトップ100圏外だったのが、2月下旬までに2位まで急上昇しました。この急上昇は、同社がAI使用制限をめぐって国防総省と公に交渉した後に起こりました。

Apple Silicon ベンチマーク:M3、M4、M5 MaxにおけるQwen3-VLのVision LLM分類性能
ベンチマーク結果によると、Qwen3-VL視覚LLMの分類性能はApple Siliconにおいて、M3 MaxとM4 Studioは8Bモデルでほぼ同等であり、M5 Maxは75-83%高速です。視覚タスクでは、トークン生成においてメモリ帯域幅がプリフィルよりも重要です。

カイザー看護師、AI監視が患者ケアを低下させると主張、契約交渉を控え
カイザー・パーマネンテの看護師らが、AIによる職場監視(通話時間追跡、生産性予測、共感スコアリング)により患者対応を急がされ、ケアの質が損なわれていると報告。自殺企図の患者との15分超の通話が管理職の批判を招いた事例も。
OpenClaw 2026.8.2: 内部コンテキストブロックがTelegramテキストに漏洩
OpenClaw 2026.8.2のTelegramポーリングで内部コンテキストブロックが表示テキストに漏れ、エージェントが正当な指示を拒否し、プロンプトインジェクションを警告する問題が発生しています。