マイクロソフト、トレーニングの洞察を伴うPhi-4-reasoning-vision-15Bマルチモーダルモデルをリリース

モデルの概要と利用可能性
Phi-4-reasoning-vision-15Bは、Microsoft Foundry、HuggingFace、GitHubを通じて利用可能な150億パラメータのオープンウェイトマルチモーダル推論モデルです。推論能力、効率性、トレーニングデータの必要性のバランスを取るコンパクトなモデルとして設計されています。
能力と性能
このモデルは、画像キャプション生成、画像に関する質問応答、文書や領収書の読み取り、宿題の手助け、一連の画像の変化推論など、幅広い視覚言語タスクを処理します。特に数学・科学推論、およびコンピュータやモバイル画面の要素の理解と位置特定に優れています。
性能ベンチマークでは、10倍以上の計算時間とトークンを必要とする遅いモデルと比較して競争力のある結果を示し、数学・科学推論において同様に高速なモデルよりも優れた精度を発揮します。使用されたベンチマークには、ChartQA_TEST、MathVista_MINI、MMMU_VAL、ScreenSpot_v2が含まれます。
トレーニング手法と効率性
このモデルはわずか2000億トークンのマルチモーダルデータでトレーニングされ、Phi-4(4000億ユニークトークン)に基づくPhi-4-reasoning(160億トークンでトレーニング)を活用しています。これは、Qwen 2.5 VL、Qwen 3 VL、Kimi-VL、Gemma3などの他のマルチモーダルモデルのトレーニングに使用される1兆トークン以上と比較されます。
マイクロソフトは、慎重なアーキテクチャ選択、厳格なデータキュレーション、推論データと非推論データの混合使用を、このモデルのトレーニングから得られた重要な教訓として強調しています。このアプローチは、精度と計算コストのトレードオフにおけるパレートフロンティアを押し上げることを目指しています。
対象ユースケース
このモデルは、より小さく高速な視覚言語モデルが必要とされるリソース制約のある環境やインタラクティブな設定を対象としています。構造化された推論能力を維持しながら、控えめなハードウェアで実行できるほど軽量です。
📖 全文を読む: HN AI Agents
👀 See Also

OpenClaw 0.9 CLIの削除によるエージェントの機能停止
ユーザーから報告されたところによると、AIエージェントを通じてOpenClawを更新しようとした結果、CLIが削除され、ゲートウェイコマンドとTelegramチャット機能が破損しました。OpenClaw 0.9ではCLIが完全に廃止され、'openclaw gateway start'や'openclaw status'などのコマンドが削除されました。
AIが数分でCTFチャレンジを解決 — サイバーセキュリティトレーニングへの影響
BSidesSF 2026で、自律エージェントが52のCTFチャレンジを数分で解き、優勝しました。これは、サイバーセキュリティスキルの測定方法とトレーニング方法の再考を迫ります。

クロード・シャノンの1950年のチェス論文が予測したGenAIの核心的問題:推測と知識
シャノンが1950年に発表したチェスに関する論文は、AIの核心的な課題を明確に示していた。それは、不確実性の中で「まあまあ良い」決定を下すこと、まさに生成AIが今日直面している問題、つまり磨き上げられたが間違った回答を生成するという問題である。

VibeThinker-3B:在AIME数学基准测试中与671B DeepSeek匹敌的3B参数模型
Sina Weiboの研究者が発表したVibeThinker-3Bは、3BパラメータでAIME 2026で94.3を記録し、DeepSeek V3.2(671B)に匹敵。論文は「パラメトリック圧縮・カバレッジ仮説」を提唱し、検証可能な推論が小規模モデルに圧縮可能だと主張。