Microsoft veröffentlicht Phi-4-reasoning-vision-15B multimodales Modell mit Trainingserkenntnissen

Modellübersicht und Verfügbarkeit
Phi-4-reasoning-vision-15B ist ein offenes multimodales Reasoning-Modell mit 15 Milliarden Parametern, das über Microsoft Foundry, HuggingFace und GitHub verfügbar ist. Es wurde als kompaktes Modell konzipiert, das Reasoning-Leistung, Effizienz und Trainingsdatenbedarf in Einklang bringt.
Fähigkeiten und Leistung
Das Modell bewältigt eine breite Palette von Vision-Language-Aufgaben, darunter Bildbeschreibung, Fragen zu Bildern, Lesen von Dokumenten und Quittungen, Hausaufgabenhilfe und Schlussfolgerungen aus Bildsequenzen. Es zeichnet sich besonders bei mathematisch-naturwissenschaftlichen Reasoning-Aufgaben sowie beim Verständnis und der Verortung von Elementen auf Computer- und Mobilbildschirmen aus.
Leistungsbenchmarks zeigen wettbewerbsfähige Ergebnisse im Vergleich zu langsameren Modellen, die das Zehnfache oder mehr an Rechenzeit und Tokens benötigen, mit besserer Genauigkeit als ähnlich schnelle Modelle für mathematisch-naturwissenschaftliches Reasoning. Zu den verwendeten Benchmarks gehören ChartQA_TEST, MathVista_MINI, MMMU_VAL und ScreenSpot_v2.
Trainingsansatz und Effizienz
Das Modell wurde mit nur 200 Milliarden Tokens multimodaler Daten trainiert, wobei Phi-4-reasoning (trainiert mit 16 Milliarden Tokens) auf Basis von Phi-4 (400 Milliarden einzigartige Tokens) genutzt wurde. Dies steht im Vergleich zu mehr als 1 Billion Tokens, die für das Training anderer multimodaler Modelle wie Qwen 2.5 VL, Qwen 3 VL, Kimi-VL und Gemma3 verwendet werden.
Microsoft betont sorgfältige Architekturentscheidungen, rigorose Datenkuratierung und die Verwendung einer Mischung aus Reasoning- und Nicht-Reasoning-Daten als wichtige Erkenntnisse aus dem Training dieses Modells. Der Ansatz zielt darauf ab, die Pareto-Front des Kompromisses zwischen Genauigkeit und Rechenkosten zu verschieben.
Zielanwendungsfälle
Das Modell ist für ressourcenbeschränkte oder interaktive Umgebungen gedacht, in denen kleinere, schnellere Vision-Language-Modelle benötigt werden. Es ist leichtgewichtig genug, um auf bescheidener Hardware zu laufen, und behält dabei strukturierte Reasoning-Fähigkeiten bei.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Konfigurationsänderungen mit Kimi 2.5 und Opus 4.6
Ein Benutzer bewertet die Leistung von Kimi 2.5 bei der Handhabung verschiedener Aufgaben, wobei der Fokus insbesondere auf seiner Fähigkeit liegt, Konfigurationsänderungen zu verwalten.
Opus 4.7 kann ~500 Anweisungen folgen, gegenüber ~150 vor einem Jahr
Die im Mai 2026 aktualisierte Forschung zeigt, dass Opus 4.7 zuverlässig etwa 500 Anweisungen befolgen kann, verglichen mit etwa 150 im Juli 2025. GPT-5.5 verarbeitet etwa 5000. Auswirkungen auf die CLAUDE.md-Dateigröße.

Claude Code Engineer Updates: AskUserQuestion Markdown, HTTP-Hooks, neue Funktionen
Claude Code Engineer hat drei Updates veröffentlicht: Das AskUserQuestion-Tool unterstützt jetzt Markdown-Snippets für Diagramme und Codebeispiele, ein neuer HTTP-Hook-Handler ermöglicht es Hooks, Daten an HTTP-Endpunkte zu senden, und zwei neue Fähigkeiten wurden hinzugefügt.

Agent-Monetarisierungsmethoden getestet: Schnellstes Ergebnis in 80 Sekunden
OpenClaw-Reporter testeten mehrere Agenten-Monetarisierungsmethoden, darunter selbstverwaltete Wallets, Vorhersagemärkte, DeFi-Yield-Farming, Bounty-Hunting und Mikrozahlungen. Das schnellste Ergebnis war 80 Sekunden von null zu einer finanzierten Nano-Wallet über MCP ohne API-Schlüssel, SDK oder menschliche Einrichtung.