Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE

IBM hat Granite 4.1 veröffentlicht, eine Open-Source-Sprachmodellfamilie (Apache 2.0) mit den Größen 3B, 8B und 30B. Alle verwenden einen dichten Decoder-Only-Transformer – kein MoE, keine langen Reasoning-Ketten. Das 8B-Modell sticht hervor: Es entspricht oder übertrifft das vorherige Granite 4.0-H-Small (32B MoE, 9B aktiv) in mehreren Benchmarks.
Wichtige Benchmark-Ergebnisse
- ArenaHard (Qualität realer Prompts): 8B erreicht 69,0, 32B MoE niedriger.
- BFCL V3 (Tool-Nutzung): 8B erreicht 68,3, 32B MoE 64,7.
- GSM8K (mathematisches Reasoning): 8B erreicht 92,5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B übertrifft das größere Modell durchgängig.
Trainingspipeline
Granite 4.1 wurde mit 15 Billionen Tokens in fünf Phasen mit sich ändernden Datenmischungen trainiert:
- Phase 1: 59% CommonCrawl, 20% Code, 7% Mathematik.
- Phase 2: Mathematik steigt auf 35%, Code auf 30%.
- Phasen 3-4: Mischung aus Chain-of-Thought-Reasoning, Instruktionsdaten und hochwertigen Webinhalten.
- Phase 5: Erweiterung des Kontextfensters auf 512K Tokens (8B und 30B).
Die entscheidende Erkenntnis: Datenqualität vor Parameterskalierung. IBMs Datenfilter-Pipeline verwirft halluzinierte oder instruktionsignorierende Beispiele während des Feintunings, um das Training auf schlechten Signalen zu vermeiden.
Warum dies für KI-Agenten wichtig ist
Dichte Modelle bieten vorhersagbare Latenz und Kosten – kein Routing-Overhead. Für Entwickler von KI-Codierungsagenten bietet das 8B-Modell von Granite 4.1 starke Tool-Nutzung und mathematisches Reasoning zu einem Bruchteil der Rechenkosten von MoE-Modellen.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Claude Code v2.1.91 Updates: Agent-Design-Patterns, Speicherregeln und Tool-Verbesserungen
Claude Code v2.1.91 fügt einen Referenzleitfaden für Agent-Design-Patterns hinzu, der die Gestaltung von Werkzeugschnittstellen, Kontextmanagement und Caching-Strategien abdeckt. Das Update vereinfacht die Regeln für die Speicherauswahl, fügt Sicherheitsüberwachung für Memory Poisoning hinzu und verbessert die Werkzeugbeschreibungen für Edit-, ReadFile- und Write-Operationen.

NIST bittet um öffentliche Stellungnahmen zu Sicherheitsstandards für KI-Agenten
Das National Institute of Standards and Technology hat eine Informationsanfrage zu Sicherheitsaspekten für künstliche Intelligenz-Agenten veröffentlicht, mit einer Stellungnahmefrist bis zum 9. März 2026. Die RFI ist über das Federal Register für öffentliche Kommentare geöffnet.

Lokaler LLM-Benchmark: Backend-Generierung durch Funktionsaufruf – GLM, Qwen, DeepSeek im Vergleich
Ein rigoroser Benchmark lokaler und Frontier-LLMs für Backend-Code-Generierung mittels Function Calling, mit Bewertungsmatrix. Wichtigste Ergebnisse: qwen3.5-35b-a3b erreicht GPT-5.4 bei DB/API-Design und dichtes Qwen 27B schlägt 397B MoE. Frontier-Modelle wurden aufgrund der Kosten gestrichen.

Andrej Karpathy tritt dem Pre-Training-Team von Anthropic bei, um die rekursive Selbstverbesserung mit Claude voranzutreiben
Andrej Karpathy, ehemaliger OpenAI-Mitbegründer, schließt sich unter Nick Josef dem Pre-Training-Team von Anthropic an, um ein neues Team aufzubauen, das sich darauf konzentriert, Claude zur Beschleunigung der Pre-Training-Forschung zu nutzen und so eine rekursive Selbstverbesserung zu ermöglichen.