Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE

IBM hat Granite 4.1 veröffentlicht, eine Open-Source-Sprachmodellfamilie (Apache 2.0) mit den Größen 3B, 8B und 30B. Alle verwenden einen dichten Decoder-Only-Transformer – kein MoE, keine langen Reasoning-Ketten. Das 8B-Modell sticht hervor: Es entspricht oder übertrifft das vorherige Granite 4.0-H-Small (32B MoE, 9B aktiv) in mehreren Benchmarks.
Wichtige Benchmark-Ergebnisse
- ArenaHard (Qualität realer Prompts): 8B erreicht 69,0, 32B MoE niedriger.
- BFCL V3 (Tool-Nutzung): 8B erreicht 68,3, 32B MoE 64,7.
- GSM8K (mathematisches Reasoning): 8B erreicht 92,5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B übertrifft das größere Modell durchgängig.
Trainingspipeline
Granite 4.1 wurde mit 15 Billionen Tokens in fünf Phasen mit sich ändernden Datenmischungen trainiert:
- Phase 1: 59% CommonCrawl, 20% Code, 7% Mathematik.
- Phase 2: Mathematik steigt auf 35%, Code auf 30%.
- Phasen 3-4: Mischung aus Chain-of-Thought-Reasoning, Instruktionsdaten und hochwertigen Webinhalten.
- Phase 5: Erweiterung des Kontextfensters auf 512K Tokens (8B und 30B).
Die entscheidende Erkenntnis: Datenqualität vor Parameterskalierung. IBMs Datenfilter-Pipeline verwirft halluzinierte oder instruktionsignorierende Beispiele während des Feintunings, um das Training auf schlechten Signalen zu vermeiden.
Warum dies für KI-Agenten wichtig ist
Dichte Modelle bieten vorhersagbare Latenz und Kosten – kein Routing-Overhead. Für Entwickler von KI-Codierungsagenten bietet das 8B-Modell von Granite 4.1 starke Tool-Nutzung und mathematisches Reasoning zu einem Bruchteil der Rechenkosten von MoE-Modellen.
📖 Read the full source: HN AI Agents
👀 Siehe auch
Vibe-Coding hat zwei Bedeutungen – welche verwendest du?
Ein Reddit-Beitrag argumentiert, dass 'Vibe Coding' zwei unterschiedliche Praktiken vermischt: nachlässiges KI-Dumping und sinnvolle KI-Unterstützung. Diese Mehrdeutigkeit erzeugt unnötige Kommunikationskonflikte unter Entwicklern.

Anthropics Mythos-Leak enthüllt latentes Hochleistungssystem
Durchgesickerte Dokumente beschreiben Claude Mythos als einen 'Leistungssprung' mit 'beispiellosen Cybersicherheitsrisiken' und fortschrittlichen Cyberfähigkeiten, während die Bewertung von Anthropic mit 380 Milliarden Dollar strukturelle Anreize schafft, eine öffentliche 'Sicherheits'-Erzählung aufrechtzuerhalten.

Claude Fable 5 von Anthropic: Mythos-Klasse-Fähigkeiten, Datenspeicherung erforderlich
Anthropic veröffentlicht Claude Fable 5 morgen, beschrieben als das fortschrittlichste öffentlich zugängliche Modell mit Fähigkeiten der Mythos-Klasse und verbesserten Schutzmaßnahmen. Es wird voraussichtlich Datenaufbewahrung erfordern.

OpenClaw-Agent-Ausgabenmuster und fehlende Ausgabenobergrenzen
Ein Entwickler verfolgte die Ausgaben von OpenClaw-Agenten über zwei Monate und stellte fest, dass die meisten Agenten im Durchschnitt 40–80 US-Dollar pro Monat an API- und Dienstgebühren verursachen, wenn sie unbeaufsichtigt bleiben, wobei die Spitzen an Wochenenden und über Nacht auftreten. Das Standardverhalten ist unbegrenzt, ohne integrierte Ausgabenobergrenze.