Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE

✍️ OpenClawRadar📅 Veröffentlicht: 30. April 2026🔗 Source
Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE
Ad

IBM hat Granite 4.1 veröffentlicht, eine Open-Source-Sprachmodellfamilie (Apache 2.0) mit den Größen 3B, 8B und 30B. Alle verwenden einen dichten Decoder-Only-Transformer – kein MoE, keine langen Reasoning-Ketten. Das 8B-Modell sticht hervor: Es entspricht oder übertrifft das vorherige Granite 4.0-H-Small (32B MoE, 9B aktiv) in mehreren Benchmarks.

Wichtige Benchmark-Ergebnisse

  • ArenaHard (Qualität realer Prompts): 8B erreicht 69,0, 32B MoE niedriger.
  • BFCL V3 (Tool-Nutzung): 8B erreicht 68,3, 32B MoE 64,7.
  • GSM8K (mathematisches Reasoning): 8B erreicht 92,5.
  • AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B übertrifft das größere Modell durchgängig.
Ad

Trainingspipeline

Granite 4.1 wurde mit 15 Billionen Tokens in fünf Phasen mit sich ändernden Datenmischungen trainiert:

  • Phase 1: 59% CommonCrawl, 20% Code, 7% Mathematik.
  • Phase 2: Mathematik steigt auf 35%, Code auf 30%.
  • Phasen 3-4: Mischung aus Chain-of-Thought-Reasoning, Instruktionsdaten und hochwertigen Webinhalten.
  • Phase 5: Erweiterung des Kontextfensters auf 512K Tokens (8B und 30B).

Die entscheidende Erkenntnis: Datenqualität vor Parameterskalierung. IBMs Datenfilter-Pipeline verwirft halluzinierte oder instruktionsignorierende Beispiele während des Feintunings, um das Training auf schlechten Signalen zu vermeiden.

Warum dies für KI-Agenten wichtig ist

Dichte Modelle bieten vorhersagbare Latenz und Kosten – kein Routing-Overhead. Für Entwickler von KI-Codierungsagenten bietet das 8B-Modell von Granite 4.1 starke Tool-Nutzung und mathematisches Reasoning zu einem Bruchteil der Rechenkosten von MoE-Modellen.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

🦀
Nachrichten

Vibe-Coding hat zwei Bedeutungen – welche verwendest du?

Ein Reddit-Beitrag argumentiert, dass 'Vibe Coding' zwei unterschiedliche Praktiken vermischt: nachlässiges KI-Dumping und sinnvolle KI-Unterstützung. Diese Mehrdeutigkeit erzeugt unnötige Kommunikationskonflikte unter Entwicklern.

OpenClawRadar
Anthropics Mythos-Leak enthüllt latentes Hochleistungssystem
Nachrichten

Anthropics Mythos-Leak enthüllt latentes Hochleistungssystem

Durchgesickerte Dokumente beschreiben Claude Mythos als einen 'Leistungssprung' mit 'beispiellosen Cybersicherheitsrisiken' und fortschrittlichen Cyberfähigkeiten, während die Bewertung von Anthropic mit 380 Milliarden Dollar strukturelle Anreize schafft, eine öffentliche 'Sicherheits'-Erzählung aufrechtzuerhalten.

OpenClawRadar
Claude Fable 5 von Anthropic: Mythos-Klasse-Fähigkeiten, Datenspeicherung erforderlich
Nachrichten

Claude Fable 5 von Anthropic: Mythos-Klasse-Fähigkeiten, Datenspeicherung erforderlich

Anthropic veröffentlicht Claude Fable 5 morgen, beschrieben als das fortschrittlichste öffentlich zugängliche Modell mit Fähigkeiten der Mythos-Klasse und verbesserten Schutzmaßnahmen. Es wird voraussichtlich Datenaufbewahrung erfordern.

OpenClawRadar
OpenClaw-Agent-Ausgabenmuster und fehlende Ausgabenobergrenzen
Nachrichten

OpenClaw-Agent-Ausgabenmuster und fehlende Ausgabenobergrenzen

Ein Entwickler verfolgte die Ausgaben von OpenClaw-Agenten über zwei Monate und stellte fest, dass die meisten Agenten im Durchschnitt 40–80 US-Dollar pro Monat an API- und Dienstgebühren verursachen, wenn sie unbeaufsichtigt bleiben, wobei die Spitzen an Wochenenden und über Nacht auftreten. Das Standardverhalten ist unbegrenzt, ohne integrierte Ausgabenobergrenze.

OpenClawRadar