Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE

✍️ OpenClawRadar📅 Veröffentlicht: 30. April 2026🔗 Source
Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE
Ad

IBM hat Granite 4.1 veröffentlicht, eine Open-Source-Sprachmodellfamilie (Apache 2.0) mit den Größen 3B, 8B und 30B. Alle verwenden einen dichten Decoder-Only-Transformer – kein MoE, keine langen Reasoning-Ketten. Das 8B-Modell sticht hervor: Es entspricht oder übertrifft das vorherige Granite 4.0-H-Small (32B MoE, 9B aktiv) in mehreren Benchmarks.

Wichtige Benchmark-Ergebnisse

  • ArenaHard (Qualität realer Prompts): 8B erreicht 69,0, 32B MoE niedriger.
  • BFCL V3 (Tool-Nutzung): 8B erreicht 68,3, 32B MoE 64,7.
  • GSM8K (mathematisches Reasoning): 8B erreicht 92,5.
  • AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B übertrifft das größere Modell durchgängig.
Ad

Trainingspipeline

Granite 4.1 wurde mit 15 Billionen Tokens in fünf Phasen mit sich ändernden Datenmischungen trainiert:

  • Phase 1: 59% CommonCrawl, 20% Code, 7% Mathematik.
  • Phase 2: Mathematik steigt auf 35%, Code auf 30%.
  • Phasen 3-4: Mischung aus Chain-of-Thought-Reasoning, Instruktionsdaten und hochwertigen Webinhalten.
  • Phase 5: Erweiterung des Kontextfensters auf 512K Tokens (8B und 30B).

Die entscheidende Erkenntnis: Datenqualität vor Parameterskalierung. IBMs Datenfilter-Pipeline verwirft halluzinierte oder instruktionsignorierende Beispiele während des Feintunings, um das Training auf schlechten Signalen zu vermeiden.

Warum dies für KI-Agenten wichtig ist

Dichte Modelle bieten vorhersagbare Latenz und Kosten – kein Routing-Overhead. Für Entwickler von KI-Codierungsagenten bietet das 8B-Modell von Granite 4.1 starke Tool-Nutzung und mathematisches Reasoning zu einem Bruchteil der Rechenkosten von MoE-Modellen.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

Claude Code v2.1.91 Updates: Agent-Design-Patterns, Speicherregeln und Tool-Verbesserungen
Nachrichten

Claude Code v2.1.91 Updates: Agent-Design-Patterns, Speicherregeln und Tool-Verbesserungen

Claude Code v2.1.91 fügt einen Referenzleitfaden für Agent-Design-Patterns hinzu, der die Gestaltung von Werkzeugschnittstellen, Kontextmanagement und Caching-Strategien abdeckt. Das Update vereinfacht die Regeln für die Speicherauswahl, fügt Sicherheitsüberwachung für Memory Poisoning hinzu und verbessert die Werkzeugbeschreibungen für Edit-, ReadFile- und Write-Operationen.

OpenClawRadar
NIST bittet um öffentliche Stellungnahmen zu Sicherheitsstandards für KI-Agenten
Nachrichten

NIST bittet um öffentliche Stellungnahmen zu Sicherheitsstandards für KI-Agenten

Das National Institute of Standards and Technology hat eine Informationsanfrage zu Sicherheitsaspekten für künstliche Intelligenz-Agenten veröffentlicht, mit einer Stellungnahmefrist bis zum 9. März 2026. Die RFI ist über das Federal Register für öffentliche Kommentare geöffnet.

OpenClawRadar
Lokaler LLM-Benchmark: Backend-Generierung durch Funktionsaufruf – GLM, Qwen, DeepSeek im Vergleich
Nachrichten

Lokaler LLM-Benchmark: Backend-Generierung durch Funktionsaufruf – GLM, Qwen, DeepSeek im Vergleich

Ein rigoroser Benchmark lokaler und Frontier-LLMs für Backend-Code-Generierung mittels Function Calling, mit Bewertungsmatrix. Wichtigste Ergebnisse: qwen3.5-35b-a3b erreicht GPT-5.4 bei DB/API-Design und dichtes Qwen 27B schlägt 397B MoE. Frontier-Modelle wurden aufgrund der Kosten gestrichen.

OpenClawRadar
Andrej Karpathy tritt dem Pre-Training-Team von Anthropic bei, um die rekursive Selbstverbesserung mit Claude voranzutreiben
Nachrichten

Andrej Karpathy tritt dem Pre-Training-Team von Anthropic bei, um die rekursive Selbstverbesserung mit Claude voranzutreiben

Andrej Karpathy, ehemaliger OpenAI-Mitbegründer, schließt sich unter Nick Josef dem Pre-Training-Team von Anthropic an, um ein neues Team aufzubauen, das sich darauf konzentriert, Claude zur Beschleunigung der Pre-Training-Forschung zu nutzen und so eine rekursive Selbstverbesserung zu ermöglichen.

OpenClawRadar