Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE

IBM hat Granite 4.1 veröffentlicht, eine Open-Source-Sprachmodellfamilie (Apache 2.0) mit den Größen 3B, 8B und 30B. Alle verwenden einen dichten Decoder-Only-Transformer – kein MoE, keine langen Reasoning-Ketten. Das 8B-Modell sticht hervor: Es entspricht oder übertrifft das vorherige Granite 4.0-H-Small (32B MoE, 9B aktiv) in mehreren Benchmarks.
Wichtige Benchmark-Ergebnisse
- ArenaHard (Qualität realer Prompts): 8B erreicht 69,0, 32B MoE niedriger.
- BFCL V3 (Tool-Nutzung): 8B erreicht 68,3, 32B MoE 64,7.
- GSM8K (mathematisches Reasoning): 8B erreicht 92,5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B übertrifft das größere Modell durchgängig.
Trainingspipeline
Granite 4.1 wurde mit 15 Billionen Tokens in fünf Phasen mit sich ändernden Datenmischungen trainiert:
- Phase 1: 59% CommonCrawl, 20% Code, 7% Mathematik.
- Phase 2: Mathematik steigt auf 35%, Code auf 30%.
- Phasen 3-4: Mischung aus Chain-of-Thought-Reasoning, Instruktionsdaten und hochwertigen Webinhalten.
- Phase 5: Erweiterung des Kontextfensters auf 512K Tokens (8B und 30B).
Die entscheidende Erkenntnis: Datenqualität vor Parameterskalierung. IBMs Datenfilter-Pipeline verwirft halluzinierte oder instruktionsignorierende Beispiele während des Feintunings, um das Training auf schlechten Signalen zu vermeiden.
Warum dies für KI-Agenten wichtig ist
Dichte Modelle bieten vorhersagbare Latenz und Kosten – kein Routing-Overhead. Für Entwickler von KI-Codierungsagenten bietet das 8B-Modell von Granite 4.1 starke Tool-Nutzung und mathematisches Reasoning zu einem Bruchteil der Rechenkosten von MoE-Modellen.
📖 Read the full source: HN AI Agents
👀 Siehe auch

OpenClaw-Entwickler meldet Kontextkompaktierungsprobleme während des Driftwatch V3-Builds
Ein OpenClaw-Entwickler schloss die Sprints 2–4 des Driftwatch-V3-Builds ab, stieß jedoch auf Kontextkomprimierungsprobleme, die den Speicher des KI-Agenten mitten in der Sitzung löschten, was manuelle Eingriffe zur Wiederherstellung des Fortschritts mithilfe von Sprint-Zusammenfassungen erforderte.

Indien und VAE kooperieren bei KI-Souveränität mit Cerebras-Supercomputern
Indien und die VAE haben sich zusammengetan, um einen Cerebras-gestützten KI-Supercomputer auf indischem Boden zu installieren und damit die US-Cloud-Giganten zu umgehen. Der Deal mit G42 gibt Indien Maschinenbesitz und Datenhoheit.

Sechs wissenschaftlich belegte Parallelen zwischen LLM-Fehlfunktionen und ADHS-Kognition
Ein Entwickler mit ADHS identifiziert sechs Parallelen zwischen LLM-Fehlermustern und der ADHS-Kognitionswissenschaft, gestützt durch unabhängige Forschung zu assoziativer Verarbeitung, Konfabulation, Arbeitsgedächtnisbeschränkungen, Musterergänzung, Strukturabhängigkeit und Themenkontinuität.

Gemma 4 Chat-Vorlagenfehler: Tool-Parameter mit anyOf/null werden als leerer Typ dargestellt
Ein Fehler in der Chat-Vorlage von Gemma 4 entfernt $ref, anyOf und $defs aus Tool-Parameter-Schemata, wodurch nullable Referenzen als leere Typfelder erscheinen. Ein Jinja-Fix stellt die korrekte Schema-Parsing für alle Inferenz-Engines wieder her.