Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE

✍️ OpenClawRadar📅 Veröffentlicht: 30. April 2026🔗 Source
Granite 4.1: IBMs 8B dichtes Modell erreicht Benchmarks von 32B MoE
Ad

IBM hat Granite 4.1 veröffentlicht, eine Open-Source-Sprachmodellfamilie (Apache 2.0) mit den Größen 3B, 8B und 30B. Alle verwenden einen dichten Decoder-Only-Transformer – kein MoE, keine langen Reasoning-Ketten. Das 8B-Modell sticht hervor: Es entspricht oder übertrifft das vorherige Granite 4.0-H-Small (32B MoE, 9B aktiv) in mehreren Benchmarks.

Wichtige Benchmark-Ergebnisse

  • ArenaHard (Qualität realer Prompts): 8B erreicht 69,0, 32B MoE niedriger.
  • BFCL V3 (Tool-Nutzung): 8B erreicht 68,3, 32B MoE 64,7.
  • GSM8K (mathematisches Reasoning): 8B erreicht 92,5.
  • AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B übertrifft das größere Modell durchgängig.
Ad

Trainingspipeline

Granite 4.1 wurde mit 15 Billionen Tokens in fünf Phasen mit sich ändernden Datenmischungen trainiert:

  • Phase 1: 59% CommonCrawl, 20% Code, 7% Mathematik.
  • Phase 2: Mathematik steigt auf 35%, Code auf 30%.
  • Phasen 3-4: Mischung aus Chain-of-Thought-Reasoning, Instruktionsdaten und hochwertigen Webinhalten.
  • Phase 5: Erweiterung des Kontextfensters auf 512K Tokens (8B und 30B).

Die entscheidende Erkenntnis: Datenqualität vor Parameterskalierung. IBMs Datenfilter-Pipeline verwirft halluzinierte oder instruktionsignorierende Beispiele während des Feintunings, um das Training auf schlechten Signalen zu vermeiden.

Warum dies für KI-Agenten wichtig ist

Dichte Modelle bieten vorhersagbare Latenz und Kosten – kein Routing-Overhead. Für Entwickler von KI-Codierungsagenten bietet das 8B-Modell von Granite 4.1 starke Tool-Nutzung und mathematisches Reasoning zu einem Bruchteil der Rechenkosten von MoE-Modellen.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

OpenClaw-Entwickler meldet Kontextkompaktierungsprobleme während des Driftwatch V3-Builds
Nachrichten

OpenClaw-Entwickler meldet Kontextkompaktierungsprobleme während des Driftwatch V3-Builds

Ein OpenClaw-Entwickler schloss die Sprints 2–4 des Driftwatch-V3-Builds ab, stieß jedoch auf Kontextkomprimierungsprobleme, die den Speicher des KI-Agenten mitten in der Sitzung löschten, was manuelle Eingriffe zur Wiederherstellung des Fortschritts mithilfe von Sprint-Zusammenfassungen erforderte.

OpenClawRadar
Indien und VAE kooperieren bei KI-Souveränität mit Cerebras-Supercomputern
Nachrichten

Indien und VAE kooperieren bei KI-Souveränität mit Cerebras-Supercomputern

Indien und die VAE haben sich zusammengetan, um einen Cerebras-gestützten KI-Supercomputer auf indischem Boden zu installieren und damit die US-Cloud-Giganten zu umgehen. Der Deal mit G42 gibt Indien Maschinenbesitz und Datenhoheit.

OpenClawRadar
Sechs wissenschaftlich belegte Parallelen zwischen LLM-Fehlfunktionen und ADHS-Kognition
Nachrichten

Sechs wissenschaftlich belegte Parallelen zwischen LLM-Fehlfunktionen und ADHS-Kognition

Ein Entwickler mit ADHS identifiziert sechs Parallelen zwischen LLM-Fehlermustern und der ADHS-Kognitionswissenschaft, gestützt durch unabhängige Forschung zu assoziativer Verarbeitung, Konfabulation, Arbeitsgedächtnisbeschränkungen, Musterergänzung, Strukturabhängigkeit und Themenkontinuität.

OpenClawRadar
Gemma 4 Chat-Vorlagenfehler: Tool-Parameter mit anyOf/null werden als leerer Typ dargestellt
Nachrichten

Gemma 4 Chat-Vorlagenfehler: Tool-Parameter mit anyOf/null werden als leerer Typ dargestellt

Ein Fehler in der Chat-Vorlage von Gemma 4 entfernt $ref, anyOf und $defs aus Tool-Parameter-Schemata, wodurch nullable Referenzen als leere Typfelder erscheinen. Ein Jinja-Fix stellt die korrekte Schema-Parsing für alle Inferenz-Engines wieder her.

OpenClawRadar