VibeThinker-3B: Ein 3B-Parameter-Modell, das auf AIME-Mathe-Benchmarks mit 671B DeepSeek mithalten kann

✍️ OpenClawRadar📅 Veröffentlicht: 28. Juni 2026🔗 Source
VibeThinker-3B: Ein 3B-Parameter-Modell, das auf AIME-Mathe-Benchmarks mit 671B DeepSeek mithalten kann
Ad

Ein Team von neun Forschern bei Sina Weibo veröffentlichte am Wochenende einen 14-seitigen arXiv-Bericht, in dem sie behaupten, dass ein 3B-Parameter-Modell – VibeThinker-3B – die Denkleistung von Modellen, die hunderte Male größer sind, erreicht oder übertrifft. Das Modell erzielte 94,3 auf AIME 2026 (American Invitational Mathematics Examination) und platziert sich damit neben DeepSeek V3.2 (671B Parameter) und vor Gemini 3 Pro (91,7). Mit einer Testzeit-Skalierungstechnik namens Claim-Level Reliability Assessment erreicht die Punktzahl 97,1.

Wichtige Benchmarks

  • AIME 2025: 91,4
  • AIME 2026: 94,3 (97,1 mit CLRA)
  • HMMT 2025: 89,3
  • BruMO 2025: 93,8
  • IMO-AnswerBench: 76,4
  • LiveCodeBench v6 (Pass@1): 80,2
  • Unveröffentlichte LeetCode-Wettbewerbe (April–Mai 2026): 96,1% Akzeptanzrate
  • IFEval: 93,4

Bemerkenswerterweise schneidet VibeThinker-3B bei Wissens-Benchmarks schlechter ab: 70,2 auf GPQA-Diamond gegenüber 91,9 (Gemini 3 Pro) und 87,0 (Claude Opus 4,5). Die Autoren räumen dies ausdrücklich ein und sagen, es stehe im Einklang mit ihrer Behauptung – verifizierbares Denken sei „parameterdicht“, während offenes Wissen „parameterexpansiv“ sei.

Ad

Der Trainings-Pipeline

VibeThinker-3B wird auf Qwen2.5-Coder-3B (Alibabas Qwen-Team) mittels des „Spectrum-to-Signal Principle“ nachtrainiert, einer mehrstufigen Pipeline, die in der früheren VibeThinker-Arbeit des Teams eingeführt wurde. Das Papier stellt eine Parametric Compression-Coverage-Hypothese vor: Verifizierbares Denken kann auf einen kompakten Kern komprimiert werden, während breites Wissen mehr Parameter erfordert.

Innerhalb weniger Stunden nach der Veröffentlichung erhielt das Papier 62 Upvotes auf Hugging Face Daily Papers, das Modell-Repo hatte 130 Likes und das GitHub-Repo 685 Sterne. In den sozialen Medien war die Skepsis groß – der Beitrag von User @orcus108 sammelte über 161.000 Aufrufe und fragte: „Ich weiß wirklich nicht, ob das ein Durchbruch ist oder ob die Benchmarks kaputt sind.“

Zum Vergleich: DeepSeek V3.2 hat 671B Parameter (~224x größer), GLM-5 hat 744B und Kimi K2.5 übertrifft 1 Billion. VibeThinker-3B kann auf einem Consumer-Laptop laufen.

📖 Lesen Sie die vollständige Quelle: HN AI Agents

Ad

👀 Siehe auch

Trump zieht KI-Verordnung wegen Bedenken um Verlangsamung der US-Technologie zurück
Nachrichten

Trump zieht KI-Verordnung wegen Bedenken um Verlangsamung der US-Technologie zurück

Präsident Trump hat eine KI-Verfügung aus der Biden-Ära aufgehoben, um die US-Technologieführerschaft zu stärken. Damit entfallen Sicherheitsauflagen.

OpenClawRadar
Qwen 3.6 27B im DeepSWE-Benchmark: 2% Punktzahl, 70 Stunden, 44k durchschnittliche Ausgabetoken
Nachrichten

Qwen 3.6 27B im DeepSWE-Benchmark: 2% Punktzahl, 70 Stunden, 44k durchschnittliche Ausgabetoken

Qwen 3.6 27B (FP8, BF16 KV-Cache, 262k Kontext) erreichte 2% bei DeepSWE in 70 Stunden. Die Ausgabetoken betrugen durchschnittlich 44k pro Aufgabe – vergleichbar mit größeren Modellen wie Qwen 3.6 Plus. Ausgeführt auf 1x RTX6000 Pro Blackwell über RunPod.

OpenClawRadar
OpenClaw Agent bearbeitet HEARTBEAT.md automatisch und fügt 10 selbst zugewiesene Aufgaben hinzu
Nachrichten

OpenClaw Agent bearbeitet HEARTBEAT.md automatisch und fügt 10 selbst zugewiesene Aufgaben hinzu

Bei einer standardmäßigen HEARTBEAT.md-Ausführung fügte ein OpenClaw-Agent 10 selbst zugewiesene Aufgaben hinzu, darunter Systemüberprüfung, Speicherwartung und Wetterchecks – was Bedenken hinsichtlich des Token-Verbrauchs aufwarf.

OpenClawRadar
AWS Bedrock eliminiert still und leise das Claude Opus 4.7-Kontingent: Eine Warnung für produktive KI-Workflows
Nachrichten

AWS Bedrock eliminiert still und leise das Claude Opus 4.7-Kontingent: Eine Warnung für produktive KI-Workflows

Ein HN-Nutzer berichtet, dass AWS Bedrock sein Claude Opus 4.7-Kontingent ohne Vorwarnung auf 0 gesetzt hat. AWS-Support bestätigt, dass es sich um ein Systemupdate handelte und eine Wiederherstellung nicht garantiert werden kann. Benutzern wird empfohlen, zu Opus 4.6 zu migrieren oder den Anbieter zu wechseln.

OpenClawRadar