VibeThinker-3B: Un modelo de 3B parámetros que iguala a DeepSeek 671B en los benchmarks de matemáticas AIME

Un equipo de nueve investigadores de Sina Weibo publicó este fin de semana un informe arXiv de 14 páginas afirmando que un modelo de 3B parámetros —VibeThinker-3B— iguala o supera el rendimiento en razonamiento de modelos cientos de veces más grandes. El modelo obtuvo 94.3 en AIME 2026 (American Invitational Mathematics Examination), colocándose junto a DeepSeek V3.2 (671B parámetros) y por delante de Gemini 3 Pro (91.7). Con una técnica de escalado en tiempo de prueba llamada Evaluación de Fiabilidad a Nivel de Afirmación (CLRA), la puntuación alcanza 97.1.
Puntos de Referencia Clave
- AIME 2025: 91.4
- AIME 2026: 94.3 (97.1 con CLRA)
- HMMT 2025: 89.3
- BruMO 2025: 93.8
- IMO-AnswerBench: 76.4
- LiveCodeBench v6 (Pass@1): 80.2
- Concursos LeetCode inéditos (abril–mayo 2026): 96.1% tasa de aceptación
- IFEval: 93.4
Notablemente, VibeThinker-3B rinde por debajo en puntos de referencia de conocimiento: 70.2 en GPQA-Diamond vs. 91.9 (Gemini 3 Pro) y 87.0 (Claude Opus 4.5). Los autores reconocen explícitamente que esto es coherente con su afirmación: el razonamiento verificable es "denso en parámetros", mientras que el conocimiento de dominio abierto es "expansivo en parámetros".
El Pipeline de Entrenamiento
VibeThinker-3B se post-entrena sobre Qwen2.5-Coder-3B (equipo Qwen de Alibaba) usando el "Principio de Espectro a Señal", un pipeline multi-etapa introducido en el trabajo anterior de VibeThinker del equipo. El artículo describe una Hipótesis de Compresión-Cobertura Paramétrica: el razonamiento verificable puede comprimirse en un núcleo compacto, mientras que el conocimiento amplio requiere más parámetros.
En cuestión de horas tras la publicación, el artículo recibió 62 votos positivos en Hugging Face Daily Papers, el repositorio del modelo tenía 130 likes, y el repositorio de GitHub tenía 685 estrellas. El escepticismo en redes sociales fue alto: el post del usuario @orcus108 acumuló más de 161 mil visualizaciones preguntando: "Sinceramente, no sé si esto es un gran avance o si los benchmarks están rotos."
Para contexto: DeepSeek V3.2 tiene 671B parámetros (~224 veces más grande), GLM-5 tiene 744B, y Kimi K2.5 supera 1 billón. VibeThinker-3B puede ejecutarse en un portátil de consumo.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

El Análisis de Precios de Inferencia Muestra una Diferencia de 4.4x para el Mismo Modelo entre Proveedores
El análisis de precios de inferencia para Llama 3.1 70B Instruct muestra una diferencia de coste de 4.4x entre proveedores, con DeepInfra a $0.20/$0.27 por millón de tokens y Together a $0.88/$0.88. Para modelos de razonamiento, la diferencia alcanza ~30x entre DeepSeek R1 y OpenAI o1.

La discusión en Reddit destaca una reducción del 68% en tokens para agentes de IA mediante cambios en la infraestructura.
Un usuario de Reddit informa haber reducido el uso de tokens de agentes de IA en un 68,5% al cambiar de una infraestructura estándar a un sistema operativo nativo para agentes con acceso nativo a estados en JSON, reduciendo las comprobaciones de estado de aproximadamente 9 comandos de shell a 1 llamada estructurada.

Ajuste Fino Autosupervisado en Errores Propios Eleva Modelos Pequeños al 80% en HumanEval
Un desarrollador entrenó a Qwen 2.5 7B con sus propios pares de código autogenerados, alcanzando 112/164 en HumanEval (+87 problemas) sin datos de entrenamiento escritos por humanos. El enfoque se transfiere a Llama 3.2 3B y Qwen 3 4B.

DeepSeek hace un descuento permanente del 75% en su modelo insignia de IA
DeepSeek hace permanente un descuento del 75% en su modelo estrella de IA. La reducción de precio se aplica al acceso por API y originalmente era una promoción temporal.