Los Modelos Qwen3 Small Ajustados Superan a los LLMs de Vanguardia en Tareas Específicas con Menor Costo

Una comparación sistemática de los pequeños modelos destilados Qwen3 frente a modelos API de vanguardia muestra que los modelos de lenguaje pequeños ajustados pueden superar a modelos más grandes y costosos en tareas estructuradas específicas.
Resultados de Referencia
El estudio comparó modelos Qwen3 (de 0.6B a 8B parámetros) frente a APIs de vanguardia que incluyen GPT-5 nano/mini/5.2, Gemini 2.5 Flash Lite/Flash, Claude Haiku 4.5/Sonnet 4.6/Opus 4.6, y Grok 4.1 Fast/Grok 4 a través de 9 conjuntos de datos. Todos los modelos destilados fueron entrenados usando únicamente maestros de peso abierto, con tan solo 50 ejemplos. La inferencia se ejecutó en vLLM en una sola H100.
Hallazgos Clave de Rendimiento
- Llamadas a funciones de Hogar Inteligente: Qwen3-0.6B logró un 98.7% de precisión frente al 92.0% de Gemini Flash
- Text2SQL: Qwen3-4B destilado obtuvo un 98.0% frente al 98.7% de Claude Haiku y el 96.0% de GPT-5 nano
- Comparación de costos: Costo por millón de solicitudes en Text2SQL: Qwen3-4B ~$3 vs. Claude Haiku $378 y GPT-5 nano $24
- Tareas de clasificación: Los modelos destilados se desempeñaron dentro de 0–1.5 puntos porcentuales de la mejor opción de vanguardia en los conjuntos de datos Banking77, E-commerce y TREC
- Ventaja de vanguardia: HotpotQA (razonamiento abierto + conocimiento del mundo) — 92.0% vs. 98.0% de Haiku
Métricas de Rendimiento
Para Text2SQL con Qwen3-4B en H100:
- 222 RPS sostenidos
- p50: 390ms | p95: 640ms | p99: 870ms
- 7.6 GiB de VRAM (BF16, sin cuantización)
- FP8 dio +15% de rendimiento, −44% de VRAM, sin pérdida de precisión medible en experimentos breves
Metodología
- Mismos conjuntos de prueba, indicaciones y criterios de evaluación para todos los modelos
- Modelos de vanguardia ejecutados 3× por conjunto de datos (reportando media ± desv. estándar), destilados a temperatura=0
- Evaluación: coincidencia exacta para clasificación, equivalencia de llamada a herramienta (comparación JSON con normalización de parámetros por defecto) para llamadas a funciones, Claude Sonnet 4.6 como juez-LLM para tareas de generación
- Cálculo de costos: vanguardia = uso de tokens medido × precios publicados (feb 2026); destilado = H100 a $2.40/hr ÷ RPS sostenidos
Recomendaciones Prácticas
- Usar modelos destilados cuando: Tengas tareas estructuradas, esquemas bien definidos, alto volumen o necesidades de soberanía de datos
- Usar APIs de vanguardia cuando: Necesites conocimiento amplio del mundo, generación libre o el volumen sea tan bajo que el costo no importe
- Enfoque híbrido: Enrutar entre los dos según los requisitos de la tarea
Disponibilidad
Todo el código, modelos, datos y scripts de evaluación son de código abierto en GitHub: https://github.com/distil-labs/inference-efficiency-benchmarks/
Análisis completo con gráficos disponible en el blog: https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Meta pausa programa interno de entrenamiento de IA tras fuga de datos de pulsaciones de teclas de empleados
Meta pausa el programa MCI que rastrea las pulsaciones de teclado de los empleados tras una filtración SEV 2 que expuso conversaciones privadas, datos de rendimiento y transcripciones en toda la empresa.

IA escribió un motor PHP en Rust, pasa el 17% de las pruebas de PHP-src, renderiza WordPress
Phargo, un intérprete de PHP escrito desde cero en Rust íntegramente por IA, pasa 3,844 de 22,037 pruebas de PHP (17.4 %) y renderiza páginas de WordPress desde SQLite.
Claude Agent SDK obtiene créditos mensuales dedicados para uso programático a partir del 15 de junio
A partir del 15 de junio, los planes pagos de Claude reciben un crédito mensual separado para uso programático (Agent SDK, claude-p, Claude Code GitHub Actions, herramientas de terceros). Pro obtiene $20, Max 5x $100, etc. El uso se pausa si se agota el crédito y los créditos de uso adicional están desactivados.
La reacción pública en contra de la IA es real: violencia, datos de encuestas y rendimientos decrecientes
Un ataque con cóctel molotov al CEO de OpenAI, la ira de la Generación Z sube al 31% y el 80% de las empresas no ven ganancias de productividad: la luna de miel de la IA ha terminado.