"Evaluación de los Últimos Modelos de IA: El Auge de los Modelos Extremos"

La reciente evaluación de 40 nuevos modelos de IA pone de manifiesto cambios significativos en el paisaje de Precio vs. Rendimiento. Con atención centrada en Kimi k2.5 y Claude Opus 4.6, el análisis revela una división en dos extremos: 'Modo Dios' y 'Modo Flash', lo que hace que los modelos de gama media sean ineficaces.
Detalles Clave
- Situación de Kimi k2.5: Los intentos de evaluar Kimi k2.5 no tuvieron éxito debido a errores persistentes de 'Sin Contenido', probablemente por sobrecarga. Sin embargo, Kimi-k2-Thinking se desempeñó adecuadamente en tareas de razonamiento complejo a ~15 TPS.
- Dominio de Velocidad: Para aplicaciones sensibles a la latencia, Liquid LFM 2.5 surgió como el modelo más rápido, alcanzando ~359 tokens/segundo, seguido por Ministral 3B a ~293 tokens/segundo.
- Rentabilidad: Ministral 3B se destaca como la solución más rentable, a $0.10/1M de tokens de entrada. Es ~17 veces más barato y ~40% más rápido que GPT-5.2 Codex, lo que lo convierte en una opción de gran valor frente a opciones de precios más altos.
Se recomienda evitar modelos de gama media que cuesten entre $0.50 y $1.00, ya que no ofrecen un rendimiento competitivo. Dependiendo de tus necesidades, elige modelos más caros como Opus/GPT-5 para inteligencia o opta por velocidad rentable con Liquid/Mistral.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

La auditoría de registros de API revela que los agentes de IA desperdician tokens en la hinchazón de la ventana de contexto
Una auditoría de Reddit descubre que los agentes de Claude queman más de 30k tokens en exploración de archivos y registros verbosos antes de escribir código, provocando degradación arquitectónica a medida que el contexto se llena de ruido.

Atlassian despide al 10% de su plantilla para financiar inversiones en IA.
Atlassian está recortando 1,600 puestos de trabajo (10% de su plantilla) para autofinanciar inversiones en IA y fortalecer su perfil financiero, con 900 puestos en desarrollo de software afectados. El CEO Mike Cannon-Brookes dice que la IA no reemplaza a las personas, sino que cambia los requisitos de habilidades.

Claude 4.6 Opus Puede Reproducir list.h de Linux a Partir de una Entrada Mínima
Un usuario demostró que Claude 4.6 Opus puede generar una copia casi idéntica del archivo de encabezado list.h de Linux cuando se le proporcionan las primeras 43 líneas como entrada con la temperatura ajustada a 0, lo que plantea preguntas sobre las implicaciones de la licencia GPL para los modelos de IA entrenados con código de código abierto.
Gates sobre la IA: Una era turbulenta exige decisiones críticas
Bill Gates sostiene que estamos en una era turbulenta de la IA, y las decisiones que tomemos ahora son críticas. Destaca decisiones clave sobre seguridad, equidad y regulación.