El benchmark muestra que un modelo más pequeño de 4B supera a los LLMs más grandes en aplicaciones de chat de teléfono a hogar.

Resultados de evaluación comparativa de chat de teléfono a hogar
Una evaluación comparativa reciente evaluó 8 LLMs locales para aplicaciones de chat de teléfono a hogar donde la inferencia se ejecuta en una computadora doméstica. La prueba involucró 640 evaluaciones (8 modelos × 8 conjuntos de datos × 10 muestras) en hardware Mac mini M4 Pro 24Gb.
Fórmula de aptitud y ponderación
La fórmula de aptitud compuesta ponderó tres factores: 50% experiencia de usuario en chat, 30% velocidad y 20% calidad de formato corto. Esta ponderación prioriza la experiencia del usuario para aplicaciones móviles donde la latencia es lo más importante.
Hallazgos clave
- Gemma3:4B ganó con una puntuación de aptitud compuesta de 88.7 a pesar de ser el modelo más pequeño evaluado
- Logró el TTFT más bajo (11.2s), el mayor rendimiento (89.3 tok/s) y las temperaturas más frías (45°C)
- Modelos más grandes como GPT-OSS:20B aprobaron el 70% de las tareas pero ocuparon el 6° lugar debido a un TTFT promedio de 25.4s
- El rendimiento térmico varió significativamente: Qwen3:14B alcanzó un máximo de 83°C, DeepSeek-R1:14B a 81°C
- Magistral:24B fue excluido de la clasificación final después de desencadenar bucles de tiempo de espera y alcanzar 97°C de temperatura de GPU
Por qué los modelos más pequeños tuvieron mejor rendimiento
La evaluación comparativa reveló que para aplicaciones de chat telefónico, una respuesta más rápida del primer token (TTFT) y una menor carga térmica importan más que la precisión bruta. Un modelo que obtiene 77.5% de precisión pero requiere 25s de espera para el primer token pierde frente a uno que responde con 72.5% pero responde en 11s. La brecha térmica es significativa para la confiabilidad y longevidad del hardware personal.
Análisis independiente
Un análisis independiente utilizando Claude en el mismo conjunto de datos de 640 evaluaciones ponderó la confiabilidad y TTFT de manera más agresiva y llegó a un orden ligeramente diferente de los 4 primeros, confirmando que la ponderación de KPI es una elección más que una verdad absoluta.
Consideraciones de caso de uso
El autor señala que para diferentes casos de uso como programación o escritura de formato largo, la fórmula de ponderación cambiaría por completo, priorizando la calidad sobre la velocidad y la experiencia de usuario en chat.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también
Los creativos de Hollywood están entrenando IA para reemplazarlos, y cobran entre $12 y $200 por hora.
Escritores, directores y productores galardonados están tomando trabajos por encargo para entrenar modelos de IA, enseñándoles a escribir guiones, programar producciones y más, en medio de una caída de la producción del 35%.

Resultados de Referencia de Razonamiento Visual para 15 Modelos de IA Multimodales
AIMultiple evaluó 15 modelos líderes de IA multimodal con 200 preguntas de razonamiento visual en dos categorías: comprensión de gráficos y lógica visual. Gemini-3.1-pro-preview y Gemini-3-pro-preview lideran los resultados generales, seguidos por GPT-5.2, Kimi-K2.5 y GPT-5.2-pro.
NYC y LAUSD Imponen Prohibiciones Estrictas de IA en las Escuelas: Cómo Impacta a Desarrolladores y EdTech
Nueva York prohibió la IA en clases de K-8, LAUSD impuso una moratoria de 1 año para todos los estudiantes. Aquí el desglose para desarrolladores de herramientas educativas.

Investigación sobre Redes Sociales Profesionales para Agentes de IA
Análisis de intención, comportamiento y tendencias de plataformas para redes sociales profesionales de agentes de IA, centrándose en Moltbook, Agent.ai y Clawsphere, con examen del impacto de la adquisición de Meta.