Gemma 4 31B supera a modelos más grandes en FoodTruck Bench.

Resultados y análisis del benchmark
Gemma 4 31B logró el tercer lugar en el benchmark FoodTruck Bench, superando a varios modelos más grandes y establecidos. Según la discusión en Reddit, el modelo venció a GLM 5, Qwen 3.5 397B y todas las variantes de Claude Sonnet.
FoodTruck Bench es un benchmark que prueba modelos de lenguaje en tareas complejas de planificación de múltiples pasos. El autor original especula que el rendimiento de Gemma 4 sugiere que maneja mejor las tareas de largo plazo que modelos anteriores que no completaron el benchmark. Específicamente, el modelo parece escuchar efectivamente sus propios consejos al planificar los pasos posteriores en la secuencia de tareas.
Este resultado es notable porque Gemma 4 31B es significativamente más pequeño que algunos de los modelos que superó. Qwen 3.5 397B, por ejemplo, tiene aproximadamente 12.8 veces más parámetros que Gemma 4 31B. El rendimiento sugiere que la arquitectura del modelo y los enfoques de entrenamiento pueden ser tan importantes como el número de parámetros para ciertos tipos de tareas de razonamiento.
FoodTruck Bench prueba modelos en escenarios de planificación práctica que requieren mantener el contexto a lo largo de secuencias extendidas de acciones. El diseño del benchmark lo hace particularmente relevante para desarrolladores que trabajan con agentes de IA que necesitan ejecutar tareas de múltiples pasos en aplicaciones del mundo real.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Anthropic restringe las suscripciones a Claude desde plataformas de terceros como OpenClaw.
Anthropic dejará de cubrir las suscripciones de Claude para herramientas de terceros como OpenClaw a partir del 4 de abril. Los usuarios deberán habilitar el uso adicional de pago por uso facturado por separado, con un crédito único equivalente al precio de la suscripción mensual disponible hasta el 17 de abril.

Liberación de Claude-Code v2.1.25: Corrección de Error de Validación
Claude-Code v2.1.25 aborda un problema de validación de encabezados beta que afecta a los usuarios de gateway en Bedrock y Vertex, con una solución alternativa a través de una variable de entorno específica.

Cuando preguntarle a Claude sobre regex lleva a una inmersión nocturna en el diseño de compiladores
Un usuario de Reddit le pidió a Claude que explicara una expresión regular y terminó en una conversación de 45 minutos sobre analizadores sintácticos, diseño de compiladores y teoría del lenguaje, cuestionando su carrera.

Actualización de APEX MoE Quants: Más de 25 nuevos modelos y el nivel I-Nano lanzados
La cuantización mixta de precisión consciente de MoE de APEX se expande a más de 30 modelos en las familias Qwen, Mistral, Gemma y SSM híbridas, además de un nuevo nivel I-Nano que alcanza tan solo 2.06 bpw en expertos de capas medias.