Gemma 4 31B supera a modelos más grandes en FoodTruck Bench.

✍️ OpenClawRadar📅 Publicado: 21 de abril de 2026🔗 Source
Gemma 4 31B supera a modelos más grandes en FoodTruck Bench.
Ad
Ad

Resultados y análisis del benchmark

Gemma 4 31B logró el tercer lugar en el benchmark FoodTruck Bench, superando a varios modelos más grandes y establecidos. Según la discusión en Reddit, el modelo venció a GLM 5, Qwen 3.5 397B y todas las variantes de Claude Sonnet.

FoodTruck Bench es un benchmark que prueba modelos de lenguaje en tareas complejas de planificación de múltiples pasos. El autor original especula que el rendimiento de Gemma 4 sugiere que maneja mejor las tareas de largo plazo que modelos anteriores que no completaron el benchmark. Específicamente, el modelo parece escuchar efectivamente sus propios consejos al planificar los pasos posteriores en la secuencia de tareas.

Este resultado es notable porque Gemma 4 31B es significativamente más pequeño que algunos de los modelos que superó. Qwen 3.5 397B, por ejemplo, tiene aproximadamente 12.8 veces más parámetros que Gemma 4 31B. El rendimiento sugiere que la arquitectura del modelo y los enfoques de entrenamiento pueden ser tan importantes como el número de parámetros para ciertos tipos de tareas de razonamiento.

FoodTruck Bench prueba modelos en escenarios de planificación práctica que requieren mantener el contexto a lo largo de secuencias extendidas de acciones. El diseño del benchmark lo hace particularmente relevante para desarrolladores que trabajan con agentes de IA que necesitan ejecutar tareas de múltiples pasos en aplicaciones del mundo real.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Anthropic restringe las suscripciones a Claude desde plataformas de terceros como OpenClaw.
Noticias

Anthropic restringe las suscripciones a Claude desde plataformas de terceros como OpenClaw.

Anthropic dejará de cubrir las suscripciones de Claude para herramientas de terceros como OpenClaw a partir del 4 de abril. Los usuarios deberán habilitar el uso adicional de pago por uso facturado por separado, con un crédito único equivalente al precio de la suscripción mensual disponible hasta el 17 de abril.

OpenClawRadar
Liberación de Claude-Code v2.1.25: Corrección de Error de Validación
Noticias

Liberación de Claude-Code v2.1.25: Corrección de Error de Validación

Claude-Code v2.1.25 aborda un problema de validación de encabezados beta que afecta a los usuarios de gateway en Bedrock y Vertex, con una solución alternativa a través de una variable de entorno específica.

OpenClawRadar
Cuando preguntarle a Claude sobre regex lleva a una inmersión nocturna en el diseño de compiladores
Noticias

Cuando preguntarle a Claude sobre regex lleva a una inmersión nocturna en el diseño de compiladores

Un usuario de Reddit le pidió a Claude que explicara una expresión regular y terminó en una conversación de 45 minutos sobre analizadores sintácticos, diseño de compiladores y teoría del lenguaje, cuestionando su carrera.

OpenClawRadar
Actualización de APEX MoE Quants: Más de 25 nuevos modelos y el nivel I-Nano lanzados
Noticias

Actualización de APEX MoE Quants: Más de 25 nuevos modelos y el nivel I-Nano lanzados

La cuantización mixta de precisión consciente de MoE de APEX se expande a más de 30 modelos en las familias Qwen, Mistral, Gemma y SSM híbridas, además de un nuevo nivel I-Nano que alcanza tan solo 2.06 bpw en expertos de capas medias.

OpenClawRadar