Gemma 4 31B supera a modelos más grandes en FoodTruck Bench.

✍️ OpenClawRadar📅 Publicado: 21 de abril de 2026🔗 Source
Gemma 4 31B supera a modelos más grandes en FoodTruck Bench.
Ad
Ad

Resultados y análisis del benchmark

Gemma 4 31B logró el tercer lugar en el benchmark FoodTruck Bench, superando a varios modelos más grandes y establecidos. Según la discusión en Reddit, el modelo venció a GLM 5, Qwen 3.5 397B y todas las variantes de Claude Sonnet.

FoodTruck Bench es un benchmark que prueba modelos de lenguaje en tareas complejas de planificación de múltiples pasos. El autor original especula que el rendimiento de Gemma 4 sugiere que maneja mejor las tareas de largo plazo que modelos anteriores que no completaron el benchmark. Específicamente, el modelo parece escuchar efectivamente sus propios consejos al planificar los pasos posteriores en la secuencia de tareas.

Este resultado es notable porque Gemma 4 31B es significativamente más pequeño que algunos de los modelos que superó. Qwen 3.5 397B, por ejemplo, tiene aproximadamente 12.8 veces más parámetros que Gemma 4 31B. El rendimiento sugiere que la arquitectura del modelo y los enfoques de entrenamiento pueden ser tan importantes como el número de parámetros para ciertos tipos de tareas de razonamiento.

FoodTruck Bench prueba modelos en escenarios de planificación práctica que requieren mantener el contexto a lo largo de secuencias extendidas de acciones. El diseño del benchmark lo hace particularmente relevante para desarrolladores que trabajan con agentes de IA que necesitan ejecutar tareas de múltiples pasos en aplicaciones del mundo real.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Gemini Embedding 2: El Primer Modelo de Incrustación Nativamente Multimodal de Google Lanzado
Noticias

Gemini Embedding 2: El Primer Modelo de Incrustación Nativamente Multimodal de Google Lanzado

Google ha lanzado Gemini Embedding 2, su primer modelo de incrustación multimodal nativo que mapea texto, imágenes, video, audio y documentos en un único espacio de incrustación. El modelo admite hasta 8192 tokens de texto, 6 imágenes por solicitud, 120 segundos de video y PDF de hasta 6 páginas de longitud, con dimensiones de salida flexibles desde 3072 hasta 768.

OpenClawRadar
La eliminación de la CLI de OpenClaw 0.9 provoca interrupción del agente
Noticias

La eliminación de la CLI de OpenClaw 0.9 provoca interrupción del agente

Un usuario reportó que intentar actualizar OpenClaw a través de un agente de IA resultó en la eliminación de la CLI, rompiendo los comandos de puerta de enlace y la funcionalidad del chat de Telegram. OpenClaw 0.9 eliminó completamente la CLI, quitando comandos como 'openclaw gateway start' y 'openclaw status'.

OpenClawRadar
Claude Code v2.1.79: Inicio de sesión OAuth roto tras actualización automática: Solución temporal y Corrección
Noticias

Claude Code v2.1.79: Inicio de sesión OAuth roto tras actualización automática: Solución temporal y Corrección

Claude Code v2.1.79 tiene un error confirmado en el inicio de sesión OAuth donde la CLI se agota el tiempo de espera después de la autorización del navegador. El problema surge porque el instalador nativo se actualiza automáticamente a esta versión, y la solución implica volver a la versión v2.1.75 eliminando la instalación nativa.

OpenClawRadar
🦀
Noticias

OpenClaw再遭延期:v2026.7.1升级测试问题

El lanzamiento de OpenClaw previsto para el 18 de agosto se retrasa, ya que las pruebas encuentran problemas con instalaciones nuevas y actualizaciones desde la v2026.7.1 y anteriores. No hay nueva fecha.

OpenClawRadar