Evaluación de LLMs locales: generación de backend mediante llamada a funciones – comparativa entre GLM, Qwen y DeepSeek

✍️ OpenClawRadar📅 Publicado: 3 de mayo de 2026🔗 Source
Evaluación de LLMs locales: generación de backend mediante llamada a funciones – comparativa entre GLM, Qwen y DeepSeek
Ad

Cinco meses después de una medición inicial no controlada, AutoBe.dev ha publicado un benchmark adecuado de LLMs locales y fronterizos para generación de código backend mediante llamadas a funciones. El benchmark utiliza una configuración de variables controladas con una rúbrica de puntuación real, probando modelos en la generación de esquemas AST de unión recursiva a través de un harness de llamadas a funciones.

Hallazgos Clave

  • El harness de llamadas a funciones ha cerrado efectivamente la brecha entre los modelos fronterizos y locales en generación backend. Específicamente, las puntuaciones de diseño DB/API de gpt-5.4 son aproximadamente iguales a las de qwen3.5-35b-a3b, y las puntuaciones de lógica de claude-sonnet-4.6 coinciden con las de qwen3.5-27b.
  • Esta es la última ronda que incluye modelos fronterizos. Ejecutarlos mensualmente cuesta ~200–300M de tokens (~$1,000–$1,500 por modelo según la tarifa de GPT 5.5). A partir del próximo mes, solo se incluirán endpoints de OpenRouter por debajo de $0.25/M de tokens o modelos que quepan en una laptop con memoria unificada de 64GB.
  • Se añadirá automatización de frontend al benchmark en la ronda de junio/julio, utilizando el SDK que AutoBe ya emite para impulsar frontends construidos de extremo a extremo por IA (visuales toscos, pero todas las funciones funcionan).
Ad

Inversiones Inesperadas

Varios resultados aún están bajo investigación:

  • openai/gpt-5.4 puntúa por debajo de su propio hermano mini.
  • deepseek-v4-pro se sitúa un escalón por debajo de qwen3.5-35b-a3b y apenas se separa de su propio hermano Flash.
  • Dentro de la familia Qwen, el denso 27B supera a todas las variantes MoE, incluida la 397B-A17B.

Las posibles explicaciones que se investigan incluyen el fenómeno de cumplimiento de CoT (los modelos más grandes/fronterizos tienden a saltarse las instrucciones procesales impuestas por el harness) y defectos del benchmark (n=4 proyectos de referencia, banda de puntuación estrecha, harness puntuando su propio pipeline).

Modelos Recomendados

Tres candidatos confirmados para el próximo mes:

  • openai/gpt-5.4-nano — $0.25/M tokens
  • qwen/qwen3.6-27b — $0.195/M tokens
  • deepseek/deepseek-v4-flash — $0.14/M tokens

Todos están por debajo de $0.25/M en OpenRouter o se pueden ejecutar en una laptop con memoria unificada de 64GB, y manejan las llamadas a funciones correctamente.

Referencias

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Claude Code v2.1.81 agrega la bandera "bare" para scripting, corrige problemas de autenticación y del modo de voz.
Noticias

Claude Code v2.1.81 agrega la bandera "bare" para scripting, corrige problemas de autenticación y del modo de voz.

Claude Code v2.1.81 introduce una bandera --bare para llamadas -p automatizadas que omite hooks, LSP y sincronización de complementos, requiriendo ANTHROPIC_API_KEY o apiKeyHelper mediante --settings. La versión también corrige problemas de autenticación en múltiples sesiones concurrentes, manejo de errores en modo de voz y agrega la retransmisión de permisos --channels.

OpenClawRadar
Claude Code v2.1.196: Modelos predeterminados de organización, corrección de seguridad, recuperación de trabajos en segundo plano
Noticias

Claude Code v2.1.196: Modelos predeterminados de organización, corrección de seguridad, recuperación de trabajos en segundo plano

Claude Code v2.1.196 agrega modelos predeterminados de organización, corrige un problema de seguridad con la generación de servidores MCP, mejora la confiabilidad de las sesiones en segundo plano y reduce el uso de tokens en /code-review en un 25%.

OpenClawRadar
Discusión en Reddit critica a los asistentes de IA reactivos y exige una verdadera proactividad.
Noticias

Discusión en Reddit critica a los asistentes de IA reactivos y exige una verdadera proactividad.

Una publicación de Reddit argumenta que los asistentes de IA actuales son reactivos por diseño, esperando indicaciones humanas en lugar de identificar problemas de manera proactiva. El autor distingue entre verificaciones programadas y verdadera conciencia contextual, señalando que la proactividad real requiere memoria persistente, desencadenadores impulsados por eventos y razonamiento a través del tiempo.

OpenClawRadar
La aplicación Claude encabeza las listas de la App Store de EE. UU., los asistentes de IA dominan el top 10
Noticias

La aplicación Claude encabeza las listas de la App Store de EE. UU., los asistentes de IA dominan el top 10

Claude de Anthropic es actualmente la aplicación número 1 en la lista de las mejores aplicaciones de la App Store de EE.UU., con ChatGPT en el puesto #2 y Google Gemini en el #4. El top 10 incluye tres asistentes de IA entre aplicaciones de compras, redes sociales y utilidades.

OpenClawRadar