Resultados de Referencia para Modelos Locales Pequeños y de OpenRouter en la Tarea Agéntica de Texto a SQL

✍️ OpenClawRadar📅 Publicado: 17 de abril de 2026🔗 Source
Resultados de Referencia para Modelos Locales Pequeños y de OpenRouter en la Tarea Agéntica de Texto a SQL
Ad

Un desarrollador ha publicado los resultados de un punto de referencia para modelos locales pequeños y de OpenRouter en una tarea de agente de texto a SQL. El punto de referencia toma consultas en inglés como "Mostrar líneas de pedido, ingresos, unidades vendidas, ingresos por unidad (ingresos totales ÷ unidades totales vendidas), precio de lista promedio por producto en la subcategoría, beneficio bruto y porcentaje de margen para cada subcategoría de producto" y las convierte en SQL que se prueba contra tablas de base de datos.

Detalles del Punto de Referencia

El agente puede ver los resultados de las consultas y modificar el SQL para corregir problemas, con un límite en las rondas de depuración. El punto de referencia es deliberadamente corto con 25 preguntas y se ejecuta en mucho menos de 5 minutos para la mayoría de los modelos, lo que lo hace práctico para probar diferentes configuraciones. Está diseñado para ser lo suficientemente difícil como para separar los mejores modelos de los demás.

Ad

Hallazgos Clave

  • Los mejores modelos abiertos identificados fueron kimi-k2.5, Qwen 3.5 397B-A17B y Qwen 3.5 27B
  • NVIDIA Nemotron-Cascade-2-30B-A3B supera a Qwen 3.5-35B-A3B y coincide con Codex 5.3
  • Mimo v2 Flash fue descrito como "una joya de modelo"

Opción de Autoalojamiento

El punto de referencia ahora incluye la capacidad de ejecutarlo tú mismo contra tu propio servidor usando la versión WASM de Llama.cpp. El desarrollador está buscando comentarios sobre qué cambiar para la versión 2 y quiere ver las puntuaciones que otros obtienen con diferentes configuraciones.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Herramientas CLI con Compatibilidad de Agente de IA: Enfoque de Directorio de Habilidades
Herramientas

Herramientas CLI con Compatibilidad de Agente de IA: Enfoque de Directorio de Habilidades

Un usuario de Reddit comparte un método para hacer que las herramientas CLI funcionen con agentes de codificación de IA como Claude Code, creando archivos SKILL.md que enseñan a los agentes sobre instalación, autenticación y uso. El enfoque aborda problemas comunes como mensajes interactivos, salida JSON y métodos de autenticación.

OpenClawRadar
Controla iPhones reales desde agentes de OpenClaw — Práctica con la configuración de AvaBerry43
Herramientas

Controla iPhones reales desde agentes de OpenClaw — Práctica con la configuración de AvaBerry43

Un desarrollador creó un sistema con iPhones reales controlados por API para agentes de IA, probando funciones como redacción de iMessages, Shortcuts y control de calidad móvil. Hay 70 teléfonos disponibles para que otros experimenten.

OpenClawRadar
Dos Habilidades Gratuitas de Claude para Código: Generador de Tutoriales y Corrector de Prompts
Herramientas

Dos Habilidades Gratuitas de Claude para Código: Generador de Tutoriales y Corrector de Prompts

Dos nuevas habilidades gratuitas de Claude Code: create-tutorial genera tutoriales de lectura de código a partir de los archivos reales de tu proyecto, y prompter reescribe instrucciones con errores tipográficos en instrucciones accionables. Ambas tienen licencia MIT y se instalan a través de GitHub.

OpenClawRadar
La Autoinvestigación de Karpathy Portada al Motor Neuronal de Apple para Mejor Rendimiento por Vatio
Herramientas

La Autoinvestigación de Karpathy Portada al Motor Neuronal de Apple para Mejor Rendimiento por Vatio

Un prototipo combina el proyecto de investigación automática de Andrej Karpathy con el rendimiento de ingeniería inversa del Motor Neuronal de Apple, con el objetivo de lograr un mejor rendimiento por vatio en comparación con las API oficiales. El proyecto se basa en repositorios de GitHub existentes y reconoce las contribuciones de múltiples desarrolladores.

OpenClawRadar