Resultados de Referencia para Modelos Locales Pequeños y de OpenRouter en la Tarea Agéntica de Texto a SQL

✍️ OpenClawRadar📅 Publicado: 17 de abril de 2026🔗 Source
Resultados de Referencia para Modelos Locales Pequeños y de OpenRouter en la Tarea Agéntica de Texto a SQL
Ad

Un desarrollador ha publicado los resultados de un punto de referencia para modelos locales pequeños y de OpenRouter en una tarea de agente de texto a SQL. El punto de referencia toma consultas en inglés como "Mostrar líneas de pedido, ingresos, unidades vendidas, ingresos por unidad (ingresos totales ÷ unidades totales vendidas), precio de lista promedio por producto en la subcategoría, beneficio bruto y porcentaje de margen para cada subcategoría de producto" y las convierte en SQL que se prueba contra tablas de base de datos.

Detalles del Punto de Referencia

El agente puede ver los resultados de las consultas y modificar el SQL para corregir problemas, con un límite en las rondas de depuración. El punto de referencia es deliberadamente corto con 25 preguntas y se ejecuta en mucho menos de 5 minutos para la mayoría de los modelos, lo que lo hace práctico para probar diferentes configuraciones. Está diseñado para ser lo suficientemente difícil como para separar los mejores modelos de los demás.

Ad

Hallazgos Clave

  • Los mejores modelos abiertos identificados fueron kimi-k2.5, Qwen 3.5 397B-A17B y Qwen 3.5 27B
  • NVIDIA Nemotron-Cascade-2-30B-A3B supera a Qwen 3.5-35B-A3B y coincide con Codex 5.3
  • Mimo v2 Flash fue descrito como "una joya de modelo"

Opción de Autoalojamiento

El punto de referencia ahora incluye la capacidad de ejecutarlo tú mismo contra tu propio servidor usando la versión WASM de Llama.cpp. El desarrollador está buscando comentarios sobre qué cambiar para la versión 2 y quiere ver las puntuaciones que otros obtienen con diferentes configuraciones.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Claude Sleuth: Un Flujo de Trabajo de Investigación de 56 Tareas para Claude AI
Herramientas

Claude Sleuth: Un Flujo de Trabajo de Investigación de 56 Tareas para Claude AI

Claude Sleuth es un flujo de trabajo de investigación estructurado para Claude AI con 6 fases y 56 tareas, que incluye almacenamiento de estado persistente mediante Cloudflare D1 y convenciones de salida estandarizadas que abarcan marcas de tiempo ISO 8601, registros de entidades POLE y el lenguaje de probabilidad ICD 203.

OpenClawRadar
Batalla de Bots: Arena de Agentes de IA para Juegos Multijugador Desarrollada con Claude Code
Herramientas

Batalla de Bots: Arena de Agentes de IA para Juegos Multijugador Desarrollada con Claude Code

Bot Fight es una arena donde los agentes de IA juegan entre sí en partidas de póker, billar, Gorillas y snake, construida completamente con código Claude como un monorepo de Next.js + Node con WebSockets y motores de juego en tiempo real.

OpenClawRadar
Funciones de IA: Generación de Código en Tiempo de Ejecución con Verificación Automatizada
Herramientas

Funciones de IA: Generación de Código en Tiempo de Ejecución con Verificación Automatizada

AI Functions es una biblioteca de Python que te permite definir funciones con especificaciones en lenguaje natural en lugar de código de implementación, ejecuta código generado por LLM en tiempo de ejecución y valida las salidas con postcondiciones que activan reintentos automáticos en caso de fallo.

OpenClawRadar
OpenPlawd: Habilidad de OpenClaw para Notas Automatizadas de Reuniones Plaud
Herramientas

OpenPlawd: Habilidad de OpenClaw para Notas Automatizadas de Reuniones Plaud

OpenPlawd es una habilidad de OpenClaw que procesa automáticamente las grabaciones de Plaud y las convierte en notas de reunión estructuradas en HTML. Consulta las cuentas de Plaud cada hora, transcribe con Whisper o OpenAI, divide archivos grandes y genera notas con elementos de acción mediante un agente de OpenClaw.

OpenClawRadar