EvalShift: CLI de código abierto para detectar regresiones de LLM durante la migración de modelos

✍️ OpenClawRadar📅 Publicado: 15 de mayo de 2026🔗 Source
EvalShift: CLI de código abierto para detectar regresiones de LLM durante la migración de modelos
Ad

EvalShift es una CLI de Python de código abierto diseñada para detectar regresiones al cambiar entre LLM o versiones de modelos. Ejecuta su suite de entradas de referencia tanto contra el modelo fuente como el destino, evalúa las salidas y produce un informe HTML local, sin backend, cuentas ni telemetría.

Características clave

  • Comparación de modelo fuente vs destino mediante LiteLLM
  • Suites de referencia JSONL con etiquetas/segmentos
  • Evaluadores estructurales: esquema JSON, expresión regular, longitud
  • Evaluador semántico: similitud de incrustaciones
  • Evaluación por pares LLM-como-juez
  • Evaluadores de llamadas a herramientas: selección de herramientas, coincidencia de argumentos, estructura de traza
  • Pruebas estadísticas pareadas: t-test / Wilcoxon
  • Tamaños del efecto: d de Cohen
  • Corrección de comparaciones múltiples: Benjamini-Hochberg
  • Desgloses por segmento
  • Caché local para controlar costos
  • Ejecuciones reanudables
  • Informe HTML en un solo archivo + salida JSON

El objetivo concreto del proyecto es la seguridad en la migración: "¿Puedo cambiar de modelo sin romper el comportamiento de mis indicaciones/agentes?" El autor enfatiza la detección de regresiones silenciosas en agentes, por ejemplo, un modelo más nuevo que produce una respuesta final aceptable pero omite una llamada a herramienta requerida, llama a la herramienta incorrecta o muta los argumentos.

Ad

Casos de uso

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Modelo local → modelo alojado

El autor busca comentarios sobre la utilidad para modelos locales frente a alojados, los tipos de evaluadores más importantes para flujos de trabajo locales de LLM, y si las regresiones en llamadas a herramientas/salidas estructuradas son un punto crítico real. El repositorio tiene licencia MIT.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Orchino: Sistema Local de Orquestación Multi-Agente para Windows con Automatización Paralela de Navegador e Interfaz de Usuario
Herramientas

Orchino: Sistema Local de Orquestación Multi-Agente para Windows con Automatización Paralela de Navegador e Interfaz de Usuario

Orchino es un sistema local de orquestación multiagente para Windows que ejecuta tareas paralelas en el navegador y en Windows sin secuestrar la interfaz de usuario. Una demostración muestra a 4 agentes completando 'Buscar auriculares Sony en Flipkart y Amazon, enviar los resultados por correo electrónico, guardar en el Bloc de notas' en 29.5 segundos utilizando ejecución verdaderamente paralela.

OpenClawRadar
Superglue CLI: Permite que los Agentes de IA Ejecuten Llamadas API Sin Herramientas Preconstruidas
Herramientas

Superglue CLI: Permite que los Agentes de IA Ejecuten Llamadas API Sin Herramientas Preconstruidas

Superglue CLI proporciona una habilidad que enseña a los agentes de IA de programación cómo usar sus comandos, manejar autenticación, construir herramientas y depurar fallos. En lugar de crear herramientas predefinidas para cada integración de API, los agentes pueden leer las especificaciones de la API en tiempo de ejecución y planificar llamadas de múltiples pasos.

OpenClawRadar
Cowork vs. Claude Chat: Comparación de Precisión en la Extracción de Documentos
Herramientas

Cowork vs. Claude Chat: Comparación de Precisión en la Extracción de Documentos

Un desarrollador probó Claude.ai chat y Cowork en la extracción de datos de PDFs financieros de más de 140 páginas utilizando prompts idénticos. Chat produjo resultados de grado institucional con autocorrección y cero errores en más de 150 puntos de datos, mientras que Cowork fabricó partidas de conciliación, invirtió recuentos de unidades y tuvo contaminación de columnas de ejercicios anteriores.

OpenClawRadar
Demostración de Fábula de Claude: Corrección de Errores Proactiva e Incansable con Automatización del Navegador
Herramientas

Demostración de Fábula de Claude: Corrección de Errores Proactiva e Incansable con Automatización del Navegador

Simon Willison describe cómo Claude Fable 5 depuró automáticamente un problema de barra de desplazamiento horizontal sin instrucciones explícitas. Usó automatización del navegador, inyección de JavaScript y un servidor web CORS personalizado.

OpenClawRadar