EvalShift: CLI de código abierto para detectar regresiones de LLM durante la migración de modelos

EvalShift es una CLI de Python de código abierto diseñada para detectar regresiones al cambiar entre LLM o versiones de modelos. Ejecuta su suite de entradas de referencia tanto contra el modelo fuente como el destino, evalúa las salidas y produce un informe HTML local, sin backend, cuentas ni telemetría.
Características clave
- Comparación de modelo fuente vs destino mediante LiteLLM
- Suites de referencia JSONL con etiquetas/segmentos
- Evaluadores estructurales: esquema JSON, expresión regular, longitud
- Evaluador semántico: similitud de incrustaciones
- Evaluación por pares LLM-como-juez
- Evaluadores de llamadas a herramientas: selección de herramientas, coincidencia de argumentos, estructura de traza
- Pruebas estadísticas pareadas: t-test / Wilcoxon
- Tamaños del efecto: d de Cohen
- Corrección de comparaciones múltiples: Benjamini-Hochberg
- Desgloses por segmento
- Caché local para controlar costos
- Ejecuciones reanudables
- Informe HTML en un solo archivo + salida JSON
El objetivo concreto del proyecto es la seguridad en la migración: "¿Puedo cambiar de modelo sin romper el comportamiento de mis indicaciones/agentes?" El autor enfatiza la detección de regresiones silenciosas en agentes, por ejemplo, un modelo más nuevo que produce una respuesta final aceptable pero omite una llamada a herramienta requerida, llama a la herramienta incorrecta o muta los argumentos.
Casos de uso
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- Modelo local → modelo alojado
El autor busca comentarios sobre la utilidad para modelos locales frente a alojados, los tipos de evaluadores más importantes para flujos de trabajo locales de LLM, y si las regresiones en llamadas a herramientas/salidas estructuradas son un punto crítico real. El repositorio tiene licencia MIT.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

LightMem: Sistema de Memoria Ligero para Agentes LLM con Ganancias de 10×+ y Costo 100× Menor
LightMem es un sistema de memoria modular para agentes LLM que logra una mejora de precisión de hasta el 10,9% mientras reduce los tokens hasta 117 veces, las llamadas API hasta 159 veces y el tiempo de ejecución en más de 12 veces. Está diseñado para un razonamiento de contexto largo escalable en flujos de trabajo de agentes.

FUTO Swipe: Modelos de escritura deslizando de código abierto igualan la precisión de las grandes tecnológicas
FUTO lanza modelos de escritura por deslizamiento de código abierto y un conjunto de datos de 1 millón de gestos. Codificador (635K parámetros) + ContextLM (1.5M) + decodificador (304K) logran una tasa de fallo del ~4% en top-4. Totalmente offline en FUTO Keyboard.

ClawCall obtiene números telefónicos dedicados: los agentes ahora pueden reservar un número para llamadas salientes
ClawCall, la habilidad de llamadas telefónicas con IA para agentes OpenClaw, ahora te permite reservar un número de teléfono por código de área. Tu agente lo usa por defecto al hacer llamadas. 10k descargas, 300 llamadas/día.

La habilidad OpenClaw añade generación de imágenes con IA, soporte local para ComfyUI y prompts curados.
Una nueva habilidad de OpenClaw proporciona capacidades de generación de imágenes con IA directamente en la terminal, con más de 1,300 indicaciones curadas, integración local de ComfyUI y flujos de trabajo de mejora de indicaciones.