EvalShift: CLI de código aberto para detectar regressões de LLM durante a migração de modelos

✍️ OpenClawRadar📅 Publicado: May 15, 2026🔗 Source
EvalShift: CLI de código aberto para detectar regressões de LLM durante a migração de modelos
Ad

EvalShift é um CLI Python de código aberto projetado para detectar regressões ao alternar entre LLMs ou versões de modelos. Ele executa seu conjunto de entradas douradas (golden inputs) tanto no modelo fonte quanto no destino, avalia as saídas e produz um relatório HTML local — sem backend, contas ou telemetria.

Principais características

  • Comparação de modelo fonte vs destino via LiteLLM
  • Conjuntos dourados JSONL com tags/fatias (tags/slices)
  • Avaliadores estruturais: schema JSON, regex, comprimento
  • Avaliador semântico: similaridade de embeddings
  • Avaliação pareada LLM-como-juiz
  • Avaliadores de chamada de ferramentas: seleção de ferramenta, correspondência de argumentos, estrutura de rastreamento
  • Testes estatísticos pareados: t-test / Wilcoxon
  • Tamanhos de efeito: d de Cohen
  • Correção para múltiplas comparações: Benjamini-Hochberg
  • Detalhamento por fatia
  • Cache local para controlar custos
  • Execuções retomáveis
  • Relatório HTML em único arquivo + saída JSON

O objetivo estreito do projeto é segurança na migração: "Posso trocar de modelo sem quebrar o comportamento do meu prompt/agente?" O autor enfatiza a detecção de regressões silenciosas de agentes — por exemplo, um modelo mais novo produzindo uma resposta final de aparência decente, mas pulando uma chamada de ferramenta necessária, chamando a ferramenta errada ou alterando argumentos.

Ad

Casos de uso

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Modelo local → modelo hospedado

O autor está buscando feedback sobre utilidade para modelos locais vs hospedados, tipos de avaliadores mais importantes para fluxos de trabalho de LLM local, e se regressões de chamada de ferramentas/saída estruturada são um ponto problemático real. O repositório é licenciado sob MIT.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

A receita OpenClaw-RL do Reef coloca atualizações de peso pontuadas atrás de um portão de liberação

A receita de evolução de pesos OpenClaw-RL da Reef trata 72 problemas do GSM8K como 72 tarefas, usa o Qwen3-4B para os papéis de política e modelo de recompensa de processo, com o Qwen3-32B como aluno, e roda em sete GPUs. Atingiu o critério de três aprovações consecutivas na sessão 14.

OpenClawRadar
Ferramenta Local Visualiza Dados de Sessão de Código do Claude
Tools

Ferramenta Local Visualiza Dados de Sessão de Código do Claude

Um script Python lê os dados da sessão do Claude Code armazenados localmente em ~/.claude/ e gera uma visualização controlada por rolagem com gráficos D3.js mostrando atividade diária, divisão por projeto, uso de ferramentas e mapas de calor do ritmo de codificação.

OpenClawRadar
🦀
Tools

Servidor MCP Claude Garmin: Dados Reais de Fitness para Conselhos de Treino Mais Inteligentes

Um servidor MCP que conecta o Claude Desktop ao Garmin Connect, expondo 8 ferramentas (prontidão de recuperação, VFC, VO2max, etc.) para planos de treino baseados em dados.

OpenClawRadar
Claude Command Center v5.0.0 Adiciona Suporte no Primeiro Dia para Fable 5 com Alternância no Meio da Sessão
Tools

Claude Command Center v5.0.0 Adiciona Suporte no Primeiro Dia para Fable 5 com Alternância no Meio da Sessão

Claude Command Center v5.0.0 adiciona suporte de primeira classe ao novo nível Fable 5 da Anthropic, incluindo troca de modelo no meio da sessão, um seletor de modelo reprojetado e uma correção para erros de CLI com aliases versionados.

OpenClawRadar