EvalShift: CLI de código aberto para detectar regressões de LLM durante a migração de modelos

✍️ OpenClawRadar📅 Publicado: May 15, 2026🔗 Source
EvalShift: CLI de código aberto para detectar regressões de LLM durante a migração de modelos
Ad

EvalShift é um CLI Python de código aberto projetado para detectar regressões ao alternar entre LLMs ou versões de modelos. Ele executa seu conjunto de entradas douradas (golden inputs) tanto no modelo fonte quanto no destino, avalia as saídas e produz um relatório HTML local — sem backend, contas ou telemetria.

Principais características

  • Comparação de modelo fonte vs destino via LiteLLM
  • Conjuntos dourados JSONL com tags/fatias (tags/slices)
  • Avaliadores estruturais: schema JSON, regex, comprimento
  • Avaliador semântico: similaridade de embeddings
  • Avaliação pareada LLM-como-juiz
  • Avaliadores de chamada de ferramentas: seleção de ferramenta, correspondência de argumentos, estrutura de rastreamento
  • Testes estatísticos pareados: t-test / Wilcoxon
  • Tamanhos de efeito: d de Cohen
  • Correção para múltiplas comparações: Benjamini-Hochberg
  • Detalhamento por fatia
  • Cache local para controlar custos
  • Execuções retomáveis
  • Relatório HTML em único arquivo + saída JSON

O objetivo estreito do projeto é segurança na migração: "Posso trocar de modelo sem quebrar o comportamento do meu prompt/agente?" O autor enfatiza a detecção de regressões silenciosas de agentes — por exemplo, um modelo mais novo produzindo uma resposta final de aparência decente, mas pulando uma chamada de ferramenta necessária, chamando a ferramenta errada ou alterando argumentos.

Ad

Casos de uso

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Modelo local → modelo hospedado

O autor está buscando feedback sobre utilidade para modelos locais vs hospedados, tipos de avaliadores mais importantes para fluxos de trabalho de LLM local, e se regressões de chamada de ferramentas/saída estruturada são um ponto problemático real. O repositório é licenciado sob MIT.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

ClawCall Ganha Números de Telefone Dedicados: Agentes Agora Podem Reservar um Número para Chamadas de Saída
Tools

ClawCall Ganha Números de Telefone Dedicados: Agentes Agora Podem Reservar um Número para Chamadas de Saída

ClawCall, a habilidade de chamadas telefônicas com IA para agentes OpenClaw, agora permite reservar um número de telefone por código de área. Seu agente o usa por padrão ao fazer chamadas. 10 mil downloads, 300 chamadas/dia.

OpenClawRadar
Plugin Peek para Claude Code: Navegação Automática pela Memória da Sessão
Tools

Plugin Peek para Claude Code: Navegação Automática pela Memória da Sessão

Peek é um plugin do Claude Code que captura e injeta automaticamente correções e preferências dos usuários para direcionar o assistente de IA. Ele usa busca por fusão com embeddings, BM25, decaimento temporal e filtros de metadados para fornecer contexto relevante sem solicitação manual.

OpenClawRadar
Servidor de memória MCP de código aberto com grafo de conhecimento e recursos de aprendizado
Tools

Servidor de memória MCP de código aberto com grafo de conhecimento e recursos de aprendizado

Um servidor MCP de código aberto escrito em Rust oferece memória persistente para agentes de IA com arquitetura de grafo de conhecimento, aprendizado hebbiano e busca híbrida. Tem 7,6MB com latência submilissegundo e funciona com qualquer cliente compatível com MCP.

OpenClawRadar
Ferramenta de Voz para Texto Offline para macOS Usando Whisper Local via MLX
Tools

Ferramenta de Voz para Texto Offline para macOS Usando Whisper Local via MLX

Um desenvolvedor disponibilizou em código aberto o whisper-dictate, uma ferramenta para macOS que oferece transcrição de voz para texto totalmente offline com capacidades de tradução em tempo real, utilizando o Whisper rodando localmente através do MLX em Apple Silicon. A transcrição leva cerca de 500ms após o término da fala.

OpenClawRadar