EvalShift: 모델 마이그레이션 중 LLM 성능 저하를 감지하는 오픈소스 CLI

EvalShift는 LLM 또는 모델 버전 간 전환 시 회귀를 탐지하도록 설계된 오픈소스 Python CLI입니다. 골든 입력 스위트를 소스 및 대상 모델에 대해 실행하고, 출력을 평가하며, 로컬 HTML 보고서를 생성합니다 — 백엔드, 계정 또는 원격 측정이 필요 없습니다.
주요 기능
- LiteLLM을 통한 소스 대 대상 모델 비교
- 태그/슬라이스가 있는 JSONL 골든 스위트
- 구조적 평가기: JSON 스키마, 정규식, 길이
- 의미론적 평가기: 임베딩 유사도
- LLM-as-judge 쌍별 평가
- 도구 호출 평가기: 도구 선택, 인수 일치, 트레이스 구조
- 쌍별 통계 테스트: t-검정 / Wilcoxon
- 효과 크기: Cohen's d
- 다중 비교 보정: Benjamini-Hochberg
- 슬라이스 수준 분석
- 비용 제어를 위한 로컬 캐싱
- 재개 가능한 실행
- 단일 파일 HTML 보고서 + JSON 출력
프로젝트의 좁은 목표는 마이그레이션 안전성입니다: "프롬프트/에이전트 동작을 망가뜨리지 않고 모델을 전환할 수 있을까?" 저자는 조용한 에이전트 회귀 — 예를 들어, 최신 모델이 괜찮아 보이는 최종 답변을 생성하지만 필수 도구 호출을 건너뛰거나, 잘못된 도구를 호출하거나, 인수를 변경하는 경우 —를 잡아내는 것을 강조합니다.
사용 사례
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- 로컬 모델 → 호스티드 모델
저자는 로컬 모델 대 호스티드 모델에 대한 유용성, 로컬 LLM 워크플로에서 가장 중요한 평가기 유형, 그리고 도구 호출/구조화된 출력 회귀가 실제로 문제가 되는지에 대한 피드백을 구하고 있습니다. 저장소는 MIT 라이선스입니다.
📖 원문 읽기: r/LocalLLaMA
👀 See Also

오픈소스 MCP 서버는 Claude Code와 IDE 도구를 연결합니다
오픈소스 MCP 서버는 Claude Code가 LSP, 터미널, Git, GitHub, 디버깅, 진단 도구 등 124개 이상의 도구를 통해 IDE 기능에 지속적으로 접근할 수 있게 합니다. 이 서버를 설정한 기기가 있으면 모바일 기기에서도 코딩이 가능해집니다.

ClawBridge – OpenClaw를 통해 홈 어시스턴트 엔티티를 안전하게 공개하세요
ClawBridge는 Home Assistant 엔티티를 OpenClaw에 노출시키는 원활한 방법을 소개하며, 안전성을 보장하면서 자동화를 강화합니다. 그 기능과 이점을 알아보세요.

Agent Smith: MCP 서버, 스킬 및 Claude Code를 위한 티켓-to-PR 파이프라인을 구축하는 하나의 명령어
Agent Smith가 리포지토리를 스캔하고 정확한 스택(Go/Echo, React/Zustand, golang-jwt, pgx 등)을 감지하여 MCP 서버, 훅, 스킬을 설정하고, Jira 티켓에서 PR까지 자동화하는 파이프라인을 제공합니다.

지식 레이븐: Claude용 검색 가능한 지식 베이스 플러그인
Knowledge Raven은 Claude Desktop 플러그인이나 MCP 서버를 통해 Confluence, Notion, Google Drive, Dropbox, GitHub와 같은 소스에서 Claude가 문서를 검색할 수 있게 해주는 도구로, 의미론적 검색, 키워드 검색, 전체 문서 검색 기능을 제공합니다.