EvalShift: 모델 마이그레이션 중 LLM 성능 저하를 감지하는 오픈소스 CLI

✍️ OpenClawRadar📅 게시일: May 15, 2026🔗 Source
EvalShift: 모델 마이그레이션 중 LLM 성능 저하를 감지하는 오픈소스 CLI
Ad

EvalShift는 LLM 또는 모델 버전 간 전환 시 회귀를 탐지하도록 설계된 오픈소스 Python CLI입니다. 골든 입력 스위트를 소스 및 대상 모델에 대해 실행하고, 출력을 평가하며, 로컬 HTML 보고서를 생성합니다 — 백엔드, 계정 또는 원격 측정이 필요 없습니다.

주요 기능

  • LiteLLM을 통한 소스 대 대상 모델 비교
  • 태그/슬라이스가 있는 JSONL 골든 스위트
  • 구조적 평가기: JSON 스키마, 정규식, 길이
  • 의미론적 평가기: 임베딩 유사도
  • LLM-as-judge 쌍별 평가
  • 도구 호출 평가기: 도구 선택, 인수 일치, 트레이스 구조
  • 쌍별 통계 테스트: t-검정 / Wilcoxon
  • 효과 크기: Cohen's d
  • 다중 비교 보정: Benjamini-Hochberg
  • 슬라이스 수준 분석
  • 비용 제어를 위한 로컬 캐싱
  • 재개 가능한 실행
  • 단일 파일 HTML 보고서 + JSON 출력

프로젝트의 좁은 목표는 마이그레이션 안전성입니다: "프롬프트/에이전트 동작을 망가뜨리지 않고 모델을 전환할 수 있을까?" 저자는 조용한 에이전트 회귀 — 예를 들어, 최신 모델이 괜찮아 보이는 최종 답변을 생성하지만 필수 도구 호출을 건너뛰거나, 잘못된 도구를 호출하거나, 인수를 변경하는 경우 —를 잡아내는 것을 강조합니다.

사용 사례

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • 로컬 모델 → 호스티드 모델

저자는 로컬 모델 대 호스티드 모델에 대한 유용성, 로컬 LLM 워크플로에서 가장 중요한 평가기 유형, 그리고 도구 호출/구조화된 출력 회귀가 실제로 문제가 되는지에 대한 피드백을 구하고 있습니다. 저장소는 MIT 라이선스입니다.

📖 원문 읽기: r/LocalLLaMA

Ad

👀 See Also

오픈소스 MCP 메모리 서버 - 지식 그래프 및 학습 기능 포함
Tools

오픈소스 MCP 메모리 서버 - 지식 그래프 및 학습 기능 포함

Rust로 작성된 오픈소스 MCP 서버가 지식 그래프 아키텍처, 헤비안 학습, 하이브리드 검색을 통해 AI 에이전트에 지속적 메모리를 제공합니다. 7.6MB 크기에 밀리초 미만의 지연 시간을 가지며 모든 MCP 호환 클라이언트와 작동합니다.

OpenClawRadar
OpenClaw Codex-GPT5.4 작업 검증 루프 문제
Tools

OpenClaw Codex-GPT5.4 작업 검증 루프 문제

개발자가 OpenClaw를 통해 Codex-GPT5.4를 사용하여 자율 프로젝트 작업 중 작업 검증 루프에 갇히는 문제를 보고했습니다. 모델이 작업을 식별하고 확인만 반복하며 실제로 실행하지 않는 현상입니다. 이 문제를 해결하기 위해 TASKS.md, 하트비트 규칙, 페르소나 파일 등 작업 공간 제어 장치를 구현했습니다.

OpenClawRadar
1997년 축구 매니저 게임에서 데이터를 추출하기 위해 Claude 사용하기
Tools

1997년 축구 매니저 게임에서 데이터를 추출하기 위해 Claude 사용하기

Ben Nuttall이 Claude를 사용하여 FIFA Soccer Manager 97의 선수, 팀, 경기장 데이터를 추출했습니다. AI가 SM97.DAT 파일을 파싱하고 CSV로 내보낸 후 검색 가능한 웹사이트를 구축했습니다. 모든 Python 코드는 GitHub에 공개되어 있습니다.

OpenClawRadar
클로드봇, 프로 구독으로 새로운 기능 공개
Tools

클로드봇, 프로 구독으로 새로운 기능 공개

Clawdbot은 코딩 환경에서 자동화의 잠재력을 극대화하려는 사용자를 위해 향상된 기능을 제공하는 'Pro' 구독을 소개합니다. 최신 기능과 r/clawdbot 커뮤니티의 인사이트를 살펴보세요.

OpenClawRadar