미세 조정된 Qwen2.5-7B, 3달러와 제로 인간 레이블러로 클로드 하이쿠의 96% 성능 달성

한 개발자가 Qwen2.5-7B를 미세 조정하여 특정 도메인 의사결정 추론 작업에서 Claude Haiku의 종합 성능의 96%를 달성했습니다. 단 ~$3의 API 호출 비용과 인간 레이블러 0명을 사용했습니다. 이 방법은 DV-DPO(Decision-Validated Direct Preference Optimization)라고 불리며, 다중 음성 적대 위원회를 실행하여 학습 신호를 자동으로 생성합니다.
DV-DPO 작동 방식
파이프라인은 각 결정 질문에 대해 3음성 위원회를 실행하여 종합을 생성합니다. 그런 다음 두 패배한 음성이 종합을 심문합니다. 종합이 이 적대적 압력 하에 수정되면 DPO 쌍이 형성됩니다: 수정 후 버전이 선택 응답이고, 수정 전 버전이 거부 응답입니다. 종합이 유지되면 쌍이 생성되지 않습니다. 이렇게 하면 형식 선호도나 샘플링 분산이 아닌 실제 추론 오류만 학습 신호를 생성합니다.
결과
- 1,040개의 학습 쌍 생성 (Haiku 요금으로 ~$3)
- Claude Haiku 대비: 형식 100%, 커밋 100%, 컨텍스트 89%, 종합 96%
- 지연 시간: 11초 (T4 GPU, 4비트 양자화) vs Haiku의 3초
- 적대적 실패율: 2% (96개 표적 질문 기준)
자율 개선 루프
시스템은 이제 자동화된 주기를 실행합니다: failure_detector → auto_red_team → DPO pairs → retrain → redeploy → eval. 버전 5 쌍이 축적되고 있습니다. 미세 조정된 모델은 GGUF 파일로 제공되며 Ollama에서 바로 사용할 수 있습니다.
대상
호출당 비용을 지불하는 API에서 비싼 인간 주석 없이 로컬 미세 조정 모델로 전환하려는 도메인 특화 추론 에이전트를 구축하는 개발자.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also
Claude Code v2.1.288에서 재개 수정, Ctrl+C 초안 복구 및 /code-review --max-findings 제공
Claude Code v2.1.288은 --resume이 압축된 컨텍스트와 저장되지 않은 턴 응답을 누락시키는 문제를 수정하고, Ctrl+C 초안 복구, Ctrl+F 세션 검색, /code-review를 위한 --max-findings를 추가했습니다.
Claude Code v2.1.208: 스크린 리더 모드, Vim 리맵, 메모리 누수 수정 등
Claude Code v2.1.208에서 화면 읽기 모드, vim 삽입 모드 리맵, 프로세스 래퍼를 추가하고, MCP stdio, LSP, 도구 결과 페이로드의 메모리 누수를 포함한 수많은 버그를 수정했습니다.

InclusionAI, 링-2.6-1T 출시: 에이전트 워크플로우를 위한 조 단위 파라미터 모델
InclusionAI가 Ring-2.6-1T를 공개했습니다. 이는 에이전트 실행에 최적화된 1조 매개변수 추론 모델로, 이중 추론 노력 수준(high/xhigh)과 IcePop 알고리즘을 통한 비동기 RL 훈련을 특징으로 합니다.

Qwen KV 캐시 양자화 심층 분석: PPL, KL 발산 및 비대칭 K/V 결과
Qwen 3.6-35B-A3B에 대한 두 번째 KV 캐시 양자화 벤치마크: perplexity, KL divergence, 비대칭 K/V 조합, 그리고 Apple M5 Max에서의 64K 컨텍스트 깊이.