미세 조정된 Qwen2.5-7B, 3달러와 제로 인간 레이블러로 클로드 하이쿠의 96% 성능 달성

✍️ OpenClawRadar📅 게시일: June 11, 2026🔗 Source
미세 조정된 Qwen2.5-7B, 3달러와 제로 인간 레이블러로 클로드 하이쿠의 96% 성능 달성
Ad

한 개발자가 Qwen2.5-7B를 미세 조정하여 특정 도메인 의사결정 추론 작업에서 Claude Haiku의 종합 성능의 96%를 달성했습니다. 단 ~$3의 API 호출 비용과 인간 레이블러 0명을 사용했습니다. 이 방법은 DV-DPO(Decision-Validated Direct Preference Optimization)라고 불리며, 다중 음성 적대 위원회를 실행하여 학습 신호를 자동으로 생성합니다.

DV-DPO 작동 방식

파이프라인은 각 결정 질문에 대해 3음성 위원회를 실행하여 종합을 생성합니다. 그런 다음 두 패배한 음성이 종합을 심문합니다. 종합이 이 적대적 압력 하에 수정되면 DPO 쌍이 형성됩니다: 수정 후 버전이 선택 응답이고, 수정 전 버전이 거부 응답입니다. 종합이 유지되면 쌍이 생성되지 않습니다. 이렇게 하면 형식 선호도나 샘플링 분산이 아닌 실제 추론 오류만 학습 신호를 생성합니다.

Ad

결과

  • 1,040개의 학습 쌍 생성 (Haiku 요금으로 ~$3)
  • Claude Haiku 대비: 형식 100%, 커밋 100%, 컨텍스트 89%, 종합 96%
  • 지연 시간: 11초 (T4 GPU, 4비트 양자화) vs Haiku의 3초
  • 적대적 실패율: 2% (96개 표적 질문 기준)

자율 개선 루프

시스템은 이제 자동화된 주기를 실행합니다: failure_detector → auto_red_team → DPO pairs → retrain → redeploy → eval. 버전 5 쌍이 축적되고 있습니다. 미세 조정된 모델은 GGUF 파일로 제공되며 Ollama에서 바로 사용할 수 있습니다.

대상

호출당 비용을 지불하는 API에서 비싼 인간 주석 없이 로컬 미세 조정 모델로 전환하려는 도메인 특화 추론 에이전트를 구축하는 개발자.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also