미세 조정된 Qwen2.5-7B, 3달러와 제로 인간 레이블러로 클로드 하이쿠의 96% 성능 달성

✍️ OpenClawRadar📅 게시일: June 11, 2026🔗 Source
미세 조정된 Qwen2.5-7B, 3달러와 제로 인간 레이블러로 클로드 하이쿠의 96% 성능 달성
Ad

한 개발자가 Qwen2.5-7B를 미세 조정하여 특정 도메인 의사결정 추론 작업에서 Claude Haiku의 종합 성능의 96%를 달성했습니다. 단 ~$3의 API 호출 비용과 인간 레이블러 0명을 사용했습니다. 이 방법은 DV-DPO(Decision-Validated Direct Preference Optimization)라고 불리며, 다중 음성 적대 위원회를 실행하여 학습 신호를 자동으로 생성합니다.

DV-DPO 작동 방식

파이프라인은 각 결정 질문에 대해 3음성 위원회를 실행하여 종합을 생성합니다. 그런 다음 두 패배한 음성이 종합을 심문합니다. 종합이 이 적대적 압력 하에 수정되면 DPO 쌍이 형성됩니다: 수정 후 버전이 선택 응답이고, 수정 전 버전이 거부 응답입니다. 종합이 유지되면 쌍이 생성되지 않습니다. 이렇게 하면 형식 선호도나 샘플링 분산이 아닌 실제 추론 오류만 학습 신호를 생성합니다.

Ad

결과

  • 1,040개의 학습 쌍 생성 (Haiku 요금으로 ~$3)
  • Claude Haiku 대비: 형식 100%, 커밋 100%, 컨텍스트 89%, 종합 96%
  • 지연 시간: 11초 (T4 GPU, 4비트 양자화) vs Haiku의 3초
  • 적대적 실패율: 2% (96개 표적 질문 기준)

자율 개선 루프

시스템은 이제 자동화된 주기를 실행합니다: failure_detector → auto_red_team → DPO pairs → retrain → redeploy → eval. 버전 5 쌍이 축적되고 있습니다. 미세 조정된 모델은 GGUF 파일로 제공되며 Ollama에서 바로 사용할 수 있습니다.

대상

호출당 비용을 지불하는 API에서 비싼 인간 주석 없이 로컬 미세 조정 모델로 전환하려는 도메인 특화 추론 에이전트를 구축하는 개발자.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

AI 코딩 에이전트가 워크플로를 분산시키고 주의력을 소진시킬 수 있다고 개발자가 경고
News

AI 코딩 에이전트가 워크플로를 분산시키고 주의력을 소진시킬 수 있다고 개발자가 경고

12년 차 웹 개발자가 Claude Code를 매일 사용하면 미세한 중단, 집중력 저하, 정신적 피로가 발생하며 생산성 향상은 측정되지 않는다고 보고합니다.

OpenClawRadar
클로드 코드 소스 유출로 자동 드림 메모리 시스템과 멀티 에이전트 패턴이 드러났습니다
News

클로드 코드 소스 유출로 자동 드림 메모리 시스템과 멀티 에이전트 패턴이 드러났습니다

Anthropic이 Claude Code의 TypeScript 소스를 npm 소스 맵에 실수로 포함시켜 배포하면서, autoDream 메모리 통합, 모듈형 시스템 프롬프트 아키텍처, 다중 에이전트 조정자 패턴이 드러났습니다.

OpenClawRadar
NHS 잉글랜드, 오픈소스에서 후퇴: SDLC-8 정책 철회 촉구하는 공개서한
News

NHS 잉글랜드, 오픈소스에서 후퇴: SDLC-8 정책 철회 촉구하는 공개서한

74명의 서명이 포함된 공개 서한은 NHS 잉글랜드가 모든 NHS 소스 코드를 숨기는 정책인 SDLC-8을 철회하고 NHS 서비스 표준의 원칙 12인 '새 소스 코드를 공개하라'를 재확인할 것을 촉구합니다.

OpenClawRadar
삼성 노동자들 AI 칩 수익 분배 요구 — 개발자가 알아야 할 사항
News

삼성 노동자들 AI 칩 수익 분배 요구 — 개발자가 알아야 할 사항

삼성의 노동 계약은 반도체 부문 영업이익의 10.5%를 보너스로 지급하는 선례를 남겼다. AI 공급망 전반의 노동자들이 기록적인 이익의 일부를 요구하는 더 큰 움직임이 일어나고 있다.

OpenClawRadar