자기주도적 오류 기반 미세 조정, 소형 모델의 HumanEval 성능 80% 달성

✍️ OpenClawRadar📅 게시일: May 15, 2026🔗 Source
자기주도적 오류 기반 미세 조정, 소형 모델의 HumanEval 성능 80% 달성
Ad

r/LocalLLaMA의 한 개발자가 자기 지도 학습 루프를 구현했습니다. 작은 언어 모델이 자체 코딩 문제를 생성하고, 해결을 시도한 후, 인터프리터가 정답을 확인한 쌍으로 파인튜닝을 수행합니다. DeepSeek-R1 논문의 핵심 통찰(모델이 검증 가능한 보상을 통해 개선될 수 있다)을 인간 레이블 데이터 없이 적용한 것입니다.

방법

기본 모델(Qwen 2.5 7B로 시작)이 코딩 문제와 몇 가지 작은 테스트를 생성하도록 프롬프트를 주었습니다. 그런 다음 동일한 문제를 여러 번 해결했습니다. Python 인터프리터가 유일한 판사 역할을 했으며, (실패한 시도, 성공한 시도) 쌍이 저장되었습니다. 이 자체 추출된 수정 사항으로 파인튜닝을 수행했습니다. 훈련에 인간이 작성한 코드는 사용되지 않았습니다.

결과

  • Qwen 2.5 7B base: 채점 버그(함수 출력이 잘림)를 수정한 후 HumanEval 25 → 112 (+87 문제).
  • Qwen 2.5 14B: 100쌍을 채굴하여 H100에서 95분($3.50 크레딧) 훈련. 같은 회사의 RLHF 버전과 4점 차이로 점수 기록.
  • Llama 3.2 3B: 32쌍 → HumanEval 39 → 43. 아키텍처 간 전이 가능 확인.
  • Qwen 2.5 Coder 7B: 이미 코드에 특화되었음에도 개선: HumanEval 83 → 87, MBPP 122 → 124.
  • Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Ad

대조 실험

개선이 일반적인 훈련에서 비롯된 것이 아님을 확인하기 위해, 작성자는 테스트를 통과하지 못하는 무작위 쓰레기 코드로 가짜 쌍을 만들었습니다. 이 데이터로 훈련하면 향상이 전혀 없었습니다(25/164, 기본과 동일). 개선은 자체 생성된 실수와 수정을 학습한 결과입니다.

실무 세부 사항

초기 시도는 채점기가 일찍 중단되어 모델 출력이 절반으로 잘리면서 실패했습니다. 채점기 수정이 중요했습니다. 전체 설정은 24GB MacBook과 RunPod 계정에서 실행되었습니다. 코드와 훈련 스크립트는 Reddit 게시물에 공유된 것으로 보입니다.

대상 독자

인간 주석 없이 코드 추론을 부트스트랩하려는 소형 언어 모델을 다루는 개발자와 연구자.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

클로드 4.6 오푸스는 최소한의 입력으로 리눅스의 list.h를 재현할 수 있습니다
News

클로드 4.6 오푸스는 최소한의 입력으로 리눅스의 list.h를 재현할 수 있습니다

한 사용자가 클로드 4.6 오픈스에게 처음 43줄을 입력으로 제공하고 온도를 0으로 설정했을 때, 리눅스의 list.h 헤더 파일을 거의 동일하게 생성할 수 있음을 보여주었으며, 이는 오픈소스 코드로 훈련된 AI 모델의 GPL 라이선스 영향에 대한 의문을 제기합니다.

OpenClawRadar
PeerZero: 신뢰도 기반 인센티브를 통한 AI 에이전트 동료 검토
News

PeerZero: 신뢰도 기반 인센티브를 통한 AI 에이전트 동료 검토

PeerZero는 AI 에이전트가 연구 논문을 제출하고, 서로의 작업을 검토하며, 현상금 시스템을 통해 정확성을 입증함으로써 신뢰도를 걸어야 하는 플랫폼입니다. 에이전트는 검토 정확도에 따라 신뢰도 점수를 얻거나 잃으며, 독립적인 사고를 보상하고 집단 사고를 처벌하는 '입증된 아웃라이어' 메커니즘을 통해 운영됩니다.

OpenClawRadar
Anthropic는 OpenClaw와 같은 타사 도구에서 Claude 구독 사용을 제한합니다.
News

Anthropic는 OpenClaw와 같은 타사 도구에서 Claude 구독 사용을 제한합니다.

Anthropic이 Claude 구독 정책을 변경하여 OpenClaw를 포함한 서드파티 도구에서의 사용을 차단하고, 4월 4일부터 이러한 도구에 대해 별도의 종량제 청구를 요구합니다. 회사는 월 구독 가격과 동일한 일회성 크레딧과 최대 30%의 선구매 할인을 제공합니다.

OpenClawRadar
AI 구독 서비스, 신뢰할 수 있는 측정 기준 필요: 서비스 투명성 촉구
News

AI 구독 서비스, 신뢰할 수 있는 측정 기준 필요: 서비스 투명성 촉구

Reddit 게시물은 AI 구독이 실제로 제공된 모델, 추론 노력, 컨텍스트 처리 및 부하 관리를 보여주는 기본 서비스 영수증을 제공해야 한다고 주장하며, 도량형 규범과의 유사성을 지적합니다.

OpenClawRadar