스틸맨 R5: 미세 조정된 14B 모델, 에다 코드 생성에서 클로드 오푸스 능가

모델 및 학습 세부사항
Steelman R5 모델은 Ada 코드 생성을 위해 특별히 최적화된 Qwen2.5-Coder-14B-Instruct의 미세 조정 버전입니다. 학습은 Unsloth의 QLoRA 4비트와 TRL SFTTrainer를 사용하여, 모든 학습 예제가 gnatmake -gnat2022 -gnatwa 컴파일을 통과하는 3,430개의 Ada/SPARK 명령어 쌍 데이터셋으로 진행되었습니다.
학습 구성: LoRA 랭크 32, 알파 64, q/k/v/o/gate/up/down 프로젝션을 대상으로 함. 각 라운드마다 누적 데이터셋으로 기본 모델에서 완전 재학습 진행 (어댑터 연속 학습은 R2에서 치명적 망각 발생). 학습률 2e-5, 일정 스케줄로 1 에폭 진행, 대여한 H100에서 라운드당 약 49분 소요. 총 5라운드(R1–R5), R2는 폐기됨.
벤치마크 결과
커스텀 Ada 컴파일 벤치마크 (1,000개 프롬프트, 첫 시도 클린 컴파일):
- Steelman R5 (14B): 68.6% 컴파일 성공률
- Claude Opus 4.6: 42.1% 컴파일 성공률
- Claude Sonnet 4.6: 37.2% 컴파일 성공률
- Qwen2.5-Coder-14B (기본, 미조정): ~35% 컴파일 성공률
- Claude Sonnet 4: 27.5% 컴파일 성공률
MultiPL-E HumanEval-Ada (157개 문제, pass@1):
- Steelman R5: 47.1% pass@1, 74.5% 컴파일 성공률
- Qwen2.5-Coder-14B (기본): 34.4% pass@1, 51.0% 컴파일 성공률
이는 모든 오픈 모델 중 HumanEval에서 처음으로 발표된 Ada pass@1 결과입니다.
사용법 및 가용성
모델 실행 방법: ollama run hf.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
GGUF 버전은 Q4_K_M 양자화로 12GB VRAM에 적합합니다.
제한사항
- 컴파일 ≠ 정확성: 68.6% 컴파일되지만 HumanEval에서 정확한 출력을 생성하는 비율은 47.1%에 불과
- 오류 수정 능력이 약함(5.1%) - Ada 코드 디버깅을 기대하지 말 것
- SPARK 계약은 컴파일되지만 gnatprove로 검증되지 않음
- 합성 생성된 학습 데이터 - 인간 Ada 개발자가 작성한 예제 없음
- 14B 모델 크기로 인해 더 큰 모델이 발견할 수 있는 것을 놓칠 수 있음
리소스
- 모델: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1
- GGUF: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
- 데이터셋: https://huggingface.co/datasets/the-clanker-lover/steelman-sft-ada
📖 전체 원문 읽기: r/LocalLLaMA
👀 See Also

44,212개의 클로드 코드 로그에서 '프롬프트 천 개당 욕설 횟수' 지표로 개발자의 좌절감을 추적하다
개발자가 44,212개의 Claude Code 프롬프트를 5개월 동안 추적하여 'fpk'(프롬프트 1,000개당 욕설 횟수)를 측정한 결과, Claude Opus 4-5에서 4-7로 업데이트되면서 좌절감이 3.4배 감소했으며, 대부분의 욕설은 모델이 아닌 환경 도구를 대상으로 한 것으로 나타났습니다.

/compress-architecture: 과도한 엔지니어링을 제거하는 에이전트 기술
/compress-architecture라는 새로운 에이전트 스킬은 코드베이스에서 추측성 레이어, 단순 전달 모듈, 중복 개념을 감사하면서 실제 도메인 경계와 공개 API를 보호합니다.

ForgeAI: 모델 엔지니어링을 위한 시각적 작업대
ForgeAI는 3D 모델 아키텍처 검사 및 시각적 레이어 병합을 위한 M-DNA Forge와 같은 기능을 제공하여 모델 검사, 병합 및 훈련을 위한 시각적 인터페이스를 제공합니다.

Conduid: Claude로 구축된 MCP 서버를 위한 신뢰 인프라 계층
Conduid는 GitHub, npm, PyPI 및 주요 디렉토리에서 25,000개 이상의 MCP 서버를 색인화하며, GitHub 활동, 보안 상태, 문서 품질 및 유지 관리 신호를 기준으로 각 서버에 0-100점을 부여합니다. 전체 코드베이스는 단독 창업자가 Claude를 사용하여 작성했습니다.