스틸맨 R5: 미세 조정된 14B 모델, 에다 코드 생성에서 클로드 오푸스 능가

모델 및 학습 세부사항
Steelman R5 모델은 Ada 코드 생성을 위해 특별히 최적화된 Qwen2.5-Coder-14B-Instruct의 미세 조정 버전입니다. 학습은 Unsloth의 QLoRA 4비트와 TRL SFTTrainer를 사용하여, 모든 학습 예제가 gnatmake -gnat2022 -gnatwa 컴파일을 통과하는 3,430개의 Ada/SPARK 명령어 쌍 데이터셋으로 진행되었습니다.
학습 구성: LoRA 랭크 32, 알파 64, q/k/v/o/gate/up/down 프로젝션을 대상으로 함. 각 라운드마다 누적 데이터셋으로 기본 모델에서 완전 재학습 진행 (어댑터 연속 학습은 R2에서 치명적 망각 발생). 학습률 2e-5, 일정 스케줄로 1 에폭 진행, 대여한 H100에서 라운드당 약 49분 소요. 총 5라운드(R1–R5), R2는 폐기됨.
벤치마크 결과
커스텀 Ada 컴파일 벤치마크 (1,000개 프롬프트, 첫 시도 클린 컴파일):
- Steelman R5 (14B): 68.6% 컴파일 성공률
- Claude Opus 4.6: 42.1% 컴파일 성공률
- Claude Sonnet 4.6: 37.2% 컴파일 성공률
- Qwen2.5-Coder-14B (기본, 미조정): ~35% 컴파일 성공률
- Claude Sonnet 4: 27.5% 컴파일 성공률
MultiPL-E HumanEval-Ada (157개 문제, pass@1):
- Steelman R5: 47.1% pass@1, 74.5% 컴파일 성공률
- Qwen2.5-Coder-14B (기본): 34.4% pass@1, 51.0% 컴파일 성공률
이는 모든 오픈 모델 중 HumanEval에서 처음으로 발표된 Ada pass@1 결과입니다.
사용법 및 가용성
모델 실행 방법: ollama run hf.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
GGUF 버전은 Q4_K_M 양자화로 12GB VRAM에 적합합니다.
제한사항
- 컴파일 ≠ 정확성: 68.6% 컴파일되지만 HumanEval에서 정확한 출력을 생성하는 비율은 47.1%에 불과
- 오류 수정 능력이 약함(5.1%) - Ada 코드 디버깅을 기대하지 말 것
- SPARK 계약은 컴파일되지만 gnatprove로 검증되지 않음
- 합성 생성된 학습 데이터 - 인간 Ada 개발자가 작성한 예제 없음
- 14B 모델 크기로 인해 더 큰 모델이 발견할 수 있는 것을 놓칠 수 있음
리소스
- 모델: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1
- GGUF: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
- 데이터셋: https://huggingface.co/datasets/the-clanker-lover/steelman-sft-ada
📖 전체 원문 읽기: r/LocalLLaMA
👀 See Also

오픈소스 MCP 서버는 AI 에이전트가 라이트닝 네트워크를 통해 L402 결제를 처리할 수 있도록 지원합니다.
FastMCP로 구축된 Python MCP 플러그인은 HTTP 402 결제 필요 응답을 가로채 라이트닝 네트워크 인보이스를 결제하고 AI 에이전트를 위한 데이터를 검색합니다. 이 저장소에는 실제 자금을 사용하지 않고 테스트할 수 있는 로컬 더미 에이전트가 포함되어 있습니다.

re_gent: AI 코딩 에이전트를 위한 Git – 에이전트 활동의 버전 관리
re_gent는 AI 에이전트 세션에 버전 관리를 제공하는 오픈소스 도구로, 모든 도구 호출을 추적하고 프롬프트와 파일 차이를 저장하며 `rgt log`, `rgt blame`, `rgt rewind`(출시 예정) 같은 명령을 지원합니다.

ReRouted: macOS 메뉴 바 앱으로 Claude, Codex, Grok 등 간 자동 폴백
ReRouted는 여러 AI 코딩 도구 계정과 제공자를 위한 로컬 게이트웨이 역할을 하는 가벼운 macOS 메뉴바 앱입니다. 모든 도구를 하나의 로컬 엔드포인트로 연결하면, 제공자 제한에 도달했을 때 자동으로 라우팅과 폴백을 처리합니다.

n8n-mcp-lite: MCP 서버가 n8n 워크플로우와 함께 Claude의 토큰 사용량을 80% 절감합니다
n8n-mcp-lite라는 새로운 오픈소스 Model Context Protocol 서버가 Claude가 n8n 자동화 워크플로우를 추론하는 데 도움을 주면서 토큰 사용량을 약 80% 감소시킵니다. 이 도구는 시각적 노드 자동화의 토큰 집약적 특성을 해결하기 위해 타겟팅된 워크플로우 스캐닝과 정밀 업데이트를 제공합니다.