Omnicoder-9B 성능 검토: 속도 대 도구 호출 문제

기술 개요
Omnicoder-9B는 Tesslate가 개발한 Qwen 3.5 아키텍처 기반의 코딩 전용 모델입니다. Opus 4.6, GPT 5.4, GPT 5.3 Codex, Gemini 3.1 Pro를 포함한 여러 모델의 출력을 사용하여 Qwen3.5 9B를 기반으로 미세 조정되었습니다.
성능 특성
이 모델은 중급 하드웨어에서 강력한 성능을 보입니다. 12GB VRAM으로 사용자들은 컨텍스트 크기가 100k로 설정된 상태에서도 15 토큰/초의 일관된 토큰 생성을 보고합니다. 프롬프트 처리 속도는 약 265 토큰/초로 특히 빠릅니다. 모델은 시스템 충돌이나 성능 저하 없이 실행됩니다.
제한 사항 및 문제점
속도 장점에도 불구하고, Omnicoder-9B는 실제 코딩 시나리오에서 몇 가지 제한 사항을 보입니다:
- 원샷 프롬프트로 독립형 HTML 파일에 완전한 슈퍼 마리오 클론을 생성하지 못함
- MCP 서버와의 도구 호출 실패, 데이터 가져오기 중 MCP 오류 발생
- Claude Code에서 쓰기 도구 호출 실행 문제(호환성 요인 포함 가능)
IDE 통합 테스트
개발 환경에서의 테스트 결과는 혼재되었습니다:
- LM Studio와 Roo Code에서: 토큰 크기가 4k로 증가하면 연결이 끊어짐(통합 문제로 보이며 모델 특정 문제는 아님)
- 모델은 2-3k 토큰 크기의 작은 스크립트를 성공적으로 업데이트하거나 작성함
- 4k 이상 토큰에 대한 API 요청은 오류 메시지 없이 실패함
- Claude Code에서: 토큰 생성이 Roo Code에 비해 느리게 느껴지며, 출력 생성 후 쓰기 도구 호출 실행 실패
사용자는 Continue 및 다른 테스트 옵션 중에서 Roo Code가 로컬 LLM에 가장 효과적인 확장 프로그램이라고 언급합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

사벤트 커맨더 48B: 12개의 증류 모델로 구성된 맞춤형 Qwen 3 전문가 혼합 모델
Savant Commander 48B는 Claude, Gemini, OpenAI, Deepseek와 같은 제공업체의 12개 증류 모델을 결합한 맞춤형 Qwen 3 Mixture-of-Experts 모델로, 수동 코딩된 라우팅을 특징으로 합니다. 256K 컨텍스트 길이를 지원하며 프롬프트 제어를 통해 특정 증류 모델을 활성화할 수 있습니다.

Octopoda: 로컬 AI 에이전트를 위한 오픈 소스 메모리 레이어
옥토포다는 로컬 AI 에이전트에게 세션 간 지속적인 메모리, 의미론적 검색, 루프 감지, 충돌 복구 기능을 제공하는 오픈소스 메모리 레이어입니다. 33MB 임베딩 모델로 완전 오프라인에서 실행되며 LangChain, CrewAI, AutoGen, OpenAI Agents SDK와 통합됩니다.

린 컨텍스트: 클로드 코드 플러그인이 장황한 문서를 에이전트 최적화 파일로 변환합니다
Lean Context라는 무료 오픈소스 Claude Code 플러그인은 프로젝트 문서를 스캔하여 AI 에이전트가 grep 검색을 통해 발견할 수 있는 내용을 제거하고, 필수적인 비명령어, 주의사항, 환경별 특이사항만 남깁니다. .NET 전자상거래 프로젝트 테스트에서는 8개 문서 총 1,263줄을 단 23줄로 줄였습니다.

프로모클록: Claude의 2배 오프피크 시간대를 위한 타임존 트래커 (Claude 4.6로 제작)
한 개발자가 Claude의 2배 오프피크 프로모션 시간을 자동으로 현지 시간으로 변환해주는 무료 도구 PromoClock.co를 구축했습니다. 이 도구는 Claude 4.6을 사용해 시간대 로직을 처리하고, Next.js 15 설정과 UI 디자인을 구현했습니다.