OmniCoder-9B 파인튜닝은 8GB VRAM 시스템에서 에이전트 코딩에 강력한 성능을 보여줍니다.

✍️ OpenClawRadar📅 게시일: March 13, 2026🔗 Source
OmniCoder-9B 파인튜닝은 8GB VRAM 시스템에서 에이전트 코딩에 강력한 성능을 보여줍니다.
Ad

OpenCode로 OmniCoder-9B 테스트 성능 결과

r/LocalLLaMA의 한 사용자가 Opus 트레이스로 훈련된 Qwen3.5-9B의 파인튜닝 모델인 OmniCoder-9B를 테스트했으며, 제한된 VRAM을 가진 시스템에서 에이전트 코딩 작업에 잘 작동한다고 보고했습니다. 이 모델은 Hugging Face에서 Tesslate/OmniCoder-9B로 이용 가능합니다.

기술 설정 및 구성

사용자는 다음 명령어로 ik_llama를 사용하여 Q4_K_M GGUF 양자화를 실행했습니다:

ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0

이 구성으로 약 초당 40개의 토큰을 달성했습니다. 사용자는 64,000 컨텍스트 길이의 Q5_KS 양자화가 비슷한 속도를 제공한다고 언급했습니다.

Ad

OpenCode 구성

테스트에 사용된 OpenCode 구성:

"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }

사용자는 전체 프롬프트 재처리를 유발할 수 있는 잠재적 버그를 조사 중이라고 언급했습니다.

배경 및 비교

이 테스트는 상용 AI 코딩 도구의 할당량 제한 및 가격 변경에 대한 우려에서 비롯되었습니다. 사용자는 특히 8GB VRAM을 가지고 있어, 일반적으로 에이전트 코딩에 적합한 속도로 우수한 오픈소스 모델을 실행하는 능력이 제한된다고 언급했습니다. MOE 모델이 더 나은 성능을 제공할 수 있지만 속도가 상당히 느리다고 지적했습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

LiveDocs 탐색: AI 네이티브 데이터 분석 노트북
Tools

LiveDocs 탐색: AI 네이티브 데이터 분석 노트북

LiveDocs는 데이터 팀이 다단계 분석을 수행하고 AI 에이전트의 도움으로 분석을 처음부터 끝까지 유지할 수 있는 반응형 노트북 환경을 제공합니다.

OpenClawRadar
대규모 Java/Spring 모노레포를 Claude에 맞게 압축하는 오픈소스 CLI
Tools

대규모 Java/Spring 모노레포를 Claude에 맞게 압축하는 오픈소스 CLI

sourcecode CLI는 약 4천 개의 파일로 구성된 Java/Spring 모노레포를 약 300만 토큰에서 1.7k 토큰(컴팩트 모드)으로 줄입니다. 현재 컨텍스트 압축, git 핫스팟 탐지 및 심볼 조회에 중점을 둡니다.

OpenClawRadar
Cloudflare의 vinext: Vite 위에 AI로 구축된 Next.js 호환 프레임워크
Tools

Cloudflare의 vinext: Vite 위에 AI로 구축된 Next.js 호환 프레임워크

Cloudflare 엔지니어들이 AI를 활용해 일주일 만에 Vite 기반으로 Next.js API 표면을 재구축하여 vinext를 만들었습니다. 이는 4배 더 빠르게 빌드하고 57% 더 작은 번들을 생성하는 드롭인 대체제입니다. 단일 명령어로 Cloudflare Workers에 배포됩니다.

OpenClawRadar
LLM 세션 드리프트 방지를 위한 7-파일 거버넌스 레이어
Tools

LLM 세션 드리프트 방지를 위한 7-파일 거버넌스 레이어

한 개발자가 Claude가 세션 간에 아키텍처 결정을 조용히 되돌리는 것을 방지하기 위해 7개의 파일로 구성된 거버넌스 레이어를 만들었습니다. 이 시스템에는 active_context.md, contracts.md, decisions.md 파일과 엄격한 실행 루프가 포함되어 있습니다.

OpenClawRadar