Qwen3.6:27b + 맞춤형 Go 에이전트: Claude Code의 로컬 대안

로컬 LLM 통합 사업을 운영하는 개발자(codehamr)가 Claude Code의 대체재로 로컬 모델을 실험한 결과를 설명합니다. 그들은 96GB와 128k 컨텍스트를 갖춘 RTX 6000에서 Q8 양자화된 Qwen3.6:27b가 Claude Code와 유사한 코딩 경험을 제공하며, 32GB의 Q4_M에서 소비자용 RTX 5090도 비슷한 결과를 낼 수 있다고 언급합니다.
에이전트 계층의 경우, 그들은 codehamr(MIT 오픈소스)이라는 최소한의 단일 Go 바이너리를 구축했습니다. 플러그인, MCP, 테마가 없으며, 에이전트는 필요에 따라 bash를 통해 검색, 종속성, 파일 작업을 처리합니다. 저장소는 https://github.com/codehamr/codehamr에서 확인할 수 있습니다.
주요 세부사항
- 모델: RTX 6000(96GB)에서 128k 컨텍스트로 실행되는 Q8 양자화 Qwen3.6:27b — 30B 모델에는 과한 사양입니다.
- 소비자 대안: Q4_M으로 실행되는 RTX 5090(32GB)은 좋은 프롬프트 규율과 함께 비슷한 코딩 경험을 제공해야 합니다.
- 에이전트 빌드: 커스텀 Go 바이너리 — 최소한, 플러그인 없음, MCP 없음. 검색, 종속성, 파일 작업에 bash 사용.
- 라이선스: MIT 오픈소스, 포크하거나 무시 가능.
개발자는 로컬 LLM으로의 모든 단계가 클라우드 도구에 대한 의존성을 줄여준다고 강조합니다. 이 설정은 규율 있는 프롬프트와 결합되어 Claude Code가 그리워지지 않는 첫 번째 로컬 구성입니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

코드플래시 분석: 클로드 코드로 작성된 두 개의 PR에서 118개의 성능 버그 발견
Codeflash는 Claude Code로 구축된 두 가지 주요 기능의 성능을 측정한 결과, 118개의 함수가 필요 이상으로 최대 446배 느리게 실행되는 것을 발견했습니다. 분석 결과 비효율적인 알고리즘, 중복 계산, 캐싱 누락, 최적화되지 않은 데이터 구조 패턴이 드러났습니다.

Intuno: AI 에이전트 발견 및 통신을 위한 오픈 소스 네트워크
Intuno는 AI 에이전트가 기능을 등록하고, 의미론적 검색을 통해 서로를 발견하며, 3줄의 Python 코드로 함수를 호출할 수 있는 오픈소스 네트워크입니다. Claude Desktop 또는 Cursor에서 사용할 수 있는 MCP 통합을 포함하고 있습니다.

Show HN: WUPHF — 진실의 원천으로 마크다운 + 깃을 사용하는 카파시 스타일 LLM 위키
WUPHF는 Markdown + Git을 사용하여 AI 에이전트를 위한 위키 레이어를 제공하며, 지속성에는 bleve (BM25) + SQLite를 사용하고 엔터티 사실 로그, 위키링크, 일일 린트 크론 작업을 포함합니다. 벡터 데이터베이스 의존성 없이 로컬에서 실행됩니다.

Kanban CLI: 로컬 우선, 에이전트 우선 터미널 작업 관리자
Kanban CLI는 Rust 기반 터미널 도구로, Git 완전 통합과 함께 구조화된 작업 추적을 제공하며 AI 에이전트 주도 워크플로우를 위해 설계되었습니다.