OpenClaw 폴백으로서의 Bonsai 2 (Qwen 3.8 27B): 5070에서 8GB, 85 tok/s
PrismML의 Ternary-Bonsai-2-27B는 r/openclaw 사용자가 ChatGPT와 Grok 할당량이 소진됐을 때 OpenClaw 폴백 모델로 로컬에서 실행 중인 양자화된 Qwen3 3.8 27B 빌드입니다. 사용자의 주장에 따르면 약 8GB 용량, 기본 Qwen3 27B 품질의 98% 유지, 텍스트와 비전 지원을 갖췄습니다.
구성에서 나온 수치
- 출력 속도: 85 tok/s
- 하드웨어: RTX 5070 16GB VRAM, 시스템 메모리 64GB
- 디스크 용량: 약 8GB
- 품질 유지: Qwen3 3.8 27B의 98%로 보고됨
필요한 두 개의 GGUF
파일은 Hugging Face의 prism-ml/Ternary-Bonsai-2-27B-gguf 저장소에서 받을 수 있습니다:
Ternary-Bonsai-2-27B-PQ2_0.gguf (텍스트) Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf (비전)
멀티모달 경로를 원한다면 둘 다 필요합니다. mmproj 파일은 비전 프로젝터이고, PQ2_0 파일은 삼진화된 텍스트 가중치입니다.
설정 참고 사항
Bonsai 2는 PrismML 자체의 llama.cpp 포크가 필요합니다 — 기본 llama.cpp에서는 로드되지 않습니다. 작성자는 OpenClaw 호스트와 별도의 AI 머신에서 GPT로 포크를 연결했고, 모델은 다음과 같이 구성했습니다:
- OpenClaw가 호출할 때 동적으로 로드
- 10분 동안 비활성 상태면 언로드
- GPT 5.6과 Grok이 사용 한도에 도달했을 때 폴백으로 작동
실제로 한 일
흥미로운 부분은 tok/s가 아니라 에이전트형 동작입니다. 게시물에 따르면 브라우저를 통한 웹 검색, VM 제어, 새 소프트웨어 설치 및 사용, 기존 워크플로 실행을 처리했으며, 작성자는 "최전선 모델이 아닌지 구분할 수 없다"고 말할 정도였습니다.
이는 벤치마크가 아닌 한 사용자의 보고이므로 품질 주장은 일화로 받아들이는 게 좋습니다. 실용적인 핵심은 유휴 시 로드/언로드 패턴입니다. 유료 제공자가 속도 제한에 걸렸을 때만 로컬 27B를 상주시키므로, 다른 작업도 하는 장비의 VRAM을 영구적으로 소모하지 않는 합리적인 방법입니다.
16GB 이상 VRAM이 있는 GPU가 있다면 PQ2_0 + mmproj 조합은 충분히 작아서, 자신의 에이전트 작업에 맞는지 결정하기 전에 직접 테스트해볼 가치가 있습니다.
📖 전체 원문 읽기: Source
👀 See Also

스킬 스튜디오: Claude AI 에이전트 스킬 관리를 위한 오픈소스 데스크톱 애플리케이션
Skill Studio는 개발자가 커뮤니티 스킬 저장소를 탐색하고, 마크다운 렌더링으로 문서를 미리 보고, npx skills add와 같은 원클릭 명령어로 스킬을 설치할 수 있는 무료 오픈소스 macOS 데스크톱 앱입니다.

Swarm Orchestra v2 플러그인, 클로드 코드 에이전트 팀 혼잡 해결을 위한 에이전트 간 메시징 기능 추가
Swarm Orchestra는 Claude Code의 실험적인 TeamCreate 기능으로 인해 발생하는 폭주하는 에이전트 문제를 해결하는 플러그인입니다. 버전 2는 PreToolUse 훅을 통한 에이전트 간 메시징과 /teammate 스킬을 통한 자체 구성 기능을 추가했습니다.

오픈소스 지속 메모리 시스템인 Claude Code는 세션 간 컨텍스트 손실 문제를 해결합니다.
한 개발자가 Claude Code를 위한 파일 기반 메모리 시스템을 구축했습니다. 이 시스템은 플러그인이나 API 키 없이도 프로젝트 컨텍스트를 자동으로 캡처합니다. 대화 기록, 인박스 파일, 야간 크론 작업을 활용해 세션 간 지속적인 메모리를 유지합니다.

마우스: AI 코딩 에이전트를 위한 좌표 기반 편집 단계별 변경 및 원자적 롤백
Mouse는 문자열 교체 편집 대신 6가지 좌표 기반 작업(INSERT, DELETE, ADJUST)과 단계별 변경 및 원자적 롤백을 통해 AI 에이전트에게 정밀한 파일 편집 기능을 제공합니다.