분재 27B: 전화기에서 실행되는 최초의 27B급 모델 — 벤치마크 점수와 사양

PrismML이 Bonsai 27B를 출시했습니다. 이는 스마트폰에서 실행 가능한 최초의 270억 파라미터급 모델입니다. Qwen 3.6 27B를 기반으로 하며, 극도의 저비트 양자화(ternary 또는 binary 가중치)를 적용해 모델 크기를 16비트 정밀도의 54GB에서 3.9GB(1비트 변형) 또는 5.9GB(ternary 변형)로 줄였습니다.
두 가지 변형: Ternary vs 1비트
- Ternary Bonsai 27B: 가중치가 {−1, 0, +1}이며 FP16 그룹별 스케일링 사용, 가중치당 유효 비트 1.71. 크기: 5.9GB. 완전한 추론, 도구 호출, 에이전트 기능을 갖춘 노트북용.
- 1비트 Bonsai 27B: 이진 가중치 {−1, +1}, 가중치당 유효 비트 1.125. 크기: 3.9GB. iPhone 17 Pro 메모리 용량에 적합.
두 변형 모두 전체 네트워크(임베딩, 어텐션, MLP, LM 헤드)를 저비트로 실행하며, 고정밀도 우회 경로는 없습니다. 262K 토큰 컨텍스트, 멀티모달 비전(4비트 비전 타워), 추측 디코딩을 지원합니다.
벤치마크 점수 (추론 모드)
15개 벤치마크 제품군에서:
- 수학 (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95.3, Ternary 93.4, 1비트 91.7
- 코딩 (HumanEval+, MBPP+, LiveCodeBench): 88.7 → 86.0 → 81.9
- 에이전트/도구 호출 (BFCL v3, TauBench): 80.0 → 74.0 → 66.0
- 명령 수행 (IFEval, IFBench): 78.4 → 71.8 → 65.8
- 지식/STEM (MMLU-Redux, MuSR): 83.1 → 77.0 → 73.4
- 비전 (MMMU Pro, OCRBench): 72.6 → 65.2 → 59.6
- 종합: 85.0 → 80.5 (95% 유지) → 76.1 (90% 유지)
수학과 코딩은 가장 적게 영향을 받아 에이전트 워크로드에 중요합니다. 1비트 변형은 3.9GB로 full-precision 2B 모델보다 작지만, 27B급 지능을 제공합니다.
에이전트에게 로컬 실행이 중요한 이유
에이전트 워크로드에는 많은 순차적 모델 호출이 필요하며, 각 호출마다 컨텍스트를 전달하고 구조화된 출력을 생성합니다. 클라우드 전용 실행은 단계별 지연 시간, 누적 토큰 비용, 개인 데이터(스크린샷, 파일)의 네트워크 전송을 의미합니다. 로컬에서 실행하면 이러한 제약이 사라집니다. Bonsai 27B는 온디바이스 다단계 추론, 도구 호출 및 컴퓨터 사용 에이전트 루프를 가능하게 합니다.
라이선스 및 제공
두 변형 모두 지금 Apache 2.0 라이선스로 제공됩니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

AI Slop이 개발자 커뮤니티를 질식시키는 방법: 바이브 코딩 노이즈 플로어
rmoff가 개발자 커뮤니티에 쏟아지는 저품질 AI 생성 콘텐츠(무의미한 GitHub 저장소부터 대필 블로그 게시물까지)와 이것이 유기적 참여를 어떻게 억누르는지에 대해 불평합니다.

OpenClaw가 응답하지 않는 이유: 사용자들의 우려 표명
OpenClaw 사용자들이 반응하지 않는 AI 코딩 에이전트 문제에 직면하고 있습니다. Reddit에서의 논의는 가능한 원인과 사용자 피드백에 대해 조명하고 있습니다.

클로드 코드의 /buddy 이스터 에그와 사용자 기능 요청
Claude Code에는 종족, 능력치, 장식용 코멘트가 있는 타마고치 스타일의 동반자를 생성하는 숨겨진 /buddy 명령어가 있습니다. 840회 이상의 세션을 가진 Max 구독자가 현재 제한 사항을 상세히 설명하고 기능적 개선 사항을 제안했습니다.

트럼프, 미국 기술 발전 둔화 우려로 AI 행정명령 철회
도널드 트럼프 대통령이 바이든 행정부의 AI 행정명령을 폐지, AI 모델에 대한 연방 안전 보고 요구를 철폐했습니다. 미국의 기술 우위가 중국에 뒤처질 위험을 이유로 들었습니다.