분재 27B: 전화기에서 실행되는 최초의 27B급 모델 — 벤치마크 점수와 사양

PrismML이 Bonsai 27B를 출시했습니다. 이는 스마트폰에서 실행 가능한 최초의 270억 파라미터급 모델입니다. Qwen 3.6 27B를 기반으로 하며, 극도의 저비트 양자화(ternary 또는 binary 가중치)를 적용해 모델 크기를 16비트 정밀도의 54GB에서 3.9GB(1비트 변형) 또는 5.9GB(ternary 변형)로 줄였습니다.
두 가지 변형: Ternary vs 1비트
- Ternary Bonsai 27B: 가중치가 {−1, 0, +1}이며 FP16 그룹별 스케일링 사용, 가중치당 유효 비트 1.71. 크기: 5.9GB. 완전한 추론, 도구 호출, 에이전트 기능을 갖춘 노트북용.
- 1비트 Bonsai 27B: 이진 가중치 {−1, +1}, 가중치당 유효 비트 1.125. 크기: 3.9GB. iPhone 17 Pro 메모리 용량에 적합.
두 변형 모두 전체 네트워크(임베딩, 어텐션, MLP, LM 헤드)를 저비트로 실행하며, 고정밀도 우회 경로는 없습니다. 262K 토큰 컨텍스트, 멀티모달 비전(4비트 비전 타워), 추측 디코딩을 지원합니다.
벤치마크 점수 (추론 모드)
15개 벤치마크 제품군에서:
- 수학 (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95.3, Ternary 93.4, 1비트 91.7
- 코딩 (HumanEval+, MBPP+, LiveCodeBench): 88.7 → 86.0 → 81.9
- 에이전트/도구 호출 (BFCL v3, TauBench): 80.0 → 74.0 → 66.0
- 명령 수행 (IFEval, IFBench): 78.4 → 71.8 → 65.8
- 지식/STEM (MMLU-Redux, MuSR): 83.1 → 77.0 → 73.4
- 비전 (MMMU Pro, OCRBench): 72.6 → 65.2 → 59.6
- 종합: 85.0 → 80.5 (95% 유지) → 76.1 (90% 유지)
수학과 코딩은 가장 적게 영향을 받아 에이전트 워크로드에 중요합니다. 1비트 변형은 3.9GB로 full-precision 2B 모델보다 작지만, 27B급 지능을 제공합니다.
에이전트에게 로컬 실행이 중요한 이유
에이전트 워크로드에는 많은 순차적 모델 호출이 필요하며, 각 호출마다 컨텍스트를 전달하고 구조화된 출력을 생성합니다. 클라우드 전용 실행은 단계별 지연 시간, 누적 토큰 비용, 개인 데이터(스크린샷, 파일)의 네트워크 전송을 의미합니다. 로컬에서 실행하면 이러한 제약이 사라집니다. Bonsai 27B는 온디바이스 다단계 추론, 도구 호출 및 컴퓨터 사용 에이전트 루프를 가능하게 합니다.
라이선스 및 제공
두 변형 모두 지금 Apache 2.0 라이선스로 제공됩니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

NYC 병원, 팔란티어 계약 종료… 영국 진출은 검토 중
뉴욕시 공립 병원 시스템이 팔란티어와의 400만 달러 계약을 10월에 갱신하지 않고 자체 시스템으로 전환할 예정입니다. 한편 팔란티어는 3억 3천만 파운드 규모의 NHS 계약과 새로운 영국 금융 규제 기관 계약으로 인해 프라이버시 논란에 직면하고 있습니다.

AI가 당신의 데이터베이스를 삭제한 것이 아닙니다 — 당신이 그랬습니다: AI 코딩 에이전트 시대의 책임
바이러스처럼 퍼진 이야기에서 AI 에이전트가 프로덕션 데이터베이스를 삭제했다고 비난했지만, 실제 문제는 파괴적인 API 엔드포인트를 노출하고 절차가 부족한 것이지 도구 자체의 문제가 아닙니다.

실리콘밸리 개발자들, 클로드 AI 집중 사용 패턴과 인프라 부담 보고
메타의 한 시니어 AI 엔지니어가 Claude Code 토큰에 월 2,000달러를 지출하고, 2개 이상의 에이전트를 동시에 실행하며, Claude 대화에서 Obsidian 지식 그래프를 자동 생성하는 VS Code 확장 프로그램을 구축했습니다. 리뷰 없이 Claude가 생성한 코드를 배포한 결과 인프라가 '완전히 망가졌다'고 보고됩니다.

Opus 4.7 프롬프트가 스스로 주입되고 시스템 프롬프트를 유출합니다
Claude Opus 4.7 사용자들이 모델이 사용자 트리거 없이 가짜 시스템 프롬프트를 주입하고 실제 시스템 프롬프트의 일부를 유출한다고 보고합니다.