M4 Max에서 자체 튜닝된 메탈 커널로 초당 442토큰을 기록한 Bonsai 1.7B 삼진 모델

✍️ OpenClawRadar📅 게시일: May 4, 2026🔗 Source
M4 Max에서 자체 튜닝된 메탈 커널로 초당 442토큰을 기록한 Bonsai 1.7B 삼진 모델
Ad

PrismML의 삼진 모델인 Bonsai 1.7B가 자율 튜닝된 Metal 커널을 사용하여 Apple Silicon에 최적화되었습니다. 이 작업은 Agents2Agents의 자율 엔지니어링 에이전트인 ata가 수행했으며, 6시간 동안 에이전틱 진화 검색을 실행하여 맞춤형 GPU 커널을 생성했습니다.

벤치마크 결과

동일한 Bonsai/Q2_0 커밋의 상위 llama.cpp와 M4 Max에서 측정(동일한 모델 파일, 동일한 llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99 구성):

  • 디코드 (tg128): 311.66 → 442.42 t/s (+42.0%)
  • 프리필 (pp512): 4250.32 → 4622.63 t/s (+8.8%)

참고로 Bonsai 8B 백서에서는 Apple Silicon에서 MLX 업스트림 Q2_0 디코드가 235 t/s라고 보고합니다. 이 빌드는 맞춤형 Metal 커널을 통해 1.7B 변종에서 442 t/s를 달성합니다(다른 프레임워크, 더 작은 모델 — 스택에서 여유 공간이 있음을 방향적으로 시사).

포함 내용

이 빌드는 M 시리즈 Mac(arm64 전용)용 드롭인 최적화 추론 패키지입니다. 358 MB tar.xz 내부:

  • chat.sh — 대화형 REPL
  • complete.sh — 비대화형 완성
  • bench.sh — 벤치마크 재현
  • server.sh — :8080에서 OpenAI 호환 HTTP API
  • Bonsai-1.7B-Q2_0.gguf — 모델 파일 (442 MB)
Ad

빠른 시작

tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.sh

기술적 세부 사항

모든 Metal 커널은 인간의 개입 없이 ata가 작성하고 조정했습니다. 이 작업은 Bonsai 1.7B Q2_0 디코드 경로에 특화된 matvec / FFN / KV-캐시 계층의 맞춤형 GPU 커널에 중점을 두었습니다. 수치 출력은 참조 빌드와 일치합니다(상위-1 토큰 일치 확인). M4 Max에서 테스트됨; M1+에서 비례적인 성능 향상 예상.

주의 사항

  • Apple Silicon 전용 (arm64) — Intel Mac 또는 CPU 전용 빌드 없음.
  • M4 Max 기준 수치; M1/M2/M3는 메모리 대역폭이 낮아 더 낮은 성능.
  • 모델은 Q2_0 양자화 — F16 대비 작은 정확도 차이.

📖 전체 출처 읽기: HN AI Agents

Ad

👀 See Also

Coinbase x402 대 Google A2A: 에이전트 간 결제를 위한 두 가지 상반된 결제 순서
News

Coinbase x402 대 Google A2A: 에이전트 간 결제를 위한 두 가지 상반된 결제 순서

에이전트 간 결제를 구축하다 보면 근본적인 차이가 드러납니다: Coinbase의 x402 미들웨어는 작업 완료 후 정산(verify→run→settle)하는 반면, Google의 A2A 확장은 느린 에이전트 호출의 경우 작업 전에 정산(verify→settle→run)합니다.

OpenClawRadar
Andrej Karpathy, Anthropic의 사전 학습 팀에 합류하여 클로드를 사용한 순환적 자기 개선 추진
News

Andrej Karpathy, Anthropic의 사전 학습 팀에 합류하여 클로드를 사용한 순환적 자기 개선 추진

OpenAI 공동 창업자였던 안드레 카파시(Andrej Karpathy)가 Anthropic의 사전 학습 팀에 합류해, Nick Josef 밑에서 Claude를 이용해 사전 학습 연구를 가속화하고 재귀적 자기 개선을 가능하게 하는 새로운 팀을 구축합니다.

OpenClawRadar
Codestrap 창립자들, AI 코딩 지표 비판하며 품질 문제 경고
News

Codestrap 창립자들, AI 코딩 지표 비판하며 품질 문제 경고

Codestrap 창립자들은 AI 코딩 도구가 코드 라인 수나 풀 리퀘스트 같은 지표로 잘못 평가받고 있다고 주장하며, 품질 지표는 SQLite를 Rust로 재작성한 사례에서 코드베이스가 3.7배 더 크면서 성능은 2,000배나 떨어지는 문제를 보여준다고 말합니다.

OpenClawRadar
🦀
News

Claude Code v2.1.227 CI에서 기능 플래그 구독 및 Bash 오류 수정

Claude Code v2.1.227은 만료된 토큰으로 인한 기능 플래그 평가 오류, claude-code-action에서의 Bash 실패를 수정하고 슬래시 명령 메뉴 접근성을 개선합니다.

OpenClawRadar