PrismML의 Bonsai 1-bit Qwen 모델 테스트 결과: 8GB VRAM에서 초당 107 토큰 생성 성능

✍️ OpenClawRadar📅 게시일: April 5, 2026🔗 Source
PrismML의 Bonsai 1-bit Qwen 모델 테스트 결과: 8GB VRAM에서 초당 107 토큰 생성 성능
Ad

Bonsai 모델: PrismML의 1비트 Qwen 양자화

PrismML은 Qwen3 모델(8B, 4B, 1.7B 파라미터)의 1비트 양자화 버전 세트인 Bonsai를 출시했습니다. 이 모델들은 극단적인 양자화를 사용하여 특정 작업에 대한 사용 가능한 성능을 유지하면서 메모리 요구 사항을 극적으로 줄입니다.

테스트 성능 벤치마크

8GB VRAM의 RTX 4060에서 테스트한 결과:

  • 초당 107 토큰 생성 속도
  • >1114 토큰/초 프롬프트 처리
  • Q4 양자화 모델 대비 상당히 낮은 RAM 사용량

비교를 위해, 동일한 하드웨어에서 동일한 프롬프트를 사용한 Qwen 3.5 4B Q4는 56 토큰/초를 달성했습니다.

실용적 의미

감소된 메모리 사용량으로 인해 8B 파라미터 모델을 8GB VRAM 시스템에서 실행할 수 있습니다. 더 작은 모델들은 메모리 절약 덕분에 더 긴 컨텍스트 윈도우와 함께 사용될 수 있습니다.

품질 평가

초기 테스트는 텍스트 요약에 집중했으며, 모델이 잘 수행했습니다. 테스터는 코딩이나 도구 사용 능력은 평가하지 않았다고 언급했습니다.

기술적 제한 사항

현재 구현에는 CPU 추론 문제가 있습니다. GPU가 없는 미니 PC에서 테스트했을 때:

  • llama.cpp 포크는 성공적으로 컴파일됨
  • 모델은 로드되지만 프롬프트 처리 중 멈춤
  • 분석 결과 CPU 구현이 존재하지 않는 것으로 보임 - 아마도 FP32로 역양자화하고 일반 추론을 시도하는데, 이는 CPU에서 매우 느릴 것임

기술적 잠재력

1비트 모델은 대역폭과 메모리 요구 사항뿐만 아니라 계산 요구 사항도 줄일 수 있습니다. 1비트 행렬의 행렬 곱셈은 XOR 연산을 사용할 수 있으며, 이는 부동 소수점 연산보다 훨씬 빠릅니다. XOR 연산 후 FP16으로 스케일링하더라도 상당한 계산 절약이 가능할 것이며, 이는 CPU 전용 추론 및 엣지 컴퓨팅 시나리오에 유익할 수 있습니다.

설정 세부 사항

테스터는 다음을 다운로드했습니다:

  • 8B Bonsai 모델
  • PrismML의 llama.cpp 포크
  • CUDA가 설치된 Windows에서 테스트

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

분산형 소형 모델 네트워크, 중앙 집중형 AI를 비용과 성능에서 압도하다: 프런티어 AI 경쟁의 종말
News

분산형 소형 모델 네트워크, 중앙 집중형 AI를 비용과 성능에서 압도하다: 프런티어 AI 경쟁의 종말

소형 AI 모델 네트워크가 속도, 정확도, 비용에서 모든 최첨단 AI 시스템을 능가합니다. 중앙 집중식 AI 기업은 '히드라 효과'로 인해 선두를 되찾을 수 없다고 주장합니다.

OpenClawRadar
Claude Code v2.1.116: 성능 개선, 터미널 수정 및 보안 업데이트
News

Claude Code v2.1.116: 성능 개선, 터미널 수정 및 보안 업데이트

Claude Code v2.1.116는 40MB 이상 세션에서 /resume 명령어 처리 속도를 최대 67% 향상시키고, 터미널 스크롤을 더 부드럽게 하며, MCP 시작 속도를 개선하는 등 상당한 성능 향상을 제공합니다. 이번 릴리스는 터미널 렌더링 문제를 해결하고, 위험한 경로 작업에 대한 보안 보호 기능을 추가하며, 슬래시 명령어와 플러그인 관리에 영향을 미치는 여러 버그를 수정했습니다.

OpenClawRadar
🦀
News

우버, 알고리즘 기반 드라이버 비활성화로 네덜란드 규제당국에 8억 2천5백만 유로 벌금 부과

네덜란드 데이터 보호 당국이 우버에 8억 2500만 유로의 벌금을 부과했습니다. 운전자 계정을 적절한 인간의 감독 없이 자동으로 비활성화하는 알고리즘을 사용한 것이 GDPR을 위반했다는 이유에서입니다.

OpenClawRadar
Opus 4.6은 연구에서 뛰어난 반면, Gemini 3.1 Pro는 예측 벤치마크에서 더 나은 판단력을 보입니다
News

Opus 4.6은 연구에서 뛰어난 반면, Gemini 3.1 Pro는 예측 벤치마크에서 더 나은 판단력을 보입니다

1,417개의 이진 예측 질문으로 구성된 벤치마크가 연구 성능과 판단 성능을 분리합니다: Claude Opus 4.6은 에이전틱 연구에서 선두, Gemini 3.1 Pro는 고정 증거 기반 보정에서 우위. GPT-5.4와 Grok 4.20은 조건 간 변화가 거의 없습니다.

OpenClawRadar