보데가 추론 엔진: Apple Silicon의 통합 메모리를 위한 LLM 추론 최적화

✍️ OpenClawRadar📅 게시일: March 19, 2026🔗 Source
보데가 추론 엔진: Apple Silicon의 통합 메모리를 위한 LLM 추론 최적화
Ad

Bodega는 Apple Silicon의 통합 메모리 아키텍처를 위해 특별히 설계된 추론 엔진으로, MLX에서 Metal 레이어에 가까운 최적화와 함께 2.5년 이상 구축되었습니다. Mac 하드웨어에서 LLM을 실행할 때 개발자가 직면하는 근본적인 처리량 한계를 해결합니다.

Apple Silicon이 다른 최적화를 요구하는 이유

Apple Silicon은 CPU, GPU, 신경 엔진이 단일 온칩 버스를 통해 하나의 물리적 풀을 공유하는 통합 메모리를 사용합니다. 이는 별도의 VRAM과 시스템 RAM 풀이 PCIe로 연결된 NVIDIA와 같은 개별 GPU와 근본적으로 다릅니다. 메모리 대역폭은 M1 Max의 ~400 GB/s에서 M3 Ultra의 ~800 GB/s까지 범위를 가지며(다이 간 패널티로 인해 실제 처리량은 단일 다이 성능의 1.6-1.8배로 감소).

주요 아키텍처적 의미:

  • 디코드는 메모리 대역폭에 제한됨 - 각 토큰은 공유 버스에서 모델 가중치를 로드해야 함
  • 프리필은 컴퓨팅에 제한됨 - 행렬-행렬 곱셈을 위한 GPU TFLOPS가 지배적
  • 메모리 버스는 모든 것과 공유됨 - KV 캐시, 모델 가중치, OS, 애플리케이션이 모두 동일한 400-800 GB/s 대역폭을 경쟁

이 아키텍처는 vLLM이나 llama.cpp의 배칭 구현을 MLX에 직접 포팅하는 것을 비효율적으로 만듭니다. 왜냐하면 그들은 다른 메모리 아키텍처를 위해 설계되었기 때문입니다.

Ad

Bodega가 구축하는 것

개발자는 연속 배칭, 추측 디코딩, 청크 프리필, 프리픽스 캐싱을 포함한 vLLM의 핵심 내부 구조를 연구한 후, MLX와 Apple의 통합 메모리 모델을 위해 모든 구성 요소를 재구축했습니다.

연속 배칭에 대한 핵심 통찰: 단일 시퀀스에 대한 단일 토큰 생성은 행렬-벡터 곱셈을 위해 전체 모델 가중치를 로드하는데, 이는 400+ GB/s 대역폭을 가진 하드웨어에서 비효율적입니다. 해결책은 가중치 × 단일 벡터 대신 가중치 × 벡터 행렬을 사용하여 여러 시퀀스를 동시에 실행하는 것입니다.

KV 캐시 관리는 격리된 VRAM 시스템과 비교하여 캐시 블록을 제거하는 데 다른 비용 영향이 있는 통합 메모리를 위해 재설계되었습니다.

실제적 의미

개발자는 두 개의 M3 Ultra(256GB 및 512GB), M4 Max 128GB, M1 Max 64GB를 포함한 여러 Apple Silicon 구성에서 테스트했다고 보고합니다. 확인된 공통 한계는 한 번에 하나의 요청과 대부분 유휴 상태인 GPU를 사용한 단일 사용자 처리량입니다.

저장소에는 간단한 curl 스크립트로 설정을 확인할 수 있는 벤치마크가 포함되어 있습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

ProofShot CLI는 AI 코딩 에이전트에 브라우저 검증 기능을 제공합니다
Tools

ProofShot CLI는 AI 코딩 에이전트에 브라우저 검증 기능을 제공합니다

ProofShot은 브라우저 세션을 녹화하고, 스크린샷을 캡처하며, 콘솔 오류를 수집하여 AI 코딩 에이전트가 UI 기능을 검증할 수 있도록 하는 오픈소스 CLI 도구입니다. 셸 명령어를 실행할 수 있는 모든 에이전트와 호환되며, 사람이 검토할 수 있는 독립형 HTML 보고서를 생성합니다.

OpenClawRadar
Revdiff: AI 에이전트를 위한 인라인 주석이 포함된 터미널 Diff 뷰어
Tools

Revdiff: AI 에이전트를 위한 인라인 주석이 포함된 터미널 Diff 뷰어

Revdiff는 터미널 세션을 떠나지 않고 AI 생성 코드 변경 사항을 검토하기 위해 특별히 제작된 TUI diff 검토 도구입니다. 구조화된 주석을 stdout으로 출력하여 Claude Code와 같은 AI 에이전트에 직접 파이프로 전달할 수 있어 지속적인 검토 루프를 생성합니다.

OpenClawRadar
나노코드: JAX와 TPU를 사용한 클로드(Claude) 스타일 코딩 에이전트 훈련
Tools

나노코드: JAX와 TPU를 사용한 클로드(Claude) 스타일 코딩 에이전트 훈련

Nanocode는 Constitutional AI와 TPU 최적화를 사용하여 Claude와 유사한 코딩 에이전트를 종단 간 학습시키는 JAX 라이브러리입니다. 13억 개의 파라미터를 가진 모델은 TPU v6e-8에서 약 9시간 동안 200달러의 비용으로 학습시킬 수 있습니다.

OpenClawRadar
🦀
Tools

Android용 OpenClaw: 엄지손가락 크기의 개인 AI 컴퓨터가 VM에서 OpenClaw를 실행합니다

Trustkernel의 PlugClaw는 엄지손가락 크기의 USB 스틱으로, 전용 VM에서 Android와 OpenClaw를 실행하여 모든 휴대폰이나 노트북에서 Android 앱과 상호작용하는 GUI 에이전트를 추가합니다.

OpenClawRadar