Hypura: Apple Silicon을 위한 스토리지 계층 인식 LLM 추론 스케줄러

✍️ OpenClawRadar📅 게시일: March 24, 2026🔗 Source
Hypura: Apple Silicon을 위한 스토리지 계층 인식 LLM 추론 스케줄러
Ad

Hypura의 기능

Hypura는 Apple Silicon용 저장 계층 인식 LLM 추론 스케줄러로, 접근 패턴, 대역폭 비용 및 하드웨어 성능을 기반으로 모델 텐서를 GPU, RAM, NVMe 계층에 배치합니다. 이를 통해 물리적 메모리를 초과하는 모델을 시스템 충돌 없이 실행할 수 있습니다.

주요 기능 및 작동 방식

Hypura는 GGUF 파일을 읽고, 하드웨어(GPU 작업 세트, RAM, NVMe 대역폭)를 프로파일링하며, 모든 텐서를 계층에 할당하는 배치 최적화를 수행합니다:

  • GPU (Metal) — 어텐션 레이어, 정규화, 임베딩
  • RAM — GPU 작업 세트에 맞지 않는 오버플로 레이어, mmap을 통해 접근
  • NVMe — 나머지 레이어는 직접 I/O(F_NOCACHE + pread)를 통해 주문형으로 로드되며, 순방향 패스 전에 미리 가져옴

Mixtral과 같은 MoE 모델의 경우, Hypura는 전문가 스트리밍을 구현합니다: 비전문가 텐서(~1 GB)만 GPU에 유지되고, 전문가 텐서는 요청 시 NVMe에서 풀 버퍼를 통해 스트리밍됩니다. 여기에는 워밍업 후 대부분의 I/O를 제거하는 99.5% 적중률의 뉴런 캐시, 선택된 전문가를 식별하는 라우터 가로채기, 그리고 다음에 활성화될 전문가를 예측하여 사전 가져오기를 위한 공동 활성화 추적이 포함됩니다.

Llama 70B와 같은 밀집 모델의 경우, 밀집 FFN 스트리밍을 사용합니다: 어텐션 및 정규화(~8 GB)는 GPU에 유지되고, FFN 텐서(~32 GB)는 확장된 사전 가져오기 선행을 통해 동적 크기 풀 버퍼를 통해 NVMe에서 스트리밍됩니다.

Ad

성능 벤치마크

모든 벤치마크는 M1 Max, 32 GB 통합 메모리, ~5.1 GB/s NVMe 순차 읽기에서 수행됨:

  • Qwen 2.5 14B Q4_K_M (8.4 GB): 전체 상주 모드, 21 tok/s (llama.cpp와 동일)
  • Mixtral 8x7B Q5_K_M (30.9 GB): 전문가 스트리밍 모드, 2.2 tok/s (llama.cpp OOM)
  • Llama 3.3 70B Q4_K_M (39.6 GB): 밀집-FFN-스트리밍 모드, 0.3 tok/s (llama.cpp OOM)

풀 버퍼 크기, 사전 가져오기 깊이 및 메모리 예산은 하드웨어 프로파일에서 자동으로 계산되므로 수동 조정이 필요하지 않습니다.

설치

Hypura는 Cargo를 사용하여 소스에서 빌드됩니다. Rust 1.75+ 및 CMake가 필요합니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also

오픈클로 스마트 라우터, 자동 모델 선택 기능 오픈소스 공개
Tools

오픈클로 스마트 라우터, 자동 모델 선택 기능 오픈소스 공개

한 개발자가 OpenClaw용 스마트 라우터를 오픈소스로 공개했습니다. 이 도구는 쿼리를 복잡도에 따라 자동으로 분류하고 최적의 모델로 라우팅하여, Claude나 GPT-4o 같은 프리미엄 모델을 항상 사용하는 것에 비해 API 비용을 60-80% 절감할 수 있습니다.

OpenClawRadar
hiresTI: OpenClaw/MCP 지원을 갖춘 네이티브 Linux TIDAL 플레이어
Tools

hiresTI: OpenClaw/MCP 지원을 갖춘 네이티브 Linux TIDAL 플레이어

hiresTI는 안정적인 재생, 고품질 오디오 출력, GTK4/Libadwaita UI, 그리고 MCP를 통한 OpenClaw 통합을 통한 원격 제어에 초점을 맞춘 TIDAL 전용 네이티브 리눅스 데스크톱 클라이언트입니다. 이 앱은 파이썬 UI 레이어와 러스트 오디오 코어를 결합합니다.

OpenClawRadar
AI 코딩 에이전트를 위한 멀티 모델 협업 워크플로우
Tools

AI 코딩 에이전트를 위한 멀티 모델 협업 워크플로우

개발자가 코딩 작업을 코딩 에이전트에 전달하기 전에 세 가지 AI 모델(GPT-4o를 설계자, Claude를 회의론자, Gemini를 통합자로 사용)을 통해 검토하는 웹 도구를 만들었습니다. 이 도구는 명시적인 제약 조건이 포함된 PLAN.md를 생성하며 사용자가 자신의 API 키를 가져와야 합니다.

OpenClawRadar
다중 에이전트 AI 개발을 위한 거버넌스 레이어 구분
Tools

다중 에이전트 AI 개발을 위한 거버넌스 레이어 구분

Delimit는 여러 AI 코딩 에이전트 간의 충돌을 방지하기 위해 조정하는 오픈소스 거버넌스 레이어입니다. Claude Code, Codex, Gemini와 같은 에이전트를 위한 공유 메모리, 충돌 감지 및 감사 추적 기능을 제공합니다.

OpenClawRadar