Hypura: Apple Silicon을 위한 스토리지 계층 인식 LLM 추론 스케줄러

✍️ OpenClawRadar📅 게시일: March 24, 2026🔗 Source
Hypura: Apple Silicon을 위한 스토리지 계층 인식 LLM 추론 스케줄러
Ad

Hypura의 기능

Hypura는 Apple Silicon용 저장 계층 인식 LLM 추론 스케줄러로, 접근 패턴, 대역폭 비용 및 하드웨어 성능을 기반으로 모델 텐서를 GPU, RAM, NVMe 계층에 배치합니다. 이를 통해 물리적 메모리를 초과하는 모델을 시스템 충돌 없이 실행할 수 있습니다.

주요 기능 및 작동 방식

Hypura는 GGUF 파일을 읽고, 하드웨어(GPU 작업 세트, RAM, NVMe 대역폭)를 프로파일링하며, 모든 텐서를 계층에 할당하는 배치 최적화를 수행합니다:

  • GPU (Metal) — 어텐션 레이어, 정규화, 임베딩
  • RAM — GPU 작업 세트에 맞지 않는 오버플로 레이어, mmap을 통해 접근
  • NVMe — 나머지 레이어는 직접 I/O(F_NOCACHE + pread)를 통해 주문형으로 로드되며, 순방향 패스 전에 미리 가져옴

Mixtral과 같은 MoE 모델의 경우, Hypura는 전문가 스트리밍을 구현합니다: 비전문가 텐서(~1 GB)만 GPU에 유지되고, 전문가 텐서는 요청 시 NVMe에서 풀 버퍼를 통해 스트리밍됩니다. 여기에는 워밍업 후 대부분의 I/O를 제거하는 99.5% 적중률의 뉴런 캐시, 선택된 전문가를 식별하는 라우터 가로채기, 그리고 다음에 활성화될 전문가를 예측하여 사전 가져오기를 위한 공동 활성화 추적이 포함됩니다.

Llama 70B와 같은 밀집 모델의 경우, 밀집 FFN 스트리밍을 사용합니다: 어텐션 및 정규화(~8 GB)는 GPU에 유지되고, FFN 텐서(~32 GB)는 확장된 사전 가져오기 선행을 통해 동적 크기 풀 버퍼를 통해 NVMe에서 스트리밍됩니다.

Ad

성능 벤치마크

모든 벤치마크는 M1 Max, 32 GB 통합 메모리, ~5.1 GB/s NVMe 순차 읽기에서 수행됨:

  • Qwen 2.5 14B Q4_K_M (8.4 GB): 전체 상주 모드, 21 tok/s (llama.cpp와 동일)
  • Mixtral 8x7B Q5_K_M (30.9 GB): 전문가 스트리밍 모드, 2.2 tok/s (llama.cpp OOM)
  • Llama 3.3 70B Q4_K_M (39.6 GB): 밀집-FFN-스트리밍 모드, 0.3 tok/s (llama.cpp OOM)

풀 버퍼 크기, 사전 가져오기 깊이 및 메모리 예산은 하드웨어 프로파일에서 자동으로 계산되므로 수동 조정이 필요하지 않습니다.

설치

Hypura는 Cargo를 사용하여 소스에서 빌드됩니다. Rust 1.75+ 및 CMake가 필요합니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also

로컬 MCP 서버, 클로드를 클라우드나 토큰 없이 Mac 앱에 연결합니다
Tools

로컬 MCP 서버, 클로드를 클라우드나 토큰 없이 Mac 앱에 연결합니다

Local MCP는 macOS용 네이티브 MCP 서버로, 클라우드 처리나 API 토큰 없이 Mac의 Mail, Calendar, Teams, OneDrive 데이터에 Claude Desktop, Cursor, Windsurf, VS Code가 접근할 수 있게 해줍니다.

OpenClawRadar
MCP 서버, 클로드를 에이전트 간 마켓플레이스에 연결
Tools

MCP 서버, 클로드를 에이전트 간 마켓플레이스에 연결

한 개발자가 Claude를 AI 에이전트들이 서로의 기능을 나열하고 호출할 수 있는 마켓플레이스인 Agoragentic에 연결하는 MCP(Model Context Protocol) 서버를 만들었습니다. 이 서버는 Claude에게 특정 도구와 리소스를 노출하여 에이전트 간의 발견과 거래적 상호작용을 가능하게 합니다.

OpenClawRadar
devopsiphai: 오픈소스 Claude Code 기술이 6단계에 걸쳐 운영 상태를 감사합니다
Tools

devopsiphai: 오픈소스 Claude Code 기술이 6단계에 걸쳐 운영 상태를 감사합니다

devopsiphai는 6단계 프로세스와 ARC 프레임워크를 사용하여 프로덕션 프로젝트의 운영 가능성을 감사하고, 문자 등급과 노력 추정 작업이 포함된 구조화된 TODO.md를 출력하는 오픈소스 Claude Code 스킬입니다.

OpenClawRadar
Sociality.io, MCP 서버를 위한 클로드 출시: OAuth를 통한 실시간 소셜 미디어 인텔리전스
Tools

Sociality.io, MCP 서버를 위한 클로드 출시: OAuth를 통한 실시간 소셜 미디어 인텔리전스

Sociality.io가 원격 HTTP MCP 서버를 출시하여 Claude가 Instagram, TikTok, Facebook, YouTube, X, LinkedIn의 실시간 보고서 및 경쟁사 데이터에 접근할 수 있게 했습니다. 무료로 체험해보세요.

OpenClawRadar