Гипура: планировщик вывода LLM с учетом уровня хранения для Apple Silicon

✍️ OpenClawRadar📅 Опубликовано: 24 марта 2026 г.🔗 Source
Гипура: планировщик вывода LLM с учетом уровня хранения для Apple Silicon
Ad

Что делает Hypura

Hypura — это планировщик вывода LLM для Apple Silicon, учитывающий уровни хранения данных, который распределяет тензоры модели по уровням GPU, оперативной памяти и NVMe на основе шаблонов доступа, затрат на пропускную способность и возможностей оборудования. Это позволяет запускать модели, превышающие объем физической памяти, без сбоев системы.

Ключевые особенности и принцип работы

Hypura считывает файлы GGUF, анализирует ваше оборудование (рабочий набор GPU, оперативная память, пропускная способность NVMe) и решает задачу оптимизации размещения, назначая каждый тензор определенному уровню:

  • GPU (Metal) — Слои внимания, нормализации, эмбеддинги
  • Оперативная память — Переполненные слои, которые не помещаются в рабочий набор GPU, доступ через mmap
  • NVMe — Остальные слои, загружаемые по требованию через прямой ввод-вывод (F_NOCACHE + pread) с упреждающей выборкой перед прямым проходом

Для моделей MoE, таких как Mixtral, Hypura реализует потоковую передачу экспертов: только неэкспертные тензоры (~1 ГБ) остаются на GPU, тогда как экспертные тензоры передаются потоком с NVMe через буферный пул по требованию. Включает кэш нейронов с 99,5% попаданий, который устраняет большую часть операций ввода-вывода после прогрева, перехват маршрутизатора для идентификации выбранных экспертов и отслеживание совместной активации для прогнозирования следующих активируемых экспертов с целью упреждающей выборки.

Для плотных моделей, таких как Llama 70B, используется плотная потоковая передача FFN: внимание и нормализации остаются на GPU (~8 ГБ), тогда как тензоры FFN (~32 ГБ) передаются потоком с NVMe через динамически изменяемый буферный пул с масштабируемой упреждающей выборкой.

Ad

Тесты производительности

Все тесты проводились на M1 Max с 32 ГБ унифицированной памяти и последовательным чтением NVMe ~5,1 ГБ/с:

  • Qwen 2.5 14B Q4_K_M (8,4 ГБ): Режим полного резидентства, 21 токен/с (как в llama.cpp)
  • Mixtral 8x7B Q5_K_M (30,9 ГБ): Режим потоковой передачи экспертов, 2,2 токена/с (llama.cpp — нехватка памяти)
  • Llama 3.3 70B Q4_K_M (39,6 ГБ): Режим плотной потоковой передачи FFN, 0,3 токена/с (llama.cpp — нехватка памяти)

Размер буферного пула, глубина упреждающей выборки и объемы памяти вычисляются автоматически на основе профиля вашего оборудования — ручная настройка не требуется.

Установка

Hypura собирается из исходного кода с помощью Cargo. Вам потребуются Rust 1.75+ и CMake.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Агорогентик: устанавливаемый через pip маркетплейс агентов для покупки и продажи возможностей
Инструменты

Агорогентик: устанавливаемый через pip маркетплейс агентов для покупки и продажи возможностей

Agoragentic — это маркетплейс агент-агент, где ИИ-агенты могут находить и использовать возможности других агентов через интеграцию, устанавливаемую через pip. Маркетплейс использует USDC на Base L2 для платежей с комиссией платформы 3% и предлагает бесплатные тестовые кредиты.

OpenClawRadar
Выпущен OpenClaw Optimizer v1.18.0 с синхронизацией OpenClaw v2026.3.7.
Инструменты

Выпущен OpenClaw Optimizer v1.18.0 с синхронизацией OpenClaw v2026.3.7.

Навык OpenClaw Optimizer версии 1.18.0 теперь совместим с OpenClaw v2026.3.7, добавив поддержку новых AI-провайдеров, включая Google Gemini 3.1 Flash-Lite и OpenAI gpt-5.4, а также новых CLI-команд, таких как /session idle и /usage cost.

OpenClawRadar
memv: Открытая система памяти для ИИ-агентов
Инструменты

memv: Открытая система памяти для ИИ-агентов

<strong>memv</strong> — это система памяти с открытым исходным кодом, разработанная для ИИ-агентов, которая хранит только неожиданную информацию из взаимодействий, снижая шум и избыточность.

OpenClawRadar
Плагин ByteRover Memory для OpenClaw: Нативная интеграция с семантической иерархией
Инструменты

Плагин ByteRover Memory для OpenClaw: Нативная интеграция с семантической иерархией

Плагин ByteRover Memory для OpenClaw обеспечивает нативную, структурированную долговременную память через трёхуровневую архитектуру и семантическую иерархию, хранящуюся в файлах Markdown. Он достигает 92,2% точности извлечения и требует OpenClaw v2026.3.22+.

OpenClawRadar