FOMOE позволяет запускать вывод модели Qwen3.5 на 397 миллиардов параметров на настольном оборудовании стоимостью $2100.

✍️ OpenClawRadar📅 Опубликовано: 29 марта 2026 г.🔗 Source
FOMOE позволяет запускать вывод модели Qwen3.5 на 397 миллиардов параметров на настольном оборудовании стоимостью $2100.
Ad

Что решает FOMOE

Большие модели Mixture of Experts (MoE) требуют сотни гигабайт для хранения весов, обычно во флеш-памяти типа NVMe. Во время вывода требуется лишь небольшая часть весов, но невозможно заранее предсказать, какие именно. Случайные паттерны доступа делают задержки флеш-памяти слишком высокими для практического вывода на потребительском оборудовании.

Как работает FOMOE

Система делает большинство чтений весов экспертов ненужными благодаря нескольким техникам:

  • Хранит наиболее распространённых экспертов в памяти видеокарты (VRAM) с актуальным кольцевым кэшем экспертов
  • Достигает 60% попаданий в VRAM при тёплом старте, сокращая чтения с NVMe до 28% (12% обслуживается из DRAM)
  • Использует архитектуру пинг-понг на двух видеокартах для совмещения загрузки весов и вычислений
  • Реализует Cache-Aware Routing (CAR) — когда два эксперта имеют схожие оценки, модель выбирает следующий по качеству эксперт, уже находящийся в кэше VRAM или DRAM в пределах допустимого порога
Ad

Результаты производительности

  • Скорость вывода 5-9 токенов/сек для модели Qwen3.5 с 397 млрд параметров
  • Чтения с NVMe сокращены до 7% при включённом CAR
  • Всего 3.5% падения перплексии по измерениям на wikitext
  • Требования к оборудованию: две видеокарты по $500, 32 ГБ ОЗУ, один накопитель NVMe
  • Используется квантование Q4_K_M

Реализация состоит примерно из 15 000 строк кода на C/HIP, созданного при помощи Claude с активным руководством человека.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

OpenEvol: Потоковая система автономного самосовершенствования для больших языковых моделей с использованием истории диалога
Инструменты

OpenEvol: Потоковая система автономного самосовершенствования для больших языковых моделей с использованием истории диалога

OpenEvol v0.1.1 — это автономный конвейер, который автоматически анализирует историю диалогов ИИ для создания наборов данных для тонкой настройки без ручной разметки. Изначально работает на CPU и поддерживает пять бэкендов-учителей, включая API, совместимые с OpenAI, и HuggingFace Transformers.

OpenClawRadar
🦀
Инструменты

OpenClaw на Android: миниатюрный частный ИИ-компьютер с размером с большой палец запускает OpenClaw в виртуальной машине

Trustkernel's PlugClaw — это USB-стик размером с большой палец, который запускает Android и OpenClaw в выделенной виртуальной машине, добавляя графический агент для взаимодействия с приложениями Android на любом телефоне или ноутбуке.

OpenClawRadar
Система ACO: мультиагентный ИИ-конвейер от задачи на GitHub до объединённого PR
Инструменты

Система ACO: мультиагентный ИИ-конвейер от задачи на GitHub до объединённого PR

ACO System — это мультиагентный фреймворк с открытым исходным кодом, где шесть специализированных AI-агентов автономно выполняют весь процесс разработки от GitHub Issue до объединенного PR, а детерминированный шлюз Architect отсеивает плохие задачи до того, как они попадут к разработчикам.

OpenClawRadar
Toolport: локальный шлюз для управления MCP-серверами в одном месте для всех приложений
Инструменты

Toolport: локальный шлюз для управления MCP-серверами в одном месте для всех приложений

Toolport — это бесплатное десктопное приложение с открытым исходным кодом и локальный шлюз, который централизует конфигурации MCP-серверов, хранит API-ключи в связке ключей ОС и добавляет уровни безопасности для ИИ-агентов.

OpenClawRadar