FOMOE позволяет запускать вывод модели Qwen3.5 на 397 миллиардов параметров на настольном оборудовании стоимостью $2100.

Что решает FOMOE
Большие модели Mixture of Experts (MoE) требуют сотни гигабайт для хранения весов, обычно во флеш-памяти типа NVMe. Во время вывода требуется лишь небольшая часть весов, но невозможно заранее предсказать, какие именно. Случайные паттерны доступа делают задержки флеш-памяти слишком высокими для практического вывода на потребительском оборудовании.
Как работает FOMOE
Система делает большинство чтений весов экспертов ненужными благодаря нескольким техникам:
- Хранит наиболее распространённых экспертов в памяти видеокарты (VRAM) с актуальным кольцевым кэшем экспертов
- Достигает 60% попаданий в VRAM при тёплом старте, сокращая чтения с NVMe до 28% (12% обслуживается из DRAM)
- Использует архитектуру пинг-понг на двух видеокартах для совмещения загрузки весов и вычислений
- Реализует Cache-Aware Routing (CAR) — когда два эксперта имеют схожие оценки, модель выбирает следующий по качеству эксперт, уже находящийся в кэше VRAM или DRAM в пределах допустимого порога
Результаты производительности
- Скорость вывода 5-9 токенов/сек для модели Qwen3.5 с 397 млрд параметров
- Чтения с NVMe сокращены до 7% при включённом CAR
- Всего 3.5% падения перплексии по измерениям на wikitext
- Требования к оборудованию: две видеокарты по $500, 32 ГБ ОЗУ, один накопитель NVMe
- Используется квантование Q4_K_M
Реализация состоит примерно из 15 000 строк кода на C/HIP, созданного при помощи Claude с активным руководством человека.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

OpenEvol: Потоковая система автономного самосовершенствования для больших языковых моделей с использованием истории диалога
OpenEvol v0.1.1 — это автономный конвейер, который автоматически анализирует историю диалогов ИИ для создания наборов данных для тонкой настройки без ручной разметки. Изначально работает на CPU и поддерживает пять бэкендов-учителей, включая API, совместимые с OpenAI, и HuggingFace Transformers.
OpenClaw на Android: миниатюрный частный ИИ-компьютер с размером с большой палец запускает OpenClaw в виртуальной машине
Trustkernel's PlugClaw — это USB-стик размером с большой палец, который запускает Android и OpenClaw в выделенной виртуальной машине, добавляя графический агент для взаимодействия с приложениями Android на любом телефоне или ноутбуке.

Система ACO: мультиагентный ИИ-конвейер от задачи на GitHub до объединённого PR
ACO System — это мультиагентный фреймворк с открытым исходным кодом, где шесть специализированных AI-агентов автономно выполняют весь процесс разработки от GitHub Issue до объединенного PR, а детерминированный шлюз Architect отсеивает плохие задачи до того, как они попадут к разработчикам.

Toolport: локальный шлюз для управления MCP-серверами в одном месте для всех приложений
Toolport — это бесплатное десктопное приложение с открытым исходным кодом и локальный шлюз, который централизует конфигурации MCP-серверов, хранит API-ключи в связке ключей ОС и добавляет уровни безопасности для ИИ-агентов.