FOMOE позволяет запускать вывод модели Qwen3.5 на 397 миллиардов параметров на настольном оборудовании стоимостью $2100.

✍️ OpenClawRadar📅 Опубликовано: 29 марта 2026 г.🔗 Source
FOMOE позволяет запускать вывод модели Qwen3.5 на 397 миллиардов параметров на настольном оборудовании стоимостью $2100.
Ad

Что решает FOMOE

Большие модели Mixture of Experts (MoE) требуют сотни гигабайт для хранения весов, обычно во флеш-памяти типа NVMe. Во время вывода требуется лишь небольшая часть весов, но невозможно заранее предсказать, какие именно. Случайные паттерны доступа делают задержки флеш-памяти слишком высокими для практического вывода на потребительском оборудовании.

Как работает FOMOE

Система делает большинство чтений весов экспертов ненужными благодаря нескольким техникам:

  • Хранит наиболее распространённых экспертов в памяти видеокарты (VRAM) с актуальным кольцевым кэшем экспертов
  • Достигает 60% попаданий в VRAM при тёплом старте, сокращая чтения с NVMe до 28% (12% обслуживается из DRAM)
  • Использует архитектуру пинг-понг на двух видеокартах для совмещения загрузки весов и вычислений
  • Реализует Cache-Aware Routing (CAR) — когда два эксперта имеют схожие оценки, модель выбирает следующий по качеству эксперт, уже находящийся в кэше VRAM или DRAM в пределах допустимого порога
Ad

Результаты производительности

  • Скорость вывода 5-9 токенов/сек для модели Qwen3.5 с 397 млрд параметров
  • Чтения с NVMe сокращены до 7% при включённом CAR
  • Всего 3.5% падения перплексии по измерениям на wikitext
  • Требования к оборудованию: две видеокарты по $500, 32 ГБ ОЗУ, один накопитель NVMe
  • Используется квантование Q4_K_M

Реализация состоит примерно из 15 000 строк кода на C/HIP, созданного при помощи Claude с активным руководством человека.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Code получает проверку моделей TLA+ через MCP-сервер tla-mcp
Инструменты

Claude Code получает проверку моделей TLA+ через MCP-сервер tla-mcp

tla-mcp — это новый MCP-сервер, который позволяет Claude Code вызывать модель-чекер TLA+ tla-rs как первоклассный инструмент: проверять спецификации, выполнять ограниченные проверки с трассировкой контрпримеров и воспроизводить сценарии прямо из чата.

OpenClawRadar
Ctxpact: Прокси-компрессор контекста для локальных LLM
Инструменты

Ctxpact: Прокси-компрессор контекста для локальных LLM

Ctxpact — это совместимый с OpenAI прокси, который сжимает слишком большие входные данные для локальных LLM с окном контекста 16k, используя трёхэтапный конвейер, включающий стратегии DCP, суммаризации и извлечения. Бенчмарки показывают сжатие 110k токенов до 12k с точностью понимания прочитанного 8/8.

OpenClawRadar
mindpm: Бесплатный MCP-сервер для постоянного хранения памяти проекта с Claude
Инструменты

mindpm: Бесплатный MCP-сервер для постоянного хранения памяти проекта с Claude

mindpm — это бесплатный, открытый MCP-сервер, который предоставляет Claude локальную базу данных SQLite для отслеживания задач, решений, заметок и сводок сессий в рамках диалогов. Настройка занимает 30 секунд с помощью команды: claude mcp add mindpm -e MINDPM_DB_PATH=~/.mindpm/memory.db -- npx -y mindpm.

OpenClawRadar
Сервер Nakkas MCP Создает Анимированные SVG из Описаний ИИ
Инструменты

Сервер Nakkas MCP Создает Анимированные SVG из Описаний ИИ

Nakkas — это MCP-сервер, в котором искусственный интеллект создаёт полные анимированные SVG-конфигурации по описаниям, генерируя чистые анимированные SVG с фигурами, градиентами, анимациями и фильтрами. Он поддерживает параметрические кривые, 15 пресетов фильтров, CSS @keyframes и SMIL-анимации, и работает везде, где рендерится SVG.

OpenClawRadar