V100 кластер против MoE: сборка 12x SXM2 32GB с оркестрацией Claude Code

✍️ OpenClawRadar📅 Опубликовано: 8 июня 2026 г.🔗 Source
V100 кластер против MoE: сборка 12x SXM2 32GB с оркестрацией Claude Code
Ad

Юрист, использующий кластер из 12 V100 32GB SXM2 на Threadripper Pro, сообщает, что на GPU Volta (вычислительная способность 7.0) только MoE-модели обеспечивают приемлемую скорость декодирования. Плотные модели — ловушка: даже плотная модель 27-32B выдает 20-28 токенов/с, что ниже порога в 40 токенов/с. Для сравнения, Qwen3.5-122B-A10B (122B всего, 10B активных) достигает ~50 токенов/с на одной плате с 4 GPU через NVLink, а Gemma-4-26B-A4B — ~113 токенов/с. Все бенчмарки используют Q8 GGUF с Q4 KV cache и flash-attention.

Конфигурация оборудования

Финальная сборка: двенадцать V100-SXM2 32GB на Threadripper Pro. Две платы NVLink (по 4 GPU каждая) и две смешанные пары. Плата A занимает GPU {4,5,8,9}, плата B — {6,7,10,11}. Пара NVLink находится на {0,1}, смешанная пара — на {2,3}, где одна карта имеет 16GB. Переходы между платами идут через PCIe/NUMA, а не NVLink, что убивает пропускную способность. Все модели размещаются в пределах одной платы.

Был добавлен второй компьютер: EPYC 7302P, 512GB RAM, 4x RTX 3090 + 2x V100-PCIe, работающий под Ollama для более мелких моделей.

Смена стека: vLLM → llama.cpp

Оператор отказался от vLLM, потому что нужные ему модели — это MoE GGUF, а vLLM на Volta для них тупиковый — ядра FP8/AWQ/Marlin требуют SM75+, а ядра GPTQ сломаны на compute 7.0. Он перешел на основную ветку llama.cpp, в которой недавно исправили баг с парсером чата Gemma, искажавший длинные промпты.

Ad

Оркестрация с Claude Code

Система не является единой моделью, отвечающей в чате — оркестратор (управляемый Claude Code) распределяет юридические задачи между несколькими локальными моделями, каждая закреплена за своей платой, чтобы избежать конфликтов GPU. Для самой тяжелой задачи (полная аффидавит или ходатайство, от приема до документа) задействованы все 16 GPU на обоих компьютерах:

  • Черновая работа: Qwen3.6-35B-A3B на плате A
  • Тяжелые рассуждения и ответственная работа: Qwen3.5-122B-A10B на плате B
  • Модель-шлюз: маленькая модель на паре {0,1} проверяет, есть ли основания
  • Проверяющий-оппонент: атакует черновик на паре {2,3}
  • Финансы/извлечение: Gemma-4-26B на 3090 через Ollama

Это последовательный конвейер — модели не долбят одновременно, но все 16 остаются в памяти GPU.

Практические уроки

  • Галлюцинации: Локальные модели уверенно фабрикуют цитаты и даты. Верификатор проверяет каждую цитату, дату и номер Bates на соответствие исходным материалам и блокирует необоснованный контент. Сверху работает проверяющий-оппонент.
  • Отравление конвейера: Сборщик пакетов доказательств подхватывал собственные предыдущие результаты как доказательства клиента, из-за чего модели «опирались» на свой же ранее написанный бред — один черновик ссылался на RTX 3060 как на номер Bates. Проблема решена очисткой истории ввода сборщика.

Для легких задач требуется гораздо меньше ресурсов — объединение и добавление номеров Bates к экспонатам выполняется чисто на CPU (PyMuPDF + Tesseract), а простые сводки задействуют только Gemma и маршрутизатор.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Ошибки часовых поясов в системах бронирования, созданных ИИ: пример из практики
Кейсы

Ошибки часовых поясов в системах бронирования, созданных ИИ: пример из практики

Сгенерированный Клодом прототип бронирования хранил время в UTC, отображал в IST — сломался для преподавателей из Дубая и США. 11 ошибочных бронирований подорвали доверие. Исправлено с помощью luxon.

OpenClawRadar
OpenClaw интегрируется с API Kroger для автоматизированной покупки продуктов через AI-агентов.
Кейсы

OpenClaw интегрируется с API Kroger для автоматизированной покупки продуктов через AI-агентов.

Разработчик использовал OpenClaw с API Kroger для автоматического добавления ингредиентов рецепта в корзину покупок, задействовав Qwen3.5 для генерации рецептов и Gemini 3.1 Pro для настройки. Интеграция потребовала 6 часов работы и 359 тысяч токенов для создания одной корзины.

OpenClawRadar
Разработчик создает полноценный SaaS-продукт с Claude Cowork: Приложение с табло счёта MLB, включающее аутентификацию, платежи и виджет для встраивания.
Кейсы

Разработчик создает полноценный SaaS-продукт с Claude Cowork: Приложение с табло счёта MLB, включающее аутентификацию, платежи и виджет для встраивания.

Разработчик создал ScorePorch — персонализированное приложение для отображения результатов MLB с фронтендом на React, API на Express/Vercel, аутентификацией через Supabase, платежами Stripe и встраиваемым виджетом, полностью используя сессии Claude Cowork. Проект включает живые результаты, тематические дашборды команд и 23-килобайтный виджет без зависимостей.

OpenClawRadar
ИИ-агенты для написания кода идут по пути наименьшего сопротивления: разработчики документируют случаи, когда Claude и ChatGPT выбирают самый простой путь
Кейсы

ИИ-агенты для написания кода идут по пути наименьшего сопротивления: разработчики документируют случаи, когда Claude и ChatGPT выбирают самый простой путь

Разработчик, создающий устройство сенсорного слияния, обнаружил, что и Claude, и ChatGPT объединили входные данные с двух микрофонов в моно вместо реализации формирования луча для пространственного восприятия. В отдельной задаче обучения модели ИИ изначально объединил объекты разных размеров без группировки по возрастным когортам.

OpenClawRadar