Запуск LLM с 1 триллионом параметров локально на кластере AMD Ryzen AI Max+

Локальный запуск LLM с 1 триллионом параметров на кластере AMD Ryzen AI Max+
Техническая статья AMD подробно описывает, как построить небольшой распределённый кластер для вывода с использованием четырёх систем Framework Desktop с процессорами Ryzen AI Max+ 395 и запустить открытую модель Kimi K2.5 (1 триллион параметров, 375 ГБ) с помощью llama.cpp RPC. Данная конфигурация рассматривает четыре машины как единый логический AI-ускоритель.
Аппаратное и программное обеспечение
- Аппаратное обеспечение: 4x Framework Desktop - AMD Ryzen AI Max+ 395 - 128 ГБ
- AI-фреймворк: AMD ROCm
- Движок вывода: Llama.cpp RPC
- ОС: Ubuntu 24.04.3 LTS
- Модель: Kimi-K2.5 (UD_Q2_K_XL) (375 ГБ)
- Сеть: Ethernet 5 Гбит/с
Техническая настройка: Расширенное выделение видеопамяти
Для каждой системы Ryzen AI Max+ сначала необходимо в BIOS установить размер памяти iGPU на 512 МБ. Максимальная выделенная видеопамять на узел через BIOS составляет 96 ГБ (всего 384 ГБ на четыре узла). Использование параметров ядра Translation Table Manager (TTM) увеличивает этот объём до 120 ГБ на узел (всего 480 ГБ).
Настройте параметры ядра:
sudo nano /etc/default/grub
Найдите строку, начинающуюся с GRUB_CMDLINE_LINUX_DEFAULT=, и добавьте внутри кавычек:
"quiet splash ttm.pages_limit=30720000 amdgpu.gttsize=120000"
Ограничения TTM выражаются в страницах по 4 КБ. Расчёт для 120 ГБ: (120 * 1024 * 1024) / 4.096 = 30720000
После сохранения и выхода выполните:
sudo update-grub sudo reboot
Проверьте конфигурацию:
$ sudo dmesg | grep "amdgpu.*memory" [drm] amdgpu: 512M of VRAM memory ready [drm] amdgpu: 120000M of GTT memory ready.
Вариант настройки 1: Lemonade SDK (рекомендуется)
Скачайте предварительно собранные бинарные файлы по адресу: https://github.com/lemonade-sdk/llamacpp-rocm/releases/latest/
Скачайте архив, соответствующий вашей платформе и целевой GPU: llama-bxxxx-ubuntu-rocm-gfx1151-x64.zip
Распакуйте и подготовьте:
unzip llama-bxxxx-ubuntu-rocm-gfx1151-x64.zip cd llama-bxxxx-ubuntu-rocm-gfx1151-x64 chmod +x llama-cli llama-server rpc-server
Проверьте обнаружение GPU:
$ ./llama-cli --list-devices ggml_cuda_init: found 1 ROCm devices: Device 0: AMD Radeon Graphics, gfx1151 (0x1151), VMM: no, Wave Size: 32 Available devices: ggml_backend_cuda_get_available_uma_memory: final available_memory_kb: 127697544 ROCm0: AMD Radeon Graphics (120000 MiB, 124704 MiB free)
Вариант настройки 2: Ручная сборка из исходного кода
Установите ROCm 7.0.2 на Ubuntu 24.04.3:
wget https://repo.radeon.com/amdgpu-install/7.0.2/ubuntu/noble/amdgpu-install_7.0.2.70002-1_all.deb sudo apt install ./amdgpu-install_7.0.2.70002-1_all.deb sudo apt update sudo apt install python3-setuptools python3-wheel sudo usermod -a -G render,
Статья продолжается дополнительными шагами настройки и деталями конфигурации вывода.
📖 Read the full source: HN LLM Tools
👀 Смотрите также

Шпаргалка по структуре папок Claude Code от пользователя Reddit
Пользователь Reddit создал шпаргалку по структуре папок Claude Code после столкновения с распространёнными ошибками, охватывающую структуру каталога .claude/, события хуков, settings.json, конфигурацию MCP, структуру навыков и пороги управления контекстом.

Пять распространенных проблем с конфигурацией OpenClaw, которые увеличивают расходы на API
В посте на Reddit определены пять проблем конфигурации в настройках OpenClaw, которые приводят к чрезмерному потреблению API-кредитов, включая использование дорогих моделей для рутинных задач, отсутствие лимитов бюджета, открытые шлюзы, неуправляемую память и непроверенные навыки.

Относиться к подагентам OpenClaw как к функциям без состояния, а не как к постоянным членам команды
Разработчик делится своим опытом перехода от восприятия суб-агентов OpenClaw как постоянных членов команды с личностями к их восприятию как вызовов функций без состояния, имеющих специализированные цели.

Чек-лист настройки OpenClaw: шесть важных шагов для новых пользователей
В посте на Reddit описаны шесть важных шагов настройки для пользователей OpenClaw: сменить модель по умолчанию с Opus на Sonnet для снижения затрат, заблокировать хост шлюза на 127.0.0.1 для безопасности, создать SOUL.md для личности агента, избегать установки навыков вначале, не создавать несколько агентов и использовать команду /new для управления контекстом беседы.