Utilyze: Монитор GPU с открытым исходным кодом, измеряющий реальную вычислительную пропускную способность, а не только активность ядра

Стандартный показатель использования GPU, применяемый в nvidia-smi, nvtop, Weights & Biases, Amazon CloudWatch, Google Cloud Monitoring и Azure Monitor, вводит в заблуждение. Он сообщает долю времени, в течение которого выполняется любое ядро, поэтому GPU может показывать 100% загрузку, используя всего 1-10% реальной вычислительной мощности. Команды, полагающиеся на этот показатель для планирования мощностей, могут считать системы перегруженными, когда на самом деле они недогружены.
Utilyze
Компания SysTalize выпустила Utilyze (utlz) — инструмент с открытым исходным кодом (Apache 2.0), который измеряет использование GPU иначе. Вместо активности ядер он берет образцы аппаратных счетчиков производительности и сообщает вычислительную и памятьную пропускную способность относительно теоретических пределов оборудования. Также он оценивает достижимый потолок использования для данной рабочей нагрузки.
Установка
curl -fsSL https://systalyze.com/utilyze/install.sh | bash
Utilyze работает в реальном времени параллельно с любой AI-нагрузкой с незначительными накладными расходами. В производственных развертываниях он выявил порядковые различия в запасе производительности в системах, которые стандартные инструменты объявляли полностью загруженными.
Почему это важно
Вычислительные ресурсы AI дефицитны: годовые контракты аренды H100 выросли примерно на 40% с октября 2025 по март 2026, а сроки поставки GPU растягиваются на месяцы. Огромные средства тратятся впустую на ненужное оборудование и энергию. Точное измерение — необходимое условие для оптимизации: каждый процентный пункт восстановленной реальной пропускной способности экономит деньги и ресурсы.
Репозиторий на GitHub: https://github.com/systalyze/utilyze
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Queuelo: Облегченный API для согласования действий LLM-агентов
Queuelo — это простой API-слой, который позволяет агентам LLM приостанавливаться перед необратимыми действиями. Агенты отправляют POST-запросы на действия, вы получаете уведомление для одобрения или отклонения, и агент получает ответ через вебхук.

Qwen 3.5 35B, работающий на 8 ГБ видеопамяти с конфигурацией llama.cpp
Разработчик делится своей конфигурацией llama.cpp для запуска Qwen 3.5 35B (Q4_K_M GGUF) на RTX 4060m с 8 ГБ видеопамяти, достигая 700 токенов/с при обработке промптов и 42 токена/с при генерации, а также обсуждает использование Cline в VSCode с режимами kat-coder-pro и qwen3.5.

Открытый Исходный Генезис Книги: 20 Навыков Кода Клода для Автономного Написания Книг
Book Genesis — это открытая система из 20 специализированных навыков Claude Code, которая принимает идею книги и создаёт готовую к публикации рукопись через 14-фазный автономный конвейер. Она включает «Движок Хаоса» для разрушения шаблонов предсказуемости ИИ и сгенерировала мемуары объёмом 68 000 слов, получившие оценку 9,0/10 по шкале Genesis Score.

Spectral: Захватывайте трафик приложений для создания MCP-серверов для агентов OpenClaw
Spectral — это инструмент с открытым исходным кодом, который перехватывает трафик любого приложения, анализирует его с помощью LLM и генерирует рабочий MCP-сервер, позволяя агентам OpenClaw напрямую обращаться к реальному API приложения вместо использования автоматизации браузера.