Инструментарий Blackwell LLM: конфиги NVFP4, колёса и бенчмарки для TensorRT-LLM на RTX Pro 6000

✍️ OpenClawRadar📅 Опубликовано: 12 мая 2026 г.🔗 Source
Инструментарий Blackwell LLM: конфиги NVFP4, колёса и бенчмарки для TensorRT-LLM на RTX Pro 6000
Ad

Новый репозиторий на GitHub, blackwell-llm-toolkit, содержит конфиги TensorRT-LLM, предварительно собранные колеса и результаты бенчмарков для запуска LLM на GPU Nvidia Blackwell (RTX Pro 6000, 5090, 5080, 5070 Ti). Основное внимание уделяется квантованию NVFP4 и преодолению платформенных ограничений.

Ключевые особенности

  • Конфиги TensorRT-LLM: Включают YAML-файл (configs/trtllm/nemotron-omni-v3-sm120.yaml) с неочевидными флагами запуска, необходимыми для работы Mamba-гибридных моделей на Blackwell.
  • Колеса LMCache: Колесо с PyPI падало на Blackwell из-за отсутствия cubins sm_120. Репозиторий предоставляет пересобранное колесо и скрипт для сборки, протестированные с Optane SSD для выгрузки KV-кэша.
  • Исследовательские документы: Сгенерированные ИИ глубокие обзоры различий в архитектуре Nemotron Omni V3, Qwen 3.5/3.6 и Gemma 4. Примечательно, что Qwen 3.5/3.6 — это не просто переименованный Qwen3-VL; у них совершенно другая архитектура.
  • Инструменты для бенчмарков: rapid_bench.py запускает оценку качества из 41 запроса (интеллект, использование инструментов, калибровка, оркестрация, креативное письмо). bench_harness.py измеряет постоянный декодинг, TTFT, префилл и параллелизм, с режимом --prompt-tokens N для длинного контекста.
Ad

Основные результаты бенчмарков (один RTX Pro 6000 96 ГБ, без TP)

  • Nemotron-3-Nano-Omni V3 (мультимодальная, NVFP4, контекст 8k): 270 ток/с. Самая быстрая протестированная модель, обрабатывает изображения, видео, аудио и текст. Требует TRT-LLM v1.3.0rc13.
  • Nemotron-3-Nano (только текст, NVFP4, контекст 8k): 249 ток/с. Лучший выбор для агентов, использующих инструменты (10/10 по инструментам).
  • DeepSeek-V4-Flash (IQ2_XXS-XL GGUF, контекст 65k): 31 ток/с. Лучший для сложных рассуждений (9/10 интеллект, 10/10 инструменты, 13/13 калибровка).
  • MiniMax-M2.7-REAP-172B (Q3_K_S GGUF, контекст 196k): 117 ток/с. Хорош для длинных бесед.
  • MiniMax-M2.7 W4A16 (с LMCache на Optane SSD, контекст 154k): 20-22 ток/с. Качество длинного контекста W4A16.
  • MiniMax-M2.7 W4A16 (короткий контекст, без LMCache, контекст 64k): 22-25 ток/с. Самые качественные короткие ответы (10/10 интеллект).

Полные результаты с TTFT, скоростью префилла, параллелизмом и оценками качества находятся в bench/results.md.

Для кого это

Для разработчиков и исследователей, выполняющих инференс LLM на GPU Blackwell, которым нужны оптимизированные конфиги TensorRT-LLM, предварительно собранный LMCache для выгрузки длинного контекста или реальные данные бенчмарков для выбора модели.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Автоматизированное управление состоянием сессии для передачи кода Claude
Инструменты

Автоматизированное управление состоянием сессии для передачи кода Claude

Проект на GitHub предоставляет автоматизированные хуки для поддержания файла состояния активной сессии (.claude/session-state.md) на протяжении разговоров с Claude, решая проблему потери контекста при автокомпакте и ухудшения контекста в середине беседы. Система использует четыре bash-скрипта с jq для отслеживания важных событий и редактирования файлов.

OpenClawRadar
Шесть репозиториев GitHub для разработки кода с Claude
Инструменты

Шесть репозиториев GitHub для разработки кода с Claude

Пользователь Reddit протестировал и поделился шестью репозиториями GitHub, предназначенными для улучшения проектов Claude Code, включая инструменты для структурированной разработки, генерации пользовательского интерфейса, управления задачами, памяти, изучения экосистемы и автоматизации рабочих процессов.

OpenClawRadar
Три репозитория для разработки RAG и AI-агентов
Инструменты

Три репозитория для разработки RAG и AI-агентов

В посте на Reddit выделены три репозитория для разработчиков, работающих с RAG и AI-агентами: memvid для памяти агентов, llama_index для RAG-пайплайнов и Continue для ассистентов программирования. Автор отмечает, что чистый RAG лучше всего подходит для извлечения знаний, в то время как системы памяти лучше для агентов, а гибридные подходы часто используются в реальных инструментах.

OpenClawRadar
Клод Код против Кодекса: Реальное тестирование сборки – 36 файлов против 28, бесконечный цикл и разница в стоимости в $0.46
Инструменты

Клод Код против Кодекса: Реальное тестирование сборки – 36 файлов против 28, бесконечный цикл и разница в стоимости в $0.46

Разработчик сравнивает Claude Code и Codex (через Cursor) на двух реальных задачах: бот для триажа PR и веб-интерфейс для ревью кода через WebSocket. Claude создал 36 файлов за 12 минут с нулевыми ошибками TypeScript; Codex сделал рабочий интерфейс, но попал в бесконечный цикл React. Разница в стоимости: ~$0.46.

OpenClawRadar