Blackwell LLM 툴킷: RTX Pro 6000에서 TensorRT-LLM을 위한 NVFP4 설정, 휠, 및 벤치마크

GitHub의 새로운 저장소인 blackwell-llm-toolkit은 Nvidia Blackwell GPU(RTX Pro 6000, 5090, 5080, 5070 Ti)에서 LLM을 실행하기 위한 TensorRT-LLM 설정, 사전 빌드된 휠, 벤치마크 결과를 모아 놓았습니다. 주요 초점은 NVFP4 양자화와 플랫폼별 장애물 극복에 있습니다.
주요 기능
- TensorRT-LLM 설정: Blackwell에서 Mamba-하이브리드 모델을 실행하는 데 필요한 드문 플래그가 포함된 YAML 파일(
configs/trtllm/nemotron-omni-v3-sm120.yaml)을 제공합니다. - LMCache 휠: PyPI 휠은 Blackwell에서 sm_120 cubin이 없어 충돌했습니다. 저장소는 재빌드된 휠과 빌드 스크립트를 제공하며, Optane SSD로 KV 캐시 오프로딩을 테스트했습니다.
- 연구 문서: AI가 생성한 Nemotron Omni V3, Qwen 3.5/3.6, Gemma 4의 아키텍처 차이에 대한 심층 분석입니다. 특히 Qwen 3.5/3.6은 단순히 이름이 바뀐 Qwen3-VL이 아니라 완전히 다른 아키텍처를 가지고 있습니다.
- 벤치마크 도구:
rapid_bench.py는 41개 프롬프트 품질 평가(지능, 도구 사용, 보정, 오케스트레이션, 창작)를 실행합니다.bench_harness.py는 지속적인 디코딩, TTFT, 프리필, 동시성을 측정하며, 긴 컨텍스트를 위한--prompt-tokens N모드를 제공합니다.
벤치마크 하이라이트 (단일 RTX Pro 6000 96GB, TP 없음)
- Nemotron-3-Nano-Omni V3 (멀티모달, NVFP4, 8k 컨텍스트): 270 tok/s. 가장 빠른 테스트 모델로 이미지/비디오/오디오+텍스트를 처리합니다. TRT-LLM v1.3.0rc13이 필요합니다.
- Nemotron-3-Nano (텍스트 전용, NVFP4, 8k 컨텍스트): 249 tok/s. 도구 호출 에이전트에 최적(도구 10/10).
- DeepSeek-V4-Flash (IQ2_XXS-XL GGUF, 65k 컨텍스트): 31 tok/s. 복잡한 추론에 최적(지능 9/10, 도구 10/10, 보정 13/13).
- MiniMax-M2.7-REAP-172B (Q3_K_S GGUF, 196k 컨텍스트): 117 tok/s. 긴 대화에 적합.
- MiniMax-M2.7 W4A16 (LMCache on Optane SSD, 154k 컨텍스트): 20-22 tok/s. 긴 컨텍스트 W4A16 품질.
- MiniMax-M2.7 W4A16 (짧은 컨텍스트, LMCache 없음, 64k 컨텍스트): 22-25 tok/s. 최고 품질의 짧은 답변(지능 10/10).
TTFT, 프리필 속도, 동시성, 평가 점수를 포함한 전체 결과는 bench/results.md에 있습니다.
대상 사용자
Blackwell GPU에서 LLM 추론을 실행하는 개발자와 연구자로서 최적화된 TensorRT-LLM 설정, 긴 컨텍스트 오프로딩을 위한 사전 빌드된 LMCache, 또는 모델 선택을 위한 실제 벤치마크 데이터가 필요한 분들을 위한 것입니다.
📖 원문 보기: r/LocalLLaMA
👀 See Also

던전 앤 드래곤 캠페인을 위한 마크다운 상태 추적 기능을 갖춘 Claude 코드 플러그인
클로드 코드 플러그인은 캠페인 상태를 추적하기 위해 마크다운 파일을 사용하며, 클로드가 솔로 D&D 세션을 위해 던전 마스터 역할을 할 수 있게 합니다. 이 시스템은 무료 오픈소스로, 플러그인 설치 후 /claude-dnd:new-campaign 명령어를 실행하여 시작할 수 있습니다.

인터랙티브 웹사이트가 Claude 코드 프로젝트 구조를 시뮬레이션합니다
개발자가 exploreclaudecode.com을 구축했으며, 이는 기능적인 파일 트리, 구성 가능한 파일 및 터미널 패널을 갖춘 Claude Code 프로젝트의 브라우저 기반 시뮬레이션입니다. 이 사이트는 .claude/ 디렉토리, 설정 파일, 스킬, 에이전트, 훅 및 MCP 구성이 함께 작동하는 방식을 설명합니다.

클로워처, 200명 사용자 달성 및 오픈클로 API로 총 28,000달러 이상 절감 보고
실시간으로 OpenClaw API 비용을 추적하는 도구인 ClawWatcher가 200명의 사용자를 달성했습니다. 제작자에 따르면, 사용자들은 총 28,000달러 이상의 API 비용을 절약했으며, 평균 비용 감소율은 45%입니다.

오픈클로 개발자, 900명 사용자 시험 후 '킬러' 사용 사례 모색 중
OpenClaw의 창시자는 사용자들이 텔레그램 인터페이스, 캘린더 통합, 자동화 워크플로우 같은 기능들을 시도하지만, 대부분이 도구를 장기적으로 사용하지 않는다고 보고합니다. 도전 과제는 실험적인 것이 아닌 필수적인 일상 사용 워크플로우를 찾는 것입니다.