Blackwell LLM 툴킷: RTX Pro 6000에서 TensorRT-LLM을 위한 NVFP4 설정, 휠, 및 벤치마크

GitHub의 새로운 저장소인 blackwell-llm-toolkit은 Nvidia Blackwell GPU(RTX Pro 6000, 5090, 5080, 5070 Ti)에서 LLM을 실행하기 위한 TensorRT-LLM 설정, 사전 빌드된 휠, 벤치마크 결과를 모아 놓았습니다. 주요 초점은 NVFP4 양자화와 플랫폼별 장애물 극복에 있습니다.
주요 기능
- TensorRT-LLM 설정: Blackwell에서 Mamba-하이브리드 모델을 실행하는 데 필요한 드문 플래그가 포함된 YAML 파일(
configs/trtllm/nemotron-omni-v3-sm120.yaml)을 제공합니다. - LMCache 휠: PyPI 휠은 Blackwell에서 sm_120 cubin이 없어 충돌했습니다. 저장소는 재빌드된 휠과 빌드 스크립트를 제공하며, Optane SSD로 KV 캐시 오프로딩을 테스트했습니다.
- 연구 문서: AI가 생성한 Nemotron Omni V3, Qwen 3.5/3.6, Gemma 4의 아키텍처 차이에 대한 심층 분석입니다. 특히 Qwen 3.5/3.6은 단순히 이름이 바뀐 Qwen3-VL이 아니라 완전히 다른 아키텍처를 가지고 있습니다.
- 벤치마크 도구:
rapid_bench.py는 41개 프롬프트 품질 평가(지능, 도구 사용, 보정, 오케스트레이션, 창작)를 실행합니다.bench_harness.py는 지속적인 디코딩, TTFT, 프리필, 동시성을 측정하며, 긴 컨텍스트를 위한--prompt-tokens N모드를 제공합니다.
벤치마크 하이라이트 (단일 RTX Pro 6000 96GB, TP 없음)
- Nemotron-3-Nano-Omni V3 (멀티모달, NVFP4, 8k 컨텍스트): 270 tok/s. 가장 빠른 테스트 모델로 이미지/비디오/오디오+텍스트를 처리합니다. TRT-LLM v1.3.0rc13이 필요합니다.
- Nemotron-3-Nano (텍스트 전용, NVFP4, 8k 컨텍스트): 249 tok/s. 도구 호출 에이전트에 최적(도구 10/10).
- DeepSeek-V4-Flash (IQ2_XXS-XL GGUF, 65k 컨텍스트): 31 tok/s. 복잡한 추론에 최적(지능 9/10, 도구 10/10, 보정 13/13).
- MiniMax-M2.7-REAP-172B (Q3_K_S GGUF, 196k 컨텍스트): 117 tok/s. 긴 대화에 적합.
- MiniMax-M2.7 W4A16 (LMCache on Optane SSD, 154k 컨텍스트): 20-22 tok/s. 긴 컨텍스트 W4A16 품질.
- MiniMax-M2.7 W4A16 (짧은 컨텍스트, LMCache 없음, 64k 컨텍스트): 22-25 tok/s. 최고 품질의 짧은 답변(지능 10/10).
TTFT, 프리필 속도, 동시성, 평가 점수를 포함한 전체 결과는 bench/results.md에 있습니다.
대상 사용자
Blackwell GPU에서 LLM 추론을 실행하는 개발자와 연구자로서 최적화된 TensorRT-LLM 설정, 긴 컨텍스트 오프로딩을 위한 사전 빌드된 LMCache, 또는 모델 선택을 위한 실제 벤치마크 데이터가 필요한 분들을 위한 것입니다.
📖 원문 보기: r/LocalLLaMA
👀 See Also

bad-ass-mcp: 접근성 API를 통한 네이티브 데스크톱 GUI 제어를 위한 무료 오픈소스 MCP
bad-ass-mcp는 오픈 소스 MCP 서버로, Claude 및 다른 AI 에이전트가 기본 접근성 계층을 사용하여 macOS, Windows, Linux 데스크톱을 제어할 수 있게 합니다. 스크린샷이나 look-move-look 루프가 필요 없습니다. Computer Use, Operator 또는 UiPath에 대한 무료 대안입니다.

개발자가 클로드 왓츠앱 연동 MCP 서버 구축, 어려움 공유
한 개발자가 Claude가 실제 WhatsApp 대화에 접근할 수 있도록 MCP 서버를 구축했는데, 대화 컨텍스트 관리가 예상보다 까다로워 대화를 추적하기 위한 데이터베이스가 필요하다는 사실을 발견했습니다.

SkyClaw, AI 에이전트를 위한 암호화된 채팅 기반 API 키 설정 기능 추가
SkyClaw는 채팅을 통해 AES-256-GCM 암호화된 키 수신을 구현하며, 시스템 계층에서 키 명령을 가로채어 LLM이 API 키를 전혀 볼 수 없도록 하고, 일회용 키 암호화를 사용하여 메시징 플랫폼이 암호문만 보게 합니다.
GitHub의 프로젝트 하이드라퓨전: 프런티어급 AI 코딩을 위한 멀티모델 오케스트레이션
GitHub Copilot의 HydraFusion 연구 프리뷰는 작업별로 여러 모델을 오케스트레이션하여 단일, 캐스케이드 또는 비평 워크플로우 중에서 선택합니다. 벤치마크에 따르면 Claude Opus 5 대비 품질이 4.9포인트 향상되고 비용이 67% 절감됩니다.