Blackwell LLM 툴킷: RTX Pro 6000에서 TensorRT-LLM을 위한 NVFP4 설정, 휠, 및 벤치마크

✍️ OpenClawRadar📅 게시일: May 12, 2026🔗 Source
Blackwell LLM 툴킷: RTX Pro 6000에서 TensorRT-LLM을 위한 NVFP4 설정, 휠, 및 벤치마크
Ad

GitHub의 새로운 저장소인 blackwell-llm-toolkit은 Nvidia Blackwell GPU(RTX Pro 6000, 5090, 5080, 5070 Ti)에서 LLM을 실행하기 위한 TensorRT-LLM 설정, 사전 빌드된 휠, 벤치마크 결과를 모아 놓았습니다. 주요 초점은 NVFP4 양자화와 플랫폼별 장애물 극복에 있습니다.

주요 기능

  • TensorRT-LLM 설정: Blackwell에서 Mamba-하이브리드 모델을 실행하는 데 필요한 드문 플래그가 포함된 YAML 파일(configs/trtllm/nemotron-omni-v3-sm120.yaml)을 제공합니다.
  • LMCache 휠: PyPI 휠은 Blackwell에서 sm_120 cubin이 없어 충돌했습니다. 저장소는 재빌드된 휠과 빌드 스크립트를 제공하며, Optane SSD로 KV 캐시 오프로딩을 테스트했습니다.
  • 연구 문서: AI가 생성한 Nemotron Omni V3, Qwen 3.5/3.6, Gemma 4의 아키텍처 차이에 대한 심층 분석입니다. 특히 Qwen 3.5/3.6은 단순히 이름이 바뀐 Qwen3-VL이 아니라 완전히 다른 아키텍처를 가지고 있습니다.
  • 벤치마크 도구: rapid_bench.py는 41개 프롬프트 품질 평가(지능, 도구 사용, 보정, 오케스트레이션, 창작)를 실행합니다. bench_harness.py는 지속적인 디코딩, TTFT, 프리필, 동시성을 측정하며, 긴 컨텍스트를 위한 --prompt-tokens N 모드를 제공합니다.
Ad

벤치마크 하이라이트 (단일 RTX Pro 6000 96GB, TP 없음)

  • Nemotron-3-Nano-Omni V3 (멀티모달, NVFP4, 8k 컨텍스트): 270 tok/s. 가장 빠른 테스트 모델로 이미지/비디오/오디오+텍스트를 처리합니다. TRT-LLM v1.3.0rc13이 필요합니다.
  • Nemotron-3-Nano (텍스트 전용, NVFP4, 8k 컨텍스트): 249 tok/s. 도구 호출 에이전트에 최적(도구 10/10).
  • DeepSeek-V4-Flash (IQ2_XXS-XL GGUF, 65k 컨텍스트): 31 tok/s. 복잡한 추론에 최적(지능 9/10, 도구 10/10, 보정 13/13).
  • MiniMax-M2.7-REAP-172B (Q3_K_S GGUF, 196k 컨텍스트): 117 tok/s. 긴 대화에 적합.
  • MiniMax-M2.7 W4A16 (LMCache on Optane SSD, 154k 컨텍스트): 20-22 tok/s. 긴 컨텍스트 W4A16 품질.
  • MiniMax-M2.7 W4A16 (짧은 컨텍스트, LMCache 없음, 64k 컨텍스트): 22-25 tok/s. 최고 품질의 짧은 답변(지능 10/10).

TTFT, 프리필 속도, 동시성, 평가 점수를 포함한 전체 결과는 bench/results.md에 있습니다.

대상 사용자

Blackwell GPU에서 LLM 추론을 실행하는 개발자와 연구자로서 최적화된 TensorRT-LLM 설정, 긴 컨텍스트 오프로딩을 위한 사전 빌드된 LMCache, 또는 모델 선택을 위한 실제 벤치마크 데이터가 필요한 분들을 위한 것입니다.

📖 원문 보기: r/LocalLLaMA

Ad

👀 See Also

bad-ass-mcp: 접근성 API를 통한 네이티브 데스크톱 GUI 제어를 위한 무료 오픈소스 MCP
Tools

bad-ass-mcp: 접근성 API를 통한 네이티브 데스크톱 GUI 제어를 위한 무료 오픈소스 MCP

bad-ass-mcp는 오픈 소스 MCP 서버로, Claude 및 다른 AI 에이전트가 기본 접근성 계층을 사용하여 macOS, Windows, Linux 데스크톱을 제어할 수 있게 합니다. 스크린샷이나 look-move-look 루프가 필요 없습니다. Computer Use, Operator 또는 UiPath에 대한 무료 대안입니다.

OpenClawRadar
개발자가 클로드 왓츠앱 연동 MCP 서버 구축, 어려움 공유
Tools

개발자가 클로드 왓츠앱 연동 MCP 서버 구축, 어려움 공유

한 개발자가 Claude가 실제 WhatsApp 대화에 접근할 수 있도록 MCP 서버를 구축했는데, 대화 컨텍스트 관리가 예상보다 까다로워 대화를 추적하기 위한 데이터베이스가 필요하다는 사실을 발견했습니다.

OpenClawRadar
SkyClaw, AI 에이전트를 위한 암호화된 채팅 기반 API 키 설정 기능 추가
Tools

SkyClaw, AI 에이전트를 위한 암호화된 채팅 기반 API 키 설정 기능 추가

SkyClaw는 채팅을 통해 AES-256-GCM 암호화된 키 수신을 구현하며, 시스템 계층에서 키 명령을 가로채어 LLM이 API 키를 전혀 볼 수 없도록 하고, 일회용 키 암호화를 사용하여 메시징 플랫폼이 암호문만 보게 합니다.

OpenClawRadar
🦀
Tools

GitHub의 프로젝트 하이드라퓨전: 프런티어급 AI 코딩을 위한 멀티모델 오케스트레이션

GitHub Copilot의 HydraFusion 연구 프리뷰는 작업별로 여러 모델을 오케스트레이션하여 단일, 캐스케이드 또는 비평 워크플로우 중에서 선택합니다. 벤치마크에 따르면 Claude Opus 5 대비 품질이 4.9포인트 향상되고 비용이 67% 절감됩니다.

OpenClawRadar