RTX 5000 PRO 48GB, Qwen3.6-27B용 4400 tok/s 정밀 캐싱 제공

한 개발자가 RTX 5000 Pro 48GB(세금 포함 $4300)를 Mac Studio와 비교하여 모험을 감행했고, 그 결과는 도약을 정당화했습니다: Qwen3.6-27B-FP8 및 전체 정밀도 BF16 KV 캐시를 사용하여 프롬프트 처리(PP)에서 최대 4400 토큰/초, 텍스트 생성(TG)에서 50–80 tok/s를 달성했습니다.
하드웨어 및 비용 분석
- GPU 비용: $4300 (세금 포함)
- 총 조립 비용: $5600 (64GB RAM 포함)
- 컨텍스트 제한: 전체 정밀도(BF16 KV 캐시)에서 200K 토큰
성능 벤치마크
- 프롬프트 처리: 4400 tok/s
- 텍스트 생성: 매우 큰 프롬프트의 경우 50–60 tok/s, 작은 프롬프트의 경우 최대 80 tok/s
- 모델: 전체 정밀도 캐시를 사용한 Qwen3.6-27B-FP8
- 전력 소모: 듀얼 RTX 5090 설정의 약 절반
주요 관찰 사항
사용자는 사전 경험 없이 PC를 조립했으며, Claude Code에 의존했습니다(주간 Claude Code Max 한도의 50%를 vLLM/Linux 설정에 소모). BF16 캐시를 사용한 Qwen3.6-27B-FP8의 정확한 vLLM 설정을 설명한 Reddit 게시물이 주요 참고 자료였습니다. 작성자는 두 개의 RTX 5090이 성능은 더 좋지만 비용, 소음 및 전력 소모가 훨씬 더 크다고 언급합니다.
📖 전체 출처: r/LocalLLaMA
👀 See Also

세계 최초 AI 에이전트 전용 GitHub 독점 출시: 100명 한정 베타 테스트
AI 코딩 에이전트를 위한 혁신적인 GitHub 독점 기능이 개발되었으며, 100명의 사용자로 제한된 베타 버전이 공개되었습니다. 이 도구가 AI 협업을 어떻게 혁신할지 알아보세요.

Claude Code v2.1.191: /rewind, CPU 수정, MCP 신뢰성 개선
Claude Code v2.1.191이 추가한 /rewind로 대화 내역을 복원하고, 스트리밍 CPU 사용량을 37% 줄이며, 에이전트 재생 문제를 수정하고, MCP 재시도 및 오류 처리를 개선합니다.

클로드 오퍼스 4.6, CLAUDE.md 파일 참조 기능 추가
사용자들은 Claude Opus 4.6이 더 이상 CLAUDE.md에 참조된 파일을 자동으로 로드하지 않아 각 파일마다 수동으로 개입해야 한다고 보고합니다.

클로드 코드 2.1.63은 번들링된 슬래시 명령어, HTTP 훅, 메모리 누수 수정 사항을 추가합니다.
Anthropic이 Claude Code 2.1.63을 출시했습니다. 이번 업데이트에는 새로운 /simplify 및 /batch 슬래시 명령어, URL에 JSON을 POST하는 HTTP 훅, 장기 실행 세션에서의 여러 메모리 누수 수정 등 26가지 CLI 변경 사항이 포함되었습니다.