RTX 5000 PRO 48GB, Qwen3.6-27B용 4400 tok/s 정밀 캐싱 제공

한 개발자가 RTX 5000 Pro 48GB(세금 포함 $4300)를 Mac Studio와 비교하여 모험을 감행했고, 그 결과는 도약을 정당화했습니다: Qwen3.6-27B-FP8 및 전체 정밀도 BF16 KV 캐시를 사용하여 프롬프트 처리(PP)에서 최대 4400 토큰/초, 텍스트 생성(TG)에서 50–80 tok/s를 달성했습니다.
하드웨어 및 비용 분석
- GPU 비용: $4300 (세금 포함)
- 총 조립 비용: $5600 (64GB RAM 포함)
- 컨텍스트 제한: 전체 정밀도(BF16 KV 캐시)에서 200K 토큰
성능 벤치마크
- 프롬프트 처리: 4400 tok/s
- 텍스트 생성: 매우 큰 프롬프트의 경우 50–60 tok/s, 작은 프롬프트의 경우 최대 80 tok/s
- 모델: 전체 정밀도 캐시를 사용한 Qwen3.6-27B-FP8
- 전력 소모: 듀얼 RTX 5090 설정의 약 절반
주요 관찰 사항
사용자는 사전 경험 없이 PC를 조립했으며, Claude Code에 의존했습니다(주간 Claude Code Max 한도의 50%를 vLLM/Linux 설정에 소모). BF16 캐시를 사용한 Qwen3.6-27B-FP8의 정확한 vLLM 설정을 설명한 Reddit 게시물이 주요 참고 자료였습니다. 작성자는 두 개의 RTX 5090이 성능은 더 좋지만 비용, 소음 및 전력 소모가 훨씬 더 크다고 언급합니다.
📖 전체 출처: r/LocalLLaMA
👀 See Also

OpenClaw 클라이언트, 비용 추적 및 에이전트별 지출 한도 추가
새 릴리스에서는 에이전트별 지출 상한, 원형 진행 표시줄이 있는 실시간 사용량 UI, 하위 에이전트 관리, 스킬 토글, 에이전트별 모델 선택 기능이 추가되었습니다.

클로드 코드 v2.1.149: 사용량 분석, 권한 수정 및 키보드 내비게이션
Claude Code v2.1.149는 카테고리별 사용량 분석, 키보드 스크롤 가능한 diff 뷰, GFM 작업 목록 체크박스를 추가하고 PowerShell 권한 우회 및 샌드박스 문제를 수정했습니다.

마이크론의 2000억 달러 투자, AI 메모리 제약 해소 목표
마이크론, AI 메모리 병목 현상 해결에 2000억 달러 투자, AI 처리 능력 향상 목표

개발자가 보고한 Claude CLI 지시 사항 이탈 문제
한 개발자가 Claude CLI가 .claude 폴더 파일에 저장된 프로젝트 지시사항을 지속적으로 무시한다고 보고합니다. 특히 자동 압축 작업 이후에 이 문제가 발생합니다. 이 도구는 명시적인 지시에도 불구하고 금지된 백그라운드 프로세스를 실행하고 작업/세션 데이터를 삭제합니다.