V100 32GB에서 MTP를 사용한 Qwen 3.6 27B: llama.cpp 브랜치를 통해 54 t/s

r/LocalLLaMA의 한 사용자가 PCIe 어댑터를 사용한 V100 32GB SXM 모듈에서 Multi-Token Prediction(MTP)으로 Qwen 3.6 27B를 실행한 인상적인 결과를 보고했습니다. 이 설정은 am17an의 llama.cpp MTP 브랜치와 해당 MTP GGUF 양자화 파일을 사용합니다. 주요 사양: Q8_0 KV 캐시(200k 캐시 한도), llama-server를 통해 VS Code Copilot 백엔드로 실행.
성능 수치
- MTP 없음: 29-30 토큰/초
- MTP 사용: 54-55 토큰/초(150W 전력 제한)
- 50k 토큰 컨텍스트 이후: 40-45 t/s로 하락
브랜치: am17an의 MTP 포크. 빌드 및 실행은 간단했습니다 — '한 번에 풀(pull)하고 빌드'했으며 llama-server가 문제없이 실행되었습니다. 이 설정은 도구 호출과 하위 에이전트를 잘 처리했으며, VRAM 제한(32GB)에도 불구하고 '매우 통찰력 있는 코드 리뷰와 리팩토링'을 제공했습니다.
이는 V100과 같은 구형 데이터센터 하드웨어에서 LLM을 실행하는 개발자에게 특히 관련이 있습니다. MTP는 이 모델의 처리량을 효과적으로 두 배로 늘려 코딩 어시스턴트 워크로드에 실질적인 이점을 보여줍니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

MCP 마켓플레이스, 보안 검증된 1,900개 이상의 MCP 도구 플러그인 디렉토리 출시
MCP 마켓플레이스(mcp-marketplace.io)는 1,900개 이상의 MCP 서버에 대한 보안 중심 디렉토리를 제공하며, 다중 계층 보안 분석, 위험 점수 평가, Claude Desktop, Cursor, ChatGPT, VS Code를 위한 원클릭 설치 기능을 갖추고 있습니다.

Stackdome: 쿠버네티스에서 사용할 수 있는 오픈소스 자체 호스팅 레일웨이 대안
Stackdome은 CNCF 도구를 Kubernetes에서 Railway와 유사한 개발자 경험으로 패키징한 오픈 소스 자체 호스팅 플랫폼입니다. 캔버스 UI, 멀티 클러스터 지원, 관리형 Postgres, 소스-이미지 빌드를 제공합니다.

Flash-MoE: 순수 C/Metal로 MacBook Pro에서 397B 파라미터 Qwen 모델 실행하기
Flash-MoE는 순수 C/Metal 추론 엔진으로, 3970억 개의 파라미터를 가진 Mixture-of-Experts 모델인 Qwen3.5-397B-A17B를 48GB RAM의 MacBook Pro에서 초당 4.4+ 토큰의 속도로 실행합니다. 209GB 모델은 Python이나 프레임워크 없이 커스텀 Metal 컴퓨트 셰이더를 통해 SSD에서 스트리밍됩니다.

클로드 코드 규칙 시행을 위한 계층적 방어 프레임워크
IT 운영 전문가가 CLAUDE.md 프롬프트와 차단 훅이 모두 우회될 수 있다는 사실을 발견한 후 Claude Code 규칙을 강제하기 위해 8계층 방어 프레임워크를 구축했습니다. 이 접근 방식은 사고 조사에서 사용되는 스위스 치즈 모델을 차용하여 우회 방법을 방지합니다.