V100 32GB에서 MTP를 사용한 Qwen 3.6 27B: llama.cpp 브랜치를 통해 54 t/s

r/LocalLLaMA의 한 사용자가 PCIe 어댑터를 사용한 V100 32GB SXM 모듈에서 Multi-Token Prediction(MTP)으로 Qwen 3.6 27B를 실행한 인상적인 결과를 보고했습니다. 이 설정은 am17an의 llama.cpp MTP 브랜치와 해당 MTP GGUF 양자화 파일을 사용합니다. 주요 사양: Q8_0 KV 캐시(200k 캐시 한도), llama-server를 통해 VS Code Copilot 백엔드로 실행.
성능 수치
- MTP 없음: 29-30 토큰/초
- MTP 사용: 54-55 토큰/초(150W 전력 제한)
- 50k 토큰 컨텍스트 이후: 40-45 t/s로 하락
브랜치: am17an의 MTP 포크. 빌드 및 실행은 간단했습니다 — '한 번에 풀(pull)하고 빌드'했으며 llama-server가 문제없이 실행되었습니다. 이 설정은 도구 호출과 하위 에이전트를 잘 처리했으며, VRAM 제한(32GB)에도 불구하고 '매우 통찰력 있는 코드 리뷰와 리팩토링'을 제공했습니다.
이는 V100과 같은 구형 데이터센터 하드웨어에서 LLM을 실행하는 개발자에게 특히 관련이 있습니다. MTP는 이 모델의 처리량을 효과적으로 두 배로 늘려 코딩 어시스턴트 워크로드에 실질적인 이점을 보여줍니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also
협업: 다중 에이전트 전환을 통한 구조화된 비동기 문서 작성을 위한 클로드 코드 스킬
'collaborate'라는 클로드 코드 스킬을 사용하면 여러 명이 문서를 공동 작성할 수 있습니다. 각 참가자는 클로드로부터 이전 변경 사항, 추론, 다음 작업에 대한 평이한 영어 브리핑을 받으며, 병렬 섹션, 구조화된 비평, Slack/Signal 알림을 지원합니다.

codebase-md: 도구가 git hook 유지 관리와 함께 CLAUDE.md를 자동 생성합니다
codebase-md v0.1.0는 아키텍처 감지, 의존성 건강 점검 및 git 인사이트를 통해 CLAUDE.md 파일을 생성하기 위해 프로젝트를 스캔합니다. 생성된 문서를 최신 상태로 유지하기 위한 git 훅을 포함하며, 추가 구성 파일을 통해 다른 AI 코딩 도구도 지원합니다.

라이트팬더: 네이티브 MCP 서버와 마크다운 출력을 지원하는 LLM 에이전트용 오픈소스 헤드리스 브라우저
Lightpanda는 LLM 기반 에이전트를 위해 설계된 오픈소스 헤드리스 브라우저로, Chrome보다 16배 적은 메모리(215MB 대 2GB)를 사용하며 웹 크롤링 벤치마크를 47초 대신 5초 만에 완료합니다. 네이티브 마크다운 출력, 상호작용 감지 기능이 있는 시맨틱 트리, 내장 MCP 서버를 제공합니다.

클로드 코드 스킬: 자동화된 프로젝트 스캐폴딩
한 개발자가 React, Next.js, Node.js API, Turborepo 모노레포를 위한 명령어로 풀스택 프로젝트 설정을 자동화하는 Claude Code 스킬을 구축했습니다. 이 스킬은 최신 의존성을 가져오고, 50개 이상의 통합을 지원하며, MIT 라이선스로 제공됩니다.