ik_llama.cpp MTP를 사용한 단일 3090에서의 Qwen 3.5 122B MoE 35 t/s

한 개발자가 완전히 로컬 환경에서 단일 데스크톱으로 Qwen 3.5 122B MoE를 단일 3090만 사용하여 초당 35토큰을 달성했다고 보고했습니다. 핵심은 llama.cpp의 포크로, 오프로드된 전문가에 대한 MTP(다중 토큰 예측)를 수정한 것입니다.
하드웨어 구성
- AMD 9900X CPU
- 192GB DDR5-5200 RAM (일명 "비밀 무기")
- 3090 2개 (Ti + 일반), NVLink 없음
카드 1은 워커 실행: Unsloth IQ3_S MTP GGUF와 204K 컨텍스트를 사용한 Qwen3.5-122B-A10B. 75%의 전문가 레이어가 세부 -ot 플래그를 통해 CPU로 오프로드됩니다. 카드 2는 리즈너 실행: 135 t/s, 262K 컨텍스트의 MTP를 사용한 Qwen3.6-35B-A3B Q4_K_XL.
추가 CPU 전용 인스턴스가 백그라운드 처리를 담당: Dialectic (35B heretical Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — 총 약 19GB RAM 사용.
ik_llama.cpp 발견
기본 llama.cpp의 MTP는 각 추측된 토큰의 전문가를 DDR5를 통해 순차적으로 평가하는데, 추론 콘텐츠에서는 실제로 성능이 저하됩니다—드래프트 오버헤드가 수용 속도 향상을 압도합니다. ik 포크는 추측된 토큰에 대한 전문가 읽기를 배치 처리하는 융합 MoE 연산을 구현하여 MTP를 +4% 이득에서 +20% 이득으로 전환합니다. 개발자는 이 포크를 사용하여 단일 3090에서 122B 모델로 35 t/s 디코딩을 보고했습니다.
MoE 모델에서 RAM으로 전문가를 오프로드하는 경우, MTP를 포기하기 전에 ik_llama.cpp를 시도해보세요.
총 빌드 비용
- RAM 약 $1600
- 3090 2개 약 $1600
- 기타 약 $400
- 운영 비용: 전기세만
📖 전체 출처 보기: r/openclaw
👀 See Also

88 PSI에서 100 PSI로: 프론트엔드 최적화를 위한 클로드 코드
한 개발자가 Claude Code를 사용하여 PageSpeed Insights 모바일 점수를 88에서 100으로 끌어올렸습니다. 주요 전략: srcset을 사용한 반응형 이미지, IntersectionObserver, 글꼴 사전 로드 제거. Claude는 한 번의 프롬프트로 해결하는 도구가 아닌 디버깅 파트너로 활용되었습니다.

클로드와 함께 구축한 맞춤형 힌디어 용어집 시스템: 10개월 만에 정확도 76%에서 92%로
방갈로르의 독립 개발자가 Claude를 위한 맞춤 용어집 시스템을 구축하여 힌디어 도메인 어휘 정확도를 76%에서 92%로 향상시켰습니다. 예시 기반 용어와 문맥 문장이 가장 효과적이었습니다.

40번의 프롬프트 수정으로 클로드 AI 요약을 제품으로 전환한 방법: 튜터링 플랫폼 사례 연구 (월 $19K 수익)
월 $19K MRR의 과외 플랫폼이 클로드(Claude) 세션 요약 프롬프트를 12개월 동안 40회 이상 개선했습니다. 모호했던 v1에서 개인화된 v40까지의 여정은 프롬프트 엔지니어링이 어떻게 기능을 제품으로 변화시키는지 보여줍니다.

클로드에서 Todoist 커넥터가 제거되었으며, 사용자 지정 설정이 필요합니다.
공식 Todoist 커넥터가 Claude에서 더 이상 사용할 수 없습니다. 사용자는 MCP URL https://ai.todoist.net/mcp를 사용하여 Todoist를 커스텀 커넥터로 추가할 수 있지만, 이는 Claude Pro 또는 Max 구독이 필요합니다.