2x3090에서 CPU 오프로딩으로 MiniMax M2.7 Q8_0 128K 실행 – 실제 벤치마크 및 설정

✍️ OpenClawRadar📅 게시일: May 17, 2026🔗 Source
2x3090에서 CPU 오프로딩으로 MiniMax M2.7 Q8_0 128K 실행 – 실제 벤치마크 및 설정
Ad

최근 r/LocalLLaMA 게시글에서 한 사용자가 2x3090 설정, 256GB DDR4, 중고 10900X CPU에서 MiniMax M2.7 모델(Q8_0 양자화)을 128K 컨텍스트로 실행한 경험을 공유했습니다. 핵심 과제는 대규모 MoE 모델을 양자화되지 않은 KV 캐시와 함께 비교적 저사양 하드웨어에서 실행하는 것이었습니다.

성능 수치

사용자는 다음과 같이 보고합니다:

  • 프롬프트 처리: 초당 약 50 토큰
  • 토큰 생성: 초당 약 10 토큰
  • “매우 느리지만 코딩 에이전트 워크플로우에는 사용 가능”으로 설명

설정

그들은 ik-llama-cuda(llama.cpp 포크)를 사용하며 다음 플래그를 적용했습니다(NixOS 구성 기준):

${ik-llama-cuda}/bin/llama-server \
  -m ${modelPath} \
  --host 0.0.0.0 \
  --port ${toString cfg.port} \
  -c ${toString cfg.contextLength} \
  -ngl 999 \
  --cpu-moe \
  -sm graph \
  -fa on \
  -t 16 \
  -tb 16 \
  -b 4096 \
  -ub 4096 \
  -np 1 \
  -muge \
  -ger \
  --jinja \
  --metrics \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 40 \
  --min-p 0.01

주목할 만한 플래그:

  • --cpu-moe – MoE 전문가 계산을 CPU로 오프로드
  • -sm graph – 그래프 기반 스케줄링 활성화
  • -fa on – 플래시 어텐션
  • -t 16 / -tb 16 – 계산 및 배치 각각에 대한 스레드 16개
  • -b 4096 / -ub 4096 – 배치 및 부분 배치 크기
  • -muge – 메모리 사용량 기반 전문가 로딩(추정)
  • -ger – GPU 전문가 라우팅

Ad

배경 및 동기

사용자는 낮은 양자화에서 보이는 “이상한 동작”을 완화하기 위해 Q8_0을 선택했다고 보고합니다. 또한 M2.7용 추측 디코딩을 위한 드래프트 모델이 공개되지 않아 속도 향상이 가능했을 것이라고 언급합니다. 그들은 생성이 “말 그대로 하루 종일” 걸리지 않는 한, 속도보다 정확성에 중점을 둡니다.

개발자를 위한 시사점

이것은 대규모 MoE 모델을 시스템 RAM을 사용하는 멀티 GPU 설정에서 실행하는 사람에게 유용한 실제 데이터 포인트입니다. --cpu-moe 접근 방식은 VRAM 한계를 훨씬 넘어 컨텍스트를 확장할 수 있지만 속도는 저하됩니다. 지연 시간이 덜 중요한 코딩 에이전트 워크플로우의 경우 이러한 트레이드오프가 허용될 수 있습니다.

📖 전체 출처 보기: r/LocalLLaMA

Ad

👀 See Also

🦀
Tips

제 버그 리포트가 틀렸음을 증명한 방법: apiRoot 프록시를 통한 OpenClaw 텔레그램 디버깅

OpenClaw의 Telegram apiRoot를 로컬 프록시로 지정하여 실제 와이어 페이로드를 기록할 수 있습니다. 한 개발자는 텍스트가 렌더링된 것이지 재삽입된 것이 아님을 알고 자신의 버그 보고를 철회했습니다.

OpenClawRadar
완벽한 프롬프트 작성보다 AI 대화 구성하기
Tips

완벽한 프롬프트 작성보다 AI 대화 구성하기

한 개발자가 r/ClaudeAI에서 완벽한 프롬프트 문장에 집착하는 대신 Claude AI와의 대화를 상황으로 구성하는 방법으로 전환하여 훨씬 더 나은 결과물을 얻었다고 설명합니다.

OpenClawRadar
클로드 코드의 토큰 사용 팁
Tips

클로드 코드의 토큰 사용 팁

토큰 소모를 줄이기 위한 Reddit 게시물의 실용적인 조언: 새 채팅 시작하기, 질문 그룹화하기, CLAUDE.md 간결하게 유지하기, 파일 참조를 정확하게 하기, 요약하고 스레드 다시 시작하기, 간단한 작업에는 가벼운 모델 사용하기.

OpenClawRadar
Heartbeat 모니터링 대신 OpenClaw Cron 작업을 사용하여 예약된 작업 실행하기
Tips

Heartbeat 모니터링 대신 OpenClaw Cron 작업을 사용하여 예약된 작업 실행하기

레딧 게시글에서는 아침 브리핑과 이메일 분류와 같은 예약 작업을 위해 OpenClaw의 cron 작업 기능을 사용하는 방법을 설명하며, 컨텍스트 유출을 방지하기 위한 중요한 --session isolated 플래그와 버전 간 격리 세션의 잠재적 버그에 대해 경고합니다.

OpenClawRadar