2x3090에서 CPU 오프로딩으로 MiniMax M2.7 Q8_0 128K 실행 – 실제 벤치마크 및 설정

✍️ OpenClawRadar📅 게시일: May 17, 2026🔗 Source
2x3090에서 CPU 오프로딩으로 MiniMax M2.7 Q8_0 128K 실행 – 실제 벤치마크 및 설정
Ad

최근 r/LocalLLaMA 게시글에서 한 사용자가 2x3090 설정, 256GB DDR4, 중고 10900X CPU에서 MiniMax M2.7 모델(Q8_0 양자화)을 128K 컨텍스트로 실행한 경험을 공유했습니다. 핵심 과제는 대규모 MoE 모델을 양자화되지 않은 KV 캐시와 함께 비교적 저사양 하드웨어에서 실행하는 것이었습니다.

성능 수치

사용자는 다음과 같이 보고합니다:

  • 프롬프트 처리: 초당 약 50 토큰
  • 토큰 생성: 초당 약 10 토큰
  • “매우 느리지만 코딩 에이전트 워크플로우에는 사용 가능”으로 설명

설정

그들은 ik-llama-cuda(llama.cpp 포크)를 사용하며 다음 플래그를 적용했습니다(NixOS 구성 기준):

${ik-llama-cuda}/bin/llama-server \
  -m ${modelPath} \
  --host 0.0.0.0 \
  --port ${toString cfg.port} \
  -c ${toString cfg.contextLength} \
  -ngl 999 \
  --cpu-moe \
  -sm graph \
  -fa on \
  -t 16 \
  -tb 16 \
  -b 4096 \
  -ub 4096 \
  -np 1 \
  -muge \
  -ger \
  --jinja \
  --metrics \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 40 \
  --min-p 0.01

주목할 만한 플래그:

  • --cpu-moe – MoE 전문가 계산을 CPU로 오프로드
  • -sm graph – 그래프 기반 스케줄링 활성화
  • -fa on – 플래시 어텐션
  • -t 16 / -tb 16 – 계산 및 배치 각각에 대한 스레드 16개
  • -b 4096 / -ub 4096 – 배치 및 부분 배치 크기
  • -muge – 메모리 사용량 기반 전문가 로딩(추정)
  • -ger – GPU 전문가 라우팅

Ad

배경 및 동기

사용자는 낮은 양자화에서 보이는 “이상한 동작”을 완화하기 위해 Q8_0을 선택했다고 보고합니다. 또한 M2.7용 추측 디코딩을 위한 드래프트 모델이 공개되지 않아 속도 향상이 가능했을 것이라고 언급합니다. 그들은 생성이 “말 그대로 하루 종일” 걸리지 않는 한, 속도보다 정확성에 중점을 둡니다.

개발자를 위한 시사점

이것은 대규모 MoE 모델을 시스템 RAM을 사용하는 멀티 GPU 설정에서 실행하는 사람에게 유용한 실제 데이터 포인트입니다. --cpu-moe 접근 방식은 VRAM 한계를 훨씬 넘어 컨텍스트를 확장할 수 있지만 속도는 저하됩니다. 지연 시간이 덜 중요한 코딩 에이전트 워크플로우의 경우 이러한 트레이드오프가 허용될 수 있습니다.

📖 전체 출처 보기: r/LocalLLaMA

Ad

👀 See Also

도구 및 메모리 파일 다이어트로 OpenClaw 부트 토큰 43% 절감
Tips

도구 및 메모리 파일 다이어트로 OpenClaw 부트 토큰 43% 절감

TOOLS.md를 인덱스로 전환하고, 도구 세부 정보를 별도 파일로 이동하며, 단계적 메모리 승격을 구현하여 부트 토큰을 약 9,457개에서 약 5,400개로 줄였습니다(43% 감소).

OpenClawRadar
Claude AI의 컨텍스트 불안감을 줄이기 위한 CLAUDE.md 최적화
Tips

Claude AI의 컨텍스트 불안감을 줄이기 위한 CLAUDE.md 최적화

레딧 토론에서 CLAUDE.md 효과를 높이는 실용적인 전략을 소개합니다. 파일을 200줄 이하로 유지하고, 구체적이고 검증 가능한 지침을 사용하며, Claude의 자동 메모리 기능을 활용하여 토큰 낭비를 유발하는 수정 루프를 방지하는 방법을 다룹니다.

OpenClawRadar
시어머니 방법: 클로드의 호의성을 무기화한 가혹한 코드 리뷰
Tips

시어머니 방법: 클로드의 호의성을 무기화한 가혹한 코드 리뷰

레딧 사용자가 코드를 싫어하는 시어머니가 작성한 것처럼 설정해 Claude가 가혹한 코드 리뷰를 하도록 속였습니다. 그 결과 31분간의 심층 분석을 통해 4명의 적대적 검토 에이전트가 27개의 문제를 발견했습니다.

OpenClawRadar
그래프 메모리 vs 마크다운: 확장 시 플랫 파일이 프롬프트 부채가 되는 이유
Tips

그래프 메모리 vs 마크다운: 확장 시 플랫 파일이 프롬프트 부채가 되는 이유

한 개발자가 AI 에이전트를 위한 마크다운 메모리 시스템이 80개 이상의 파일과 500만 자에 달하면서 검색이 추측에 불과해진 경험을 공유합니다. 해결책은 노드와 엣지를 이용한 그래프 메모리로, 에이전트가 작업별로 관련 컨텍스트만 렌더링하도록 하는 것입니다.

OpenClawRadar