Apple Silicon에서의 긴 대화를 위한 KV 캐시 재사용으로 200배 속도 향상 달성

✍️ OpenClawRadar📅 게시일: March 15, 2026🔗 Source
Apple Silicon에서의 긴 대화를 위한 KV 캐시 재사용으로 200배 속도 향상 달성
Ad

이것이 무엇인가

한 개발자가 Apple Silicon에서 MLX 프레임워크를 사용한 로컬 LLM 추론을 위한 세션 기반 KV(키-값) 캐시 재사용 구현 실험 결과를 공유했습니다. 목표는 각 턴마다 전체 컨텍스트를 재처리할 필요를 없애 장기 대화(100K+ 토큰)를 실용적으로 만드는 것이었습니다.

주요 발견 및 벤치마크

핵심 접근 방식은 대화 턴 간에 KV 캐시를 메모리에 유지하고 새로운 토큰만 처리하는 것이었습니다. 이 간단한 아이디어는 극적인 성능 향상을 가져왔습니다:

  • 100K 컨텍스트에서 200배 TTFT 개선: 캐시 없음: 126초. 캐시 사용: 0.5초. 이는 처리된 토큰의 99.9% 감소를 나타냅니다.
  • 실제 세션 수치: M3 Ultra 512GB Mac Studio에서 Qwen3.5-397B 모델로 266메시지 OpenClaw 에이전트 세션 중 테스트 결과:
    • 캐시 적중률: 93.8%
    • 캐시 적중 시 TTFT (<500 새 토큰): 1.0-1.3초
    • 전체 캐시 미스 시 TTFT (124K 토큰): 528초 (8.8분)
Ad

효과가 없었던 것들

개발자는 성능을 저하시키거나 실패한 여러 최적화 시도를 테스트했습니다:

  • 사고 토큰 제거: 공간 절약을 위해 모델의 내부 추론 토큰을 캐시에서 제거하려는 시도는 병리적 행동을 유발했습니다. 응답이 31% 길어지고 품질이 떨어졌는데, 이는 모델이 턴 간에 과거 추론을 참조하기 때문입니다.
  • KV 캐시 회전 (8192 토큰): 이는 최고의 초당 토큰(TPS) 속도를 제공했지만, 모델이 초기 컨텍스트를 잃어버리게 했고, 회상력이 크게 떨어졌습니다(8개 항목 중 4개).
  • KV 8비트 양자화: 이는 TPS가 16.5% 감소하는 결과를 가져왔는데, 계산 오버헤드가 메모리 대역폭 절감을 초과했기 때문입니다.

구현 및 하드웨어

구현은 SoloHeaven이라는 오픈소스 개인 프로젝트의 일부이며, GitHub에서 MIT 라이선스로 이용 가능합니다: https://github.com/joongom/mlx-soloheaven. README에는 전체 벤치마크 테이블이 포함되어 있습니다.

테스트는 512GB RAM과 4TB 저장 공간을 가진 Mac Studio M3 Ultra에서 수행되었으며, MLX용으로 변환된 다음 모델들을 사용했습니다:

  • Qwen3.5-122B-A10B-bf16
  • Qwen3.5-397B-A17B-MLX-8bit

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

syntaqlite 구축: AI 지원으로 만든 SQLite 개발 도구 프로젝트
Tools

syntaqlite 구축: AI 지원으로 만든 SQLite 개발 도구 프로젝트

라릿 마간티는 8년 동안 원했던 SQLite용 개발자 도구 세트인 syntaqlite를 AI 코딩 에이전트를 사용하여 3개월 동안 구축했습니다. 이 프로젝트는 400개 이상의 문법 규칙을 포함하는 SQLite의 조밀한 C 코드베이스를 적응시키는 SQLite와 정확히 같은 방식으로 SQL을 파싱하는 작업이 필요했습니다.

OpenClawRadar
OpenClaw 에이전트를 위한 Harrier 임베딩 기반 지역 의미 메모리 검색
Tools

OpenClaw 에이전트를 위한 Harrier 임베딩 기반 지역 의미 메모리 검색

Microsoft의 Harrier 모델로 로컬 임베딩 서버를 실행하고 Ollama 호환 API를 노출한 후 OpenClaw의 memorySearch 설정을 연결하여 외부 서비스 없이 로컬 의미 메모리 검색을 구현합니다.

OpenClawRadar
유튜브 대본 MCP가 클로드 연구 작업 흐름을 개선합니다
Tools

유튜브 대본 MCP가 클로드 연구 작업 흐름을 개선합니다

YouTube 자막 MCP는 Claude가 YouTube 링크에서 타임스탬프가 포함된 전체 자막을 가져올 수 있게 해주어, 수동 탭 전환과 복사 붙여넣기를 제거합니다. 사용자는 Claude가 사용자 요약 대신 실제 자막을 가질 때 훨씬 더 나은 답변을 얻는다고 보고합니다.

OpenClawRadar
MCP 기반으로 구축된 암호화된 개인식별정보(PII)를 갖춘 로컬-퍼스트 AI 세금 준비 소프트웨어
Tools

MCP 기반으로 구축된 암호화된 개인식별정보(PII)를 갖춘 로컬-퍼스트 AI 세금 준비 소프트웨어

한 개발자가 AES-256-GCM으로 모든 개인 식별 정보(PII)를 암호화하는 Crow용 세금 신고 확장 프로그램을 만들었습니다. 이 시스템은 Claude, ChatGPT, Gemini 또는 Ollama를 통한 로컬 모델을 포함한 모든 MCP 호환 클라이언트와 작동하며, 1040 양식, 스케줄 1, HSA(8889), 교육 세액 공제(8863), 자영업(스케줄 C/SE), 자본 이득(스케줄 D) 계산을 로컬에서 처리합니다.

OpenClawRadar