FOMOE, 2,100달러 데스크톱 하드웨어에서 397B Qwen3.5 모델 추론 가능

FOMOE가 해결하는 문제
대규모 Mixture of Experts(MoE) 모델은 일반적으로 NVMe와 같은 플래시 메모리에 수백 GB의 가중치 저장이 필요합니다. 추론 중에는 가중치의 일부만 필요하지만, 어떤 가중치가 필요한지 미리 예측할 수 없습니다. 무작위 접근 패턴으로 인해 플래시 지연 시간이 너무 높아 소비자용 하드웨어에서 실용적인 추론이 어렵습니다.
FOMOE 작동 방식
이 시스템은 여러 기술을 통해 대부분의 전문가 가중치 읽기를 불필요하게 만듭니다:
- 최신 롤링 전문가 캐시로 가장 일반적인 전문가를 GPU 메모리(VRAM)에 저장
- 웜 스타트로 60% VRAM 적중률 달성, NVMe 읽기를 28%로 감소(12%는 DRAM에서 제공)
- 가중치 로딩과 계산을 중첩시키기 위한 듀얼 GPU 핑퐁 아키텍처 사용
- 캐시 인식 라우팅(CAR) 구현 - 두 전문가의 점수가 비슷할 때, 모델은 허용 가능한 임계값 내에서 VRAM 또는 DRAM 캐시에 이미 있는 다음으로 점수가 높은 전문가를 선택
성능 결과
- Qwen3.5의 397B 파라미터 모델에 대해 초당 5-9 토큰 추론 속도
- CAR 활성화 시 NVMe 읽기가 7%로 감소
- wikitext에서 측정된 난잡도는 3.5%만 감소
- 하드웨어 요구사항: 두 개의 500달러 GPU, 32GB RAM, 하나의 NVMe 드라이브
- Q4_K_M 양자화 사용
구현은 약 15,000줄의 Claude 주도 C/HIP 코드로 구성되어 있으며, 많은 인간의 지도가 포함되었습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

높은 채택률을 보인 OpenClaw 기술: Capability Evolver, WACLI, Composio 등
레딧 게시물에서 설치 수와 특정 사용 사례를 기준으로 주목할 만한 여러 OpenClaw 스킬을 소개합니다. 여기에는 에이전트 행동 자체 감사를 위한 Capability Evolver, WhatsApp 접근을 위한 WACLI, 860개 이상의 앱 연결을 위한 Composio 등이 포함됩니다.
수술적 GitHub 추출: 전체 저장소가 아닌 하나의 함수를 가져오는 클로드 기술
surgical-github-extraction이라는 새로운 오픈 소스 Claude Skill은 함수나 패턴 하나만 필요할 때 Claude Code가 전체 저장소를 클론하는 것을 방지합니다. README를 읽고, 1~3개의 원시 소스 파일을 가져온 후, 출처 주석과 함께 가장 작은 유용한 단위를 추출합니다.

클로드의 캔바 통합: 디자인 생성을 위한 실용적인 워크플로우
Claude의 Canva 커넥터는 단순한 이미지가 아닌 구조화된 레이아웃으로 편집 가능한 Canva 프로젝트를 내보냅니다. 이 게시물은 프롬프트에서 완성된 캐러셀까지 12~15분이 걸리는 워크플로우를 설정, 고충실도 모드, 솔직한 한계를 포함하여 설명합니다.

Be My Butler: AI 코드 검증을 위한 멀티 에이전트 파이프라인
Be My Butler는 다양한 AI 모델이 블라인드 검증을 통해 서로의 코드를 검토하는 오픈소스 멀티 에이전트 파이프라인입니다. 이 시스템은 AI 에이전트가 자신의 코드를 잘못된 상태로 보고하는 문제를 해결합니다.