M5 Max에서 Flash-MOE 벤치마크: Qwen3.5-397B로 12.99 토큰/초

성능 결과
한 사용자가 128GB 통합 메모리를 탑재한 M5 Max MacBook Pro에서 flash-moe 구현을 벤치마크했으며, mlx-community/Qwen3.5-397B-A17B-4bit 모델을 실행했습니다. Dan Woods가 48GB RAM을 탑재한 M3 Max에서 수행한 원본 벤치마크는 초당 4.36 토큰을 달성했습니다. M5 Max에서는 4비트 양자화와 cache-io-split 없이 기본 설정으로 초당 12.48 토큰에 도달했습니다. 최적의 --cache-io-split 4 설정으로 성능이 초당 12.99 토큰으로 향상되어 원본 벤치마크보다 세 배 빠른 속도를 보였습니다.
Cache-IO-Split 분석
사용자는 M5+ 칩을 위한 Metal 4 NAX 지원을 추가한 Anemll 포크의 flash-moe를 사용하여 cache-io-split 값을 완전히 검증했습니다. 결과에 따르면 split 2와 3은 성능을 저하시키는 반면, split 4가 최적의 성능을 제공합니다:
- cache-io-split 1 (없음): 12.48 tok/s, 토큰당 28.4ms 전문가 I/O
- cache-io-split 2: 9.94 tok/s, 토큰당 28.2ms 전문가 I/O
- cache-io-split 3: 9.99 tok/s, 토큰당 36.1ms 전문가 I/O
- cache-io-split 4: 12.99 tok/s, 토큰당 25.9ms 전문가 I/O
- cache-io-split 5: 12.64 tok/s, 토큰당 27.5ms 전문가 I/O
- cache-io-split 8: 12.90 tok/s, 토큰당 26.4ms 전문가 I/O
분석에 따르면 split 4는 M5 Max SSD 컨트롤러의 내부 병렬 처리와 일치하는 반면, 더 높은 값은 스케줄링 오버헤드를 추가합니다. 권장 사항은 --cache-io-split 4를 사용하거나 아예 split을 사용하지 않으면서 split 2와 3은 피하는 것입니다.
양자화 비교
2비트 대 4비트 양자화 테스트 결과, M5 Max에서는 2비트가 속도 이점을 제공하지 않으며, SSD 속도로 인해 더 작은 파일이 필요하지 않고 디양자화 오버헤드가 모든 이득을 상쇄합니다. 2비트에서는 품질이 크게 저하됩니다:
- 4비트: 12.99 tok/s, WikiText-2에서 3.64 퍼플렉시티
- 2비트: ~12.65 tok/s, WikiText-2에서 5.71 퍼플렉시티 (57% 더 나쁨)
결론은 속도를 희생하지 않고 더 나은 품질을 위해 4비트 양자화를 사용하는 것입니다.
기술적 세부사항
벤치마크는 https://github.com/Anemll/flash-moe에서 사용 가능한 Anemll 포크를 사용했습니다. 지속적인 성능은 1000 토큰 동안 초당 11.23 토큰으로 안정적으로 유지되었으며 성능 저하는 없었습니다. 사용자는 LM Studio와 같은 Metal/GPU를 사용하는 백그라운드 프로세스가 성능에 상당한 영향을 미칠 수 있으므로 벤치마크 중에는 종료해야 한다고 언급했습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

오픈소스 도구, 로컬 데이터 분석으로 AI 코딩 에이전트 자율성 측정
Codelens-AI는 Claude Code 세션 파일을 git 기록과 함께 분석하여 자율성 지표(예: 오토파일럿 비율, 자가 치유 점수)를 계산하는 오픈소스 CLI 도구입니다. 이 도구는 npx claude-roi를 사용하여 설정 없이 로컬에서 실행되며 모든 데이터를 사용자의 기기에 보관합니다.

TigrimOS v1.1.0과 Tiger CoWork v0.5.0이 원격 에이전트 군집 및 구성 가능 거버넌스 기능과 함께 출시되었습니다.
오늘 출시된 TigrimOS v1.1.0과 Tiger CoWork v0.5.0은 원격 인스턴스 간의 스웜 대 스웜 통신과 다섯 가지 구성 가능한 거버넌스 프로토콜을 추가했습니다. 두 제품 모두 셀프 호스팅, 무료, 오픈 소스입니다.

OpenClaw-superpowers는 운영 장애 모드에 대한 신뢰성 기능을 추가합니다.
openclaw-superpowers 저장소가 배포 전 검사, cron 실행 증명, 세션 재설정 복구, MCP 인증 수명 주기 관리 등 신뢰성에 초점을 맞춘 8가지 새로운 스킬로 확장되었습니다. 이로써 총 스킬 수는 60개가 되었으며, 그중 44개는 OpenClaw 네이티브 스킬이고 23개는 cron 스케줄링을 위해 설계되었습니다.

높은 채택률을 보인 OpenClaw 기술: Capability Evolver, WACLI, Composio 등
레딧 게시물에서 설치 수와 특정 사용 사례를 기준으로 주목할 만한 여러 OpenClaw 스킬을 소개합니다. 여기에는 에이전트 행동 자체 감사를 위한 Capability Evolver, WhatsApp 접근을 위한 WACLI, 860개 이상의 앱 연결을 위한 Composio 등이 포함됩니다.