번개 MLX: 애플 실리콘 에이전트 사용을 위한 초고속 로컬 AI 엔진, Qwen 35B-A3B에서 220 tok/s 구현

Lightning MLX라는 Apple Silicon용 새로운 오픈소스 추론 엔진이 에이전틱 워크플로(코딩 에이전트, 도구 호출, 짧은 응답 작업)에 특화된 가장 빠른 로컬 AI 엔진이라고 주장합니다. 이 프로젝트는 GitHub samuelfaj/lightning-mlx에서 확인할 수 있습니다.
벤치마크 결과
개발자는 128GB RAM의 MacBook Max M5에서 테스트하여 다음과 같은 토큰 생성 속도를 보고했습니다:
- Qwen3.6-27B: 40.67 tok/s
- Qwen3.6-35B-A3B: 220.86 tok/s
이 결과는 엔진이 토큰당 일부 파라미터만 활성화하는 Qwen3.6-35B-A3B 모델의 mixture-of-expert 아키텍처에 특히 효율적임을 시사합니다.
주요 기능
- 짧은 응답 에이전틱 사용 사례 — 코드 생성, 도구 호출, 빠른 추론 루프에 최적화
- MTPLX(커스텀 샘플링 기본값)라는 사전 설정 구성 포함; 개발자는 이러한 기본값이 프로덕션에 적합한지에 대한 피드백을 구하고 있습니다
- GitHub에서 MIT 라이선스(추정)로 오픈소스 제공
피드백 요청
개발자는 커뮤니티에 다음을 적극적으로 요청하고 있습니다:
- 로컬 코딩 에이전트를 위한 더 나은 벤치마크 설계
- MTPLX 사전 설정 기본값에 대한 의견
- 다른 Apple Silicon 구성(예: M1, M2, M3, M4, 다양한 RAM 크기)에서의 테스트 결과
대상 사용자
에이전틱 코딩 워크플로를 위해 Apple Silicon에서 로컬 LLM을 실행하며 최대 추론 속도가 필요한 개발자.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

공공 보건, 학술 및 정부 데이터를 위한 공개 호스팅 MCP 서버
한 개발자가 CDC 데이터셋, 임상시험, FDA 데이터, 학술 논문, 의회 정보, 날씨 데이터 및 기타 유틸리티에 접근할 수 있는 14개의 MCP 서버를 구축하여 공개적으로 호스팅하고 있습니다. 이 서버들은 설정, API 키 또는 로컬 설치가 필요하지 않습니다.

우분투 UTM VM에서 LLM API 및 Ollama 접근을 통한 OpenClaw 설정
한 사용자가 M3 Mac에서 샌드박스화된 Ubuntu VM 내에서 OpenClaw를 성공적으로 구성했습니다. 이 구성은 macOS의 로컬 Ollama와 Gemini, Claude, DeepSeek과 같은 외부 LLM API에 모두 접근할 수 있습니다. 샘플 구성 파일과 문제 해결 노트는 GitHub에서 확인할 수 있습니다.

AIsbf 0.9.8은 캐싱 기능, 라우팅 개선 및 확장된 AI 서비스 지원을 추가합니다.
AIsbf 0.9.8은 여러 AI 서비스에 OpenAI 호환 인터페이스를 제공하는 API 프록시/라우터입니다. 이번 릴리스에서는 Redis, SQLite, MySQL 및 파일 기반 캐싱, 향상된 의미론적 라우팅, Claude.ai, Amazon Kiro-cli, OpenAI Codex, Kilo.ai 구독자를 위한 완전한 OAuth2 지원이 추가되었습니다.

클로드 컴팩트 가드 플러그인은 새로운 PostCompact 후크를 사용하여 컨텍스트를 보존합니다
한 개발자가 Claude의 /compact 명령어가 중요한 컨텍스트를 파괴하기 전에 자동으로 저장한 후, 완료 시점에 모든 내용을 재주입하는 claude-compact-guard 플러그인을 공개했습니다. 이 플러그인은 4일 전에 공개된 Anthropic의 새로운 PostCompact 훅을 활용합니다.