Mac Mini에서 OpenClaw와 LM Studio를 사용한 로컬 LLM 성능 벤치마크

한 레딧 사용자가 32GB RAM을 탑재한 Mac Mini에서 로컬 대규모 언어 모델을 실행한 구체적인 성능 벤치마크를 공유했습니다. 이 게시물은 이 하드웨어 구성에 대한 구체적인 성능 데이터가 부족한 점을 다루고 있습니다.
기술 설정 상세 정보
사용자는 다음과 같은 구성과 결과를 보고했습니다:
- 소프트웨어 버전: OpenClaw 2026.3.8, LM Studio 0.4.6+1
- 모델: Unsloth gpt-oss-20b-Q4_K_S.gguf
- 컨텍스트 크기: 26035
- 성능 지표: 첫 프롬프트 이후 초당 34토큰, 초기 토큰까지 0.7초
모델 구성
사용자는 다음 모델 설정을 지정했습니다(모두 기본값):
- GPU 오프로드 = 18
- CPU 스레드 풀 크기 = 7
- 최대 동시 실행 수 = 4
- 전문가 수 = 4
- 플래시 어텐션 = 켜짐
Q4_K_S 양자화는 이 모델이 200억 개의 매개변수를 가진 모델의 4비트 양자화 버전임을 나타내며, 이는 합리적인 성능을 유지하면서 메모리 요구 사항을 줄입니다. Mac Mini의 32GB RAM은 주어진 컨텍스트 길이로 이 모델 크기에 충분합니다. 초당 34토큰의 처리량은 Apple Silicon 하드웨어에서 유사한 로컬 LLM 설정을 고려하는 개발자들에게 실용적인 벤치마크입니다.
📖 Read the full source: r/openclaw
👀 See Also

Ollama의 기술적 문제와 커뮤니티 논란
인기 있는 로컬 LLM 도구인 Ollama는 llama.cpp에 대한 의존성을 축소하는 태도, 라이선스 준수 문제, 그리고 성능 저하와 재발된 버그를 포함한 맞춤형 백엔드의 기술적 문제로 비판을 받고 있습니다.

지속적 AI 어드바이저의 크로스 플랫폼 메모리: 3개월간 의사결정 이력 추적
레딧 사용자가 Claude Code, Cursor, 웹 인터페이스에서 모든 제품 결정을 기억하고 모순을 찾아내며 수개월에 걸쳐 개선되는 지속형 AI 어드바이저를 만들었습니다.

Mandala v0.3: 물류 원격 계측 데이터를 에이전트 추론을 위한 OpenTelemetry 스팬으로 통합하는 오픈소스 비동기 런타임
Mandala v0.3은 Samsara, Descartes, Vizion, FMCSA의 원격 측정 데이터를 웹훅으로 수집하고, 이벤트를 OpenTelemetry 스팬으로 내보내며, LLM 에이전트를 위한 MCP 도구를 통해 데이터를 노출하는 오픈소스 비동기 런타임입니다.

초보자에게 적합한 라이브 빌드: 첫 번째 OpenClaw 에이전트
클로캐스트가 7월 8일 초보자 친화적인 라이브 빌드 세션을 진행합니다. 코딩 없이 OpenClaw 에이전트를 설정하는 방법을 보여줍니다. Discord에서 참여하거나 YouTube에서 녹화를 시청하세요.