GLM 5 on Mac M3: 에이전트 코딩 성능 관찰

성능 벤치마크와 한계
한 개발자가 에이전트 코딩 작업을 위해 Mac M3(512GB RAM)에서 MLX 4비트 양자화를 사용해 GLM 5를 테스트했습니다. 이 모델은 컨텍스트가 약 5만 토큰 미만으로 유지될 경우 '상당히 사용 가능'하다고 설명되지만, 특히 프롬프트 처리 중에는 Claude와 같은 API 기반 솔루션보다 상당히 느립니다.
컨텍스트가 5만 토큰을 초과하면 성능이 크게 저하됩니다. 한 테스트에서 6만5천 토큰을 처리할 때, 처음 절반은 8분(초당 67토큰)에 완료되었지만, 나머지 절반은 추가로 18분이 걸려 전체 속도는 초당 41토큰이 되었습니다. 토큰 생성은 더 빠르며, 큰 컨텍스트 크기에서 초당 12-20토큰으로 추정됩니다.
워크플로 관찰
사용자는 Opencode(에이전트 코딩 시스템)가 계획이 수립되면 다중 파일 코드 생성을 효율적으로 처리하며, '몇 분 만에 여러 파일에 걸쳐 수천 토큰의 코드를 출력하고 그 사이에 추론을 수행한다'고 언급했습니다. 프롬프트 처리는 일반적으로 파일당 수백 줄의 코드를 읽는 데 '몇 분'이 걸리며, 계획 세션 전체에 약 10분이 소요됩니다.
Opencode의 압축은 '전체 컨텍스트를 기본적으로 재처리하는 경향이 있어 시간이 꽤 걸립니다.' 5만 토큰 컨텍스트 제한에서 압축은 약 5분이 소요됩니다.
기술 설정과 미래 전망
이 테스트는 최신 런타임 최적화를 제공하지 않을 수 있는 LM Studio를 사용해 수행되었습니다. 사용자는 'MLX 또는 GGUF도 GLM 5용 런타임이 업데이트되면 프롬프트 처리가 더 빨라질 수 있지만, 이보다 훨씬 빠르지는 않을 것'이라고 제안했습니다.
이 설정은 컨텍스트에 7만 토큰 이상이 필요한 작업에는 권장되지 않습니다. 컨텍스트 크기 제한과 프롬프트 처리 중 특정 임계값을 초과한 후 발생하는 '견디기 힘든 느림' 때문입니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

Maggy: 크로스 세션 메모리와 P2P 팀 학습을 갖춘 Claude Code 기반의 자율 엔지니어링 플랫폼
Maggy는 AI 코딩 도구 스펙트럼의 4단계에 위치합니다: 다중 모델 오케스트레이션, 세션 간 메모리, CI/리뷰에서의 프로세스 인텔리전스, P2P 팀 학습. 벤치마크에서 Claude 사용량을 83% 줄이고 단일 파이프라인 Claude Code가 놓친 7개의 보안 문제를 발견했습니다.

코그니소어: PGE 트리니티 아키텍처 기반 로컬-퍼스트 에이전트 OS
Cognithor는 16개의 개발 단계를 거쳐 1년 동안 구축된 완전 로컬 자율 에이전트 OS입니다. PGE 트리니티 아키텍처(Planner → Gatekeeper → Executor), 89% 커버리지의 11,609개 이상의 테스트, Ollama 및 LM Studio를 포함한 16개의 LLM 제공업체를 지원하는 기능을 갖추고 있습니다.

QCAI 앱은 OpenClaw 생태계를 위한 모바일 제어 센터를 제공합니다.
학술 연구팀이 iOS와 안드로이드용 QCAI 앱을 출시했습니다. 이 앱은 AI 지원 개발로 구축되었으며, 대시보드 모니터링, 게이트웨이 채팅, OpenClaw 도구에 대한 보안 VPN 접근 기능을 제공합니다.

펨토봇: 저자원 환경을 위한 효율적인 러스트 에이전트
펨토봇은 저사양 머신에서 효율적으로 실행되도록 설계된 경량 Rust 기반 AI 에이전트로, 약 10MB의 바이너리로 대규모 런타임 종속성 없이 구동됩니다.