GLM 5 on Mac M3: 에이전트 코딩 성능 관찰

성능 벤치마크와 한계
한 개발자가 에이전트 코딩 작업을 위해 Mac M3(512GB RAM)에서 MLX 4비트 양자화를 사용해 GLM 5를 테스트했습니다. 이 모델은 컨텍스트가 약 5만 토큰 미만으로 유지될 경우 '상당히 사용 가능'하다고 설명되지만, 특히 프롬프트 처리 중에는 Claude와 같은 API 기반 솔루션보다 상당히 느립니다.
컨텍스트가 5만 토큰을 초과하면 성능이 크게 저하됩니다. 한 테스트에서 6만5천 토큰을 처리할 때, 처음 절반은 8분(초당 67토큰)에 완료되었지만, 나머지 절반은 추가로 18분이 걸려 전체 속도는 초당 41토큰이 되었습니다. 토큰 생성은 더 빠르며, 큰 컨텍스트 크기에서 초당 12-20토큰으로 추정됩니다.
워크플로 관찰
사용자는 Opencode(에이전트 코딩 시스템)가 계획이 수립되면 다중 파일 코드 생성을 효율적으로 처리하며, '몇 분 만에 여러 파일에 걸쳐 수천 토큰의 코드를 출력하고 그 사이에 추론을 수행한다'고 언급했습니다. 프롬프트 처리는 일반적으로 파일당 수백 줄의 코드를 읽는 데 '몇 분'이 걸리며, 계획 세션 전체에 약 10분이 소요됩니다.
Opencode의 압축은 '전체 컨텍스트를 기본적으로 재처리하는 경향이 있어 시간이 꽤 걸립니다.' 5만 토큰 컨텍스트 제한에서 압축은 약 5분이 소요됩니다.
기술 설정과 미래 전망
이 테스트는 최신 런타임 최적화를 제공하지 않을 수 있는 LM Studio를 사용해 수행되었습니다. 사용자는 'MLX 또는 GGUF도 GLM 5용 런타임이 업데이트되면 프롬프트 처리가 더 빨라질 수 있지만, 이보다 훨씬 빠르지는 않을 것'이라고 제안했습니다.
이 설정은 컨텍스트에 7만 토큰 이상이 필요한 작업에는 권장되지 않습니다. 컨텍스트 크기 제한과 프롬프트 처리 중 특정 임계값을 초과한 후 발생하는 '견디기 힘든 느림' 때문입니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

终极虚幻引擎 MCP:Claude Code 现可用 132 个工具构建并验证虚幻引擎关卡
오픈소스 MCP 서버가 26개 도메인에 걸쳐 132개의 도구를 제공하여 Claude가 액터 생성, UPROPERTY 값 설정, 뷰포트 스크린샷 촬영, 카메라 탐색, 변형 후 자체 수정을 할 수 있게 합니다.

Freestyle Launches Sandboxes for AI Coding Agents with Live Forking
Freestyle provides cloud sandboxes for AI coding agents that start in ~500ms and feature live forking with <400ms pause, allowing full VM clones including memory state. They run full Debian with hardware virtualization on bare metal infrastructure.

클로드의 캔바 통합: 디자인 생성을 위한 실용적인 워크플로우
Claude의 Canva 커넥터는 단순한 이미지가 아닌 구조화된 레이아웃으로 편집 가능한 Canva 프로젝트를 내보냅니다. 이 게시물은 프롬프트에서 완성된 캐러셀까지 12~15분이 걸리는 워크플로우를 설정, 고충실도 모드, 솔직한 한계를 포함하여 설명합니다.

시그넷: AI 코딩 에이전트를 위한 오픈소스 메모리 레이어, LoCoMo에서 80% F1 점수 달성
Signet는 AI 코딩 에이전트를 위한 오픈소스 메모리 시스템으로, LoCoMo 벤치마크에서 표준 RAG의 41%에 비해 80% F1 점수를 달성했습니다. 이 시스템은 각 세션 후 메모리를 추출하고 프롬프트 전에 관련 컨텍스트를 주입하며, SQLite를 사용해 로컬에서 실행됩니다.