GLM-5-Turbo, 사용자 테스트에서 낮은 도구 호출 오류율 보여

r/LocalLLaMA에서 공유된 사용자 테스트에 따르면, z-ai/glm-5-turbo 모델이 도구 호출 애플리케이션에서 유망한 성능을 보여주고 있습니다.
벤치마크 결과
테스트 결과, 이 모델은 평균 0.57%의 매우 낮은 도구 호출 오류율을 달성하는 것으로 나타났습니다. 이는 약 3%의 오류율을 보이는 표준 GLM-5 모델에 비해 상당한 개선으로, GLM-5-turbo가 도구 호출 작업에서 약 6배 더 정확함을 의미합니다.
다른 제공업체의 모델과 비교했을 때:
- Anthropic 모델은 0.38%에서 0.93% 범위이며 평균 0.67%
- Amazon Bedrock 모델은 1.48%에서 1.76% 범위이며 평균 1.63%
- Google Vertex 모델은 0.99%에서 2.62% 범위이며 평균 1.93%
실제 적용 사례
한 사용자가 판타지 소설 작성을 위한 새로운 CLI 도구로 GLM-5-turbo를 테스트했으며, 이전 모델들에 비해 상당한 개선을 보고했습니다. 표준 GLM-5를 사용할 때는 "비영어권 콘텐츠에 대해 다소 불안정했고, 사용자 요청에 비해 어떤 명령을 올바르게 사용해야 할지 무작위로 모르는 경우가 있었다"고 합니다.
GLM-5-turbo(Max 플랜)를 사용하여, 해당 사용자는 "불안정함 없이, em-dash 없이, 연결된 장과 거의 올바르게 수행된 도구 호출로" 97,000단어를 성공적으로 작성했습니다. 소스에 따르면 이 모델은 특히 OpenClaw를 잘 지원합니다.
사용 시 고려사항
소스에 따르면 GLM-5-turbo는 코딩 지원이 필요한 사이드 프로젝트에 적합할 수 있지만, 더 안정적인 요소가 필요한 프로덕션 프로젝트의 경우 "올바른 선택이 아닌 것 같다"고 경고합니다. 또한 해당 사용자는 OpenClaw 대신 홈랩 설정에서 NemoClaw와 GLM-5-turbo를 함께 사용하는 것을 고려하고 있다고 언급했습니다.
Openrouter의 초기 사용 데이터는 첫 100B 토큰에 대해 좋은 수치를 보여주지만, 소스에서는 구체적인 지표가 제공되지 않았습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

SWE-rebench-V2 출시: 코드 에이전트 훈련을 위한 가장 큰 오픈 멀티링구얼 데이터셋
Nebius가 SWE-rebench-V2를 출시했습니다. 이는 현재 코딩 에이전트 훈련을 위한 가장 큰 오픈 데이터셋으로, 대규모 강화 학습 훈련을 위해 설계된 자동화된 파이프라인을 통해 RL 환경을 대규모로 추출합니다.

Clawpage: OpenClaw 대화를 정적 웹사이트로 변환하는 도구
한 개발자가 OpenClaw 세션 기록을 정적 웹 페이지로 변환하여 가치 있는 대화, 주고받은 내용, 연구 및 디버깅 과정을 보존하는 Clawpage라는 스킬을 만들었습니다. 이 도구는 GitHub에서 이용할 수 있습니다.

클로드 코드의 로컬 메모리 통합과 쇼드: 시간 경과에 따른 컨텍스트 유지 강화
Claude Code와 Shodh 메모리의 통합을 통해 로컬 메모리 서버를 사용한 장기 프로젝트 컨텍스트 유지 기능을 살펴보세요.

에이전트작업메모리: AI 코딩 에이전트를 위한 로컬 메모리 시스템
AgentWorkingMemory(AWM)는 AI 코딩 에이전트의 세션 간 기억 상실 문제를 해결하는 로컬 메모리 시스템입니다. SQLite 데이터베이스, 세 개의 로컬 ML 모델(총 약 124MB)을 사용하며 MCP를 통해 자동으로 통합되어 Claude Code 세션 전반에 걸쳐 지속적이고 상황 인식 메모리를 제공합니다.