GLM 5 auf Mac M3: Leistungsbeobachtungen für agentenbasiertes Programmieren

✍️ OpenClawRadar📅 Veröffentlicht: 23. Februar 2026🔗 Source
GLM 5 auf Mac M3: Leistungsbeobachtungen für agentenbasiertes Programmieren
Ad

Leistungsbenchmarks und Einschränkungen

Ein Entwickler testete GLM 5 mit MLX 4-Bit-Quantisierung auf einem Mac M3 mit 512 GB RAM für agentenbasierte Programmieraufgaben. Das Modell wird als "durchaus nutzbar" beschrieben, solange der Kontext unter etwa 50.000 Token bleibt, obwohl es deutlich langsamer ist als API-basierte Lösungen wie Claude, insbesondere während der Prompt-Verarbeitung.

Die Leistung verschlechtert sich erheblich, wenn der Kontext 50.000 Token überschreitet. In einem Test mit 65.000 Token wurde die erste Hälfte in 8 Minuten verarbeitet (67 Token/Sekunde), während die zweite Hälfte weitere 18 Minuten benötigte, was einer Gesamtrate von 41 Token/Sekunde entspricht. Die Token-Generierung bleibt schneller und wird bei größeren Kontextgrößen auf 12–20 Token/Sekunde geschätzt.

Workflow-Beobachtungen

Der Nutzer stellt fest, dass Opencode (das agentenbasierte Programmier-System) die Generierung von Code über mehrere Dateien effizient handhabt, sobald ein Plan erstellt ist, und "Tausende von Token Code über mehrere Dateien in nur wenigen Minuten mit dazwischenliegenden Überlegungen" ausgibt. Die Prompt-Verarbeitung dauert typischerweise "ein paar Minuten", um einige hundert Codezeilen pro Datei zu lesen, wobei insgesamt etwa 10 Minuten über mehrere Planungssitzungen verteilt anfallen.

Die Komprimierung in Opencode "dauert tatsächlich eine Weile, da sie im Grunde den gesamten Kontext neu verarbeiten möchte". Bei einer Kontextgrenze von 50.000 Token dauert die Komprimierung etwa 5 Minuten.

Ad

Technisches Setup und zukünftige Erwartungen

Der Test wurde mit LM Studio durchgeführt, das möglicherweise nicht die neuesten Laufzeitoptimierungen bietet. Der Nutzer vermutet, dass "MLX oder sogar GGUF bei der Prompt-Verarbeitung schneller werden könnten, wenn die Laufzeiten für GLM 5 aktualisiert werden, aber es wird wahrscheinlich nicht VIEL schneller als dies werden".

Das Setup wird für Aufgaben, die 70.000+ Token im Kontext erfordern, nicht empfohlen, sowohl aufgrund der Kontextgrößenbeschränkungen als auch der "unerträglichen Langsamkeit", die nach Überschreiten bestimmter Schwellenwerte während der Prompt-Verarbeitung auftritt.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Zwei Monate mit GitHub Spec-Kit und Claude Code: Was funktioniert, was nicht
Werkzeuge

Zwei Monate mit GitHub Spec-Kit und Claude Code: Was funktioniert, was nicht

Ein Entwickler teilt praktische Notizen zur Verwendung von GitHub's Spec-Driven Development Toolkit mit Claude Code und behandelt den Fünf-Phasen-Workflow, Drift-Probleme, Aufwand-Kompromisse und Einrichtungstipps.

OpenClawRadar
Inline-Visualisierer: Lokale KI-Modelle können jetzt interaktive HTML-Visualisierungen rendern
Werkzeuge

Inline-Visualisierer: Lokale KI-Modelle können jetzt interaktive HTML-Visualisierungen rendern

Inline Visualizer ist ein BSD-3-lizenziertes Plugin für Open WebUI, das jedem lokalen KI-Modell mit Tool-Calling-Unterstützung ermöglicht, interaktive HTML/SVG-Visualisierungen direkt im Chat darzustellen, wobei eine JavaScript-Brücke es Elementen erlaubt, Nachrichten zurück an die KI zu senden.

OpenClawRadar
Multi-Operator Claude Code: Hub-basierte Architektur für Multi-Agent-Sessions
Werkzeuge

Multi-Operator Claude Code: Hub-basierte Architektur für Multi-Agent-Sessions

Ein Hub-basiertes Setup für Claude Code ermöglicht mehreren Personen, an derselben Sitzung teilzunehmen, Teilaufgaben über Repos zu verteilen und headless Agents in Docker-Containern auszuführen.

OpenClawRadar
Kostenlose macOS-Menüleisten-App überwacht Claude-Nutzung in Echtzeit
Werkzeuge

Kostenlose macOS-Menüleisten-App überwacht Claude-Nutzung in Echtzeit

Ein Entwickler hat eine kostenlose macOS-Menüleisten-App zur Überwachung der Claude-Nutzung erstellt, die vollständig mit Claude Code und Opus entwickelt wurde. Die App zeigt Nutzungsbalken für 5-Stunden- und 7-Tage-Sitzungen, den Füllstand des Kontextfensters in Prozent und sendet Benachrichtigungen, wenn Grenzwerte erreicht werden.

OpenClawRadar