Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten

Leistungsbenchmarks aus Community-Tests
Community-Tests wurden mit einer einzelnen modifizierten RTX 4090 GPU mit 48GB VRAM durchgeführt. Die offiziellen Modelle Qwen3.5-35B-A3B-FP8 und Qwen3.5-27B-FP8 wurden mit einer Kontextlänge von 256K getestet.
Framework-Empfehlungen
SGLang wird empfohlen als einziges Framework, das Prefix-Caching vollständig unterstützt, was für die hybride Aufmerksamkeitsarchitektur von Qwen3.5 entscheidend ist.
- Für 100K Kontext: Cold-Start-Prefill dauert etwa 10 Sekunden
- Mit Caching: Prefill sinkt auf 200ms
- Ergebnis: Sehr niedrige Latenz für das erste Token und extrem schnelle Ausgabe
Modellleistungsmetriken
- Qwen3.5-35B-A3B-FP8: Startete bei 120 Token/Sekunde, fiel auf 80 Token/Sekunde ab
- Qwen3.5-27B-FP8: Startete bei 20 Token/Sekunde, sank leicht auf 18 Token/Sekunde
OpenClaw-Agenten-Skalierung
OpenClaw kann Agententeams mit sechs Agenten gleichzeitig ausführen, und die Geschwindigkeit skaliert bis zu 120 Token/Sekunde. Der Tester äußerte Überraschung über dieses Skalierungsverhalten.
Der genannte Nachteil ist, dass die Single-Thread-Leistung mit dieser Konfiguration langsam ist.
MTP-Optimierungshinweise
Das Aktivieren von MTP (Multi-Token Prediction) für das 27B-FP8-Modell kann die Generierungsgeschwindigkeit für einzelne Anfragen erheblich steigern:
- Auf einer einzelnen NVIDIA H100: Hält 100 Token/Sekunde mit 20K Kontextfenster
- Prefill-Geschwindigkeit für 64K Token: Unter 1 Sekunde
Wichtiger Hinweis: MTP steht im Konflikt mit Prefix-Caching und ist sehr VRAM-intensiv. Benutzer mit RTX 4090 sollten mit einer niedrigeren num-steps-Einstellung beginnen.
📖 Read the full source: r/openclaw
👀 Siehe auch

Claude-Code-Subagenten laden keine Fähigkeiten in Multi-Agenten-Systemen
Ein Entwickler berichtet, dass Subagenten in Claude Code v2.1.91 nicht auf Fähigkeiten zugreifen können, die im .claude/skills/-Verzeichnis definiert sind, obwohl diese Fähigkeiten in der Hauptsitzung einwandfrei funktionieren. Mehrere Ansätze – einschließlich Fähigkeiten in der Agent-Frontmatter, dem Skill-Tool, CLI-Flags und Agent Teams – schlagen alle fehl.

Was fehlt in der „agentischen“ Geschichte: eine klar definierte Benutzer-Agent-Rolle
Mark Nottingham argumentiert, dass aktuellen KI-Agenten eine klare Benutzeragenten-Rolle fehlt, was eine Vertrauenslücke zwischen den Erwartungen der Nutzer und dem tatsächlichen Verhalten der Agenten schafft.

Anthropics Geschäftsstrategie: API-Einnahmen führen zu Einschränkungen bei der Verbraucherstufe
Anthropics Verbraucherabonnement-Stufen operieren mit Verlust, subventioniert um KI-Marktanteil aufzubauen, während ihr API-Geschäft Umsatz generiert. Die 20-Dollar-Pro-Stufe ist absichtlich begrenzt, um Nutzer zu wertvolleren Max-Abonnements zu lenken.

Google Trends zeigt einen steigenden Suchinteresse für Claude Code Anfang 2026
Ein Reddit-Nutzer verglich die Google Trends-Suchanfragen der letzten Jahr für fünf Coding-Tools: Vibe Coding, Cursor, Claude Code, Codex und Replit. Der Aufstieg von Claude Code Anfang 2026 sticht in den Daten besonders hervor.