Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten

Leistungsbenchmarks aus Community-Tests
Community-Tests wurden mit einer einzelnen modifizierten RTX 4090 GPU mit 48GB VRAM durchgeführt. Die offiziellen Modelle Qwen3.5-35B-A3B-FP8 und Qwen3.5-27B-FP8 wurden mit einer Kontextlänge von 256K getestet.
Framework-Empfehlungen
SGLang wird empfohlen als einziges Framework, das Prefix-Caching vollständig unterstützt, was für die hybride Aufmerksamkeitsarchitektur von Qwen3.5 entscheidend ist.
- Für 100K Kontext: Cold-Start-Prefill dauert etwa 10 Sekunden
- Mit Caching: Prefill sinkt auf 200ms
- Ergebnis: Sehr niedrige Latenz für das erste Token und extrem schnelle Ausgabe
Modellleistungsmetriken
- Qwen3.5-35B-A3B-FP8: Startete bei 120 Token/Sekunde, fiel auf 80 Token/Sekunde ab
- Qwen3.5-27B-FP8: Startete bei 20 Token/Sekunde, sank leicht auf 18 Token/Sekunde
OpenClaw-Agenten-Skalierung
OpenClaw kann Agententeams mit sechs Agenten gleichzeitig ausführen, und die Geschwindigkeit skaliert bis zu 120 Token/Sekunde. Der Tester äußerte Überraschung über dieses Skalierungsverhalten.
Der genannte Nachteil ist, dass die Single-Thread-Leistung mit dieser Konfiguration langsam ist.
MTP-Optimierungshinweise
Das Aktivieren von MTP (Multi-Token Prediction) für das 27B-FP8-Modell kann die Generierungsgeschwindigkeit für einzelne Anfragen erheblich steigern:
- Auf einer einzelnen NVIDIA H100: Hält 100 Token/Sekunde mit 20K Kontextfenster
- Prefill-Geschwindigkeit für 64K Token: Unter 1 Sekunde
Wichtiger Hinweis: MTP steht im Konflikt mit Prefix-Caching und ist sehr VRAM-intensiv. Benutzer mit RTX 4090 sollten mit einer niedrigeren num-steps-Einstellung beginnen.
📖 Read the full source: r/openclaw
👀 Siehe auch

Ubuntu Linux integriert im nächsten Jahr KI-Funktionen, beginnend mit lokalem Inferencing
Canonical kündigt einen mehrjährigen KI-Vorstoß für Ubuntu an, mit Fokus auf lokale Inferenz, agentische Workflows und kontextbewusste OS-Funktionen, die im Laufe des Jahres 2026 ausgerollt werden.
KI-Produktivitätsgewinne führen im Energie-Wirtschaftsmodell zu einem Netto-Anstieg der CO₂-Emissionen
Eine neue Studie modelliert KI als bidirektionalen Produktivitätsverstärker in einem globalen Energie-Wirtschaftsmodell und findet, dass ermöglichte Emissionen aus Produktivitätssteigerungen bei fossilen Brennstoffen die vermiedenen Emissionen aus erneuerbaren Energien übersteigen, es sei denn, die Gewinne bei erneuerbaren Energien sind 4–5× größer.

Claude-Code-Subagenten laden keine Fähigkeiten in Multi-Agenten-Systemen
Ein Entwickler berichtet, dass Subagenten in Claude Code v2.1.91 nicht auf Fähigkeiten zugreifen können, die im .claude/skills/-Verzeichnis definiert sind, obwohl diese Fähigkeiten in der Hauptsitzung einwandfrei funktionieren. Mehrere Ansätze – einschließlich Fähigkeiten in der Agent-Frontmatter, dem Skill-Tool, CLI-Flags und Agent Teams – schlagen alle fehl.

OpenClaw 2026.3.11 Release fügt lokale Ollama-Einrichtung, vereinheitlichte OpenCode-Schlüssel und multimodalen Speicher hinzu.
OpenClaw 2026.3.11 führt ein erstklassiges Ollama-Setup mit rein lokalen oder hybriden Modi ein, vereinheitlichtes OpenCode-Schlüsselmanagement für Zen- und Go-Modelle sowie multimodale Bild-/Audio-Indizierung mit Gemini-Embeddings.