Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten

Leistungsbenchmarks aus Community-Tests
Community-Tests wurden mit einer einzelnen modifizierten RTX 4090 GPU mit 48GB VRAM durchgeführt. Die offiziellen Modelle Qwen3.5-35B-A3B-FP8 und Qwen3.5-27B-FP8 wurden mit einer Kontextlänge von 256K getestet.
Framework-Empfehlungen
SGLang wird empfohlen als einziges Framework, das Prefix-Caching vollständig unterstützt, was für die hybride Aufmerksamkeitsarchitektur von Qwen3.5 entscheidend ist.
- Für 100K Kontext: Cold-Start-Prefill dauert etwa 10 Sekunden
- Mit Caching: Prefill sinkt auf 200ms
- Ergebnis: Sehr niedrige Latenz für das erste Token und extrem schnelle Ausgabe
Modellleistungsmetriken
- Qwen3.5-35B-A3B-FP8: Startete bei 120 Token/Sekunde, fiel auf 80 Token/Sekunde ab
- Qwen3.5-27B-FP8: Startete bei 20 Token/Sekunde, sank leicht auf 18 Token/Sekunde
OpenClaw-Agenten-Skalierung
OpenClaw kann Agententeams mit sechs Agenten gleichzeitig ausführen, und die Geschwindigkeit skaliert bis zu 120 Token/Sekunde. Der Tester äußerte Überraschung über dieses Skalierungsverhalten.
Der genannte Nachteil ist, dass die Single-Thread-Leistung mit dieser Konfiguration langsam ist.
MTP-Optimierungshinweise
Das Aktivieren von MTP (Multi-Token Prediction) für das 27B-FP8-Modell kann die Generierungsgeschwindigkeit für einzelne Anfragen erheblich steigern:
- Auf einer einzelnen NVIDIA H100: Hält 100 Token/Sekunde mit 20K Kontextfenster
- Prefill-Geschwindigkeit für 64K Token: Unter 1 Sekunde
Wichtiger Hinweis: MTP steht im Konflikt mit Prefix-Caching und ist sehr VRAM-intensiv. Benutzer mit RTX 4090 sollten mit einer niedrigeren num-steps-Einstellung beginnen.
📖 Read the full source: r/openclaw
👀 Siehe auch

Claude Opus 4.6 blockiert den Kaggle-Wettbewerbs-Workflow für Code-Review
Ein Entwickler berichtet, dass Claude Opus 4.6 nun legitime Kaggle-Wettbewerbsabläufe blockiert, bei denen Claude Argumentationsspuren für die Validierung von SFT-Trainingsdaten prüft. Der Nutzer arbeitete an der NVIDIA Nemotron Reasoning Challenge, als Sicherheitsfilter Beispiele für Substitutionschiffren markierten.

4 Monate, $950 MRR: Bau eines MCP-Servers für Claude Code Intel
Ein Solo-Entwickler hat einen MCP-Server für Codebase-Intelligenz gebaut, in 4 Monaten $950 MRR mit 54 Nutzern erreicht und dabei 8-10 Stunden nach einem Tagjob gearbeitet. Keine Anzeigen, kein Growth Hacking – nur Reddit und Medium.

Die Claude API verzeichnete am 25. Februar 2026 bei mehreren Modellen erhöhte Fehlerraten.
Claudes API unter api.anthropic.com verzeichnete am 25. Februar 2026 erhöhte Fehlerraten bei mehreren Modellen. Die Untersuchung begann um 17:15 UTC und die Lösung wurde um 17:46 UTC bestätigt.

Yann LeCun bei der UN: Open-Source-KI ist der einzige Weg nach vorne für globale Souveränität
Auf der UN Open Source Week argumentierte Yann LeCun, dass proprietäre KI zu teuer und zu zentralisiert sei, und schlug eine föderierte Open-Source-Plattform namens Project Tapestry vor, bei der Länder über Parametervektoren Daten beisteuern, ohne Rohdaten zu teilen.