Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 28. Februar 2026🔗 Source
Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten
Ad

Leistungsbenchmarks aus Community-Tests

Community-Tests wurden mit einer einzelnen modifizierten RTX 4090 GPU mit 48GB VRAM durchgeführt. Die offiziellen Modelle Qwen3.5-35B-A3B-FP8 und Qwen3.5-27B-FP8 wurden mit einer Kontextlänge von 256K getestet.

Framework-Empfehlungen

SGLang wird empfohlen als einziges Framework, das Prefix-Caching vollständig unterstützt, was für die hybride Aufmerksamkeitsarchitektur von Qwen3.5 entscheidend ist.

  • Für 100K Kontext: Cold-Start-Prefill dauert etwa 10 Sekunden
  • Mit Caching: Prefill sinkt auf 200ms
  • Ergebnis: Sehr niedrige Latenz für das erste Token und extrem schnelle Ausgabe

Modellleistungsmetriken

  • Qwen3.5-35B-A3B-FP8: Startete bei 120 Token/Sekunde, fiel auf 80 Token/Sekunde ab
  • Qwen3.5-27B-FP8: Startete bei 20 Token/Sekunde, sank leicht auf 18 Token/Sekunde
Ad

OpenClaw-Agenten-Skalierung

OpenClaw kann Agententeams mit sechs Agenten gleichzeitig ausführen, und die Geschwindigkeit skaliert bis zu 120 Token/Sekunde. Der Tester äußerte Überraschung über dieses Skalierungsverhalten.

Der genannte Nachteil ist, dass die Single-Thread-Leistung mit dieser Konfiguration langsam ist.

MTP-Optimierungshinweise

Das Aktivieren von MTP (Multi-Token Prediction) für das 27B-FP8-Modell kann die Generierungsgeschwindigkeit für einzelne Anfragen erheblich steigern:

  • Auf einer einzelnen NVIDIA H100: Hält 100 Token/Sekunde mit 20K Kontextfenster
  • Prefill-Geschwindigkeit für 64K Token: Unter 1 Sekunde

Wichtiger Hinweis: MTP steht im Konflikt mit Prefix-Caching und ist sehr VRAM-intensiv. Benutzer mit RTX 4090 sollten mit einer niedrigeren num-steps-Einstellung beginnen.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Claude Opus 4.6 blockiert den Kaggle-Wettbewerbs-Workflow für Code-Review
Nachrichten

Claude Opus 4.6 blockiert den Kaggle-Wettbewerbs-Workflow für Code-Review

Ein Entwickler berichtet, dass Claude Opus 4.6 nun legitime Kaggle-Wettbewerbsabläufe blockiert, bei denen Claude Argumentationsspuren für die Validierung von SFT-Trainingsdaten prüft. Der Nutzer arbeitete an der NVIDIA Nemotron Reasoning Challenge, als Sicherheitsfilter Beispiele für Substitutionschiffren markierten.

OpenClawRadar
4 Monate, $950 MRR: Bau eines MCP-Servers für Claude Code Intel
Nachrichten

4 Monate, $950 MRR: Bau eines MCP-Servers für Claude Code Intel

Ein Solo-Entwickler hat einen MCP-Server für Codebase-Intelligenz gebaut, in 4 Monaten $950 MRR mit 54 Nutzern erreicht und dabei 8-10 Stunden nach einem Tagjob gearbeitet. Keine Anzeigen, kein Growth Hacking – nur Reddit und Medium.

OpenClawRadar
Die Claude API verzeichnete am 25. Februar 2026 bei mehreren Modellen erhöhte Fehlerraten.
Nachrichten

Die Claude API verzeichnete am 25. Februar 2026 bei mehreren Modellen erhöhte Fehlerraten.

Claudes API unter api.anthropic.com verzeichnete am 25. Februar 2026 erhöhte Fehlerraten bei mehreren Modellen. Die Untersuchung begann um 17:15 UTC und die Lösung wurde um 17:46 UTC bestätigt.

OpenClawRadar
Yann LeCun bei der UN: Open-Source-KI ist der einzige Weg nach vorne für globale Souveränität
Nachrichten

Yann LeCun bei der UN: Open-Source-KI ist der einzige Weg nach vorne für globale Souveränität

Auf der UN Open Source Week argumentierte Yann LeCun, dass proprietäre KI zu teuer und zu zentralisiert sei, und schlug eine föderierte Open-Source-Plattform namens Project Tapestry vor, bei der Länder über Parametervektoren Daten beisteuern, ohne Rohdaten zu teilen.

OpenClawRadar