Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 28. Februar 2026🔗 Source
Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten
Ad

Leistungsbenchmarks aus Community-Tests

Community-Tests wurden mit einer einzelnen modifizierten RTX 4090 GPU mit 48GB VRAM durchgeführt. Die offiziellen Modelle Qwen3.5-35B-A3B-FP8 und Qwen3.5-27B-FP8 wurden mit einer Kontextlänge von 256K getestet.

Framework-Empfehlungen

SGLang wird empfohlen als einziges Framework, das Prefix-Caching vollständig unterstützt, was für die hybride Aufmerksamkeitsarchitektur von Qwen3.5 entscheidend ist.

  • Für 100K Kontext: Cold-Start-Prefill dauert etwa 10 Sekunden
  • Mit Caching: Prefill sinkt auf 200ms
  • Ergebnis: Sehr niedrige Latenz für das erste Token und extrem schnelle Ausgabe

Modellleistungsmetriken

  • Qwen3.5-35B-A3B-FP8: Startete bei 120 Token/Sekunde, fiel auf 80 Token/Sekunde ab
  • Qwen3.5-27B-FP8: Startete bei 20 Token/Sekunde, sank leicht auf 18 Token/Sekunde
Ad

OpenClaw-Agenten-Skalierung

OpenClaw kann Agententeams mit sechs Agenten gleichzeitig ausführen, und die Geschwindigkeit skaliert bis zu 120 Token/Sekunde. Der Tester äußerte Überraschung über dieses Skalierungsverhalten.

Der genannte Nachteil ist, dass die Single-Thread-Leistung mit dieser Konfiguration langsam ist.

MTP-Optimierungshinweise

Das Aktivieren von MTP (Multi-Token Prediction) für das 27B-FP8-Modell kann die Generierungsgeschwindigkeit für einzelne Anfragen erheblich steigern:

  • Auf einer einzelnen NVIDIA H100: Hält 100 Token/Sekunde mit 20K Kontextfenster
  • Prefill-Geschwindigkeit für 64K Token: Unter 1 Sekunde

Wichtiger Hinweis: MTP steht im Konflikt mit Prefix-Caching und ist sehr VRAM-intensiv. Benutzer mit RTX 4090 sollten mit einer niedrigeren num-steps-Einstellung beginnen.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Claude-Code-Subagenten laden keine Fähigkeiten in Multi-Agenten-Systemen
Nachrichten

Claude-Code-Subagenten laden keine Fähigkeiten in Multi-Agenten-Systemen

Ein Entwickler berichtet, dass Subagenten in Claude Code v2.1.91 nicht auf Fähigkeiten zugreifen können, die im .claude/skills/-Verzeichnis definiert sind, obwohl diese Fähigkeiten in der Hauptsitzung einwandfrei funktionieren. Mehrere Ansätze – einschließlich Fähigkeiten in der Agent-Frontmatter, dem Skill-Tool, CLI-Flags und Agent Teams – schlagen alle fehl.

OpenClawRadar
Was fehlt in der „agentischen“ Geschichte: eine klar definierte Benutzer-Agent-Rolle
Nachrichten

Was fehlt in der „agentischen“ Geschichte: eine klar definierte Benutzer-Agent-Rolle

Mark Nottingham argumentiert, dass aktuellen KI-Agenten eine klare Benutzeragenten-Rolle fehlt, was eine Vertrauenslücke zwischen den Erwartungen der Nutzer und dem tatsächlichen Verhalten der Agenten schafft.

OpenClawRadar
Anthropics Geschäftsstrategie: API-Einnahmen führen zu Einschränkungen bei der Verbraucherstufe
Nachrichten

Anthropics Geschäftsstrategie: API-Einnahmen führen zu Einschränkungen bei der Verbraucherstufe

Anthropics Verbraucherabonnement-Stufen operieren mit Verlust, subventioniert um KI-Marktanteil aufzubauen, während ihr API-Geschäft Umsatz generiert. Die 20-Dollar-Pro-Stufe ist absichtlich begrenzt, um Nutzer zu wertvolleren Max-Abonnements zu lenken.

OpenClawRadar
Google Trends zeigt einen steigenden Suchinteresse für Claude Code Anfang 2026
Nachrichten

Google Trends zeigt einen steigenden Suchinteresse für Claude Code Anfang 2026

Ein Reddit-Nutzer verglich die Google Trends-Suchanfragen der letzten Jahr für fünf Coding-Tools: Vibe Coding, Cursor, Claude Code, Codex und Replit. Der Aufstieg von Claude Code Anfang 2026 sticht in den Daten besonders hervor.

OpenClawRadar