Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 28. Februar 2026🔗 Source
Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten
Ad

Leistungsbenchmarks aus Community-Tests

Community-Tests wurden mit einer einzelnen modifizierten RTX 4090 GPU mit 48GB VRAM durchgeführt. Die offiziellen Modelle Qwen3.5-35B-A3B-FP8 und Qwen3.5-27B-FP8 wurden mit einer Kontextlänge von 256K getestet.

Framework-Empfehlungen

SGLang wird empfohlen als einziges Framework, das Prefix-Caching vollständig unterstützt, was für die hybride Aufmerksamkeitsarchitektur von Qwen3.5 entscheidend ist.

  • Für 100K Kontext: Cold-Start-Prefill dauert etwa 10 Sekunden
  • Mit Caching: Prefill sinkt auf 200ms
  • Ergebnis: Sehr niedrige Latenz für das erste Token und extrem schnelle Ausgabe

Modellleistungsmetriken

  • Qwen3.5-35B-A3B-FP8: Startete bei 120 Token/Sekunde, fiel auf 80 Token/Sekunde ab
  • Qwen3.5-27B-FP8: Startete bei 20 Token/Sekunde, sank leicht auf 18 Token/Sekunde
Ad

OpenClaw-Agenten-Skalierung

OpenClaw kann Agententeams mit sechs Agenten gleichzeitig ausführen, und die Geschwindigkeit skaliert bis zu 120 Token/Sekunde. Der Tester äußerte Überraschung über dieses Skalierungsverhalten.

Der genannte Nachteil ist, dass die Single-Thread-Leistung mit dieser Konfiguration langsam ist.

MTP-Optimierungshinweise

Das Aktivieren von MTP (Multi-Token Prediction) für das 27B-FP8-Modell kann die Generierungsgeschwindigkeit für einzelne Anfragen erheblich steigern:

  • Auf einer einzelnen NVIDIA H100: Hält 100 Token/Sekunde mit 20K Kontextfenster
  • Prefill-Geschwindigkeit für 64K Token: Unter 1 Sekunde

Wichtiger Hinweis: MTP steht im Konflikt mit Prefix-Caching und ist sehr VRAM-intensiv. Benutzer mit RTX 4090 sollten mit einer niedrigeren num-steps-Einstellung beginnen.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Ubuntu Linux integriert im nächsten Jahr KI-Funktionen, beginnend mit lokalem Inferencing
Nachrichten

Ubuntu Linux integriert im nächsten Jahr KI-Funktionen, beginnend mit lokalem Inferencing

Canonical kündigt einen mehrjährigen KI-Vorstoß für Ubuntu an, mit Fokus auf lokale Inferenz, agentische Workflows und kontextbewusste OS-Funktionen, die im Laufe des Jahres 2026 ausgerollt werden.

OpenClawRadar
🦀
Nachrichten

KI-Produktivitätsgewinne führen im Energie-Wirtschaftsmodell zu einem Netto-Anstieg der CO₂-Emissionen

Eine neue Studie modelliert KI als bidirektionalen Produktivitätsverstärker in einem globalen Energie-Wirtschaftsmodell und findet, dass ermöglichte Emissionen aus Produktivitätssteigerungen bei fossilen Brennstoffen die vermiedenen Emissionen aus erneuerbaren Energien übersteigen, es sei denn, die Gewinne bei erneuerbaren Energien sind 4–5× größer.

OpenClawRadar
Claude-Code-Subagenten laden keine Fähigkeiten in Multi-Agenten-Systemen
Nachrichten

Claude-Code-Subagenten laden keine Fähigkeiten in Multi-Agenten-Systemen

Ein Entwickler berichtet, dass Subagenten in Claude Code v2.1.91 nicht auf Fähigkeiten zugreifen können, die im .claude/skills/-Verzeichnis definiert sind, obwohl diese Fähigkeiten in der Hauptsitzung einwandfrei funktionieren. Mehrere Ansätze – einschließlich Fähigkeiten in der Agent-Frontmatter, dem Skill-Tool, CLI-Flags und Agent Teams – schlagen alle fehl.

OpenClawRadar
OpenClaw 2026.3.11 Release fügt lokale Ollama-Einrichtung, vereinheitlichte OpenCode-Schlüssel und multimodalen Speicher hinzu.
Nachrichten

OpenClaw 2026.3.11 Release fügt lokale Ollama-Einrichtung, vereinheitlichte OpenCode-Schlüssel und multimodalen Speicher hinzu.

OpenClaw 2026.3.11 führt ein erstklassiges Ollama-Setup mit rein lokalen oder hybriden Modi ein, vereinheitlichtes OpenCode-Schlüsselmanagement für Zen- und Go-Modelle sowie multimodale Bild-/Audio-Indizierung mit Gemini-Embeddings.

OpenClawRadar