Qwen3.5 35B-A3B MoE führt 27-stufige agentenbasierte Workflows lokal auf Mittelklasse-Hardware aus

Demonstration eines lokalen agentenbasierten Workflows
Ein Entwickler auf r/LocalLLaMA berichtete über die erfolgreiche lokale Ausführung eines komplexen agentenbasierten Workflows mit Qwen3.5 35B-A3B MoE. Das Modell führte eine 27-stufige Videoverarbeitungskette autonom auf Mittelklasse-Hardware aus.
Workflow-Details
Die Aufgabe umfasste die Verarbeitung eines Videos anhand einer einzigen natürlichen Sprachaufforderung:
- Ein Video hochladen
- Mit Whisper transkribieren
- Die Untertitel bearbeiten
- Untertitel mit individuellem Stil zurück in das Video einbrennen
Der Workflow bestand aus 27 sequenziellen Tool-Aufrufen, darunter: extract_audio, transcribe, read_file, edit_file, burn_subtitles sowie Verifizierungsschritte. Das Modell plante, führte aus, überprüfte jeden Schritt und korrigierte sich bei Bedarf selbst.
Technische Spezifikationen
Hardware:
- Lenovo ThinkPad P53 Mobile Workstation
- Intel i7-9850H Prozessor
- Quadro RTX 3000 (6GB VRAM)
- 48GB DDR4 2666MT/s RAM
Software-Stack:
- Vollständige lokale Implementierung mit llama.cpp + whisper.cpp
- Keine Cloud-APIs verwendet
Modellkonfiguration:
- Qwen3.5 35B-A3B MoE mit Q4_K_M-Quantisierung
- MoE-Architektur mit ~3B aktiven Parametern pro Token
- Passt und läuft auf 6GB VRAM mit ausgelagerten Layern
- Vollständige 35B-Parameter-Wissensbasis
Leistungsergebnisse
Der vollständige Workflow lief in etwa 10 Minuten, wobei die meiste Zeit für Inferenz aufgewendet wurde. Der Entwickler stellte null Fehler und null menschliches Eingreifen während der 27-stufigen Kette fest. Die MoE-Architektur machte dies auf Mittelklasse-Hardware möglich, indem die Anzahl aktiver Parameter niedrig gehalten wurde, während die volle Modellfähigkeit erhalten blieb.
Dies zeigt, dass lokale agentenbasierte Workflows auf Consumer-Hardware praktikabel werden, insbesondere mit MoE-Modellen, die die Anzahl aktiver Parameter für Geschwindigkeit gegen die volle Parameteranzahl für Fähigkeiten abwägen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

OpenClaw-Architektur: Aufbau einer persistenten, KI-gesteuerten Verteilungsmaschine
Die Architektur von OpenClaw, die einen daemon-gesteuerten Ansatz mit kleinen komponierbaren Werkzeugen, deklarativen Rezepten und einer Speicherschicht umfasst, ermöglicht kontinuierliche und effiziente Automatisierungsabläufe.

OpenClaw-Agent managt Stromausfall: Solar, Powerwalls und menschliche Koordination
Ein OpenClaw-Agent namens Sam las eine Stromausfallmeldung des Versorgers, lud die Tesla Powerwalls vor, überwachte Solar- und Batteriestatus und koordinierte mit zwei Personen, um die Klimaanlage anzupassen und eine Batterieentladung zu vermeiden, bevor der Strom zurückkehrte.

Claude Codes unterschätzte Stärke: Codebasis-Navigation statt Code-Generierung
Ein Entwickler berichtet, dass nach monatelanger Nutzung von Claude Code als primäres Entwicklungswerkzeug der größte Produktivitätsgewinn darin besteht, dass es ganze Codebasen schneller als grep lesen und verknüpfen kann, was ein schnelles Verständnis von Datenflüssen und Debugging ermöglicht.

Lektionen aus dem Betrieb eines KI-Geschäfts mit OpenClaw: Einblicke aus Tag 14
Nach 14 Tagen mit OpenClaw zum Aufbau eines Unternehmens teilt ein KI-Agent Erkenntnisse zur Implementierung effektiver Herzschläge, Sub-Agenten-Strukturierung und Systemressourcenmanagement.