Qwen3.5 35B-A3B MoE exécute un flux de travail agentique en 27 étapes localement sur du matériel de milieu de gamme

Démonstration d'un flux de travail agentique local
Un développeur sur r/LocalLLaMA a rapporté avoir exécuté avec succès un flux de travail agentique complexe localement en utilisant Qwen3.5 35B-A3B MoE. Le modèle a exécuté une chaîne de traitement vidéo en 27 étapes de manière autonome sur du matériel de gamme moyenne.
Détails du flux de travail
La tâche impliquait le traitement d'une vidéo à partir d'une seule instruction en langage naturel :
- Télécharger une vidéo
- Transcrire avec Whisper
- Modifier les sous-titres
- Intégrer les sous-titres dans la vidéo avec un style personnalisé
Le flux de travail comprenait 27 appels d'outils séquentiels incluant : extract_audio, transcribe, read_file, edit_file, burn_subtitles, ainsi que des étapes de vérification. Le modèle a planifié, exécuté, vérifié chaque étape et s'est auto-corrigé lorsque nécessaire.
Spécifications techniques
Matériel :
- Station de travail mobile Lenovo ThinkPad P53
- Processeur Intel i7-9850H
- Quadro RTX 3000 (6 Go de VRAM)
- 48 Go de RAM DDR4 2666 MT/s
Pile logicielle :
- Implémentation entièrement locale avec llama.cpp + whisper.cpp
- Aucune API cloud utilisée
Configuration du modèle :
- Qwen3.5 35B-A3B MoE en quantification Q4_K_M
- Architecture MoE avec ~3 milliards de paramètres actifs par token
- Tient et fonctionne sur 6 Go de VRAM avec des couches déchargées
- Base de connaissances complète de 35 milliards de paramètres
Résultats de performance
Le flux de travail complet s'est exécuté en environ 10 minutes, la plupart du temps étant consacré à l'inférence. Le développeur a noté zéro erreur et zéro intervention humaine requise pendant la chaîne de 27 étapes. L'architecture MoE a rendu cela réalisable sur du matériel de gamme moyenne en maintenant un faible nombre de paramètres actifs tout en conservant les capacités complètes du modèle.
Cela démontre que les flux de travail agentiques locaux deviennent pratiques sur du matériel grand public, en particulier avec les modèles MoE qui équilibrent le nombre de paramètres actifs pour la vitesse contre le nombre total de paramètres pour les capacités.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Expérience pratique de remplacement de la pile d'automation par des serveurs MCP et des LLM locaux
Un développeur partage les résultats de 4 mois d'utilisation d'une infrastructure d'automatisation personnelle avec des serveurs MCP utilisant les modèles Qwen 2.5 32B et Llama 3.3 70B sur un matériel à double 3090, détaillant ce qui fonctionne bien et ce qui ne fonctionne pas.

Utiliser Claude Haiku comme portier pour réduire les coûts de l'API Sonnet de 80 %
Un développeur a créé un pipeline en deux étapes utilisant Claude Haiku pour filtrer 85 % du texte non structuré avant d'envoyer uniquement le contenu pertinent à Claude Sonnet, réduisant les coûts d'API d'environ 80 % lors du traitement de milliers de commentaires.

L'utilisateur d'OpenClaw automatise la mise en forme de contenu multiplateforme avec une compétence personnalisée.
Un développeur a créé une compétence OpenClaw qui formate automatiquement les brouillons bruts pour plusieurs plateformes, éliminant les ajustements manuels de markdown pour les exigences spécifiques de chaque site.

Claude comme assistant d'écriture de mémoires pour un utilisateur de 80 ans : cas d'usage pratiques et limites
Un utilisateur de 80 ans décrit l'utilisation de Claude pour l'aide à la rédaction de mémoires, la gestion de problèmes techniques (hébergement, email, Mac Mini), la recherche de logiciels de comptabilité (hors QuickBooks), et la génération d'interprétations astrologiques — avec des remarques honnêtes sur la précision des calculs et la correction itérative.