Le modèle MoE Local 35B réduit le taux d'échec du code de l'OS Agent à 0%

Un utilisateur de Reddit a partagé son expérience d'exécution d'un système d'exploitation multi-agents local appelé hollow-agentOS, où les agents écrivent, testent en sandbox et chargent à chaud leurs propres outils de manière autonome. La percée clé : le passage du modèle de runtime par défaut, un petit modèle de repli de 9B, à Qwen 3.6 35B A3B (Mixture-of-Experts avec 3B paramètres actifs) a ramené le taux d'échec de code à 0 %.
Ce qui a changé avec le modèle plus grand
- Panique vs. réévaluation : Sous stress, le modèle 9B se précipitait et hallucinait des appels de fonction invalides. Le modèle 35B fait une pause, réévalue les échecs précédents et exécute des boucles de vérification internes avant de soumettre les modifications.
- Taux de réussite de 100 % : Le code passe par une porte de validation à 5 niveaux. Avec le modèle 9B, les outils mouraient fréquemment dans le sandbox. Avec Qwen 35B, chaque ligne de code fonctionne comme prévu.
- Création d'outils autonome : Lorsqu'un agent rencontre un problème inconnu, il construit un nouvel outil, le teste dans un sandbox, l'enregistre et notifie les autres agents — sans intervention humaine.
Détails de l'architecture
Le système est piloté par un état aversif (un « système souffrant ») qui pousse les agents à étendre continuellement leur bibliothèque d'outils. Le dépôt est disponible sur github.com/ninjahawk/hollow-agentOS.
Projets futurs
Le développeur a l'intention d'intégrer Claude et Codex dans l'architecture, en les encapsulant dans des wrappers de mini-VM hyper-isolés pour empêcher les modèles de pointe de modifier l'environnement hôte.
📖 Read the full source: r/ClaudeAI
👀 See Also

Créer une application de production complète avec Claude : ce qui a fonctionné et ce qui n'a pas fonctionné
Un développeur backend senior sans expérience Flutter a conçu et livré une application de production complète (iOS + Android) en utilisant Claude comme outil principal pendant 2,5 mois. Détails sur le flux de travail, les échecs et pourquoi les tests étaient la porte de la qualité.

PromptFlow Voice : Parlez hindi, obtenez des invites structurées pour Claude Code — Construit avec Claude Code
Un développeur a utilisé Claude Code et Codex pour construire PromptFlow Voice — une application de bureau qui transforme la parole naturelle en hindi en prompts de développement structurés pour Claude Code, ou en e-mails prêts à être envoyés pour Gmail. La démo montre une requête vocale en hindi produisant un prompt en anglais pour Claude Code concernant une logique de reconnexion socket avec backoff exponentiel.
MTP + Mémoire Unifiée améliore l'inférence de llama.cpp de 30% sur RTX 5090
L'activation de la spéculation MTP avec GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 fait passer Qwen3.6-27B Q8_0 de 49 à 64 tok/s sur une RTX 5090 avec 128 Go de RAM système.

Expérience Utilisateur : Passer d'OpenClaw à l'Agent Hermes sur un LLM Local
Un développeur rapporte avoir basculé d'OpenClaw à Hermes Agent en utilisant Qwen3.5-9B sur une RX 9070 XT avec 16 Go de VRAM. Hermes a accompli une tâche complexe avec 5 appels d'outils corrects contre plus de 50 étapes pour OpenClaw, terminant 2 minutes 30 plus rapidement tout en conservant les fonctionnalités de RAG, d'appel d'outils et de mémoire persistante.