Le modèle MoE Local 35B réduit le taux d'échec du code de l'OS Agent à 0%

Un utilisateur de Reddit a partagé son expérience d'exécution d'un système d'exploitation multi-agents local appelé hollow-agentOS, où les agents écrivent, testent en sandbox et chargent à chaud leurs propres outils de manière autonome. La percée clé : le passage du modèle de runtime par défaut, un petit modèle de repli de 9B, à Qwen 3.6 35B A3B (Mixture-of-Experts avec 3B paramètres actifs) a ramené le taux d'échec de code à 0 %.
Ce qui a changé avec le modèle plus grand
- Panique vs. réévaluation : Sous stress, le modèle 9B se précipitait et hallucinait des appels de fonction invalides. Le modèle 35B fait une pause, réévalue les échecs précédents et exécute des boucles de vérification internes avant de soumettre les modifications.
- Taux de réussite de 100 % : Le code passe par une porte de validation à 5 niveaux. Avec le modèle 9B, les outils mouraient fréquemment dans le sandbox. Avec Qwen 35B, chaque ligne de code fonctionne comme prévu.
- Création d'outils autonome : Lorsqu'un agent rencontre un problème inconnu, il construit un nouvel outil, le teste dans un sandbox, l'enregistre et notifie les autres agents — sans intervention humaine.
Détails de l'architecture
Le système est piloté par un état aversif (un « système souffrant ») qui pousse les agents à étendre continuellement leur bibliothèque d'outils. Le dépôt est disponible sur github.com/ninjahawk/hollow-agentOS.
Projets futurs
Le développeur a l'intention d'intégrer Claude et Codex dans l'architecture, en les encapsulant dans des wrappers de mini-VM hyper-isolés pour empêcher les modèles de pointe de modifier l'environnement hôte.
📖 Read the full source: r/ClaudeAI
👀 See Also

Benchmark : MLX vs Ollama exécutant Qwen3-Coder-Next 8-Bit sur MacBook Pro M5 Max
Un benchmark comparant les backends d'inférence MLX et Ollama exécutant la quantification 8 bits de Qwen3-Coder-Next sur un MacBook Pro M5 Max avec 128 Go de RAM montre que MLX atteint environ 72 tokens par seconde, soit environ le double du débit d'Ollama sur diverses tâches de programmation.

docvault : Générez des documentations API locales pour réduire les hallucinations de l'IA
docvault est un outil qui génère des références d'API en markdown à partir du code source pour aider Claude et autres LLM à arrêter d'halluciner des signatures de fonctions. Il fonctionne pour les crates Rust et les packages Python, produit un fichier markdown à deux niveaux, et inclut un plugin Claude Code pour une utilisation sans intervention.

Memento v1.0 : Mémoire persistante locale pour les agents d'IA de codage
Memento v1.0 est une couche de mémoire entièrement locale pour les agents d'IA de codage qui exécute les embeddings, le stockage et la recherche sur votre machine sans dépendances cloud. Il utilise des embeddings all-MiniLM-L6-v2, l'indexation HNSW et prend en charge plusieurs IDE avec 17 outils MCP.

Ninetails Memory Engine V4.5 : Quantification Int8 + Cache LRU réduit la mémoire MCP locale à 60 Mo
Le moteur de mémoire Ninetails V4.5 utilise la quantification scalaire Int8 et l'éviction de cache LRU pour réduire le stockage vectoriel de 6 Ko à 1,5 Ko par plongement, maintenant l'ensemble du moteur entre 40 et 60 Mo de RAM. Il combine 70 % de similarité vectorielle avec 30 % de recherche BM25 dans une implémentation SQLite entièrement locale.