Agent de codage Pi avec Qwen 35B Q2 : utilisation du système de fichiers comme mémoire externe et mise en place de gardes de contexte

✍️ OpenClawRadar📅 Publié: May 11, 2026🔗 Source
Agent de codage Pi avec Qwen 35B Q2 : utilisation du système de fichiers comme mémoire externe et mise en place de gardes de contexte
Ad

Un utilisateur de Reddit a partagé son approche de codage agentique avec des LLM locaux, construite sur l'agent de codage Pi avec Qwen 35B (quant Q2_K_XL via LM Studio). L'idée centrale : traiter le LLM comme un processeur logique, pas comme une base de données contextuelle. L'implémentation impose des garde-fous stricts à la frontière de l'API — le modèle ne peut pas les contourner.

Contraintes clés imposées par le système

  • Limite d'écriture/modification : Rejette toute sortie de plus de 100 lignes. Le modèle doit d'abord écrire un squelette, puis remplir une section à la fois. S'il tente de déverser un fichier complet, l'appel est bloqué avec des instructions pour diviser le travail.
  • Plafond du bloc de réflexion : Si le raisonnement du modèle dépasse 2000 caractères, il reçoit une correction pour écrire les conclusions sur le disque et passer à autre chose.
  • Surveillance du contexte : À 65 % d'utilisation du contexte, le modèle est invité à écrire son état dans des fichiers. À 80 %, tout s'arrête — le modèle écrit son « cerveau » sur le disque tant qu'il est encore cohérent.
  • Sortie persistante : Si le modèle donne une longue réponse sans écrire de fichier, il est invité à enregistrer les résultats dans un fichier d'étape. Rien ne reste uniquement dans le contexte.

Structure du cerveau externe

Le système utilise les répertoires .think/ et .plan/ comme mémoire externe du modèle. Chaque étape, décision et résultat est écrit dans un fichier. Lorsque le contexte se compresse, le modèle relit ses propres notes. L'objectif de la session est enregistré séparément dans _purpose.md et réinjecté après la compression du contexte, préservant le but initial.

Ad

Distillation des connaissances

Une commande /distill explore une base de code, construit un graphe d'importations, trie les fichiers topologiquement, et fait résumer chaque fichier par le modèle un par tour dans une base de connaissances. Le manifeste est divisé en pages de 50 fichiers pour ne pas consommer tout le contexte. Les utilisateurs peuvent déposer des fichiers comme svelte5-gotchas.md ou astro-gotchas.md dans un dossier de connaissances ; un appel LLM isolé sélectionne ceux qui sont pertinents pour la tâche en cours, et seul le contenu est injecté dans la conversation principale.

Résultat réel

L'utilisateur a demandé au modèle de construire un jeu de vol d'avion en Three.js. La première tentative a essayé d'écrire 652 lignes en un seul appel — le garde-fou l'a rejetée. Le modèle a replanifié, écrit un squelette, puis ajouté les fonctionnalités une modification à la fois. Le résultat final était un jeu fonctionnel avec modèle d'avion 3D, obstacles, HUD, mini-carte et écrans de démarrage/game over — le tout en quantification Q2.

La configuration complète fonctionne à la quantification Q2_K_XL comme minimum ; l'utilisateur note que Q4 ou Q8 devrait donner de meilleurs résultats. Le code est disponible sur GitHub : github.com/Kodrack/Pi-forge.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Claude Code Routines : Tâches Cloud Automatisées pour les Flux de Travail de Développement IA
Tools

Claude Code Routines : Tâches Cloud Automatisées pour les Flux de Travail de Développement IA

Les Routines Claude Code permettent aux développeurs de sauvegarder des configurations Claude Code sous forme de tâches automatisées qui s'exécutent sur l'infrastructure cloud gérée par Anthropic. Les routines prennent en charge des déclencheurs programmés, API et GitHub pour une exécution automatique de prompts sur des dépôts.

OpenClawRadar
Utiliser un LLM local comme sous-agent de code Claude pour réduire l'utilisation du contexte
Tools

Utiliser un LLM local comme sous-agent de code Claude pour réduire l'utilisation du contexte

Un développeur partage une méthode pour utiliser Claude Code afin de déléguer des tâches à un LLM local via l'API de LM Studio, en gardant le contenu des fichiers hors du contexte de Claude. L'approche utilise un script Python d'environ 120 lignes avec des appels d'outils pour lire les fichiers localement et renvoyer des résumés.

OpenClawRadar
Annonce de Flyto Indexer : Refactorisation de code IA améliorée avec analyse des dépendances sources
Tools

Annonce de Flyto Indexer : Refactorisation de code IA améliorée avec analyse des dépendances sources

Flyto Indexer, un serveur MCP, construit un graphe de symboles de votre base de code, aidant l'IA dans la refactorisation intelligente du code en analysant les dépendances et les sites d'appel.

OpenClawRadar
SkyClaw : Un environnement d'exécution d'agent ouvert écrit en Rust
Tools

SkyClaw : Un environnement d'exécution d'agent ouvert écrit en Rust

SkyClaw est un environnement d'exécution d'agent open-source écrit en Rust avec 34 nouvelles fonctionnalités réparties sur 7 phases de développement. Il inclut la sauvegarde de tâches, des files d'attente persistantes avec SQLite, l'exécution parallèle d'outils et la prise en charge du multi-locataire.

OpenClawRadar