altRAG : Remplacez la base de données vectorielle RAG par des fichiers pointeurs de 2 Ko pour les agents d'IA de codage

Ce que fait altRAG
altRAG résout le problème des agents de codage IA qui peinent avec de gros fichiers de compétences de 200KB en remplaçant la génération augmentée par récupération (RAG) de base de données vectorielle par une approche plus simple basée sur des pointeurs. L'outil crée un fichier squelette léger qui mappe les sections du document à leurs emplacements exacts, éliminant le besoin d'embeddings, de découpage ou de bases de données.
Comment ça fonctionne
altRAG scanne vos fichiers de compétences Markdown ou YAML et construit un fichier squelette TSV (extension .skt) qui mappe chaque section à son numéro de ligne exact et à son décalage d'octets. Ce fichier squelette fait environ 2KB.
Lorsque votre agent IA a besoin d'informations, il lit d'abord le fichier squelette, trouve la section spécifique dont il a besoin, puis lit uniquement ces lignes du document original. Cette approche est particulièrement efficace pour la documentation structurée où vous savez déjà où se trouvent les informations.
Fonctionnalités clés de la source
- Crée des fichiers squelettes de 2KB au lieu d'utiliser des bases de données vectorielles
- Fonctionne avec les fichiers de compétences Markdown et YAML
- Génère des fichiers squelettes au format TSV (extension .skt)
- Mappe les sections aux numéros de ligne exacts et aux décalages d'octets
- Zéro dépendance
- Nécessite Python 3.10+
- Sous licence MIT
Installation et configuration
L'installation est simple :
pip install altrag
altrag setupCompatibilité
L'outil fonctionne avec divers agents de codage IA, notamment Claude Code, Cursor, Copilot, Windsurf, Cline et Codex — essentiellement tout système capable de lire des fichiers.
Avantages du mode Plan
Le mode Plan bénéficie considérablement de cette approche. Selon la source, il permet aux agents de construire des arbres de compétences tout en utilisant un contexte précoce et sans encombrement pour créer des plans "presque chirurgicaux".
Cas d'utilisation
Cette approche est spécifiquement conçue pour la documentation structurée où les développeurs savent déjà où se trouvent les informations, rendant la RAG de base de données vectorielle excessive. Elle est particulièrement utile lorsque les agents IA doivent référencer des sections spécifiques de documentation sans charger des fichiers entiers dans le contexte.
📖 Read the full source: r/LocalLLaMA
👀 See Also

L'extension OpenClaw achemine les requêtes via Claude Code CLI plutôt que par l'API
Une extension OpenClaw lance le binaire CLI Claude en tant que sous-processus, acheminant les requêtes via Claude Code CLI au lieu de l'API Anthropic. Cela offre l'expérience complète de Claude Code au tarif forfaitaire d'un plan max.

La bibliothèque de workflows Claude suit et évalue désormais automatiquement les workflows issus de Reddit
Un index consultable et mis à jour automatiquement des workflows Claude et Claude Code provenant des principaux subreddits, avec étapes, artefacts et évaluations par la communauté.

mnemos : Une couche de mémoire persistante pour les agents de codage IA (Go, MCP-Natif, Pas de Python)
mnemos est une couche mémoire persistante native MCP pour agents de codage IA, écrite en Go. L'auteur a construit un vérificateur pour mesurer l'amélioration : +40% agrégé sur les scénarios de lecture, mais seulement 53% de taux de capture en écriture après des corrections itératives.

Benchmark Flash-MOE sur M5 Max : 12,99 tok/s avec Qwen3.5-397B
Un benchmark du modèle Qwen3.5 de 397 milliards de paramètres exécuté localement sur un MacBook Pro M5 Max avec 128 Go de RAM a atteint 12,99 tokens par seconde en utilisant une quantification 4 bits et cache-io-split 4, soit trois fois plus rapide que le benchmark original de 48 Go.