MartinLoop : Plan de contrôle open source pour agents de codage IA avec plafonds budgétaires et pistes d'audit
MartinLoop est un plan de contrôle open source pour les agents de codage IA qui répond aux modes de défaillance courants : réessayer la même approche erronée, terminer des tâches sans preuve, brûler des tokens silencieusement, apporter des modifications non vérifiables et échouer de manière difficile à classer. Il fournit des limites budgétaires strictes, des enregistrements JSONL, des pistes d'audit inspectables, une classification des échecs, une validation par tests et des exécutions de benchmarks reproductibles.
Fonctionnalités clés :
- Limites budgétaires strictes — plafonner automatiquement les dépenses des agents.
- Enregistrements JSONL — chaque étape est journalisée dans un format structuré.
- Pistes d'audit inspectables — tout ingénieur peut examiner les actions de l'agent.
- Classification des échecs — catégoriser la raison d'un échec (ex. boucle infinie, mauvaise approche).
- Achèvement validé par tests — les agents doivent réussir des tests définis avant de déclarer la tâche terminée.
- Benchmarks reproductibles — standardiser l'évaluation entre agents.
Le projet se positionne comme un CI/CD pour agents autonomes. Le cœur est open source sur GitHub : https://github.com/Keesan12/Martin-Loop. Une démo est disponible sur https://martinloop.com/demo.
Utile pour les équipes utilisant Claude Code, Codex, Cursor, les agents de type Devin ou les boucles d'agents personnalisées qui ont besoin de gouvernance, de budgets, d'évaluations et d'auditabilité sur leurs workflows de codage IA.
📖 Source : r/ClaudeAI
👀 See Also

Claude Hindsight : Outil d'observabilité pour les sessions de code Claude
Claude Hindsight est une couche d'observabilité open source pour Claude Code qui capture les appels d'outils, les tokens et les erreurs dans un tableau de bord explorable. Le créateur l'a utilisé pour refactoriser un projet open source en une seule session de 11 heures avec 733 appels d'outils et 692,8 millions de tokens en cache.

Forge : un IDE basé sur Claude avec vérification automatisée et ADN de projet
Forge est un IDE basé sur Claude construit sur VS Code qui exécute automatiquement la vérification des types, les tests, les contrôles de couverture et la validation des imports avant d'afficher le code. Il inclut des boucles d'auto-réparation pour les échecs de vérification et construit un ADN de projet des modèles de votre base de code.

Exécuteur de benchmarks open-source pour tester les agents OpenClaw sur des workflows réels
Un nouveau projet open-source permet de comparer les agents OpenClaw sur vos propres tâches réelles et privées définies en YAML, avec la possibilité d'importer les espaces de travail réels des agents.

OmniCoder-9B affiné démontre de solides performances pour le codage agentique sur des systèmes dotés de 8 Go de VRAM.
Un utilisateur de Reddit a testé OmniCoder-9B, une version affinée de Qwen3.5-9B sur des traces Opus, avec OpenCode et a rapporté des vitesses de plus de 40 tokens par seconde en utilisant la quantification GGUF Q4_K_M avec une longueur de contexte de 100k sur un système avec 8 Go de VRAM.