MartinLoop : Plan de contrôle open source pour agents de codage IA avec plafonds budgétaires et pistes d'audit

✍️ OpenClawRadar📅 Publié: May 11, 2026🔗 Source
Ad

MartinLoop est un plan de contrôle open source pour les agents de codage IA qui répond aux modes de défaillance courants : réessayer la même approche erronée, terminer des tâches sans preuve, brûler des tokens silencieusement, apporter des modifications non vérifiables et échouer de manière difficile à classer. Il fournit des limites budgétaires strictes, des enregistrements JSONL, des pistes d'audit inspectables, une classification des échecs, une validation par tests et des exécutions de benchmarks reproductibles.

Fonctionnalités clés :

  • Limites budgétaires strictes — plafonner automatiquement les dépenses des agents.
  • Enregistrements JSONL — chaque étape est journalisée dans un format structuré.
  • Pistes d'audit inspectables — tout ingénieur peut examiner les actions de l'agent.
  • Classification des échecs — catégoriser la raison d'un échec (ex. boucle infinie, mauvaise approche).
  • Achèvement validé par tests — les agents doivent réussir des tests définis avant de déclarer la tâche terminée.
  • Benchmarks reproductibles — standardiser l'évaluation entre agents.

Le projet se positionne comme un CI/CD pour agents autonomes. Le cœur est open source sur GitHub : https://github.com/Keesan12/Martin-Loop. Une démo est disponible sur https://martinloop.com/demo.

Ad

Utile pour les équipes utilisant Claude Code, Codex, Cursor, les agents de type Devin ou les boucles d'agents personnalisées qui ont besoin de gouvernance, de budgets, d'évaluations et d'auditabilité sur leurs workflows de codage IA.

📖 Source : r/ClaudeAI

Ad

👀 See Also

Claude Hindsight : Outil d'observabilité pour les sessions de code Claude
Tools

Claude Hindsight : Outil d'observabilité pour les sessions de code Claude

Claude Hindsight est une couche d'observabilité open source pour Claude Code qui capture les appels d'outils, les tokens et les erreurs dans un tableau de bord explorable. Le créateur l'a utilisé pour refactoriser un projet open source en une seule session de 11 heures avec 733 appels d'outils et 692,8 millions de tokens en cache.

OpenClawRadar
Forge : un IDE basé sur Claude avec vérification automatisée et ADN de projet
Tools

Forge : un IDE basé sur Claude avec vérification automatisée et ADN de projet

Forge est un IDE basé sur Claude construit sur VS Code qui exécute automatiquement la vérification des types, les tests, les contrôles de couverture et la validation des imports avant d'afficher le code. Il inclut des boucles d'auto-réparation pour les échecs de vérification et construit un ADN de projet des modèles de votre base de code.

OpenClawRadar
Exécuteur de benchmarks open-source pour tester les agents OpenClaw sur des workflows réels
Tools

Exécuteur de benchmarks open-source pour tester les agents OpenClaw sur des workflows réels

Un nouveau projet open-source permet de comparer les agents OpenClaw sur vos propres tâches réelles et privées définies en YAML, avec la possibilité d'importer les espaces de travail réels des agents.

OpenClawRadar
OmniCoder-9B affiné démontre de solides performances pour le codage agentique sur des systèmes dotés de 8 Go de VRAM.
Tools

OmniCoder-9B affiné démontre de solides performances pour le codage agentique sur des systèmes dotés de 8 Go de VRAM.

Un utilisateur de Reddit a testé OmniCoder-9B, une version affinée de Qwen3.5-9B sur des traces Opus, avec OpenCode et a rapporté des vitesses de plus de 40 tokens par seconde en utilisant la quantification GGUF Q4_K_M avec une longueur de contexte de 100k sur un système avec 8 Go de VRAM.

OpenClawRadar