Dirac : un agent open-source domine TerminalBench avec 65,2 %, moins cher et ouvert

Dirac est un agent de codage open-source qui vient de prendre la tête du classement TerminalBench 2.0 pour gemini-3-flash-preview avec un score de 65,2 %, battant le socle officiel de Google de 47,6 % et le précédent meilleur agent propriétaire Junie CLI avec 64,3 %. L'exécution a été entièrement open-source, sans fichiers AGENTS.md spécifiques au benchmark ni autre mécanisme de triche. Le mainteneur a soumis une pull request au classement il y a 8 jours, mais n'a pas reçu de réponse en raison du retard.
Fonctionnalités clés
- Éditions parallèles ancrées par hachage pour des modifications de code efficaces et précises.
- Manipulation AST pour comprendre et transformer le code structurellement.
- Curatation du contexte pour garder un contexte bien ciblé, améliorant la précision et réduisant les coûts — revendique une réduction moyenne des coûts de 64,8 % par rapport aux autres agents.
- Pas de MCP (Model Context Protocol) — un outillage simple.
Résultats TerminalBench 2.0
Score sur gemini-3-flash-preview : 65,2 % contre 47,6 % pour Google et 64,3 % pour Junie CLI. L'exécution a été conforme au classement (aucune modification des ressources ou des délais d'attente). Tout le code est sur GitHub — aucune différence entre ce qui a été exécuté et ce qui est public.
Comparaison des coûts
Le coût moyen par tâche de Dirac sur 8 benchmarks (face à Cline, Kilo, Ohmypi, Opencode, Pimono, Roo) était de 0,18 $, contre 0,38 $ pour le suivant. Soit une réduction de 64,8 %, ou 2,8 fois moins cher. Par exemple, Task1 (transformers, 8 fichiers) a coûté 0,13 $ contre 0,37 $ pour Cline. Task6 (transformers, 25 fichiers) a coûté 0,34 $ contre 0,94 $ pour Ohmypi.
Installation et utilisation
Clonez le dépôt et suivez les instructions d'installation dans le README.md. L'agent fonctionne comme un outil en ligne de commande. Aucune configuration particulière autre que Node.js et les clés API pour le modèle choisi.
📖 Lire la source complète : HN AI Agents
👀 See Also

MCP Memory Gateway : Un serveur MCP pour la mémoire persistante dans Claude Code
Un développeur a construit un serveur MCP appelé MCP Memory Gateway en utilisant Claude Code comme principal outil de développement. Il fournit à Claude Code une mémoire persistante entre les sessions grâce à la capture de retours, des règles de prévention et l'injection de contexte.

Framework multi-agent open-source extrait de la fuite du code Claude
Un développeur a extrait le système d'orchestration multi-agents du code source divulgué de Claude Code et l'a reconstruit en tant que framework open-source indépendant des modèles sous licence MIT. Le framework TypeScript de 8 000 lignes comprend la planification des tâches, la messagerie inter-agents et des outils intégrés.

Clawback : Implémentation basée sur des hooks des boucles de vérification de Claude divulguées
Clawback est un projet GitHub qui réimplémente les boucles de vérification de la fuite de source map de Claude sous forme de crochets mécaniques plutôt que de prompts. Il inclut des crochets d'arrêt, PreToolUse, PostToolUse et PostCompact qui ne peuvent pas être ignorés par le modèle sous pression de contexte.

Testreel : Génération de vidéos de démonstration programmatiques avec Claude Code
Testreel est un package npm qui génère des vidéos de démonstration de produits polies à partir de descriptions d'interactions JSON, YAML ou Playwright. Il crée des vidéos webm/mp4/gif avec des superpositions de curseur, des ondulations de clic et des arrière-plans dégradés.