Dirac : un agent open-source domine TerminalBench avec 65,2 %, moins cher et ouvert

✍️ OpenClawRadar📅 Publié: April 27, 2026🔗 Source
Dirac : un agent open-source domine TerminalBench avec 65,2 %, moins cher et ouvert
Ad

Dirac est un agent de codage open-source qui vient de prendre la tête du classement TerminalBench 2.0 pour gemini-3-flash-preview avec un score de 65,2 %, battant le socle officiel de Google de 47,6 % et le précédent meilleur agent propriétaire Junie CLI avec 64,3 %. L'exécution a été entièrement open-source, sans fichiers AGENTS.md spécifiques au benchmark ni autre mécanisme de triche. Le mainteneur a soumis une pull request au classement il y a 8 jours, mais n'a pas reçu de réponse en raison du retard.

Fonctionnalités clés

  • Éditions parallèles ancrées par hachage pour des modifications de code efficaces et précises.
  • Manipulation AST pour comprendre et transformer le code structurellement.
  • Curatation du contexte pour garder un contexte bien ciblé, améliorant la précision et réduisant les coûts — revendique une réduction moyenne des coûts de 64,8 % par rapport aux autres agents.
  • Pas de MCP (Model Context Protocol) — un outillage simple.
Ad

Résultats TerminalBench 2.0

Score sur gemini-3-flash-preview : 65,2 % contre 47,6 % pour Google et 64,3 % pour Junie CLI. L'exécution a été conforme au classement (aucune modification des ressources ou des délais d'attente). Tout le code est sur GitHub — aucune différence entre ce qui a été exécuté et ce qui est public.

Comparaison des coûts

Le coût moyen par tâche de Dirac sur 8 benchmarks (face à Cline, Kilo, Ohmypi, Opencode, Pimono, Roo) était de 0,18 $, contre 0,38 $ pour le suivant. Soit une réduction de 64,8 %, ou 2,8 fois moins cher. Par exemple, Task1 (transformers, 8 fichiers) a coûté 0,13 $ contre 0,37 $ pour Cline. Task6 (transformers, 25 fichiers) a coûté 0,34 $ contre 0,94 $ pour Ohmypi.

Installation et utilisation

Clonez le dépôt et suivez les instructions d'installation dans le README.md. L'agent fonctionne comme un outil en ligne de commande. Aucune configuration particulière autre que Node.js et les clés API pour le modèle choisi.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Plugin Claude Code pour les Campagnes de D&D Utilisant le Suivi d'État en Markdown
Tools

Plugin Claude Code pour les Campagnes de D&D Utilisant le Suivi d'État en Markdown

Un plugin Claude Code utilise des fichiers markdown pour suivre l'état de la campagne et permet à Claude de jouer le rôle de Maître du Donjon pour des sessions de D&D en solo. Le système est gratuit et open-source, nécessitant une installation en tant que plugin suivie de la commande /claude-dnd:new-campaign pour démarrer.

OpenClawRadar
Claude Code v2.1.229 : Contrôle à distance, places de marché de plugins et correctifs critiques
Tools

Claude Code v2.1.229 : Contrôle à distance, places de marché de plugins et correctifs critiques

Claude Code v2.1.229 ajoute le contrôle à distance --continue, les sources de commandes de la place de marché de plugins, les keepalives SSE, et corrige des plantages, OAuth MCP et les fuites de surveillance de fichiers.

OpenClawRadar
Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.
Tools

Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.

MemAware est un benchmark avec 900 questions réparties sur 3 niveaux de difficulté qui teste si les assistants IA dotés de mémoire peuvent faire remonter un contexte pertinent lorsque les requêtes ne le suggèrent pas. Les résultats montrent que la recherche BM25 a obtenu 2,8 % contre 0,8 % sans mémoire, tandis que la recherche vectorielle chute à 0,7 % sur les connexions inter-domaines.

OpenClawRadar
Projet d'autorecherche de Karpathy : des agents IA exécutent des expériences d'entraînement de LLM pendant la nuit.
Tools

Projet d'autorecherche de Karpathy : des agents IA exécutent des expériences d'entraînement de LLM pendant la nuit.

Andrej Karpathy a publié un projet d'autorecherche minimal où un agent IA modifie train.py, exécute des expériences d'entraînement nanochat de 5 minutes, vérifie si val_bpb s'est amélioré, et répète le processus pendant la nuit sur un seul GPU.

OpenClawRadar