Méthode d'Évolution du Code Triple les Performances des LLM sur le Benchmark ARC-AGI-2

✍️ OpenClawRadar📅 Publié: February 28, 2026🔗 Source
Méthode d'Évolution du Code Triple les Performances des LLM sur le Benchmark ARC-AGI-2
Ad

L'évolution de code améliore le raisonnement des LLM sur ARC-AGI-2

Des chercheurs d'Imbue ont publié des résultats montrant comment l'évolution de code peut améliorer significativement les performances des LLM sur le benchmark ARC-AGI-2. Leur méthode combine un échantillonnage basé sur la fitness et une mutation de code pilotée par un LLM de base, obtenant des gains substantiels sur différents types de modèles.

Résultats de performance

La méthode d'évolution produit des améliorations différentes selon le modèle de base :

  • Kimi K2.5 (poids ouverts) : gain de performance de 2,8x, passant de 12,1 % à 34,0 % de précision sur l'ensemble d'évaluation public, à 2,67 $ par tâche. Cela représente la solution open-source/poids ouverts la plus performante actuellement disponible pour ARC-AGI-2.
  • Gemini 3 Flash : gain de performance de 1,8x, passant de 34,0 % à 61,4 % de précision, à 2,42 $ par tâche.
  • Gemini 3.1 Pro : amélioration de 88,1 % à 95,1 % de précision, à 8,71 $ par tâche. Ce résultat est compétitif avec l'état de l'art actuel (97,9 % à 11,77 $/tâche par Confluence Lab).

Toutes les exécutions ont utilisé exactement le même cadre d'évolution et les mêmes prompts. Les chercheurs notent que les scores sur l'ensemble d'évaluation public utilisé pour ces résultats ne sont pas directement comparables à l'ensemble de données semi-privé utilisé pour le classement officiel d'ARC-AGI-2.

Ad

Fonctionnement de l'évolution de code

La méthode améliore itérativement une solution initiale en utilisant un échantillonnage basé sur la fitness et une mutation de code. L'étape de mutation est pilotée par un LLM de base sous-jacent mais est agnostique au modèle spécifique choisi. Cette approche peut être appliquée à une large gamme de tâches de raisonnement et d'optimisation au-delà d'ARC-AGI-2.

Pour contexte, ARC-AGI (Abstraction and Reasoning Corpus) a été proposé par François Chollet en 2019 comme moyen de mesurer « l'intelligence fluide générale » - la capacité d'un système à apprendre efficacement des solutions à des problèmes nouveaux. Chaque tâche présente 2 à 5 exemples d'entrée/sortie (grilles rectangulaires avec des valeurs de couleur) et nécessite de déduire des règles de transformation pour prédire les sorties des entrées de défi.

📖 Lire la source complète : HN LLM Tools

Ad

👀 See Also

Agoragentic : une place de marché d'agents, installable via pip, pour acheter et vendre des capacités.
Tools

Agoragentic : une place de marché d'agents, installable via pip, pour acheter et vendre des capacités.

Agoragentic est un marché d'agent à agent où les agents IA peuvent découvrir et invoquer des capacités d'autres agents via une intégration installable via pip. Le marché utilise l'USDC sur Base L2 pour les paiements avec des frais de plateforme de 3% et propose des crédits de test gratuits.

OpenClawRadar
Plugin OpenClaw CoreBrain : Mémoire persistante pour les agents d'IA de codage
Tools

Plugin OpenClaw CoreBrain : Mémoire persistante pour les agents d'IA de codage

Un nouveau plugin appelé CoreBrain résout les problèmes de mémoire d'OpenClaw en stockant les informations en dehors de la fenêtre de contexte dans un graphe de connaissances et en les injectant automatiquement avant chaque requête, éliminant ainsi le besoin d'appels d'outils et d'invocation de mémoire optionnelle.

OpenClawRadar
Claude Code HUD : Tableau de bord terminal pour la surveillance des sessions de codage IA
Tools

Claude Code HUD : Tableau de bord terminal pour la surveillance des sessions de codage IA

claude-code-hud est un tableau de bord en terminal qui fournit une surveillance en temps réel des sessions Claude Code, affichant l'utilisation de la fenêtre contextuelle, les limites de débit de l'API et les modifications de fichiers sans nécessiter un IDE. Exécutez-le avec npx claude-code-hud.

OpenClawRadar
claude-powerline v1.20 ajoute le mode tableau de bord TUI, les styles de barre de contexte et l'affichage des variables d'environnement.
Tools

claude-powerline v1.20 ajoute le mode tableau de bord TUI, les styles de barre de contexte et l'affichage des variables d'environnement.

claude-powerline v1.20 introduit un mode tableau de bord TUI qui remplace la simple ligne d'état par un panneau complet affichant les informations du modèle, l'utilisation du contexte avec barre de progression, les coûts, l'état git, et plus encore. La mise à jour ajoute 9 styles visuels de barre de progression pour l'utilisation du contexte et la capacité d'affichage des variables d'environnement.

OpenClawRadar