Benchmark d'analyse de code par IA : Comparaison de Claude, Gemini, Codex, Qwen et MiniMax

Comparaison des performances de revue de code par IA
Une expérience récente a évalué cinq modèles d'IA phares pour la revue de code en utilisant 15 demandes de tirage de Milvus, une base de données vectorielle open source. Chaque PR contenait des bogues connus apparus en production après fusion, fournissant un ensemble de tests réaliste.
Modèles et configuration
Les modèles testés étaient :
- Claude Opus 4.6
- Gemini 3 Pro
- GPT-5.2-Codex
- Qwen-3.5-Plus
- MiniMax-M2.5
Le benchmark a utilisé Magpie, un outil open source qui prépare le contexte en récupérant le code environnant, les chaînes d'appel et les modules associés avant de les fournir au modèle.
Niveaux de difficulté des bogues
Les bogues ont été catégorisés par difficulté :
- L1 : Visibles uniquement à partir du diff (tous les modèles les ont détectés, donc exclus du score)
- L2 (10 cas) : Nécessite la compréhension du code environnant (changements d'interface, conditions de concurrence)
- L3 (5 cas) : Nécessite une compréhension au niveau système (incohérences entre modules, compatibilité des mises à jour)
Résultats par modèle
Deux modes d'évaluation ont été utilisés :
- Brut : Le modèle ne voit que le diff et le contenu de la PR
- R1 : Magpie fournit le contexte environnant
Taux de détection globaux (L2 + L3 uniquement) :
- Claude : 53 % brut, 47 % avec contexte
- Gemini : 13 % brut, 33 % avec contexte
- Codex : 33 % brut, 27 % avec contexte
- MiniMax : 27 % brut, 33 % avec contexte
- Qwen : 33 % brut, 40 % avec contexte
Principales conclusions
Claude a dominé la revue brute avec 53 % de détection et un score parfait de 5/5 sur les bogues L3. Il excelle à organiser son propre contexte, donc un contexte supplémentaire a en réalité réduit ses performances.
Gemini a obtenu de mauvais résultats en mode brut (13 %) mais s'est significativement amélioré avec le contexte (33 %), suggérant qu'il a besoin d'un contexte fourni d'emblée.
Qwen a été le meilleur performant assisté par contexte à 40 %, avec la plus haute détection de bogues L2 (5/10).
Résultats du débat contradictoire
Lorsque les modèles ont débattu les uns contre les autres pendant cinq tours, la détection des bogues est passée de 53 % (meilleur modèle individuel) à 80 %. Les bogues L3 les plus difficiles ont atteint 100 % de détection en mode débat.
L'expérience révèle que différents modèles ont des forces complémentaires : la rigueur de Claude, l'analyse orientée conception de Gemini lorsqu'on lui donne du contexte, les retours concrets et exploitables de Codex, et les solides performances assistées par contexte de Qwen.
📖 Lire la source complète : HN AI Agents
👀 See Also
Strata : une couche sémantique qui refuse les requêtes invalides avant que votre LLM ne les exécute
Strata est une couche sémantique full-stack conçue par un ancien ingénieur de Netflix qui valide et rejette les requêtes sémantiquement invalides avant leur exécution, avec un routage tenant compte des partitions vers ClickHouse, Druid, Snowflake et Athena.

Comparaison des systèmes d'IA multi-agents : Le modèle Harness d'Anthropic contre le modèle Engineering Org d'Agyn
Anthropic a publié une conception de harnais pour le développement d'applications de longue durée, tandis que le système multi-agents d'Agyn pour l'ingénierie logicielle autonome en équipe a été rendu open-source le mois dernier. Les deux systèmes rejettent les agents monolithiques au profit de la séparation des rôles, des transferts structurés et des boucles de révision.

Galerie d'Architecture LLM : Référence Visuelle pour les Conceptions de Modèles
La Galerie d'Architectures LLM de Sebastian Raschka rassemble des figures d'architecture et des fiches techniques issues de The Big LLM Architecture Comparison et de A Dream of Spring for Open-Weight LLMs, avec des spécifications détaillées pour des modèles comme Llama 3 8B, DeepSeek V3 et Gemma 3 27B.

Architecture de la Mémoire de Vektori : Principes du Système Fuité de Claude
Vektori met en œuvre un graphe de phrases hiérarchique à trois couches pour la mémoire IA, inspiré des principes divulgués de l'architecture de Claude. Le système utilise des filtres de qualité stricts, une récupération sceptique avec un score minimum de 0,3 et conserve l'historique des corrections entre les sessions.