GitVelocity : L'IA évalue 50 000 PR et révèle des informations sur la complexité du code

✍️ OpenClawRadar📅 Publié: March 31, 2026🔗 Source
GitVelocity : L'IA évalue 50 000 PR et révèle des informations sur la complexité du code
Ad

Comment fonctionne GitVelocity

GitVelocity se connecte à vos dépôts GitHub, GitLab ou Bitbucket et utilise Claude (par défaut Sonnet 4.6, qui offre des performances quasi équivalentes à Opus 4.6 à moindre coût) pour analyser chaque pull request fusionnée. Chaque PR reçoit une note de 0 à 100 selon six dimensions :

  • Portée (0-20)
  • Architecture (0-20)
  • Implémentation (0-20)
  • Risque (0-20)
  • Qualité (0-15)
  • Performance/Sécurité (0-5)

Les scores des six dimensions sont additionnés, puis ajustés en fonction de la taille des modifications à l'aide d'un multiplicateur — une correction de 10 lignes obtient un score inférieur à une refactorisation de 500 lignes, même à complexité égale. La formule complète est disponible sur gitvelocity.dev/scoring-guide.

Principales conclusions tirées de plus de 50 000 PR

L'analyse de plus de 50 000 PR dans plusieurs langages a révélé plusieurs tendances contre-intuitives :

  • Les grosses PR n'obtiennent pas automatiquement un score élevé : Une migration de 800 lignes avec une faible complexité obtient un score inférieur à un changement architectural de 200 lignes. La taille vous donne le multiplicateur complet, mais le score de base doit encore le mériter.
  • Il est impossible d'obtenir un bon score sans tests : La dimension qualité (0-15) ne vous attribue pas de points sans couverture de tests. À niveaux d'expérience similaires, c'était le facteur de différenciation le plus clair entre les ingénieurs.
  • Les juniors ont commencé à surpasser certains seniors : Ils ont adopté plus rapidement les outils d'IA et se sont attaqués à des problèmes plus complexes. Une fois qu'ils ont pu voir leurs propres scores, ils ont visé plus haut.
  • Le code généré par l'IA est évalué de la même manière que le code écrit par l'homme : Le code, c'est du code. Un ingénieur qui utilise l'IA pour livrer un travail plus complexe et plus rapidement est plus productif, et ses scores reflètent cela.
Ad

Détails techniques de l'implémentation

La cohérence des scores était le problème technique le plus difficile. Sans exemples de référence ancrant chaque dimension, les scores de Claude variaient de plus de 15 points entre les exécutions. L'équipe a résolu ce problème en créant 18 ancres calibrées (trois par dimension à des niveaux bas/moyen/élevé), ce qui a réduit la variance à 2-4 points pour la même PR.

L'outil utilise un modèle BYOK (apportez votre propre clé API Anthropic) et coûte quelques centimes par PR. Aucun code source n'est stocké — les différences sont analysées et immédiatement supprimées.

Impact comportemental et fonctionnalités d'équipe

L'équipe a observé ce qu'elle appelle "l'effet Fitbit" — l'outil ne vous fait pas livrer un meilleur code, mais voir le score le fait. Les ingénieurs ont commencé à mentionner leurs propres scores lors de leurs entretiens individuels sans y être invités, car les chiffres correspondaient à ce qu'ils ressentaient déjà concernant leur travail.

Chaque score est entièrement visible par l'ingénieur qui a écrit la PR, avec des détails par dimension et des explications. Il n'y a pas de tableau de bord caché que la direction voit et pas les ingénieurs.

GitVelocity a récemment ajouté des références d'équipe (gitvelocity.dev/demo/benchmarks). Une fois que vous évaluez des PR, vous pouvez voir comment votre équipe se compare aux autres dans l'ensemble des données — environ 1 000 ingénieurs sur 60 équipes jusqu'à présent. Les équipes qui étaient sceptiques quant aux scores individuels sont devenues vraiment curieuses une fois qu'elles ont pu se mesurer au reste du domaine.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Comment Claude a aidé à rétro-concevoir les protocoles BLE de Garmin pour simuler un capteur de course natif
Tools

Comment Claude a aidé à rétro-concevoir les protocoles BLE de Garmin pour simuler un capteur de course natif

Un développeur a utilisé Claude pour rétro-concevoir les protocoles BLE non documentés de Garmin, faisant passer un ESP32 pour une ceinture HRM native — double identité et dynamique de course.

OpenClawRadar
Claude Code : Comment connecter votre frontend construit par IA à un véritable backend
Tools

Claude Code : Comment connecter votre frontend construit par IA à un véritable backend

Claude Code crée des interfaces soignées mais utilise souvent des données en dur. Voici quatre façons de le connecter à de véritables backends : API brutes, SDK, CLI et MCP.

OpenClawRadar
Système d'Étude à Contexte Ingénieurisé pour Claude Code Agissant en Tuteur Persistant
Tools

Système d'Étude à Contexte Ingénieurisé pour Claude Code Agissant en Tuteur Persistant

Un développeur a créé un système d'étude utilisant Claude Code qui suit les progrès entre les sessions, sonde la compréhension, travaille sur des exercices et s'adapte aux styles d'apprentissage. Le système utilise des fichiers markdown structurés pour façonner le comportement de l'agent et inclut des outils pour extraire des pages de manuels à partir de PDF.

OpenClawRadar
Claude Code Mastery : Le système de configuration open-source ajoute une mémoire persistante et des compétences organisées à l'interface CLI Claude Code.
Tools

Claude Code Mastery : Le système de configuration open-source ajoute une mémoire persistante et des compétences organisées à l'interface CLI Claude Code.

Claude Code Mastery est un système de configuration open-source qui ajoute une mémoire persistante entre les sessions, des crochets de cycle de vie intelligents et plus de 26 compétences sélectionnées à l'interface en ligne de commande Claude Code. Il inclut une Banque de Mémoire de 6 fichiers par projet, un lanceur sans configuration et une prise en charge multiplateforme.

OpenClawRadar