Canary : Agent IA d'Assurance Qualité pour les Tests Automatisés Basés sur les Modifications de Code

Ce que fait Canary
Canary construit des agents IA qui se connectent à votre base de code pour comprendre la structure de l'application, y compris les routes, les contrôleurs et la logique de validation. Lorsque vous poussez une demande de fusion, il lit les différences, comprend l'intention derrière les changements, puis génère et exécute des tests sur votre application de prévisualisation pour vérifier les parcours utilisateurs réels de bout en bout.
Fonctionnalités clés
- Analyse les différences de PR pour comprendre ce qui a réellement changé
- Génère et exécute des tests pour chaque parcours utilisateur affecté
- Commente directement sur les PR avec les résultats des tests et les enregistrements d'écran
- Signale les comportements qui ne correspondent pas aux attentes
- Permet de déclencher des tests de parcours utilisateur spécifiques via les commentaires de PR
- Les tests générés à partir des PR peuvent être intégrés dans les suites de régression
- Créez des tests en donnant des instructions en anglais simple - Canary génère des suites de tests complètes à partir de votre base de code
- Planifie et exécute des tests en continu
Approche technique
Selon les fondateurs, ce n'est pas quelque chose qu'un seul modèle de base peut gérer seul. L'assurance qualité couvre plusieurs modalités : code source, DOM/ARIA, émulateurs de périphériques, vérifications visuelles, analyse d'enregistrement d'écran, journaux réseau/console et état du navigateur en direct. Le système nécessite des flottes de navigateurs personnalisées, des sessions utilisateur, des environnements éphémères, des fermes sur périphérique et un ensemencement de données pour exécuter les tests de manière fiable.
Détecter les effets de second ordre des changements de code nécessite un harnais spécialisé qui casse les applications de multiples façons possibles selon différents types d'utilisateurs, ce que les tests de parcours nominal ne couvriraient pas.
Résultats de référence
L'équipe a publié QA-Bench v0, la première référence pour la vérification de code. Ils ont testé leur agent d'assurance qualité spécialement conçu contre GPT 5.4, Claude Code (Opus 4.6) et Sonnet 4.6 sur 35 PR réels sur Grafana, Mattermost, Cal.com et Apache Superset. Les tests ont mesuré trois dimensions : Pertinence, Couverture et Cohérence.
La couverture a montré le plus grand écart de performance. Canary mène de :
- 11 points sur GPT 5.4
- 18 points sur Claude Code
- 26 points sur Sonnet 4.6
Exemple concret
Un client du secteur de la construction avait un flux de facturation où le montant dû déviait du total de la proposition initiale d'environ 1 600 $. Canary a détecté cette régression dans leur flux de facturation avant la mise en production.
Historique des fondateurs
Les fondateurs ont précédemment construit des outils de codage IA chez Windsurf, Cognition et Google. Ils ont observé que si les outils IA rendaient les équipes plus rapides à livrer, personne ne testait le comportement réel des utilisateurs avant la fusion, ce qui entraînait des problèmes en production dans les flux de paiement, d'authentification et de facturation.
📖 Read the full source: HN AI Agents
👀 See Also
MartinLoop : Plan de contrôle open source pour agents de codage IA avec plafonds budgétaires et pistes d'audit
MartinLoop est un plan de contrôle open source qui ajoute des limites budgétaires strictes, des pistes d'audit JSONL, une classification des échecs et des vérifications d'achèvement validées par des tests aux agents de codage IA.

La recherche hybride avec RRF améliore le système de mémoire de l'IA par rapport à la recherche vectorielle pure.
Un système de mémoire IA open-source utilisant PostgreSQL avec pgvector a constaté que la recherche vectorielle pure était insuffisante pour les correspondances exactes, il a donc ajouté la recherche en texte intégral et fusionné les résultats en utilisant la Fusion de Rangs Réciproque (RRF) avec k=60, plus un enrichissement des requêtes via un tokenizer.

Protocole de Mémoire d'Agent (AMP) : Spécification Ouverte pour la Mémoire Interopérable des Agents IA au-dessus de MCP
AMP définit une interface standard pour la mémoire persistante des agents compatibles MCP avec six verbes principaux : encoder, rappeler, oublier, consolider, épingler et statistiques. Comprend une suite de tests de conformité et une implémentation de référence.

Architecte d'Agent : Un Outil Gratuit Génère des Fichiers Complets d'Espace de Travail pour les Agents IA
Agent Architect est un outil interactif gratuit qui guide les utilisateurs à travers plus de 40 questions sur leur agent IA, puis compile le tout en un prompt formaté pour générer sept fichiers d'espace de travail de qualité production : SOUL.md, IDENTITY.md, AGENTS.md, OPERATIONS.md, TOOLS.md, MEMORY.md et HEARTBEAT.md.