ProofShot CLI offre aux agents d'IA de codage des capacités de vérification par navigateur.

ProofShot : Vérification du navigateur pour les agents d'IA de codage
ProofShot est un CLI open-source et indépendant des agents qui donne aux agents d'IA de codage la capacité de vérifier les fonctionnalités de l'interface utilisateur qu'ils construisent en enregistrant des sessions de navigation, en capturant des captures d'écran et en collectant les erreurs. Il résout le problème où les agents écrivent du code mais ne peuvent pas voir à quoi il ressemble réellement dans le navigateur ou détecter les problèmes de mise en page et les erreurs de la console.
Comment ça fonctionne
L'outil suit un flux de travail en trois étapes : démarrer, tester, arrêter. L'agent d'IA pilote le navigateur en utilisant des commandes agent-browser pendant que ProofShot enregistre la session.
Utilisation de base :
proofshot start --run "npm run dev" --port 3000
# l'agent navigue, clique, prend des captures d'écran
proofshot stop
Exemple détaillé du flux de travail :
# 1. Démarrer — ouvrir le navigateur, commencer l'enregistrement, capturer les logs du serveur
proofshot start --run "npm run dev" --port 3000 --description "Vérification du formulaire de connexion"
2. Tester — l'agent d'IA pilote le navigateur
agent-browser snapshot -i # Voir les éléments interactifs
agent-browser open http://localhost:3000/login # Naviguer
agent-browser fill @e2 "[email protected]" # Remplir le formulaire
agent-browser click @e5 # Cliquer sur soumettre
agent-browser screenshot ./proofshot-artifacts/step-login.png # Capturer la preuve
3. Arrêter — regrouper la vidéo + captures d'écran + erreurs dans les artefacts de preuve
proofshot stop
Fonctionnalités principales
- Fonctionne avec tout agent d'IA de codage capable d'exécuter des commandes shell (Claude Code, Cursor, Codex, Gemini CLI, Windsurf, GitHub Copilot, etc.)
- Emballé en tant que compétence pour que les agents d'IA comprennent comment l'utiliser
- Basé sur agent-browser de Vercel Labs (décrit comme "bien meilleur et plus rapide que Playwright MCP")
- N'est pas un framework de test — ne décide pas de la réussite/échec, fournit seulement des preuves
- Génère des fichiers HTML autonomes avec vidéo, captures d'écran et logs
- Peut télécharger les artefacts vers les PR GitHub en tant que commentaires en ligne avec
proofshot pr
Installation et configuration
npm install -g proofshot
proofshot install
La première commande installe le CLI et agent-browser (avec Chromium headless). La seconde détecte vos outils de codage IA et installe la compétence ProofShot au niveau utilisateur — fonctionne automatiquement sur tous les projets.
Artefacts de sortie
Chaque session produit un dossier horodaté dans ./proofshot-artifacts/ contenant :
session.webm— Enregistrement vidéo de toute la sessionviewer.html— Visionneuse interactive autonome avec barre de défilement, chronologie et onglets Console/Logs serveurSUMMARY.md— Rapport Markdown avec erreurs, captures d'écran et vidéostep-*.png— Captures d'écran capturées aux moments cléssession-log.json— Chronologie des actions avec horodatages et données d'élémentsserver.log— Sortie stdout/stderr du serveur de développement (lors de l'utilisation de--run)console-output.log— Sortie de la console du navigateur
Commandes disponibles
proofshot install— Détecter les outils de codage IA et installer la compétence ProofShotproofshot start— Démarrer une session de vérification avec navigateur, enregistrement, capture d'erreursproofshot stop— Arrêter l'enregistrement, collecter les erreurs, générer les artefacts de preuveproofshot exec— Commande de transmission
L'outil est entièrement gratuit et open source, sans verrouillage fournisseur ni dépendance cloud. Il est conçu pour les développeurs qui utilisent des agents IA pour construire des fonctionnalités d'interface utilisateur et veulent vérifier les résultats sans ouvrir manuellement le navigateur à chaque fois.
📖 Read the full source: HN AI Agents
👀 See Also

Claudius : Widget de chat IA intégrable open-source pour Claude
Claudius est un widget de chat open-source et auto-hébergé alimenté par Claude qui peut être intégré sur n'importe quel site web avec une seule balise script. Il s'exécute sur Cloudflare Workers avec une interface React et comprend des fonctionnalités comme des invites système personnalisées, une limitation du débit et une conformité d'accessibilité.

AgentMind : Un Plugin Claude Code Qui Apprend et Applique Vos Préférences de Codage
AgentMind est un plugin Claude Code qui observe vos habitudes de codage, apprend vos préférences comme le choix des outils et les règles de style, et injecte automatiquement ce contexte dans les sessions futures. Il utilise une boucle principale en six étapes et un système de notation de confiance pour déterminer quand appliquer les préférences apprises.

Le Benchmark Montre que l'Outil CLI Réduit les Coûts de Tokens de Code de Claude de 32% Grâce à la Navigation Structurelle
Un développeur a créé un outil CLI en Rust qui donne aux agents Claude Code des commandes de navigation structurelle comme 'montre-moi un résumé de 180 tokens de cette classe de 6 000 tokens'. Le benchmarking sur Sonnet 4.6 sur 54 exécutions automatisées a montré une réduction de 32 % du coût par tâche et 67 % de modifications de code supplémentaires par session.

Steelman R5 : Le modèle 14B affiné surpasse Claude Opus pour la génération de code Ada
Un développeur a affiné Qwen2.5-Coder-14B-Instruct en utilisant QLoRA sur un ensemble de données vérifié par un compilateur contenant 3 430 paires d'instructions Ada/SPARK, obtenant un taux de compilation de 68,6 % sur un benchmark personnalisé contre 42,1 % pour Claude Opus 4.6. Le modèle est disponible via Ollama et tient dans 12 Go de VRAM.