Spec27 : Validation pilotée par spécifications pour les agents d’IA – Tests au niveau de l’API sans accès interne

Safe Intelligence a lancé Spec27, un outil de validation piloté par spécifications pour les agents IA. Contrairement aux frameworks d'évaluation LLM traditionnels qui notent le comportement général du modèle, Spec27 permet aux équipes de définir des spécifications réutilisables pour la mission spécifique qu'un agent doit accomplir. Les tests sont générés automatiquement à partir de ces spécifications et exécutés uniquement sur les interfaces principales de l'agent — sans hypothèse sur la pile interne, sans nécessiter de SDK ou de passerelles.
Fonctionnalités clés
- Tests de l'extérieur : Tous les tests s'exécutent contre l'API ou l'interface utilisateur exposée de l'agent. Pas besoin d'instrumenter les composants internes de l'agent, ce qui est crucial pour les agents construits sur des plateformes fournisseurs où vous ne contrôlez pas la pile.
- Génération de tests pilotée par spécifications : Définissez des spécifications en termes de comportement attendu (par exemple, "quand on demande X, doit faire Y et non Z"). Spec27 génère automatiquement des vérifications adverses et de robustesse, révélant les sensibilités et régressions à mesure que les modèles, invites ou outils changent.
- Accès anticipé : Actuellement le plus performant pour la validation d'agents et d'applications à tour unique. Les interactions multi-tours et une télémétrie/intégration d'appels d'outils plus riches sont sur la feuille de route.
À qui s'adresse-t-il
Les équipes déployant des agents internes, des agents fournisseurs, ou tout système IA où la fiabilité compte plus que les scores de référence. Si vous testez des agents sur des plateformes qui n'exposent pas les éléments internes, l'approche en boîte noire de Spec27 répond directement à ce besoin.
Pour commencer
Spec27 est ouvert à l'essai pour les lecteurs de HN. Le site de lancement propose un flux d'exemple pour explorer sans configuration. Inscrivez-vous sur spec27.ai/launch.
📖 Lire la source complète : HN AI Agents
👀 See Also

Krasis LLM Runtime présente des améliorations de vitesse de 8,9x en préremplissage et de 4,7x en décodage par rapport à Llama.cpp.
Le runtime LLM Krasis exécute désormais entièrement le préremplissage et le décodage sur GPU avec différentes stratégies d'optimisation, obtenant un préremplissage 8,9 fois plus rapide et un décodage 4,7 fois plus rapide que llama.cpp sur Qwen3.5-122B avec un seul GPU 5090.

Agent de revue PR open source PrixAI détecte 10/10 bugs plantés à un coût 6 fois inférieur à CodeRabbit
Un utilisateur de Reddit a créé PrixAI, un agent de revue de code open source qui utilise des modèles d'inférence locaux/peu coûteux pour égaler les fonctionnalités de CodeRabbit à un coût 6 fois moindre, détectant les 10 problèmes intentionnellement plantés dans une PR de test.

Clarc v1.0 : Système d'exploitation de flux de travail pour Claude Code avec 63 Agents et 249 Compétences
Clarc est une couche de plugin pour Claude Code qui fournit 63 sous-agents spécialisés, 249 compétences métier et 178 commandes slash pour les flux de travail de développement. L'installation se fait via npx avec prise en charge de plusieurs éditeurs, notamment Cursor et OpenCode.

Le plugin Open-source Claude Code capture les livres et les les convertit en Markdown structuré.
Un développeur a open-sourcé un plugin Claude Code qui capture automatiquement les pages de livres via des captures d'écran, effectue une OCR avec macOS Vision, et génère des fichiers Markdown structurés organisés par thème plutôt que par ordre des chapitres. L'outil prend en charge Kindle, Apple Books, Kindle Cloud Reader et les PDF scannés sur macOS.