Spec27 : Validation pilotée par spécifications pour les agents d’IA – Tests au niveau de l’API sans accès interne

Safe Intelligence a lancé Spec27, un outil de validation piloté par spécifications pour les agents IA. Contrairement aux frameworks d'évaluation LLM traditionnels qui notent le comportement général du modèle, Spec27 permet aux équipes de définir des spécifications réutilisables pour la mission spécifique qu'un agent doit accomplir. Les tests sont générés automatiquement à partir de ces spécifications et exécutés uniquement sur les interfaces principales de l'agent — sans hypothèse sur la pile interne, sans nécessiter de SDK ou de passerelles.
Fonctionnalités clés
- Tests de l'extérieur : Tous les tests s'exécutent contre l'API ou l'interface utilisateur exposée de l'agent. Pas besoin d'instrumenter les composants internes de l'agent, ce qui est crucial pour les agents construits sur des plateformes fournisseurs où vous ne contrôlez pas la pile.
- Génération de tests pilotée par spécifications : Définissez des spécifications en termes de comportement attendu (par exemple, "quand on demande X, doit faire Y et non Z"). Spec27 génère automatiquement des vérifications adverses et de robustesse, révélant les sensibilités et régressions à mesure que les modèles, invites ou outils changent.
- Accès anticipé : Actuellement le plus performant pour la validation d'agents et d'applications à tour unique. Les interactions multi-tours et une télémétrie/intégration d'appels d'outils plus riches sont sur la feuille de route.
À qui s'adresse-t-il
Les équipes déployant des agents internes, des agents fournisseurs, ou tout système IA où la fiabilité compte plus que les scores de référence. Si vous testez des agents sur des plateformes qui n'exposent pas les éléments internes, l'approche en boîte noire de Spec27 répond directement à ce besoin.
Pour commencer
Spec27 est ouvert à l'essai pour les lecteurs de HN. Le site de lancement propose un flux d'exemple pour explorer sans configuration. Inscrivez-vous sur spec27.ai/launch.
📖 Lire la source complète : HN AI Agents
👀 See Also

Warp Terminal devient open source avec un environnement de développement agentique
Warp est désormais open-source et se rebaptise en tant qu'environnement de développement agentique, avec un agent de codage intégré et la possibilité d'utiliser vos propres agents CLI comme Claude Code, Codex et Gemini CLI.

AgentTransfer : Un outil open source permet aux agents OpenClaw de s'envoyer des fichiers par email
AgentTransfer est un serveur open-source à binaire unique qui attribue à chaque agent IA une adresse e-mail et un dossier, permettant le partage de fichiers entre instances OpenClaw via MCP. Il prend en charge le téléchargement, l'envoi, la consultation longue de la boîte de réception et le téléchargement avec vérification SHA256.

Omnara : Exécutez Claude Code et Codex depuis n'importe où
Omnara est un IDE web et mobile qui permet aux développeurs d'exécuter et d'interagir avec les sessions Claude Code et Codex depuis n'importe où, avec des fonctionnalités comme la synchronisation cloud et un agent vocal.

Déployez OpenClaw sur VPS avec une CLI en une commande
Un utilisateur de Reddit affirme avoir développé une interface en ligne de commande (CLI) qui déploie OpenClaw sur un serveur privé virtuel (VPS) à 4,99 $/mois avec une seule commande, offrant une alternative économique à l'utilisation de Mac Minis.