Spec27: Validación basada en especificaciones para agentes de IA – Pruebas a nivel de API sin acceso interno

Safe Intelligence ha lanzado Spec27, una herramienta de validación basada en especificaciones para agentes de IA. A diferencia de los marcos de evaluación tradicionales de LLM que califican el comportamiento general del modelo, Spec27 permite a los equipos definir especificaciones reutilizables para la misión específica que debe cumplir un agente. Las pruebas se generan automáticamente a partir de esas especificaciones y se ejecutan solo contra las interfaces principales del agente, sin suposiciones sobre la pila interna, sin necesidad de SDK ni pasarelas.
Características Clave
- Pruebas de afuera hacia adentro: Todas las pruebas se ejecutan contra la API o la interfaz de usuario expuesta del agente. No es necesario instrumentar los componentes internos del agente, lo cual es crucial para agentes construidos en plataformas de proveedores donde no controlas la pila.
- Generación de pruebas basada en especificaciones: Define especificaciones en términos del comportamiento esperado (por ejemplo, "cuando se le pregunte X, debe hacer Y y no Z"). Spec27 genera automáticamente comprobaciones adversariales y de robustez, revelando sensibilidades y regresiones a medida que cambian los modelos, indicaciones o herramientas.
- Acceso temprano: Actualmente es más robusto para la validación de agentes y aplicaciones de un solo turno. Las interacciones de múltiples turnos y una telemetría/integración de llamadas a herramientas más rica están en la hoja de ruta.
¿Para Quién Es?
Equipos que despliegan agentes internos, agentes de proveedores o cualquier sistema de IA donde la fiabilidad importe más que las puntuaciones de referencia. Si estás probando agentes en plataformas que no exponen componentes internos, el enfoque de caja negra de Spec27 aborda directamente esa brecha.
Cómo Empezar
Spec27 está abierto para que los lectores de HN lo prueben. El sitio de lanzamiento ofrece un flujo de muestra para que puedas explorar sin configuración. Regístrate en spec27.ai/launch.
📖 Lee la fuente original: HN AI Agents
👀 Ver también

Clawion: Envoltorio de OpenClaw con soporte para Claude Max e integración con GitHub
Clawion es un envoltorio de OpenClaw que soporta Claude Max sin requerir una clave API. La configuración implica elegir una plantilla, conectar Telegram y desplegar un compañero de código con integración de GitHub para la creación automatizada de PR.

Ssemble MCP Server permite a Claude generar videos de formato corto desde YouTube.
Un nuevo servidor MCP para Ssemble AI Clipping permite a Claude crear videos estilo TikTok/Reels/Shorts a partir de URLs de YouTube con clips generados por IA, plantillas de subtítulos, pistas musicales y superposiciones. La configuración implica agregar configuración a Claude Desktop o usar un endpoint alojado.

Sylve: Un Plano de Gestión de FreeBSD para Virtualización, Contenedores y Almacenamiento
Sylve es un plano de gestión con licencia BSD-2 para FreeBSD que proporciona control unificado sobre máquinas virtuales Bhyve, FreeBSD Jails, almacenamiento ZFS y redes. Utiliza un modelo de consenso RAFT para la agrupación en clústeres e incluye gestión de recursos compartidos de Samba con automatización de instantáneas ZFS.

Orchino: Sistema Local de Orquestación Multi-Agente para Windows con Automatización Paralela de Navegador e Interfaz de Usuario
Orchino es un sistema local de orquestación multiagente para Windows que ejecuta tareas paralelas en el navegador y en Windows sin secuestrar la interfaz de usuario. Una demostración muestra a 4 agentes completando 'Buscar auriculares Sony en Flipkart y Amazon, enviar los resultados por correo electrónico, guardar en el Bloc de notas' en 29.5 segundos utilizando ejecución verdaderamente paralela.