Spec27: Валидация на основе спецификаций для ИИ-агентов – тестирование на уровне API без внутреннего доступа

Компания Safe Intelligence запустила Spec27 — инструмент проверки AI-агентов на основе спецификаций. В отличие от традиционных фреймворков оценки LLM, которые оценивают общее поведение модели, Spec27 позволяет командам определять многократно используемые спецификации для конкретной миссии агента. Тесты автоматически генерируются из этих спецификаций и выполняются только через основные интерфейсы агента — без предположений о внутреннем стеке, без необходимости в SDK или шлюзах.
Ключевые особенности
- Тестирование извне: Все тесты выполняются через открытый API или UI агента. Не требуется инструментировать внутренности агента, что критически важно для агентов на вендорских платформах, где вы не контролируете стек.
- Генерация тестов на основе спецификаций: Определите спецификации в терминах ожидаемого поведения (например, «при запросе X должно делать Y, но не Z»). Spec27 автоматически генерирует adversarial и робастные проверки, выявляя чувствительности и регрессии при изменении моделей, промптов или инструментов.
- Ранний доступ: В настоящее время наиболее эффективен для одношаговых агентов и валидации приложений. Многошаговые взаимодействия и более богатая телеметрия/интеграция вызовов инструментов находятся в дорожной карте.
Для кого это
Для команд, развертывающих внутренних агентов, вендорских агентов или любые AI-системы, где надежность важнее бенчмарков. Если вы тестируете агентов на платформах, не раскрывающих внутренности, черный ящик Spec27 решает эту проблему.
Начало работы
Spec27 открыт для тестирования читателями HN. На сайте запуска доступен пример, позволяющий исследовать инструмент без настройки. Зарегистрируйтесь на spec27.ai/launch.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Плагин Spectyra для OpenClaw: оптимизация затрат на ИИ в реальном времени за счет анализа полного потока запросов
Плагин Spectyra снижает затраты на AI API, выявляя в реальном времени скрытые потери, такие как повторные вызовы, избыточный контекст и неправильное использование дорогих моделей.

Сравнение RunLobster и размещенных решений OpenClaw
Разработчик тестировал RunLobster против KiwiClaw, xCloud и самостоятельно размещённого OpenClaw по 2 недели каждый. RunLobster принципиально отличается как продукт, а не просто хостинг, с 3000 интеграций в один клик и памятью, которая накапливается со временем.

TRELLIS.2 Image-to-3D адаптирован для нативной работы на Apple Silicon.
Разработчик портировал 4-миллиардную параметрическую модель TRELLIS.2 от Microsoft для преобразования изображений в 3D, чтобы она работала нативно на Apple Silicon через PyTorch MPS, заменив операции, специфичные для CUDA, на чисто PyTorch-альтернативы. Порт генерирует меши с ~400K вершин из одиночных фотографий примерно за 3,5 минуты на M4 Pro с 24 ГБ памяти.

Чернила: Платформа для Развертывания, Где Искусственный Интеллект Claude — Основной Пользователь
Ink (ml.ink) — это платформа для развертывания, предназначенная для ИИ-агентов, таких как Claude, с возможностью развертывания одним вызовом инструмента, автоматическим определением фреймворков и интегрированными сервисами, включая вычисления, базы данных, DNS, секреты, домены, метрики и логи.