Spec27: Валидация на основе спецификаций для ИИ-агентов – тестирование на уровне API без внутреннего доступа

✍️ OpenClawRadar📅 Опубликовано: 30 апреля 2026 г.🔗 Source
Spec27: Валидация на основе спецификаций для ИИ-агентов – тестирование на уровне API без внутреннего доступа
Ad

Компания Safe Intelligence запустила Spec27 — инструмент проверки AI-агентов на основе спецификаций. В отличие от традиционных фреймворков оценки LLM, которые оценивают общее поведение модели, Spec27 позволяет командам определять многократно используемые спецификации для конкретной миссии агента. Тесты автоматически генерируются из этих спецификаций и выполняются только через основные интерфейсы агента — без предположений о внутреннем стеке, без необходимости в SDK или шлюзах.

Ключевые особенности

  • Тестирование извне: Все тесты выполняются через открытый API или UI агента. Не требуется инструментировать внутренности агента, что критически важно для агентов на вендорских платформах, где вы не контролируете стек.
  • Генерация тестов на основе спецификаций: Определите спецификации в терминах ожидаемого поведения (например, «при запросе X должно делать Y, но не Z»). Spec27 автоматически генерирует adversarial и робастные проверки, выявляя чувствительности и регрессии при изменении моделей, промптов или инструментов.
  • Ранний доступ: В настоящее время наиболее эффективен для одношаговых агентов и валидации приложений. Многошаговые взаимодействия и более богатая телеметрия/интеграция вызовов инструментов находятся в дорожной карте.
Ad

Для кого это

Для команд, развертывающих внутренних агентов, вендорских агентов или любые AI-системы, где надежность важнее бенчмарков. Если вы тестируете агентов на платформах, не раскрывающих внутренности, черный ящик Spec27 решает эту проблему.

Начало работы

Spec27 открыт для тестирования читателями HN. На сайте запуска доступен пример, позволяющий исследовать инструмент без настройки. Зарегистрируйтесь на spec27.ai/launch.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Плагин Spectyra для OpenClaw: оптимизация затрат на ИИ в реальном времени за счет анализа полного потока запросов
Инструменты

Плагин Spectyra для OpenClaw: оптимизация затрат на ИИ в реальном времени за счет анализа полного потока запросов

Плагин Spectyra снижает затраты на AI API, выявляя в реальном времени скрытые потери, такие как повторные вызовы, избыточный контекст и неправильное использование дорогих моделей.

OpenClawRadar
Сравнение RunLobster и размещенных решений OpenClaw
Инструменты

Сравнение RunLobster и размещенных решений OpenClaw

Разработчик тестировал RunLobster против KiwiClaw, xCloud и самостоятельно размещённого OpenClaw по 2 недели каждый. RunLobster принципиально отличается как продукт, а не просто хостинг, с 3000 интеграций в один клик и памятью, которая накапливается со временем.

OpenClawRadar
TRELLIS.2 Image-to-3D адаптирован для нативной работы на Apple Silicon.
Инструменты

TRELLIS.2 Image-to-3D адаптирован для нативной работы на Apple Silicon.

Разработчик портировал 4-миллиардную параметрическую модель TRELLIS.2 от Microsoft для преобразования изображений в 3D, чтобы она работала нативно на Apple Silicon через PyTorch MPS, заменив операции, специфичные для CUDA, на чисто PyTorch-альтернативы. Порт генерирует меши с ~400K вершин из одиночных фотографий примерно за 3,5 минуты на M4 Pro с 24 ГБ памяти.

OpenClawRadar
Чернила: Платформа для Развертывания, Где Искусственный Интеллект Claude — Основной Пользователь
Инструменты

Чернила: Платформа для Развертывания, Где Искусственный Интеллект Claude — Основной Пользователь

Ink (ml.ink) — это платформа для развертывания, предназначенная для ИИ-агентов, таких как Claude, с возможностью развертывания одним вызовом инструмента, автоматическим определением фреймворков и интегрированными сервисами, включая вычисления, базы данных, DNS, секреты, домены, метрики и логи.

OpenClawRadar