Канарейка: ИИ-агент для автоматизированного тестирования на основе изменений в коде

✍️ OpenClawRadar📅 Опубликовано: 19 марта 2026 г.🔗 Source
Канарейка: ИИ-агент для автоматизированного тестирования на основе изменений в коде
Ad

Что делает Canary

Canary создаёт ИИ-агентов, которые подключаются к вашей кодовой базе, чтобы понимать структуру приложения, включая маршруты, контроллеры и логику валидации. Когда вы отправляете пул-реквест, он читает различия, понимает намерение за изменениями, затем генерирует и выполняет тесты в вашем приложении для предпросмотра, чтобы проверить реальные пользовательские сценарии от начала до конца.

Ключевые возможности

  • Анализирует различия в PR, чтобы понять, что именно изменилось
  • Генерирует и запускает тесты для каждого затронутого пользовательского сценария
  • Комментирует прямо в PR с результатами тестов и записями экрана
  • Отмечает поведение, которое не соответствует ожиданиям
  • Позволяет запускать тесты конкретных пользовательских сценариев через комментарии в PR
  • Тесты, сгенерированные из PR, можно перенести в регрессионные наборы
  • Создавайте тесты, описывая их простым английским языком — Canary генерирует полные наборы тестов из вашей кодовой базы
  • Планирует и непрерывно запускает тесты

Технический подход

По словам основателей, это не то, с чем может справиться одна базовая модель. Контроль качества охватывает несколько модальностей: исходный код, DOM/ARIA, эмуляторы устройств, визуальная проверка, анализ записи экрана, журналы сети/консоли и состояние живого браузера. Система требует пользовательских флотов браузеров, пользовательских сессий, временных сред, ферм устройств и заполнения данных для надёжного запуска тестов.

Выявление побочных эффектов изменений кода требует специализированной обвязки, которая ломает приложения множеством возможных способов для разных типов пользователей, которые обычное тестирование по счастливому пути не охватывает.

Ad

Результаты тестирования

Команда опубликовала QA-Bench v0, первый бенчмарк для проверки кода. Они протестировали свой специально созданный агент контроля качества против GPT 5.4, Claude Code (Opus 4.6) и Sonnet 4.6 на 35 реальных PR в Grafana, Mattermost, Cal.com и Apache Superset. Тесты измеряли три параметра: Релевантность, Покрытие и Согласованность.

Покрытие показало наибольший разрыв в производительности. Canary лидирует с:

  • 11 очков над GPT 5.4
  • 18 очков над Claude Code
  • 26 очков над Sonnet 4.6

Пример из реального мира

У одного клиента из строительной сферы был процесс выставления счетов, где сумма к оплате отклонялась от исходной общей суммы предложения примерно на $1,600. Canary обнаружил этот регресс в их процессе выставления счетов до выпуска.

Прошлое основателей

Основатели ранее создавали ИИ-инструменты для программирования в Windsurf, Cognition и Google. Они заметили, что хотя ИИ-инструменты ускоряют команды в выпуске, никто не тестировал реальное поведение пользователей перед слиянием, что приводило к проблемам в продакшене в процессах оформления заказа, аутентификации и выставления счетов.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Плагин Keyoku заменяет статический пульс OpenClaw на автономность, управляемую памятью.
Инструменты

Плагин Keyoku заменяет статический пульс OpenClaw на автономность, управляемую памятью.

Keyoku — это бесплатный плагин для OpenClaw, который меняет механизм «сердцебиения» агента: вместо чтения статического файла HEARTBEAT.md он сканирует фактическое хранилище памяти агента на предмет зависшей работы, невыполненных обязательств, противоречивой информации и неактивных связей. Использует локальный движок на Go с SQLite + HNSW и предлагает три уровня автономии: наблюдение, предложение и действие.

OpenClawRadar
Обновление Void-Box добавляет изолированную интеграцию OpenClaw-Telegram через микро-ВМ KVM.
Инструменты

Обновление Void-Box добавляет изолированную интеграцию OpenClaw-Telegram через микро-ВМ KVM.

Void-Box, среда выполнения с ограниченными возможностями для ИИ-агентов, теперь включает рабочий пример, запускающий OpenClaw, подключенный к Telegram, полностью изолированный в отдельных микро-ВМ KVM. Система создает микро-ВМ по требованию для каждого этапа выполнения и уничтожает их после завершения, чтобы предотвратить утечку состояния.

OpenClawRadar
Навык OpenClaw сокращает количество токенов дерева доступности с 600 тысяч до 1,3 тысячи для сайтов с большим количеством рекламы.
Инструменты

Навык OpenClaw сокращает количество токенов дерева доступности с 600 тысяч до 1,3 тысячи для сайтов с большим количеством рекламы.

Разработчик создал навык OpenClaw, который использует ранжирование элементов на основе машинного обучения для обрезки деревьев доступности, сокращая slickdeals.com с ~598K токенов до ~1.3K токенов, сохраняя только ~50 наиболее значимых интерактивных элементов.

OpenClawRadar
Плагин Claude Code для исследования рынка Reddit без API-ключей
Инструменты

Плагин Claude Code для исследования рынка Reddit без API-ключей

Плагин Claude Code автоматизирует исследование рынка на Reddit, выполняя поиск по обсуждениям, анализ контента и генерацию отчетов в формате markdown с прямыми ссылками. Он не требует ключа API Reddit, аутентификации или конфигурационных файлов, используя публичные данные через локальный сервер MCP.

OpenClawRadar