Канарейка: ИИ-агент для автоматизированного тестирования на основе изменений в коде

Что делает Canary
Canary создаёт ИИ-агентов, которые подключаются к вашей кодовой базе, чтобы понимать структуру приложения, включая маршруты, контроллеры и логику валидации. Когда вы отправляете пул-реквест, он читает различия, понимает намерение за изменениями, затем генерирует и выполняет тесты в вашем приложении для предпросмотра, чтобы проверить реальные пользовательские сценарии от начала до конца.
Ключевые возможности
- Анализирует различия в PR, чтобы понять, что именно изменилось
- Генерирует и запускает тесты для каждого затронутого пользовательского сценария
- Комментирует прямо в PR с результатами тестов и записями экрана
- Отмечает поведение, которое не соответствует ожиданиям
- Позволяет запускать тесты конкретных пользовательских сценариев через комментарии в PR
- Тесты, сгенерированные из PR, можно перенести в регрессионные наборы
- Создавайте тесты, описывая их простым английским языком — Canary генерирует полные наборы тестов из вашей кодовой базы
- Планирует и непрерывно запускает тесты
Технический подход
По словам основателей, это не то, с чем может справиться одна базовая модель. Контроль качества охватывает несколько модальностей: исходный код, DOM/ARIA, эмуляторы устройств, визуальная проверка, анализ записи экрана, журналы сети/консоли и состояние живого браузера. Система требует пользовательских флотов браузеров, пользовательских сессий, временных сред, ферм устройств и заполнения данных для надёжного запуска тестов.
Выявление побочных эффектов изменений кода требует специализированной обвязки, которая ломает приложения множеством возможных способов для разных типов пользователей, которые обычное тестирование по счастливому пути не охватывает.
Результаты тестирования
Команда опубликовала QA-Bench v0, первый бенчмарк для проверки кода. Они протестировали свой специально созданный агент контроля качества против GPT 5.4, Claude Code (Opus 4.6) и Sonnet 4.6 на 35 реальных PR в Grafana, Mattermost, Cal.com и Apache Superset. Тесты измеряли три параметра: Релевантность, Покрытие и Согласованность.
Покрытие показало наибольший разрыв в производительности. Canary лидирует с:
- 11 очков над GPT 5.4
- 18 очков над Claude Code
- 26 очков над Sonnet 4.6
Пример из реального мира
У одного клиента из строительной сферы был процесс выставления счетов, где сумма к оплате отклонялась от исходной общей суммы предложения примерно на $1,600. Canary обнаружил этот регресс в их процессе выставления счетов до выпуска.
Прошлое основателей
Основатели ранее создавали ИИ-инструменты для программирования в Windsurf, Cognition и Google. Они заметили, что хотя ИИ-инструменты ускоряют команды в выпуске, никто не тестировал реальное поведение пользователей перед слиянием, что приводило к проблемам в продакшене в процессах оформления заказа, аутентификации и выставления счетов.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Вспомнить: Локальная память проекта для Claude Code — без затрат токенов на сводки
Recall предоставляет Claude Code долговременную локальную память сессии с помощью классической суммаризации. Без API-ключа, без внешней модели — context.md размером ~1–2K токенов, создаваемый офлайн на основе хуков сессии.

TailClaude: Открытый веб-интерфейс для доступа к сессиям кода Claude с мобильных устройств и браузера
TailClaude — это открытый веб-интерфейс, который позволяет получить доступ к сессиям Claude Code с телефона или любого браузера менее чем за минуту с помощью Tailscale. Проект был создан с помощью Claude Code для каркаса, бэкенда с потоковой передачей SSE, мобильного чат-интерфейса и интеграции QR-кода.

在6GB GPU上进行会议摘要:qwen3.5:0.8B 用时57秒,Granite 4 350M 产生幻觉
VoiceFlow v1.6.0 добавляет локальную запись и обобщение совещаний. Сравнение моделей менее 1 миллиарда параметров на RTX 3060 с 6 ГБ: qwen3.5:0.8B создает структурированные сводки за 57 с при 2,2 ГБ видеопамяти, а Granite 4 350M сильно галлюцинирует.

Audacity-MCP: Интеграция Claude AI для локального редактирования аудио с 131 инструментом
Audacity-MCP соединяет Claude с Audacity через интерфейс pipe, позволяя управлять редактированием аудио голосом с помощью 131 инструмента, 9 автоматизированных процессов и локальной транскрипции Whisper без зависимости от облачных сервисов.