TREX: ИИ-ревьюер кода от Greptile, который запускает ваш код

Компания Greptile выпустила TREX (Test, Run, Execute) — исполнительный слой, который запускает ваш код во время AI-ревью. Вместо простого чтения diff'ов TREX фактически выполняет изменённый код и выявляет баги времени выполнения — регрессии UI, логические ошибки, зависящие от состояния, состояния гонки — которые не может поймать статический анализ.
Архитектура: Оркестратор + под-агенты для каждой проблемы
Ранние версии использовали отдельные агенты или один комбинированный. Оба варианта провалились: отдельные агенты дублировали работу без общего контекста; один агент перегружался управлением настройкой, скриншотами и тестами. Решением стал оркестратор (главный ревьюер Greptile), который читает diff, выявляет подозрительные проблемы и запускает выделенного под-агента TREX для каждой проблемы, работающих параллельно. Каждый под-агент наследует контекст оркестратора и имеет собственное окно контекста, ограниченное своим исследованием.
Пример: функция UI за шлюзом аутентификации. Под-агент автономно настраивает окружение, обрабатывает аутентификацию, переключает флаги функций и возвращает скриншот отображаемой функции.
Мультимодальные артефакты vs. маркированные списки
Изначальный вывод TREX был в виде тезисов — но тезисы допускали галлюцинации (например, утверждение, что тест пройден, хотя это не так) и не давали возможности проверить. Исправление: каждый результат TREX подкреплён набором мультимодальных артефактов: скриншоты, логи выполнения, трассы API и скрипты выполнения. Каждый модальность рассказывает часть истории, позволяя точно отследить, что произошло. Первым впечатляющим артефактом стала видеозапись изменения анимации — показывающая реальный эффект во время выполнения.
Что он ловит
TREX нацелен на баги, которые не видны в diff'ах кода: логические ошибки, требующие определённых последовательностей состояний, регрессии UI после загрузки страницы и состояния гонки, требующие реальных запросов. Он генерирует и запускает тесты, но фокус на поиске багов, а не просто на написании тестов. Под-агент сам разбирается с настройкой.
Как говорит Шлок Мехротра, инженер, стоящий за TREX: «Можно идеально прочитать diff и всё равно полностью пропустить такие баги».
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

JobPilot: Плагин Claude Code для автоматической подачи заявок на вакансии
JobPilot — это плагин Claude Code, который автоматизирует поиск работы и процессы подачи заявок с использованием автоматизации браузера Playwright. Он включает команды для поиска на досках вакансий, автоматического заполнения заявок, создания сопроводительных писем и отслеживания статистики подачи заявок.

Слой маршрутизации контекста сокращает использование токенов кода Claude за счёт отслеживания обращаемых файлов.
Разработчик сэкономил примерно 80 долларов в месяц на использовании Claude Code, добавив слой маршрутизации контекста, который предотвращает повторное чтение одних и тех же файлов репозитория ИИ при последующих запросах. Инструмент отслеживает, какие файлы уже были доступны, чтобы сократить избыточное потребление токенов.

Pali v0.1: Открытая инфраструктура памяти для LLM с воспроизводимыми тестами производительности.
Pali — это инфраструктура памяти с открытым исходным кодом для больших языковых моделей, построенная на Go в виде единого бинарного файла с мультитенантными API, гибридным поиском и модульными расширениями. В релизе v0.1 добавлен набор тестов с воспроизводимыми результатами, показывающими метрики производительности для разных конфигураций.

Подход Cursor к быстрому поиску с помощью регулярных выражений для ИИ-агентов
Cursor разрабатывает индексированный поиск по регулярным выражениям для решения проблем производительности в больших монорепозиториях, где ripgrep может занимать более 15 секунд, используя инвертированные индексы с n-граммами на основе исследования 1993 года Зобеля, Моффата и Сакса-Дэвиса.