Песочница для агентов: устойчивое выполнение и холодные старты

В блоге Mendral утверждается, что обвязка агента — цикл, который управляет LLM, отправляя промпты, выполняя вызовы инструментов и возвращая результаты обратно, — должна работать вне песочницы, особенно для многопользовательских агентов. Они сравнивают две архитектуры и детально описывают три проблемы, которые решили при переходе на внешнюю модель.
Две архитектуры
- Обвязка внутри песочницы: Цикл находится в том же контейнере, что и код, с которым он работает. Вызовы инструментов (bash, read, write) выполняются локально. Навыки и память — это файлы в файловой системе контейнера. Так работает Claude Code локально. Простая модель выполнения, но учетные данные находятся внутри песочницы, песочница является сессией (ее потеря приводит к потере прогресса), а многопользовательский режим превращается в проблему распределенной файловой системы.
- Обвязка вне песочницы: Цикл выполняется на бэкенде и вызывает песочницу через API для выполнения инструментов. Учетные данные остаются за пределами песочницы (модель разрешений не нужна). Песочницы можно приостанавливать при простое, они становятся скотом (переживают сбои), а многопользовательское совместное использование — это проблема общей базы данных, а не распределенной файловой системы.
Три решенные проблемы
- Устойчивое выполнение: Сессии агента могут длиться часами и должны переживать развертывания и сбои. Mendral использует Inngest для контрольных точек — каждый шаг является шагом, и цикл продолжает с того места, где остановился, если сервер перезагружается.
- Жизненный цикл песочницы с низким холодным стартом: Цикл большую часть времени приостановлен (например, во время вызовов LLM). Они используют Blaxel для возобновления песочниц из режима ожидания за ~25 мс, избегая секундного холодного старта во время интерактивных шагов.
- Абстракция файловой системы: Поскольку обвязка и песочница находятся на разных машинах, общая файловая система больше недоступна. Mendral отмечает, что им пришлось решать эту проблему, но в статье основное внимание уделяется первым двум как ключевым решенным проблемам.
В статье делается вывод, что внешняя модель превосходит для многопользовательских конфигураций, несмотря на сложность устойчивого выполнения и обработки холодного старта.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Qwen 3.6 27B протестирован на DeepSWE: 2% балла, 70 часов, 44 тыс. средних выходных токенов
Модель Qwen 3.6 27B (FP8, BF16 KV кеш, контекст 262k) набрала 2% на DeepSWE за 70 часов. Средний вывод составил 44k токенов на задачу — сравнимо с более крупными моделями, такими как Qwen 3.6 Plus. Запуск на 1x RTX6000 Pro Blackwell через RunPod.

40 млн токенов за час: пользователь сообщает о неконтролируемой работе саб-агентов OpenClaw
Пользователь OpenClaw сообщает о потреблении 40 млн токенов за час из-за вышедших из-под контроля подагентов. С использованием OpenRouter и DeepSeek Flash дневной бюджет был исчерпан до того, как пользователь успел вмешаться. Ищет ограничители скорости и защитные механизмы.

Анализ принудительного системного промпта Claude Code на ~12K токенов выявил приоритет правил над конфигурацией пользователя
Анализ внедренного системного промпта Claude Code объемом ~12K токенов показывает приоритетные правила запрета текстов песен, делегирования субагентов и краткости, которые отменяют пользовательские CLAUDE.md и файлы памяти.

CEO, которые считают, что ИИ заменит их сотрудников, просто плохие руководители
Генеральный директор Box Аарон Леви объясняет «ИИ-психоз» — когда руководители, оторванные от реальной работы, видят демонстрации успешных сценариев и переоценивают агентные инструменты вроде Claude Code, игнорируя последний этап внедрения в производство.