Снижение задержки мультимодального агента за счет исключения истории скриншотов

✍️ OpenClawRadar📅 Опубликовано: 13 апреля 2026 г.🔗 Source
Снижение задержки мультимодального агента за счет исключения истории скриншотов
Ad

Снижение задержки за счёт исключения скриншотов

Разработчик, создающий компьютерных агентов, определил задержку как основную проблему, особенно при ожидании, пока агенты выполнят простые действия, такие как нажатие кнопок. Чтобы решить эту проблему, они провели эксперимент с использованием Claude, чтобы найти способы снижения задержки помимо простого выбора модели.

Ключевым выводом стало то, что задержку можно значительно снизить, исключив предыдущие скриншоты из запросов агентов. Вместо включения полных данных изображений в формате base64 для исторических скриншотов разработчик заменил их строкой "[изображение опущено]". Этот подход сохраняет постоянную задержку, сокращая общее время отклика.

Разработчик отметил, что фокус на агентной инженерии и паттернах ReAct заставил их упустить из виду базовые принципы HTTP, влияющие на производительность. Эксперимент и выводы задокументированы в репозитории GitHub под названием "inference-latency-study", созданном Emericen.

Ad

Техническая реализация

Основная техника включает изменение обработки истории скриншотов мультимодальными агентами:

  • Вместо отправки полных изображений в формате base64 для предыдущих скриншотов
  • Замените их текстом-заполнителем: "[изображение опущено]"
  • Сохраняйте данные текущего скриншота, исключая исторические данные изображений

Этот подход уменьшает размер полезной нагрузки и время передачи без ущерба для способности агента понимать и взаимодействовать с текущим состоянием экрана.

Репозиторий GitHub содержит экспериментальную установку и результаты, предоставляя практический справочник для разработчиков, работающих с мультимодальными агентами и сталкивающихся с проблемами задержки.

📖 Прочитать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Использование /probe для выявления галлюцинаций ИИ перед написанием кода
Инструменты

Использование /probe для выявления галлюцинаций ИИ перед написанием кода

Разработчик делится техникой под названием /probe, которая заставляет ИИ-генерируемые планы делать нумерованные утверждения с ожидаемыми значениями, а затем проверяет реальную систему, чтобы выявить расхождения. Метод обнаружил четыре фактические ошибки в описании Claude собственного формата JSONL, которые могли бы вызвать баги в коде.

OpenClawRadar
Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.
Инструменты

Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.

Среда выполнения Krasis LLM теперь полностью выполняет как предварительное заполнение, так и декодирование на GPU с различными стратегиями оптимизации, достигая ускорения предварительного заполнения в 8,9 раза и декодирования в 4,7 раза по сравнению с llama.cpp на Qwen3.5-122B с использованием одного GPU 5090.

OpenClawRadar
🦀
Инструменты

Исследователь разрабатывает функцию проверки достоверности для кода Claude и обнаруживает галлюцинации в собственной документации.

Исследователь создал навык Claude Code под названием /veracity-tweaked-555, который разбивает документы на атомарные утверждения и проверяет каждое через веб-поиск с использованием 16 параллельных агентов в 4 волнах. При самоаудите навык получил оценку 62/100 из-за сфабрикованной статистики и преувеличенных заявлений в собственной документации.

OpenClawRadar
Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex
Инструменты

Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex

Разработчик создал воспроизводимый набор тестов для оценки профилей Qwen 3.6 27B GGUF (llama.cpp) в качестве валидатора-компаньона для Codex, обнаружив, что профили с контекстом 128k необходимы для задач с длинным контекстом, а кэш KV q8 даёт минимальную потерю точности.

OpenClawRadar