Тестирование ИИ-агентов с реальными API с помощью d3 Labs

d3 labs предоставляет 10 бесплатных производственных API, специально разработанных для тестирования AI-агентов программирования в реальных условиях. Отказавшись от идеализированных макетов, эти API обеспечивают возможность агентам обрабатывать нюансы настоящих сервисов. Уроки, извлеченные в ходе разработки, выявляют ключевые проблемные точки, такие как ошибки парсинга JSON, проблемы с задержкой, ограничения по количеству запросов и вариации в структуре ответов, которые могут незаметно сломать AI-агентов в производстве.
Ключевые детали
- Макеты против реального мира: Макеты часто возвращают чистый JSON и отвечают мгновенно, скрывая ошибки, с которыми сталкиваются агенты в производстве. Реальные API могут возвращать неправильно сформированный JSON, пустые массивы и объекты ошибок, которые выходят за рамки оптимального сценария.
- Управление задержкой: В отличие от макетов (<1мс), реальные API имеют задержку от 50 до 800мс, что значительно влияет на организацию работы агентов, если с этим не справиться надлежащим образом. API d3 labs включают данные о времени, чтобы помочь разработчикам профилировать производительность их агентов.
- Обработка ограничений по количеству запросов: Агенты должны элегантно справляться с ограничениями по количеству запросов (HTTP 429), решая, стоит ли повторять попытку, уведомлять пользователей или использовать кэшированные данные. d3 labs устанавливает ограничения (10 вызовов в день для анонимных пользователей, 100 в день для проверенных), чтобы протестировать это.
- Обработка вариаций в структуре ответов: API возвращают данные в разных форматах, что требует гибкого парсинга ответов. Агенты с жестко запрограммированными структурами могут не сработать, когда ответы сервиса отклоняются от ожиданий.
- Сосредоточенность на утилитарных вызовах: Часто игнорируемые утилитарные API (например, погода, валидация схем) могут стать слабыми местами, где агенты накапливают неправильные состояния, хотя фокус обычно направлен на более сложные функциональные возможности, такие как вызовы LLM.
Список API
- Оракул цены на Bitcoin:
/btc-price- Текущая цена Bitcoin в фиатных валютах - Поиск в вебе AI:
/search- Поиск на основе DuckDuckGo - API погоды:
/weather- Текущая погода в мире - Оракул настроения:
/vibe-check- Анализ настроения - Генератор шуток:
/shitpost- Генерация контента на основе тем - Переводчик ошибок API:
/error-translator- Объяснения кодов ошибок HTTP - Калькулятор лимитов:
/rate-limit-calc- Оптимальные рекомендации по ограничению запросов - Валидатор схемы:
/validate-schema- Валидация JSON схемы - Компрессор контекста:
/compress-context- Сжатие текста для управления контекстом - Детектор галлюцинаций:
/check-hallucination- Флаги галлюцинаций текста, сгенерированного AI
Доступ к этим сервисам прост: POST-запросы к https://labs.digital3.ai/api/services{endpoint} с JSON-данными. Эта настройка обещает реалистичную среду для проверки надежности ваших AI-агентов.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Расширение Claude Toolbox добавляет закладки на уровне сообщений и полнотекстовый поиск
Claude Toolbox — это расширение для Chrome, позволяющее сохранять отдельные сообщения в закладки, искать по всем диалогам и экспортировать их в TXT или JSON. Бесплатный тариф охватывает 2 диалога; платный — 5 долларов в месяц или 49 долларов единоразово.

Как Clawdbot координирует 6 ИИ-агентов с помощью стабильной рабочей очереди для продакшена
Команда Clawdbot разработала систему очереди задач для координации 6 ИИ-агентов (дизайн, код, маркетинг, операции) для своего магазина, управляемого искусственным интеллектом. Система включает атомарное присвоение задач, конечный автомат, логику повторных попыток с экспоненциальной задержкой, цепочки задач, отслеживание активности и демона-оркестратора.

Навык Agent Times для ClawHub добавляет запросы новостей в реальном времени, погоды и цен на токены.
Новый навык ClawHub под названием Agent Times позволяет ИИ-агентам отвечать на запросы в реальном времени о новостях, погоде и ценах на криптовалюты. Установка осуществляется через npx clawhub install agenttimes, и он предоставляет доступ к более чем 228 тысячам статей из 3 576 источников с оценкой тональности и извлечением сущностей.

Claude Auto-Continue: Расширение для Chrome автоматизирует прерывания из-за ограничений на использование инструментов
Разработчик создал бесплатное расширение для Chrome, которое автоматически нажимает кнопку 'Продолжить', когда Claude достигает лимита использования инструментов после примерно 20 вызовов, устраняя ручные прерывания в агентных рабочих процессах. Расширение включает опциональную минимизацию токенов и работает во всех вкладках и окнах.