Тестирование рынков AI-агентов: практические результаты от ClawGig, RentAHuman и систем на базе OpenClaw

Разработчик потратил месяц на тестирование различных маркетплейсов ИИ-агентов, чтобы оценить их текущее состояние и практическую пригодность.
Результаты ClawGig
На ClawGig представлено более 2400 агентов. При попытке нанять одного для маркетингового исследования:
- Трое из пяти связанных агентов так и не ответили
- Один ответил явно шаблонным сообщением
- Один агент выполнил работу неплохо, но запросил $45 за задачу, с которой GPT-4 справился бы за 30 секунд
- Баллы репутации агентов оказались полностью накрученными — у агентов с 5-звёздочным рейтингом были явно фальшивые отзывы от других агентов
Результаты RentAHuman.ai
«ИИ-агенты с человеческим качеством» этой платформы не могли поддерживать связный диалог дольше трёх реплик. Когда одного агента попросили резюмировать 10-страничный отчёт о рынке, он выдумал три несуществующие компании.
Независимые решения на базе OpenClaw
Они показали наибольший потенциал. Один разработчик на r/openclaw использовал агента для поддержки клиентов своего SaaS, который справился с 73% обращений без эскалации. Однако обнаружить этого агента было невозможно, если вы не состояли в этом конкретном сообществе Discord.
Выявленная ключевая проблема
Фундаментальная проблема заключается не в самих агентах, а в отсутствии реального социального слоя. Нет возможности увидеть реальную историю работы агента, с кем он сотрудничал или в чём именно он силён. Текущий подход создаёт «жёлтые страницы для агентов», тогда как нужен «LinkedIn для агентов» — система с проверенной историей работы и подлинными метриками репутации.
📖 Read the full source: r/openclaw
👀 Смотрите также

Claude Code v2.1.201 отменяет системную роль в середине разговора для сессий Sonnet 5
Claude Code v2.1.201 убирает системную роль в середине разговора для напоминаний об обвязке в сеансах Claude Sonnet 5, упрощая контекст чата.

Обновление OpenClaw 5.2 нарушает работу cron-задач и вызовы плагина MCP
Обновление с OpenClaw 4.23 до 5.2 приводит к тому, что плагины MCP инструментов становятся видимыми, но не вызываемыми агентом, а регистрация cron-задач через CLI завершается с ошибками сопряжения устройств.

Обновления Claude Code v2.1.91: Шаблоны проектирования агентов, правила памяти и улучшения инструментов
Claude Code v2.1.91 добавляет справочное руководство по шаблонам проектирования агентов, охватывающее дизайн интерфейса инструментов, управление контекстом и стратегии кэширования. Обновление упрощает правила выбора памяти, добавляет мониторинг безопасности для отравления памяти и улучшает описания инструментов для операций Edit, ReadFile и Write.

Анализ проблем бенчмаркинга TB2 в задаче db-wal-recovery
Анализ Reddit выявляет проблемы с задачей db-wal-recovery в Terminal Bench 2.0, где агенты могут случайно уничтожить улики, открывая базы данных SQLite, и показывает, как инъекция промптов влияет на результаты лидерборда.