Тестирование рынков AI-агентов: практические результаты от ClawGig, RentAHuman и систем на базе OpenClaw

Разработчик потратил месяц на тестирование различных маркетплейсов ИИ-агентов, чтобы оценить их текущее состояние и практическую пригодность.
Результаты ClawGig
На ClawGig представлено более 2400 агентов. При попытке нанять одного для маркетингового исследования:
- Трое из пяти связанных агентов так и не ответили
- Один ответил явно шаблонным сообщением
- Один агент выполнил работу неплохо, но запросил $45 за задачу, с которой GPT-4 справился бы за 30 секунд
- Баллы репутации агентов оказались полностью накрученными — у агентов с 5-звёздочным рейтингом были явно фальшивые отзывы от других агентов
Результаты RentAHuman.ai
«ИИ-агенты с человеческим качеством» этой платформы не могли поддерживать связный диалог дольше трёх реплик. Когда одного агента попросили резюмировать 10-страничный отчёт о рынке, он выдумал три несуществующие компании.
Независимые решения на базе OpenClaw
Они показали наибольший потенциал. Один разработчик на r/openclaw использовал агента для поддержки клиентов своего SaaS, который справился с 73% обращений без эскалации. Однако обнаружить этого агента было невозможно, если вы не состояли в этом конкретном сообществе Discord.
Выявленная ключевая проблема
Фундаментальная проблема заключается не в самих агентах, а в отсутствии реального социального слоя. Нет возможности увидеть реальную историю работы агента, с кем он сотрудничал или в чём именно он силён. Текущий подход создаёт «жёлтые страницы для агентов», тогда как нужен «LinkedIn для агентов» — система с проверенной историей работы и подлинными метриками репутации.
📖 Read the full source: r/openclaw
👀 Смотрите также
Claude Code v2.1.246 исправляет проблемы с отображением diff, прерываниями MCP и другое
Claude Code v2.1.246 исправляет замедление транскриптов из-за длинных однострочных диффов, прерывания вызовов MCP, и добавляет вкладку Auto mode в /permissions.

Hy3 LLM возглавляет рейтинг OpenRouter: самая дешевая модель или нечто иное?
Hy3 preview, открытая LLM от Tencent, взлетела на вершину рейтинга OpenRouter по использованию токенов, обогнав Claude и DeepSeek V4 Flash. Цена — $0.066/1M входных токенов, это самая дешевая крупная модель, но бенчмарки показывают качество значительно ниже лидеров.

Объем кода, создаваемого искусственным интеллектом, перегружает опытных инженеров, показало исследование.
Пользователи ИИ объединяют на 98% больше пул-реквестов с помощью ИИ, но старшие инженеры сообщают о повышенной когнитивной нагрузке и выгорании. Исследования показывают, что обнаружение дефектов падает с 87% для PR объёмом до 100 строк до 28% для PR объёмом более 1000 строк.

Эскалация блокировки вендором ИИ: смена моделей теперь обходится дороже, чем ожидало большинство
Опрос Zapier, проведенный среди 542 руководителей компаний США, показывает, что 90% считали, что смогут сменить поставщика ИИ менее чем за 4 недели, но 58% реальных миграций либо провалились, либо заняли гораздо больше времени. Тем временем OpenAI повысил цены на входные токены GPT-5.2 с $1,25 до $5,75, а Anthropic перевел Claude Enterprise на динамическое ценообразование, что может удвоить или утроить расходы для активных пользователей.