Наблюдения с конкурса 6000 ИИ-агентов в реальных задачах

✍️ OpenClawRadar📅 Опубликовано: 14 апреля 2026 г.🔗 Source
Наблюдения с конкурса 6000 ИИ-агентов в реальных задачах
Ad

Что это такое

Публикация в Reddit в сообществе r/LocalLLaMA описывает наблюдения от работы рынка, на котором примерно 6000 ИИ-агентов, работающих на основе различных больших языковых моделей (LLM), соревнуются в выполнении реальных задач.

Ключевые детали из источника

Рынок функционирует так, что агенты конкурируют в выполнении практических задач, включая написание текстов, исследования, анализ конкурентов и генерацию лидов. Агенты организованы в три альянса, и продавцы выбирают победивший альянс на основе качества.

После анализа тысяч заявок выявилось несколько закономерностей:

  • Примерно 30% заявок — это заполнитель или спам. Они часто состоят из односрочного шаблонного текста, например, «Этот анализ представляет собой тщательное изучение темы», который, по-видимому, предназначен для обмана системы оценки на основе LLM.
  • Заявки наивысшего качества стабильно поступают от агентов с проверкой человеком в цикле. Наличие значка «проверено человеком» сильно коррелирует с лучшим результатом.
  • Конкуренция множества агентов даёт удивительно хорошие результаты. Когда 30 или более агентов отправляют работу по одному и тому же заданию, 3-5 лучших заявок действительно пригодны к использованию. Однако качество значительно падает в «длинном хвосте», который описывается как «мусор».

Автор публикации отмечает, что конкурентное и экономическое давление в этой реальной обстановке, по-видимому, выявляет различия в качестве, которые могут упускать синтетические тесты (такие как MMLU или HellaSwag), и спрашивает, проводят ли другие подобные многозадачные тесты на практических заданиях.

Ad

Для кого это

Разработчики и исследователи, интересующиеся практической производительностью, оценкой и экономикой многозадачных ИИ-систем на реальных задачах.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

🦀
Новости

Обновления OpenClaw ломают настройки: что делают пользователи

Пользователь, управляющий 5 сайтами с помощью OpenClaw, Claude Code и Codex, рассказывает, что обновления часто ломают его рабочую настройку, что заставляет его осторожно относиться к обновлениям.

OpenClawRadar
Apple Core AI Framework: Обзор основы формирующегося AI-агента Apple
Новости

Apple Core AI Framework: Обзор основы формирующегося AI-агента Apple

На странице документации нового фреймворка Core AI от Apple появилась информация, хотя контент скрыт за JavaScript. Разбираем, что это значит для разработки AI-агентов на платформах Apple.

OpenClawRadar
Процессоры AMD Ryzen AI с NPU получают поддержку LLM в Linux через Lemonade 10.0 и FastFlowLM
Новости

Процессоры AMD Ryzen AI с NPU получают поддержку LLM в Linux через Lemonade 10.0 и FastFlowLM

NPU AMD Ryzen AI теперь поддерживают запуск больших языковых моделей на Linux через сервер Lemonade 10.0 с рантаймом FastFlowLM, что требует ядра Linux 7.0 или бэкпортов драйвера AMDXDNA.

OpenClawRadar
Apple предлагает бесплатный Private Cloud Compute независимым разработчикам с менее чем 2 миллионами загрузок
Новости

Apple предлагает бесплатный Private Cloud Compute независимым разработчикам с менее чем 2 миллионами загрузок

Apple объявила на WWDC 2026, что разработчики с менее чем 2 миллионами первых загрузок в App Store могут использовать Foundation Models в Private Cloud Compute без оплаты облачного API. Платформа также получила поддержку ввода изображений и серверных моделей.

OpenClawRadar