Агенты ИИ предпочитают структурированные запросы вместо естественного языка в тесте сервера Cala MCP.

Команда Cala недавно выпустила MCP-сервер, который предоставляет три различных способа доступа AI-агентов к их графу знаний: запросы на естественном языке, структурированный язык запросов и прямое обход сущностей/связей.
Неожиданное поведение агентов
Несмотря на ожидания, что агенты по умолчанию будут использовать интерфейсы на естественном языке (типичная сильная сторона LLM), большинство агентов отказались от запросов на естественном языке в течение нескольких минут. Без каких-либо подсказок или направлений они автономно переключились на использование структурированных запросов и методов обхода графа.
Почему это логично
Источник объясняет это поведение, отмечая, что LLM не обучаются явно быть «эффективными», а скорее быть корректными через RLHF. Эта корректность приводит к эффективному поведению как побочному эффекту — агенты учатся выбирать кратчайший надёжный путь к решениям. Интерфейсы на естественном языке добавляют слой интерпретации, который вносит неопределённость, в то время как структурированные запросы обеспечивают детерминированные результаты.
Когда им представили три способа доступа, агенты последовательно выбирали вариант, который минимизировал неопределённость, а не самый «естественный» интерфейс.
Ключевые вопросы
- Не слишком ли мы полагаемся на интерфейсы естественного языка для инструментов агентов?
- Должны ли MCP-серверы по умолчанию отдавать приоритет структурированным/графовым методам доступа над естественным языком?
- Если агенты предпочитают детерминированные пути, как это должно влиять на дизайн инструментов?
Обсуждение на Reddit ищет мнения других разработчиков инструментов для агентов, чтобы узнать, наблюдали ли они похожие паттерны.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Сэм Альтман, Трамп и Берни Сандерс объединились вокруг идеи государственной собственности на инфраструктуру ИИ
Сэм Альтман, Дональд Трамп и Берни Сандерс неожиданно согласны: инфраструктура ИИ должна быть в общественной собственности. AP сообщает о редком двухпартийном консенсусе по модели общественного владения.

NTSB изымает документы после того, как ИИ воссоздал голоса погибших пилотов по спектрограммам
Пользователи восстановили аудио из спектрограмм NTSB с помощью Codex и алгоритма Гриффина-Лима. NTSB закрыл публичный доступ к материалам.

Claude Code v2.1.162: информация об ожидании сессии, исправление тайм-аута MCP и обновление просмотра агентов
Claude Code v2.1.162 добавляет поле waitingFor в вывод --json, исправляет ошибку таймаута MCP менее 1000 мс, улучшает отрисовку терминала для представления агентов и многое другое. Подробности внутри.

Два исследовательских проекта ставят под сомнение имитационное обучение для веб-агентов
Два исследовательских проекта демонстрируют ограничения обучения веб-агентов исключительно на имитации: 'Browser in the Loop' использует обучение с подкреплением с моделью на 8 миллиардов параметров для повышения успешности отправки форм, в то время как 'Concentrate or Collapse' показывает, что стандартное обучение с подкреплением не работает с диффузионными языковыми моделями, требуя оптимизации на уровне последовательностей.