Результаты тестирования: подходы GitHub CLI и MCP для ИИ-агентов

✍️ OpenClawRadar📅 Опубликовано: 28 марта 2026 г.🔗 Source
Результаты тестирования: подходы GitHub CLI и MCP для ИИ-агентов
Ad

Результаты бенчмарка: GitHub CLI против подходов MCP

Пользователь Reddit провёл независимое исследование, сравнивающее различные методы предоставления инструментов GitHub ИИ-агентам. Бенчмарк протестировал четыре подхода: GitHub CLI, MCP (Model Context Protocol), MCP с поиском инструментов и MCP с режимом кода, используя реальные данные и практические задачи.

Ключевые выводы

  • GitHub MCP обходится в 2–3 раза дороже, чем GitHub CLI. В источнике отмечается, что «практически нет причин использовать их MCP, за исключением некоторых особенностей обработки безопасности».
  • Поиск инструментов экономит начальные токены, но тратит их на дополнительные шаги. Оправдывает ли этот компромисс себя, зависит от сложности задачи. Поиск инструментов также вводит новый тип сбоя из-за неидеальной точности поиска.
  • Режим кода — самый дешёвый способ использования MCP, но всё же в 2 раза дороже, чем CLI, и он очень медленный. Режим кода вводит уникальный тип сбоя, когда агент пишет код с ошибками или плохо обрабатывает исключения.
  • Бенчмарк предполагает, что можно продвинуть CLI дальше в сторону более высоких показателей успеха при наименьшей стоимости и задержках, используя принципиальный подход к проектированию, который рассматривает эргономику агента как первостепенную задачу.
Ad

Ресурсы с открытым исходным кодом

Автор подробно описал свой подход на https://axi.md и открыл исходный код инфраструктуры для бенчмарков, результатов и эталонной реализации gh-axi на https://github.com/kunchenguid/axi.

📖 Прочитать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

OpenSwarm: Многозадачный CLI-оркестратор Claude для Linear и GitHub
Инструменты

OpenSwarm: Многозадачный CLI-оркестратор Claude для Linear и GitHub

OpenSwarm координирует несколько экземпляров Claude Code CLI в качестве автономных агентов, которые получают задачи из Linear и запускают конвейеры Worker/Reviewer/Test/Documenter. Он использует LanceDB с мультиязычными эмбеддингами multilingual-e5 для памяти и включает управление через Discord-бота, автоматическое улучшение PR и веб-панель управления.

OpenClawRadar
Claude Code добавляет систему многопользовательского рецензирования кода
Инструменты

Claude Code добавляет систему многопользовательского рецензирования кода

Anthropic запустила Code Review для Claude Code — многозадачную систему, которая распределяет команды ИИ-агентов для проверки пулл-реквестов. Система выявляет ошибки, которые часто пропускают люди-ревьюеры: теперь 54% PR получают содержательные комментарии по сравнению с 16% ранее.

OpenClawRadar
SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов
Инструменты

SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов

SubQ — это полностью субквадратичная разреженная LLM, обеспечивающая окно контекста в 12 млн токенов при скорости 150 токенов/с, с показателями SWE-Bench Verified 81.8% и RULER @ 128K 95.0%. Она уменьшает вычислительные затраты на внимание примерно в 1000 раз по сравнению с трансформерами.

OpenClawRadar
Qwen 3.6 27B с MTP на V100 32GB: 54 т/с через ветку llama.cpp
Инструменты

Qwen 3.6 27B с MTP на V100 32GB: 54 т/с через ветку llama.cpp

Ветка MTP от am17an для llama.cc запускает Qwen 3.6 27B со скоростью 54 т/с на V100 32GB через адаптер PCIe, падая до 29-30 т/с без MTP.

OpenClawRadar