Результаты тестирования: подходы GitHub CLI и MCP для ИИ-агентов

Результаты бенчмарка: GitHub CLI против подходов MCP
Пользователь Reddit провёл независимое исследование, сравнивающее различные методы предоставления инструментов GitHub ИИ-агентам. Бенчмарк протестировал четыре подхода: GitHub CLI, MCP (Model Context Protocol), MCP с поиском инструментов и MCP с режимом кода, используя реальные данные и практические задачи.
Ключевые выводы
- GitHub MCP обходится в 2–3 раза дороже, чем GitHub CLI. В источнике отмечается, что «практически нет причин использовать их MCP, за исключением некоторых особенностей обработки безопасности».
- Поиск инструментов экономит начальные токены, но тратит их на дополнительные шаги. Оправдывает ли этот компромисс себя, зависит от сложности задачи. Поиск инструментов также вводит новый тип сбоя из-за неидеальной точности поиска.
- Режим кода — самый дешёвый способ использования MCP, но всё же в 2 раза дороже, чем CLI, и он очень медленный. Режим кода вводит уникальный тип сбоя, когда агент пишет код с ошибками или плохо обрабатывает исключения.
- Бенчмарк предполагает, что можно продвинуть CLI дальше в сторону более высоких показателей успеха при наименьшей стоимости и задержках, используя принципиальный подход к проектированию, который рассматривает эргономику агента как первостепенную задачу.
Ресурсы с открытым исходным кодом
Автор подробно описал свой подход на https://axi.md и открыл исходный код инфраструктуры для бенчмарков, результатов и эталонной реализации gh-axi на https://github.com/kunchenguid/axi.
📖 Прочитать полный источник: r/ClaudeAI
👀 Смотрите также

OpenSwarm: Многозадачный CLI-оркестратор Claude для Linear и GitHub
OpenSwarm координирует несколько экземпляров Claude Code CLI в качестве автономных агентов, которые получают задачи из Linear и запускают конвейеры Worker/Reviewer/Test/Documenter. Он использует LanceDB с мультиязычными эмбеддингами multilingual-e5 для памяти и включает управление через Discord-бота, автоматическое улучшение PR и веб-панель управления.

Claude Code добавляет систему многопользовательского рецензирования кода
Anthropic запустила Code Review для Claude Code — многозадачную систему, которая распределяет команды ИИ-агентов для проверки пулл-реквестов. Система выявляет ошибки, которые часто пропускают люди-ревьюеры: теперь 54% PR получают содержательные комментарии по сравнению с 16% ранее.

SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов
SubQ — это полностью субквадратичная разреженная LLM, обеспечивающая окно контекста в 12 млн токенов при скорости 150 токенов/с, с показателями SWE-Bench Verified 81.8% и RULER @ 128K 95.0%. Она уменьшает вычислительные затраты на внимание примерно в 1000 раз по сравнению с трансформерами.

Qwen 3.6 27B с MTP на V100 32GB: 54 т/с через ветку llama.cpp
Ветка MTP от am17an для llama.cc запускает Qwen 3.6 27B со скоростью 54 т/с на V100 32GB через адаптер PCIe, падая до 29-30 т/с без MTP.