Grok 4.5 против Claude Code: Принятые изменения на доллар — настоящий ориентир

✍️ OpenClawRadar📅 Опубликовано: 23 июля 2026 г.🔗 Source
Ad

Запуск Grok 4.5 от xAI (53% на DeepSWE 1.1 против 59% у Opus 4.8, 29.0% pass@1 на SWE Marathon против 26.0%, 80 токенов/с при $2/M за ввод, $6/M за вывод) стоит рассматривать как практическое сравнение с Claude Code, а не очередную заявку в лидерборде. Правильная метрика для разработчиков, использующих ИИ-агентов кодинга, — принятые изменения за доллар при одинаковом репозитории, промпте, разрешениях инструментов, тестовой команде, тайм-ауте и планке проверки.

Ad

Ключевые детали

Grok 4.5 доступен в Grok Build, Cursor и через API. Он поддерживает низкий, средний и высокий режимы рассуждения. Однако сторонний тест от 20 июля (через The New Stack) запускал Grok и Opus в режиме Cursor Agent на трех идентичных Rust-задачах:

  • Исправление ошибки: Оба прошли начальные тесты.
  • Многофайловый рефакторинг: Оба справились, но Opus затронул на один файл больше.
  • Разработка функции (самый практичный тест): Оба сработали, но Opus добавил больше тестового покрытия и написал запись в man-страницу.

Дополнительные касания Opus важны для метрики «принятые изменения за доллар»: более дешевая модель, требующая одного дополнительного цикла доработок, может оказаться не дешевле. Сообщество рекомендует логировать: успех первого теста, количество доработок, выходные токены, реальное время и исправления рецензента.

Для кого это

Для всех, кто использует Claude Code, Cursor или Grok Build для агентного кодинга и хочет оценить полную стоимость доставленных изменений.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Судебный приказ в Джорджии содержит юридические ссылки, сгенерированные искусственным интеллектом с ошибками
Новости

Судебный приказ в Джорджии содержит юридические ссылки, сгенерированные искусственным интеллектом с ошибками

Апелляция в Верховном суде Джорджии выявила, что постановление суда первой инстанции содержало как минимум пять ссылок на несуществующие дела и ещё пять на дела, которые не подтверждают указанные в них положения, причём предложенный прокурором проект постановления содержал те же ошибки.

OpenClawRadar
Оценка представлений Show HN для шаблонов дизайна ИИ
Новости

Оценка представлений Show HN для шаблонов дизайна ИИ

Разработчик проанализировал 500 целевых страниц Show HN, чтобы выявить распространённые шаблоны дизайна, созданные ИИ, такие как шрифты Inter, цветные левые границы и стекломорфизм. Система оценки определила, что 21% сайтов — это «тяжёлый шлак» с 5+ шаблонами.

OpenClawRadar
Amazon Connect Talent: ИИ-агенты автоматизируют массовые собеседования
Новости

Amazon Connect Talent: ИИ-агенты автоматизируют массовые собеседования

Amazon запускает Connect Talent — ИИ-агента, который проводит автоматизированные собеседования для массового найма. Программное обеспечение берет на себя скрининг, интервью и ведение заметок без вмешательства человека, являясь частью более широкого движения к автономным ИИ-агентам.

OpenClawRadar
Клод Код v2.1.205: Блокировка подделки стенограмм, исправления JSON-схем и улучшения автоматического режима
Новости

Клод Код v2.1.205: Блокировка подделки стенограмм, исправления JSON-схем и улучшения автоматического режима

Claude Code v2.1.205 добавляет блокировку подделки протокола сессии в автоматическом режиме, исправляет проблемы с большими JSON-схемами, улучшает обработку фоновых агентов и сокращает потребление памяти обновлятора.

OpenClawRadar