GPT-5.5 Codex против Claude Opus 4.7: Бенчмарки агентов реального кодирования

✍️ OpenClawRadar📅 Опубликовано: 14 мая 2026 г.🔗 Source
GPT-5.5 Codex против Claude Opus 4.7: Бенчмарки агентов реального кодирования
Ad

Пользователь Reddit протестировал GPT-5.5 Codex (через Cursor) против Claude Opus 4.7 (Claude Code) на двух задачах производственного уровня. Оба использовали одинаковые промпты, MCP (GitHub + Slack) и машину. Результаты показывают компромиссы по стоимости, архитектуре и надежности.

Тест 1: Бот для триажа PR

  • GitHub MCP, формула оценки, уведомления в Slack, повторные попытки, строгий TypeScript (без any).
  • Claude Code: Проверил доступность MCP перед написанием кода. Создал 36 файлов за 12 минут. Написал собственный WebSocket-тест (широковещательная рассылка за 3мс). Ноль ошибок при первом запуске. Общая стоимость: ~$2.50.
  • Codex: Не справился — GitHub MCP недоступен из-за проблемы с окружением Cursor (не ошибка модели). Не смог выполнить задачу.

Ad

Тест 2: Интерфейс ревью кода в реальном времени

  • React, WebSockets, оптимистичный откат, виртуализированный diff, переподключение WS.
  • Claude Code: Такая же чистая поставка, 36 файлов, без ошибок.
  • Codex: Сдал в 28 файлах (более компактная архитектура). Потребовал одно ручное исправление для бесконечного цикла React. Общая стоимость: ~$2.04 (на 18% дешевле Claude).

Выводы: Для сложной, архитектурно-насыщенной работы Opus 4.7 по-прежнему лидирует — лучшее обращение с инструментами, вывод без переписывания и тщательная проверка MCP. Codex компактнее и дешевле, подходит для ограниченных, самодостаточных задач, где важна быстрая сдача и можно смириться с небольшими исправлениями. Пользователь пока не переключается, но следит за разницей в ценах.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Сервер Ssemble MCP позволяет Claude создавать короткие видео из YouTube.
Инструменты

Сервер Ssemble MCP позволяет Claude создавать короткие видео из YouTube.

Новый MCP-сервер для Ssemble AI Clipping позволяет Claude создавать видео в стиле TikTok/Reels/Shorts из URL-адресов YouTube с помощью AI-сгенерированных клипов, шаблонов субтитров, музыкальных треков и наложений. Настройка включает добавление конфигурации в Claude Desktop или использование размещенной конечной точки.

OpenClawRadar
Черный LLAB: Открытая архитектура для динамической маршрутизации моделей и докер-изолированных ИИ-агентов
Инструменты

Черный LLAB: Открытая архитектура для динамической маршрутизации моделей и докер-изолированных ИИ-агентов

Разработчик опубликовал в открытом доступе Black LLAB — систему, которая использует Mistral 3B для маршрутизации запросов между локальными и облачными моделями и запускает ИИ-агентов в изолированных контейнерах Docker с интеграцией OpenClaw.

OpenClawRadar
Пользователи OpenClaw сообщают о проблемах с планированием и проверкой при использовании ИИ-агентов.
Инструменты

Пользователи OpenClaw сообщают о проблемах с планированием и проверкой при использовании ИИ-агентов.

Пользователи OpenClaw описывают процессы планирования и проверки как 'похожие на MS-DOS', несмотря на эффективную генерацию кода, ссылаясь на необходимость ручного вмешательства, фрагментацию документов и потерю логики при совместной работе агентов. Некоторые экспериментируют с редакторами документов, созданными специально для агентов, такими как comment.io и Proof by Every.

OpenClawRadar
Результаты тестирования: 331 модель GGUF протестирована на Mac Mini M4 16 ГБ
Инструменты

Результаты тестирования: 331 модель GGUF протестирована на Mac Mini M4 16 ГБ

Тестирование 331 модели GGUF на Mac Mini M4 с 16 ГБ оперативной памяти выявило только 11 Парето-оптимальных моделей, и все они имеют архитектуру Mixture-of-Experts. Модели Mixture-of-Experts доминируют по производительности со средней скоростью 20,0 токенов/сек против 4,4 у плотных моделей.

OpenClawRadar