Сравнение 8 моделей ИИ для программирования на примере реализации реальной функции на TypeScript

✍️ OpenClawRadar📅 Опубликовано: 15 марта 2026 г.🔗 Source
Сравнение 8 моделей ИИ для программирования на примере реализации реальной функции на TypeScript
Ad

Сравнение моделей ИИ для программирования в реальных условиях

Разработчик провёл практическое сравнение 8 моделей ИИ для программирования, поручив им реализовать одну и ту же реальную функцию в существующем проекте на TypeScript. Целью было выйти за рамки синтетических тестов и посмотреть, как модели справляются с работой над реальными кодовыми базами.

Настройка теста

В качестве проекта использовался OpenCode Telegram Bot — Telegram-бот с открытым исходным кодом на TypeScript, созданный на фреймворке grammY, который предоставляет Telegram-интерфейс к возможностям Opencode. Бот поддерживает интернационализацию (i18n) и имеет существующее покрытие тестами.

Задачей была реализация команды /rename, которая переименовывает текущую рабочую сессию. Эта функция затрагивает все слои приложения и требует обработки множества крайних случаев. Исходная реализация была отменена, что обеспечило чистую основу для оценки.

Каждая модель получала одинаковый запрос в два этапа: сначала в режиме планирования (изучение кодовой базы и формирование плана реализации), затем в режиме кодирования. Все тестирование проводилось с использованием Opencode с включёнными режимом «размышления» и логическим выводом.

Протестированные модели

  • Claude 4.6 Sonnet ($3.00 вход/$15.00 выход за 1 млн токенов)
  • Claude 4.6 Opus ($5.00/$25.00)
  • GLM 5 ($1.00/$3.20)
  • Kimi K2.5 ($0.60/$3.00)
  • MiniMax M2.5 ($0.30/$1.20)
  • GPT 5.3 Codex (high) ($1.75/$14.00)
  • GPT 5.4 (high) ($2.50/$15.00)
  • Gemini 3.1 Pro (high) ($2.00/$12.00)

Данные по Coding Index и Agentic Index взяты из Artificial Analysis. Ко всем моделям был доступ через OpenCode Zen — сервис от команды OpenCode, который тестирует модели на совместимость с их инструментом.

Ad

Методология оценки

Использовались четыре метрики:

  • Стоимость API ($) — Общая стоимость всех вызовов API в ходе выполнения задачи, включая под-агентов
  • Время выполнения (мм:сс) — Общее время работы модели
  • Корректность реализации (0-10) — Насколько хорошо поведение соответствует требованиям и крайним случаям
  • Техническое качество (0-10) — Инженерное качество решения

Для оценки корректности и качества использовалась существующая реализация /rename для выработки детальных критериев оценки, охватывающих интеграцию команды, основной поток, обработку ошибок, отмену, i18n, документацию, архитектуру, управление состоянием, тесты и технический долг. Оценку проводила модель GPT-5.3 Codex по структурированной рубрике, при этом несколько запусков показали разброс в пределах ±0,5 балла.

Ключевые выводы

Результаты показали, что GPT-5.4 (high) достиг наивысшего балла по корректности реализации — 57 из 69 по Agentic Index. GLM 5 продемонстрировал сильное соотношение цены и производительности при стоимости $1.00/$3.20 за 1 млн токенов и Coding Index 53. Эксперимент показал, что недорогие модели с открытым исходным кодом из Китая приближаются к проприетарным в практических задачах программирования, хотя одни только бенчмарки не дают полной картины.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Расширение OpenClaw Claude обновлено для использования Agent SDK после изменений в системе биллинга Anthropic.
Инструменты

Расширение OpenClaw Claude обновлено для использования Agent SDK после изменений в системе биллинга Anthropic.

Разработчик расширения OpenClaw переписал свою интеграцию с CLI Claude, чтобы использовать официальный claude-agent-sdk после того, как Anthropic начал обнаруживать и переклассифицировать использование CLI как использование стороннего приложения, которое списывается из отдельного пула кредитов, а не из лимитов плана Max. Подход с SDK аутентифицируется через существующий вход в Claude Code и списывается как обычное использование плана Max.

OpenClawRadar
Эксперимент по сравнительному анализу кода с использованием трех ИИ-инструментов на одной кодовой базе
Инструменты

Эксперимент по сравнительному анализу кода с использованием трех ИИ-инструментов на одной кодовой базе

Видеоэксперимент тестирует Codex, Claude Code и Claude Code с Sextant на одинаковых задачах по ревью кода, где Codex проверяет результаты и оценивает, какой отчёт более полезен. Основное внимание уделяется тому, как рабочий процесс и структура влияют на то, что замечает ИИ и что он приоритезирует.

OpenClawRadar
Исправление проблемы сбоя изображения кода Клода с помощью хука PreToolUse
Инструменты

Исправление проблемы сбоя изображения кода Клода с помощью хука PreToolUse

Разработчик создал PreToolUse-хук, который перехватывает вызовы Read в Claude Code для изображений, безопасно конвертирует их и проксирует через Haiku-подпроцесс, чтобы предотвратить сбои API Error 400 из-за проблемных изображений.

OpenClawRadar
SynapsCAD: Бесплатное настольное приложение для OpenSCAD с интеграцией искусственного интеллекта Claude
Инструменты

SynapsCAD: Бесплатное настольное приложение для OpenSCAD с интеграцией искусственного интеллекта Claude

SynapsCAD — это приложение с открытым исходным кодом для настольных компьютеров, которое объединяет редактор кода OpenSCAD, окно просмотра 3D-моделей в реальном времени и ИИ-помощника. Оно полностью написано на Rust с использованием Bevy 0.15 и egui, а также поддерживает интеграцию с API Claude для программирования 3D CAD на естественном языке.

OpenClawRadar