Kimi K2.6 против Claude Opus 4.7: Практическое сравнение кода на примере мода для Minetest с интеграцией Google Sheets

Что за тест?
Разработчик сравнил Kimi K2.6 и Claude Opus 4.7 на двухэтапной задаче программирования: создание игрового мода доски объявлений для Minetest/Luanti с бэкендом на TypeScript, затем расширение его логированием в Google Sheets через Composio. Обе модели получили одинаковые промпты и оценивались по рабочему результату, качеству кода, сложности отладки, времени, использованию токенов и стоимости.
Настройка: Claude Opus 4.7 через Claude Code, Kimi K2.6 через OpenCode на OpenRouter. Тот же репозиторий, те же критерии успеха.
Тест 1: Локальная доска объявлений
Claude Opus 4.7 создал бэкенд на Express/Zod/Vitest, Lua-мод, поток /bounty, награды и таблицу лидеров с проходящими тестами.
- Стоимость: ~3,59$
- Время: 12 мин API, 23 мин общего
- Код: +1 688 / -0
- Вывод: 54,8 тыс. токенов
- Чтение кеша: 2,8 млн токенов
Kimi K2.6 также сделал работающую локальную доску объявлений — маршруты бэкенда, Lua-мод, базовый игровой процесс — но код был грязнее. Он записал secure.http_mods = bountykimi в глобальный конфиг, но также создал конфиг уровня мира с другим именем мода, поэтому HTTP API не был включен для реально запущенного мода. Отладка заняла более 30 минут.
- Стоимость: ~0,39$
- Длительность: ~9 мин 27 сек
- Изменения кода: +4 671 / -0 (в 2,7 раза больше, чем у Opus)
- Использовано контекста: 52 073 токена
- Окно контекста: 20%
Вердикт: Обе прошли Тест 1, но вывод Opus был чище и компактнее.
Тест 2: Composio + Google Sheets
Claude Opus 4.7 добился синхронизации с Google Sheets после некоторых разбирательств с tsx watch и загрузкой переменных окружения. Бэкенд смог завершать bounty и добавлять данные в Google Sheets через Composio.
- Стоимость: 16,03$ (болезненно)
- Время: 28 мин API, 1 ч 17 мин общего
- Код: +1 848 / -507
- Чтение кеша: 22,3 млн токенов
- Вывод: 123,3 тыс. токенов
Kimi K2.6 провалился. Он застрял на проблемах с dev-сервером, тестами и сборкой, и так и не довел интеграцию с Composio до рабочего состояния. Примерно через 25 минут и 135 тыс.+ токенов тест был остановлен.
- Стоимость: ~5,03$
- Время: ~25 мин
- Токены: 135 тыс.+
Ключевые выводы
- Лучший локальный MVP: Opus (чище), но Kimi гораздо выгоднее по цене.
- Лучшая реальная интеграция: Opus с большим отрывом.
- Более чистый код: Opus (1,7 тыс. против 4,7 тыс. строк для той же задачи).
- Самая дешевая экспериментальная модель: Kimi K2.6.
- Самая болезненная стоимость: Opus (16$ за синхронизацию с Google Sheets).
Kimi K2.6 интересен для дешевых локальных задач программирования — 0,39$ за рабочий Lua + TypeScript мод впечатляет. Но когда речь идет о внешних инструментах, проблемах с конфигурацией и реальной интеграции, Opus 4.7 остается явным лидером.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比
Строгий бенчмарк локальных и frontier LLM для генерации бэкенд-кода через вызов функций с оценочной рубрикой. Ключевые выводы: qwen3.5-35b-a3b соответствует gpt-5.4 в проектировании БД/API, а плотная Qwen 27B превосходит 397B MoE. Frontier модели исключены из-за стоимости.

Дилемма разработчика: соображения национальной безопасности ограничивают выбор открытых моделей
Разработчик, работающий с клиентами, чувствительными к вопросам национальной безопасности, сообщает о вынужденном выборе между устаревшими открытыми моделями США, такими как gpt-oss-120b, и более мощными китайскими моделями, такими как GLM и MiniMax, которые клиенты отвергают как угрозу национальной безопасности.

Claude Code v2.1.199 исправляет более 20 ошибок: SSL, сабагенты, крахи демона
Claude Code v2.1.199 исправляет ошибки SSL-сертификатов, молчаливые сбои сабагентов, цикл падений демона Linux и более 20 других багов. Основные исправления: мгновенные подсказки по ошибкам SSL, сохранение частичного вывода потока и корректное распространение ошибок сабагентов.

Лонгитюдное исследование показывает, что рост производительности благодаря ИИ составляет 10%, а не десятикратный.
Лонгитюдное исследование, отслеживающее 40 компаний с ноября 2024 по февраль 2026 года, показало, что использование ИИ в среднем увеличилось на 65%, но пропускная способность по пул-реквестам выросла лишь на 9,97%. Данные свидетельствуют, что написание кода никогда не было основным узким местом в разработке программного обеспечения.