Исходный код против моделей нового поколения: бенчмарк сцены с автомобилем на холсте в одном файле

Разработчик запустил один и тот же промпт для Canvas в один файл на 12 моделях, чтобы сравнить возможности открытых и передовых моделей в создании реалистичной сцены движения автомобиля с видом сбоку. Задача: один автономный HTML-файл, без библиотек, без внешних ресурсов, с параллаксным фоном, вращающимися колесами, легким движением кузова, кинематографичным освещением и бесшовным зацикливанием. Тестовый инструмент — OpenCodeOrchestra, а результаты доступны на oco-canvas-car-scene-compare.
Протестированные модели
Каждая модель запускалась в изолированном Orchestrator с максимальным доступным уровнем размышлений/усилий. Список включает GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (макс. усилий), Claude Opus 4.6 (макс. усилий), Claude Sonnet 4.6 (высокий уровень усилий), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus и Grok 4.3. Токены в секунду и время генерации не измерялись.
Ключевые выводы
- Некоторые модели внутренне использовали модели-аудиторы; некоторые нет.
- В галерее видны явные победители и неоднозначные результаты.
- MiMo V2.5 Pro была исключена из-за проблем с биллингом в подписке OpenCode Go.
Страница галереи позволяет сравнивать результаты каждой модели бок о бок. Исходный код доступен на GitHub: AidenGeunGeun/oco-canvas-car-scene-compare.
📖 Полный источник: r/LocalLLaMA
👀 Смотрите также

Инженеры ИИ не застрахованы от замены ИИ
По мере того как фундаментальные модели вроде DINO от Meta становятся универсальными, узкоспециализированные роли AI-инженеров оказываются под угрозой. Автор утверждает, что большинство рабочих мест AI-инженеров будут заменены раньше, чем другие должности разработчиков.

Обновление APEX MoE Quants: выпущено 25+ новых моделей и уровень I-Nano
APEX — MoE-адаптивная смешанная точность квантизации — теперь охватывает более 30 моделей из семейств Qwen, Mistral, Gemma и гибридных SSM, а также новое поколение I-Nano, достигающее 2,06 бит на параметр для экспертов средних слоёв.

OpenClaw v2026.7.1: Переработка интерфейса управления, адаптация, мобильные приложения, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1
OpenClaw v2026.7.1 представляет крупное обновление Control UI, переработанный онбординг, обновленные приложения для iOS, Android и macOS, поддержку GPT-5.6, Tencent Hy3 и Meta Muse Spark 1.1, а также улучшенные рабочие процессы Codex и кодинг-агентов.

Claude Code v2.1.162: информация об ожидании сессии, исправление тайм-аута MCP и обновление просмотра агентов
Claude Code v2.1.162 добавляет поле waitingFor в вывод --json, исправляет ошибку таймаута MCP менее 1000 мс, улучшает отрисовку терминала для представления агентов и многое другое. Подробности внутри.