Локальный Qwen 3.6 против передовых моделей на задаче программирования: одиночный HTML-файл для анимации на Canvas

Пользователь Reddit провел прямое сравнение локальных квантифицированных моделей с ведущими веб-моделями на конкретном примитиве программирования: генерация одного HTML-файла с полноэкранной canvas-анимацией бокового вида автомобиля, движущегося с параллаксной прокруткой, вращающимися колесами и кинематографическим освещением.
Запрос
Точный запрос требовал один HTML-файл без библиотек, полноэкранный canvas, реалистичную анимацию автомобиля сбоку, многослойный параллаксный пейзаж, вращающиеся колеса, легкое движение кузова, плавное зацикливание и целостное небо/освещение.
Протестированные модели
Ведущие (веб-версии через Perplexity, ток/с не измерялись):
- Claude Sonnet 4.6 Thinking (использовал интернет для рассуждений)
- Gemini 3.1 Pro Thinking
- GPT 5.4 Thinking
- Kimi k2.6 Thinking
Локальные (Ryzen 5 5600, 24 ГБ DDR4-3200, RX 5700 XT 8 ГБ):
- Qwen3.5 9B Q4_K_M — ~50 ток/с
- Qwen3.6-27B (Claude-opus-reasoning-distilled) Q4_K_M — 2.65 ток/с
- Qwen3.6-27B Q4_K_M — 2.70 ток/с
- Qwen3.6-31B A3B Q4_K_M — 12.13 ток/с
- Gemma-4-31b-it — 1.91 ток/с
- Qwen3.5 4B Q8 — 60 ток/с (использовал интернет для рассуждений)
- Qwen3.5 4B Q4_K_M — 80 ток/с (использовал интернет для рассуждений)
Результаты и субъективный рейтинг
Рейтинг для этой конкретной задачи:
- Kimi k2.6 Thinking — самый чистый визуальный результат
- Qwen3.6-27B Q4_K_M (локальная) — лучше ожидаемого; хороший параллакс и ощущение дороги
- Qwen3.6-27B Claude-opus-reasoning-distilled — близкое третье место
Локальная 27B квантифицированная модель показала более естественное движение и наслоение, чем некоторые ведущие модели, для этого конкретного визуального примитива. Автор отметил, что ожидал более явного превосходства ведущих моделей над локальными квантифицированными.
Пользователь менял только тег HTML <title>, чтобы отслеживать, какая модель сгенерировала какой файл. Результаты опубликованы в ветке вместе со скриншотами/GIF-анимациями работающих анимаций.
📖 Source: r/LocalLLaMA
👀 Смотрите также

OpenAI разрабатывает AI-смартфон на чипах MediaTek/Qualcomm; цель массового производства — 2028 год
По данным аналитика цепочек поставок Мин-Чи Куо, OpenAI разрабатывает AI-смартфон в партнерстве с чипмейкерами MediaTek и Qualcomm, эксклюзивным производителем Luxshare Precision, с началом массового производства в 2028 году. Устройство позиционируется как контекстно-зависимая платформа AI-агента.

Godot запрещает вклад AI-сгенерированного кода: «Мы не можем доверять активным пользователям ИИ»
Игровой движок Godot больше не будет принимать код, написанный ИИ, ссылаясь на то, что активные пользователи ИИ не могут понять свой код, чтобы исправить его.

DeepSeek-V4 Pro и Flash: 1,6 трлн параметров, контекст в 1 млн токенов, гибридное внимание
DeepSeek-V4-Pro (1,6 трлн параметров, 49 млрд активных) и V4-Flash (284 млрд параметров, 13 млрд активных) поддерживают контекст в 1 млн токенов. Новое гибридное внимание (CSA + HCA) снижает FLOPs при инференсе одного токена до 27% и KV-кэш до 10% от DeepSeek-V3.2.

Определение ИИ-агентов: Тест на работоспособность
Обсуждение на Reddit ставит под сомнение, являются ли многие продукты с ИИ-агентами по сути чат-ботами со списком задач, предлагая тест, основанный на их способности выполнять рабочие процессы в нескольких инструментах без ручного вмешательства.