Локальный Qwen 3.6 против передовых моделей на задаче программирования: одиночный HTML-файл для анимации на Canvas

Пользователь Reddit провел прямое сравнение локальных квантифицированных моделей с ведущими веб-моделями на конкретном примитиве программирования: генерация одного HTML-файла с полноэкранной canvas-анимацией бокового вида автомобиля, движущегося с параллаксной прокруткой, вращающимися колесами и кинематографическим освещением.
Запрос
Точный запрос требовал один HTML-файл без библиотек, полноэкранный canvas, реалистичную анимацию автомобиля сбоку, многослойный параллаксный пейзаж, вращающиеся колеса, легкое движение кузова, плавное зацикливание и целостное небо/освещение.
Протестированные модели
Ведущие (веб-версии через Perplexity, ток/с не измерялись):
- Claude Sonnet 4.6 Thinking (использовал интернет для рассуждений)
- Gemini 3.1 Pro Thinking
- GPT 5.4 Thinking
- Kimi k2.6 Thinking
Локальные (Ryzen 5 5600, 24 ГБ DDR4-3200, RX 5700 XT 8 ГБ):
- Qwen3.5 9B Q4_K_M — ~50 ток/с
- Qwen3.6-27B (Claude-opus-reasoning-distilled) Q4_K_M — 2.65 ток/с
- Qwen3.6-27B Q4_K_M — 2.70 ток/с
- Qwen3.6-31B A3B Q4_K_M — 12.13 ток/с
- Gemma-4-31b-it — 1.91 ток/с
- Qwen3.5 4B Q8 — 60 ток/с (использовал интернет для рассуждений)
- Qwen3.5 4B Q4_K_M — 80 ток/с (использовал интернет для рассуждений)
Результаты и субъективный рейтинг
Рейтинг для этой конкретной задачи:
- Kimi k2.6 Thinking — самый чистый визуальный результат
- Qwen3.6-27B Q4_K_M (локальная) — лучше ожидаемого; хороший параллакс и ощущение дороги
- Qwen3.6-27B Claude-opus-reasoning-distilled — близкое третье место
Локальная 27B квантифицированная модель показала более естественное движение и наслоение, чем некоторые ведущие модели, для этого конкретного визуального примитива. Автор отметил, что ожидал более явного превосходства ведущих моделей над локальными квантифицированными.
Пользователь менял только тег HTML <title>, чтобы отслеживать, какая модель сгенерировала какой файл. Результаты опубликованы в ветке вместе со скриншотами/GIF-анимациями работающих анимаций.
📖 Source: r/LocalLLaMA
👀 Смотрите также

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире
Последние данные Anthropic показывают неравномерное внедрение ИИ в мире, измеряя интенсивность использования, а не общее количество пользователей. Отчёт демонстрирует, где ИИ интегрирован в рабочие процессы, такие как программирование, исследования и принятие решений, как среди частных лиц, так и в бизнесе.

Новый ИИ-репетитор достигает размера эффекта 0.71–1.30 SD на курсе Дартмута
Новый ИИ-тьютор для вводного курса информатики Дартмута показал улучшение успеваемости на 0,71–1,30 стандартного отклонения по сравнению с контрольной группой.

Anthropic отменяет политику в отношении сторонних SDK и claude-p, снижая эффективную стоимость инференса для максимальных подписчиков в 25–40 раз
Anthropic отменила запрет на использование сторонними агентами учетных данных подписки, но переместила claude-p и Agent SDK в отдельный, непереносимый пул кредитов, выставляемый по тарифам API, что снизило эффективную стоимость вывода для подписчиков Max в 25–40 раз.

18-месячный переписывание кодовой базы Autonoma: уроки по тестированию, техническому долгу и Server Actions
Autonoma выбросила 1,5 года кода после масштабирования с 2 до 14 инженеров, назвав отсутствие тестов, нестрогий TypeScript и ограничения Server Actions ключевыми причинами для переписывания.