Локальные vs облачные модели: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark в сложной генерации кода

Пользователь Reddit сравнил локально запущенную модель Qwen-3.6-27B (GGUF q4_k_m) с API-эквивалентами: Qwen-3.6-27B через OpenRouter, Gemma-4-31B через OpenRouter, Claude Haiku 4.5 и GPT-Codex-Spark. Тест заключался в реализации цикла автоисследования из проектного документа — намеренно сложная задача для оценки чистоты отказа, а не успеха.
Аппаратная конфигурация
- CPU: Ryzen 7 7800X3D
- ОЗУ: 64 ГБ DDR5-6400
- GPU: RTX 5080 (16 ГБ VRAM)
- Локальная модель: Qwen-3.6-27B q4_k_m (GGUF) — помещается в 16 ГБ VRAM благодаря квантизации
Результаты
- Gemma-4-31B (API): Полный провал. Написал скелет с заглушками модулей, без тестов и конфигурационных файлов (
__init__.py,requirements.txt,pyproject.toml). Стоимость: $0.112, потреблено 803k токенов контекста, сгенерировано 21k. - Codex-Spark (API): Создал красивую структуру папок и код, но импорты были галлюцинациями. Без модульных тестов. Использовано 1% лимита Spark ($100/мес).
- Claude Haiku 4.5 (API): Детальная реализация, но неверная. (Дальнейшие детали обрезаны в источнике.)
- Qwen-3.6-27B (локальная q4_k_m): Не оценена явно, но пользователь отмечает, что квантизированный вывод снижает качество по сравнению с полноценной API-версией.
Контекст
Пользователь утверждает, что типичные тесты локальных моделей используют тривиальные задачи (например, Snake в HTML), где и локальные, и передовые модели преуспевают, что завышает возможности локальных моделей. В этом тесте использовался реальный рабочий проект с проектным документом; только Codex-Spark выдал полностью написанный (но сломанный) код. Вывод: локальные модели пока не готовы к сложной генерации кода без существенных доработок.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Результаты тестирования: модели Qwen3.5 на Apple Silicon и AMD GPU с ROCm и Vulkan
Разработчик провел бенчмарк моделей Qwen3.5 (35B MoE, 27B плотная, 122B MoE) на компьютерах Apple Silicon Mac и рабочих станциях с GPU AMD, сравнивая бэкенды ROCm и Vulkan с тестами на масштабирование контекста. Используемое оборудование включало M5 Max, M1 Max и три GPU AMD с различными конфигурациями PCIe.

Claude Code v2.1.139 добавляет Agent View, команду /goal и крупные улучшения MCP
Claude Code v2.1.139 представляет новый режим агента для управления сессиями, команду /goal для многозадачных задач, расширенные возможности хуков и исправления проблем с памятью MCP-сервера и повреждением терминала.

Подписки на Claude больше не покрывают использование сторонних инструментов.
С завтрашнего дня в 12:00 по тихоокеанскому времени подписки на Claude больше не будут покрывать использование сторонних оболочек, таких как OpenClaw. Пользователи по-прежнему смогут получать доступ к этим оболочкам через дополнительные пакеты использования или ключи API Claude.

Инструменты искусственного интеллекта могут привести к унификации результатов в творческой и проектной работе.
Пользователь Reddit сообщает, что несколько команд, использующих инструменты ИИ, такие как ChatGPT, Co-Pilot и Claude, для разработки стратегических дорожных карт и разработки программного обеспечения, выдают схожие результаты с одинаковыми паттернами модных словечек и структурами дизайна.