Qwen3.5-35B-A3B-UD-Q6_K_XL Протестировано в производственных рабочих процессах разработки

Разработчик на r/LocalLLaMA поделился подробными результатами тестирования модели Qwen3.5-35B-A3B-UD-Q6_K_XL в сценариях производственной разработки. Пользователь провёл как бенчмарк-тестирование, так и практическое применение на реальных клиентских проектах.
Показатели производительности
Модель показала результаты бенчмарков 1504pp2048 и 47.71 tg256. Скорость генерации токенов была стабильной при распределении на две видеокарты и увеличилась до 80 токенов в секунду (tps) при работе на одной видеокарте.
Методология тестирования в продакшене
Разработчик тестировал модель на пяти различных проектах, используя Git Worktrees для отката к известным спецификациям и функциям. Спецификации для этих тестов были сгенерированы Claude, при этом разработчик использовал план Max Pro в течение последнего года.
- Тестирование проводилось на проектах JavaScript, Go и Rust
- Использовались Git Worktrees для контроля версий во время тестирования
- Большинство "багов" требовали лишь 5-минутных правок или могли быть исправлены вторым промптом
- Опыт сравнивался с использованием Sonnet 4
Практические результаты и бизнес-последствия
Разработчик сообщил, что Qwen3.5 "справился блестяще" для выполняемой им работы, особенно отметив высокую производительность на проектах Go и Rust. Это заставило серьёзно задуматься о переходе от API-моделей к гибридному подходу: использование передовых моделей через API для генерации спецификаций и ревью, а локальных моделей — для разработки.
Тестирование подняло вопросы о соотношении инвестиций в оборудование и затрат на подписки. Разработчик уже потратил $2000 на Claude Pro Max с июня 2025 года, а потенциальные затраты могут достичь $6800 к 2027 году при продолжении подписок. Это привело к рассмотрению покупки RTX 6000 Pro как бизнес-инвестиции.
Ранее разработчик использовал Qwen Coder для автодополнения кода, но обнаружил, что Qwen3.5 выводит возможности локальных моделей на новый уровень для производственного использования.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

llm-use – Открытая платформа для маршрутизации и оркестрации многопоточных рабочих процессов агентов LLM.
llm-use революционизирует автоматизацию с помощью своей открытой архитектуры, разработанной для эффективной маршрутизации и организации рабочих процессов многоагентных LLM. Изучите его влияние на операции AI.

Calmkeep: Внешний слой непрерывности для противодействия дрейфу LLM в длинных сессиях
Calmkeep — это внешний слой непрерывности, предназначенный для противодействия дрейфу LLM в длинных сессиях. В тесте на 25 шагов при сборке бэкенда он показал 85% целостности против 60% у стандартного Claude, а в юридической сессии — 100% против 50%.

PhAIL Benchmark Проверяет Модели VLA на Реальных Задачах Складских Роботов
PhAIL — это бенчмарк для реальных роботов, который тестирует четыре модели «зрение-язык-действие» на задаче подбора заказов из ящика в ящик с использованием робота Franka FR3. Лучшая модель показала результат 64 единицы в час, в то время как при телеуправлении человеком достигается 330 ед./ч, а при ручной работе человека — более 1300 ед./ч.

Нельсон: Плагин Claude Code для координации ИИ-агентов по принципу военно-морского флота
Nelson — это плагин Claude Code, который структурирует координацию ИИ-агентов, используя принципы военно-морского флота. Он включает три режима выполнения, систему классификации рисков, мониторинг целостности корпуса и шлюзы постоянных приказов для предотвращения распространённых антипаттернов.