Разработчик тестирует Qwen3.5 27B в сравнении с более крупными моделями для локальных задач программирования.

Разработчик протестировал несколько больших языковых моделей для локальных задач программирования, сравнивая производительность и требования к оборудованию. Тестирование было сосредоточено на вариантах Qwen3.5 и моделях Nemotron, с сравнением с GPT-5.4 High.
Результаты тестирования и выводы
Разработчик протестировал следующие конкретные модели:
- unsloth/Qwen3.5-27B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-122B-A10B-GGUF
- unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL
- unsloth/Qwen3.5-27B-GGUF:UD-Q8_K_XL
- unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-IQ4_XS
- unsloth/gpt-oss-120b-GGUF:F16
Ключевые выводы из тестирования:
- Nemotron-3-Super-120B показал себя "очень, очень хорошо", наравне с GPT-5.4 High
- Qwen3.5-27B хорошо справился с задачами разработки
- GPT-OSS-120B и Qwen3.5-122B показали худшие результаты по сравнению с двумя другими моделями
- Nemotron-3-Super-120B последовательно отвечал на испанском (родном языке тестировщика), в то время как другие отвечали на английском
Метрики производительности
Разработчик предоставил конкретные показатели производительности:
- Nemotron-3-Super-120B: 80 токенов в секунду (tg/s), ~2000 обработки промпта (pp), контекст 100k на vast.ai с 4x RTX 3090
- Qwen3.5-27B Q6: 803 pp, 25 tg/s, контекст 256k на vast.ai
Требования к оборудованию
Разработчик отметил ограничения оборудования:
- Qwen3.5-122B потребовал бы новой материнской платы и 1-2 дополнительных видеокарт RTX 3090, что делает его слишком дорогим
- Qwen3.5-27B работает на существующем оборудовании с 2x RTX 3090 без дополнительных инвестиций
- Если бы у них было оборудование для Nemotron-3-Super-120B, они бы использовали его вместо этого
Детали реализации
Разработчик планирует использовать Qwen3.5-27B-GGUF:UD-Q6_K_XL для реальных задач разработки локально и предоставил команду llama.cpp, использованную для тестирования:
./llama.cpp/llama-server -hf unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL --ctx-size 262144 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 -ngl 999
Разработчик упомянул, что продолжит использовать CODEX для сложных задач, но может заменить API-подписки для ежедневных задач локальной настройкой.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

ClawedBack: Порт OpenClaw, работающий внутри кода Claude
ClawedBack — это чистая портированная версия OpenClaw, работающая внутри Claude Code, с встроенным кэшированием промптов и ограничениями по частоте запросов. Она поддерживает 19 из 23 встроенных инструментов OpenClaw и полностью совместима с ClawHub, включая обязательные проверки безопасности для импортируемых модулей.

Сообщение другим сессиям Claude Code: межсессионный обмен сообщениями
Claude Code v2.1.224+ позволяет Клоду отправлять сообщения между вашими сессиями, чтобы координировать параллельную работу, делиться находками и предупреждать о критических изменениях без копирования и вставки.

GitVelocity: Анализ 50 тысяч PR с помощью ИИ выявляет взаимосвязь со сложностью кода
GitVelocity использует Claude для оценки объединённых pull request'ов по шкале от 0 до 100 по шести параметрам: масштаб, архитектура, реализация, риск, качество и производительность/безопасность. Проанализировав более 50 000 PR в TypeScript, Python, Rust, Go, Java и Elixir, команда обнаружила удивительные закономерности относительно размера PR, покрытия тестами и внедрения ИИ.

nervx: CLI-инструмент сокращает использование токенов кода Claude за счет анализа структуры кодовой базы
nervx — это устанавливаемый через pip CLI-инструмент, который анализирует репозитории с помощью tree-sitter, строит граф SQLite из функций и импортов и генерирует структурную карту NERVX.md. Он автоматически добавляет инструкции в CLAUDE.md, обучая Claude использовать навигацию nervx, что в тестах сократило количество grep-поисков на 65% и выходных токенов на 48%.