RTX 5000 PRO 48GB обеспечивает кэширование точности 4400 ток/с для Qwen3.6-27B

✍️ OpenClawRadar📅 Опубликовано: 14 мая 2026 г.🔗 Source
RTX 5000 PRO 48GB обеспечивает кэширование точности 4400 ток/с для Qwen3.6-27B
Ad

Один разработчик рискнул, выбрав RTX 5000 Pro 48GB ($4300 с налогами) вместо Mac Studio — и цифры оправдывают скачок: до 4400 токенов/сек при обработке промптов (PP) и 50–80 ток/с при генерации текста (TG) с Qwen3.6-27B-FP8 и полным KV-кэшем BF16.

Состав оборудования и стоимость

  • Цена GPU: $4300 (с налогами)
  • Общая стоимость сборки: $5600 с 64GB RAM
  • Лимит контекста: 200K токенов с полной точностью (KV-кэш BF16)

Производительность

  • Обработка промптов: 4400 ток/с
  • Генерация текста: 50–60 ток/с для очень больших промптов, до 80 ток/с для меньших
  • Модель: Qwen3.6-27B-FP8 с кэшем полной точности
  • Энергопотребление: Примерно вдвое меньше, чем у двух RTX 5090
Ad

Ключевые наблюдения

Пользователь собрал ПК с нулевым опытом, полагаясь на Claude Code (сжег 50% недельного лимита Claude Code Max на настройку vLLM/Linux). Основным ориентиром послужил пост на Reddit с точными настройками vLLM для Qwen3.6-27B-FP8 с BF16-кэшем. Автор отмечает, что две RTX 5090 показали бы лучшую производительность, но стоили бы значительно дороже, а также создавали бы больше шума и потребляли больше энергии.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Выпуск Claude Code версии 2.1.77: Лимиты токенов, управление песочницей и исправления ошибок
Новости

Выпуск Claude Code версии 2.1.77: Лимиты токенов, управление песочницей и исправления ошибок

Claude Code v2.1.77 увеличивает стандартные максимальные лимиты токенов вывода для Claude Opus 4.6 до 64 тысяч токенов и добавляет настройку песочницы allowRead для файловой системы. В релиз включено более 30 исправлений проблем, начиная от управления памятью до поведения терминального интерфейса.

OpenClawRadar
Дилемма разработчика: соображения национальной безопасности ограничивают выбор открытых моделей
Новости

Дилемма разработчика: соображения национальной безопасности ограничивают выбор открытых моделей

Разработчик, работающий с клиентами, чувствительными к вопросам национальной безопасности, сообщает о вынужденном выборе между устаревшими открытыми моделями США, такими как gpt-oss-120b, и более мощными китайскими моделями, такими как GLM и MiniMax, которые клиенты отвергают как угрозу национальной безопасности.

OpenClawRadar
Клод создает Python-скрипт, который находит рекордный 10 069-значный эмирп.
Новости

Клод создает Python-скрипт, который находит рекордный 10 069-значный эмирп.

Claude Opus 4.6 от Anthropic сгенерировал Python-скрипт, который обнаружил эмирп (обратимое простое число) из 10 069 цифр примерно за один день процессорного времени, побив предыдущий мировой рекорд. Скрипт использует четыре уровня решета простых чисел, включая CUDA-ядро для быстрой генерации случайных чисел.

OpenClawRadar
Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.
Новости

Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.

Gemma 4 31B заняла 3-е место в тесте FoodTruck Bench, превзойдя GLM 5, Qwen 3.5 397B и все модели Claude Sonnet. Модель, по-видимому, лучше справляется с долгосрочными задачами и следует собственным рекомендациям при планировании.

OpenClawRadar