RTX 5000 PRO 48GB обеспечивает кэширование точности 4400 ток/с для Qwen3.6-27B

✍️ OpenClawRadar📅 Опубликовано: 14 мая 2026 г.🔗 Source
RTX 5000 PRO 48GB обеспечивает кэширование точности 4400 ток/с для Qwen3.6-27B
Ad

Один разработчик рискнул, выбрав RTX 5000 Pro 48GB ($4300 с налогами) вместо Mac Studio — и цифры оправдывают скачок: до 4400 токенов/сек при обработке промптов (PP) и 50–80 ток/с при генерации текста (TG) с Qwen3.6-27B-FP8 и полным KV-кэшем BF16.

Состав оборудования и стоимость

  • Цена GPU: $4300 (с налогами)
  • Общая стоимость сборки: $5600 с 64GB RAM
  • Лимит контекста: 200K токенов с полной точностью (KV-кэш BF16)

Производительность

  • Обработка промптов: 4400 ток/с
  • Генерация текста: 50–60 ток/с для очень больших промптов, до 80 ток/с для меньших
  • Модель: Qwen3.6-27B-FP8 с кэшем полной точности
  • Энергопотребление: Примерно вдвое меньше, чем у двух RTX 5090
Ad

Ключевые наблюдения

Пользователь собрал ПК с нулевым опытом, полагаясь на Claude Code (сжег 50% недельного лимита Claude Code Max на настройку vLLM/Linux). Основным ориентиром послужил пост на Reddit с точными настройками vLLM для Qwen3.6-27B-FP8 с BF16-кэшем. Автор отмечает, что две RTX 5090 показали бы лучшую производительность, но стоили бы значительно дороже, а также создавали бы больше шума и потребляли больше энергии.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Эксперимент "OpenClaw": ИИ-агенты выбирают молчание для улучшения соотношения сигнал/шум.
Новости

Эксперимент "OpenClaw": ИИ-агенты выбирают молчание для улучшения соотношения сигнал/шум.

Эксперимент OpenClaw предоставляет ИИ-агентам автономию пропускать задачи, когда они не могут добавить ценность, записывая решения о молчании в «журнал молчания» с обоснованием. Система использует вызовы LLM перед генерацией контента и автоматически корректирует пороги после 3 последовательных дней молчания.

OpenClawRadar
Pantheon-Reasoning-27B: Модель плотного рассуждения RP от Gryphe
Новости

Pantheon-Reasoning-27B: Модель плотного рассуждения RP от Gryphe

Gryphe выпускает Pantheon-Reasoning-27B — цензурированную доработку Qwen 3.6 27B с полными цепочками рассуждений для ролевых игр. Модель обучена на данных Pantheon, Opus-4.6-Reasoning-24k, WorldSim, текстовых квестов и общих RP-данных. Доступны квантизации GGUF.

OpenClawRadar
中国阻止Meta收购AI初创公司Manus
Новости

中国阻止Meta收购AI初创公司Manus

Правительство Китая заблокировало предложенное Meta приобретение AI-стартапа Manus, сославшись на опасения по поводу национальной безопасности. Сообщается, что стоимость сделки превышала 1 миллиард долларов.

OpenClawRadar
Сравнение производительности моделей Qwen 3.5 с основными моделями искусственного интеллекта
Новости

Сравнение производительности моделей Qwen 3.5 с основными моделями искусственного интеллекта

Сайт для сравнения бенчмарков включает проверенные оценки и сравнительные инфографики для моделей Qwen 3.5 (122B, 35B, 27B, 397B) в сравнении с такими моделями, как GPT-5.2, Claude 4.5 Opus, Gemini-3 Pro и другими.

OpenClawRadar