RTX 5000 PRO 48GB обеспечивает кэширование точности 4400 ток/с для Qwen3.6-27B

Один разработчик рискнул, выбрав RTX 5000 Pro 48GB ($4300 с налогами) вместо Mac Studio — и цифры оправдывают скачок: до 4400 токенов/сек при обработке промптов (PP) и 50–80 ток/с при генерации текста (TG) с Qwen3.6-27B-FP8 и полным KV-кэшем BF16.
Состав оборудования и стоимость
- Цена GPU: $4300 (с налогами)
- Общая стоимость сборки: $5600 с 64GB RAM
- Лимит контекста: 200K токенов с полной точностью (KV-кэш BF16)
Производительность
- Обработка промптов: 4400 ток/с
- Генерация текста: 50–60 ток/с для очень больших промптов, до 80 ток/с для меньших
- Модель: Qwen3.6-27B-FP8 с кэшем полной точности
- Энергопотребление: Примерно вдвое меньше, чем у двух RTX 5090
Ключевые наблюдения
Пользователь собрал ПК с нулевым опытом, полагаясь на Claude Code (сжег 50% недельного лимита Claude Code Max на настройку vLLM/Linux). Основным ориентиром послужил пост на Reddit с точными настройками vLLM для Qwen3.6-27B-FP8 с BF16-кэшем. Автор отмечает, что две RTX 5090 показали бы лучшую производительность, но стоили бы значительно дороже, а также создавали бы больше шума и потребляли больше энергии.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Эксперимент "OpenClaw": ИИ-агенты выбирают молчание для улучшения соотношения сигнал/шум.
Эксперимент OpenClaw предоставляет ИИ-агентам автономию пропускать задачи, когда они не могут добавить ценность, записывая решения о молчании в «журнал молчания» с обоснованием. Система использует вызовы LLM перед генерацией контента и автоматически корректирует пороги после 3 последовательных дней молчания.

Pantheon-Reasoning-27B: Модель плотного рассуждения RP от Gryphe
Gryphe выпускает Pantheon-Reasoning-27B — цензурированную доработку Qwen 3.6 27B с полными цепочками рассуждений для ролевых игр. Модель обучена на данных Pantheon, Opus-4.6-Reasoning-24k, WorldSim, текстовых квестов и общих RP-данных. Доступны квантизации GGUF.

中国阻止Meta收购AI初创公司Manus
Правительство Китая заблокировало предложенное Meta приобретение AI-стартапа Manus, сославшись на опасения по поводу национальной безопасности. Сообщается, что стоимость сделки превышала 1 миллиард долларов.

Сравнение производительности моделей Qwen 3.5 с основными моделями искусственного интеллекта
Сайт для сравнения бенчмарков включает проверенные оценки и сравнительные инфографики для моделей Qwen 3.5 (122B, 35B, 27B, 397B) в сравнении с такими моделями, как GPT-5.2, Claude 4.5 Opus, Gemini-3 Pro и другими.