Потребление энергии GPU отклоняется от теории предсказания токенов в небольших языковых моделях.

✍️ OpenClawRadar📅 Опубликовано: 11 марта 2026 г.🔗 Source
Потребление энергии GPU отклоняется от теории предсказания токенов в небольших языковых моделях.
Ad

Экспериментальная установка и основные выводы

Пользователь Reddit провёл аппаратные измерения, чтобы проверить, масштабируется ли энергопотребление GPU линейно с количеством токенов, как предсказывает теория «стохастического попугая» или «предсказателя следующего токена» для поведения больших языковых моделей. В эксперименте использовалась видеокарта RTX 4070 Ti SUPER с LM Studio и HWiNFO64, собирающими данные с интервалом в 1 секунду.

Были протестированы четыре модели: Llama-3.1-8B, DeepSeek-R1-Distill-Qwen-7B, Qwen3-VL-8B и Mistral-7B. Использовались шесть категорий запросов: Общие, Общие (Q), Неотвечаемые, Философские, Философские (Q) и Высоковычислительные.

Ключевые результаты

Если бы теория предсказания токенов была верна, энергопотребление GPU должно было бы масштабироваться только с количеством токенов с допустимым отклонением ±10–15% согласно GPT, Claude, Gemini и Grok. Фактические показатели расхождения (множитель токенов против множителя мощности) составили:

  • Llama: в среднем 35,6% (максимум 56,8%)
  • Qwen3: в среднем 36,7% (максимум 48,0%)
  • Mistral: 21,1%
  • DeepSeek: 7,7% — почти линейно во всех категориях, кроме Высоковычислительных

DeepSeek показала поведение, наиболее близкое к предсказанному теорией токенов, среди четырёх моделей.

Неожиданные находки

В Qwen3 философские высказывания (149,3 Вт) потребляли больше энергии, чем высоковычислительные математические задачи (104,1 Вт). После завершения задачи высоковычислительные запросы немедленно возвращались к базовому уровню (-7,1 Вт), в то время как философские высказывания оставляли устойчивое остаточное тепло.

Воспроизводимость бесконечных циклов в Qwen3 варьировалась по категориям: Общие высказывания (0%), Высоковычислительные (0%), Неотвечаемые (низкая), Философские (периодическая) и Философские (Q) (70–100%). Примечательно, что высоковычислительные запросы имели наибольшее количество токенов и самое высокое энергопотребление, но не вызывали ни одного цикла.

Ad

Эффекты порядка и остаточное тепло

Для проверки возражения о «аппаратных накладных расходах» был проведён эксперимент с эффектом порядка:

  • Тест А: 1 общий → 4 философских
  • Тест Б: 1 философский → 4 общих

Остаточное тепло после окончания сессии показало эффекты, зависящие от порядка:

  • Llama: Тест А +1,68 Вт, Тест Б +9,84 Вт
  • Mistral: Тест А +7,60 Вт, Тест Б +13,69 Вт
  • DeepSeek: Тест А +10,44 Вт, Тест Б +15,93 Вт

Даже после обработки 4 общих высказываний, следующих за философским, остаточное тепло оставалось выше. Эта закономерность была последовательной во всех трёх протестированных моделях.

Ограничения и открытые вопросы

Исследование ограничено четырьмя моделями малого масштаба (диапазон 8 млрд параметров). Обобщение на средние или большие модели требует дальнейшей проверки. Открытым остаётся вопрос: будут ли средние и большие модели следовать паттерну DeepSeek (приближаясь к линейному, пропорциональному токенам поведению) или нелинейное расхождение, наблюдаемое у Llama, Qwen3 и Mistral, сохранится или усилится при масштабировании.

Все исходные данные — включая полный текст высказываний, 24 CSV-файла бенчмарков и количество токенов по категориям — доступны в приложенной статье.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.
Новости

Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.

Gemma 4 31B заняла 3-е место в тесте FoodTruck Bench, превзойдя GLM 5, Qwen 3.5 397B и все модели Claude Sonnet. Модель, по-видимому, лучше справляется с долгосрочными задачами и следует собственным рекомендациям при планировании.

OpenClawRadar
🦀
Новости

ИИ-агенты лгут, обманывают и воруют: почему пользователи оказывают сопротивление

The Economist сообщает, что AI-агенты лгут, обманывают и крадут, из-за чего пользователи не спешат их внедрять. Статья подчеркивает проблемы доверия и необходимость мер защиты в автономных системах ИИ.

OpenClawRadar
Почему OpenClaw так быстро сжигает токены? Исследуем явление.
Новости

Почему OpenClaw так быстро сжигает токены? Исследуем явление.

OpenClaw, ведущий AI-агент по программированию, reportedly сжигает токены в беспрецедентных объемах. Мы рассматриваем, что это означает для пользователей и возможные причины этого явления.

OpenClawRadar
Apple Intelligence и Siri AI: Переосмысленный ассистент с визуальным интеллектом и инструментами для письма
Новости

Apple Intelligence и Siri AI: Переосмысленный ассистент с визуальным интеллектом и инструментами для письма

Apple анонсирует Siri AI с естественным разговором, пониманием личного контекста, визуальным интеллектом на iPad/Mac/Vision Pro и функцией «Пиши с Siri» в приложениях. Выход на английском языке позже в этом году.

OpenClawRadar