Тестирование показывает, что компактная 4B-модель превосходит более крупные языковые модели в приложениях для обмена сообщениями между телефоном и домашними устройствами.

✍️ OpenClawRadar📅 Опубликовано: 20 апреля 2026 г.🔗 Source
Тестирование показывает, что компактная 4B-модель превосходит более крупные языковые модели в приложениях для обмена сообщениями между телефоном и домашними устройствами.
Ad

Результаты бенчмарка чата с телефона на домашний компьютер

Недавний бенчмарк оценил 8 локальных LLM для приложений чата с телефона на домашний компьютер, где вывод выполняется на домашнем компьютере. Тест включал 640 оценок (8 моделей × 8 наборов данных × 10 образцов) на оборудовании Mac mini M4 Pro 24Gb.

Формула и веса показателя пригодности

Комплексная формула пригодности взвешивала три фактора: 50% UX чата, 30% скорость и 20% качество коротких ответов. Такое взвешивание отдаёт приоритет пользовательскому опыту для мобильных приложений, где задержка имеет наибольшее значение.

Ключевые выводы

  • Gemma3:4B победила с комплексным показателем пригодности 88.7, несмотря на то что это самая маленькая протестированная модель
  • Она достигла самого низкого TTFT (11.2с), самой высокой пропускной способности (89.3 ток/с) и самых низких температур (45°C)
  • Более крупные модели, такие как GPT-OSS:20B, прошли 70% задач, но заняли 6-е место из-за среднего TTFT 25.4с
  • Тепловые характеристики значительно различались: Qwen3:14B достигла пика 83°C, DeepSeek-R1:14B — 81°C
  • Magistral:24B была исключена из финального рейтинга после запуска циклов таймаута и достижения температуры GPU 97°C
Ad

Почему меньшие модели показали лучшие результаты

Бенчмарк показал, что для приложений чата с телефона более быстрое время до первого токена (TTFT) и меньшая тепловая нагрузка важнее, чем чистая точность. Модель с точностью 77.5%, но требующая 25с ожидания первого токена, проигрывает той, которая отвечает с точностью 72.5%, но отвечает за 11с. Тепловой разрыв значителен для надёжности и долговечности личного оборудования.

Независимый анализ

Независимый анализ с использованием Claude на том же наборе из 640 оценок более агрессивно взвесил надёжность и TTFT и пришёл к немного другому порядку топ-4, подтвердив, что взвешивание KPI является выбором, а не абсолютной истиной.

Соображения по вариантам использования

Автор отмечает, что для других вариантов использования, таких как программирование или написание длинных текстов, формула взвешивания полностью изменилась бы, отдавая приоритет качеству над скоростью и UX чата.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Центр обработки данных ИИ в Джорджии использовал 29 миллионов галлонов неучтенной воды
Новости

Центр обработки данных ИИ в Джорджии использовал 29 миллионов галлонов неучтенной воды

Кампус QTS в Фейетвилле за 15 месяцев израсходовал 29 миллионов галлонов воды через два несанкционированных подключения, что вызвало жалобы на низкое давление. Округ отказался от штрафов, выставив счет на 147 тысяч долларов за ретроактивную оплату.

OpenClawRadar
ИИ-агенты убивают ревью кода — объяснение проблемы «принципал-агент»
Новости

ИИ-агенты убивают ревью кода — объяснение проблемы «принципал-агент»

Внедрение AI-агентов в традиционный процесс проверки кода удваивает нагрузку на ревью, разрушает сигналы доверия и создает неустойчивый дисбаланс — это проблема принципала-агента в применении к разработке ПО.

OpenClawRadar
Модель искусственного интеллекта Google Nano Banana 2 для генерации изображений: возможности и доступность
Новости

Модель искусственного интеллекта Google Nano Banana 2 для генерации изображений: возможности и доступность

Google DeepMind выпустила Nano Banana 2 — модель генерации изображений, сочетающую расширенные возможности Nano Banana Pro со скоростью Gemini Flash. Она обеспечивает согласованность объектов для до пяти персонажей, поддерживает разрешения от 512px до 4K и внедряется в продукты Google.

OpenClawRadar
Claude Code v2.1.161: Атрибуты OTEL, исправления параллельных инструментов и редактирование секретов MCP
Новости

Claude Code v2.1.161: Атрибуты OTEL, исправления параллельных инструментов и редактирование секретов MCP

v2.1.161 включает атрибуты ресурсов OTEL в качестве метрик, независимые результаты параллельных вызовов инструментов, редактирование секретов MCP и множество исправлений ошибок для субагентов, хуков Windows и событий журнала OpenTelemetry.

OpenClawRadar