Исправление скорости обработки промптов в Llama.cpp с использованием параметра --ubatch-size

✍️ OpenClawRadar📅 Опубликовано: 17 апреля 2026 г.🔗 Source
Исправление скорости обработки промптов в Llama.cpp с использованием параметра --ubatch-size
Ad

Оптимизация обработки промптов в Llama.cpp

Пользователь Reddit поделился своим опытом оптимизации скорости обработки промптов в Llama.cpp при работе с большими моделями, такими как Qwen 27B. Он обнаружил, что настройка параметра --ubatch-size значительно улучшает производительность.

Ad

Ключевые выводы

Пользователь экспериментировал с параметром --ubatch-size после того, как не смог понять его функцию из документации и получил противоречивые результаты от ИИ-ассистентов. Он "настраивал датчики" для удовольствия и использовал метод проб и ошибок для поиска оптимальных настроек.

Для его видеокарты Radeon 9070XT с кэшем L3 размером 64 МБ установка --ubatch-size на значение 64 привела к значительному увеличению скорости:

  • Обработка промптов стала "фактически пригодной для вызова кода Claude"
  • Производительность была "невероятно быстрой" по сравнению с более высокими значениями
  • Он заметил свист дросселя GPU при нахождении оптимальной настройки

Значение --ubatch-size по умолчанию, по-видимому, равно 512, что, как обнаружил пользователь, давало плохие результаты, если его не менять. Он признал, что это может быть очевидно для более опытных пользователей, но поделился своими выводами, чтобы помочь другим, кто может столкнуться с подобными проблемами.

Этот подход к оптимизации предполагает соответствие параметра --ubatch-size размеру кэша L3 вашей конкретной видеокарты в мегабайтах, что может быть особенно полезно при работе с большими языковыми моделями, требующими эффективного управления памятью во время обработки промптов.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Обходное решение для Firefox при зависании Claude.ai с использованием скрипта Tampermonkey
Советы

Обходное решение для Firefox при зависании Claude.ai с использованием скрипта Tampermonkey

Пользователь Reddit делится обходным решением с помощью скрипта Tampermonkey для пользователей Firefox, сталкивающихся с зависаниями на Claude.ai. Скрипт изменяет поведение Date.now(), чтобы предотвратить конфликты синхронизации, вызывающие зависание интерфейса.

OpenClawRadar
Маршрутизация подзадач агента к более дешевым моделям снизила стоимость с $18 до $4 при том же рефакторинге
Советы

Маршрутизация подзадач агента к более дешевым моделям снизила стоимость с $18 до $4 при том же рефакторинге

Разработчик снизил стоимость запуска агента с 18 до 4 долларов, направив рутинные подзадачи (линтер, переименование, правки конфигов) на дешевые модели вроде DeepSeek V4 Pro и Tencent Hunyuan Hy3, оставив Opus 4.7 для сложных рассуждений.

OpenClawRadar
Браузерные агенты съели мой API-бюджет: скрытая стоимость циклов наблюдения
Советы

Браузерные агенты съели мой API-бюджет: скрытая стоимость циклов наблюдения

Запускаете ИИ-агентов на реальных веб-задачах? Пользователь Reddit сообщает, что циклы наблюдения браузера — а не модель — являются основным источником затрат. Каждый клик, ожидание и наблюдение вызывают обмен данными, а низкое качество снимков экрана создает порочный круг сбоев, увеличивающий расход токенов. Изолированные среды браузера и более быстрое выполнение агентов — ключевые меры экономии.

OpenClawRadar
Шаблон OpenClaw AGENTS.md для автоматизированной подготовки к продающим звонкам
Советы

Шаблон OpenClaw AGENTS.md для автоматизированной подготовки к продающим звонкам

Пользователь Reddit делится инструкцией AGENTS.md для OpenClaw, которая автоматизирует исследование потенциальных клиентов перед продающими звонками, изучая детали компании и болевые точки, чтобы отправить брифинг за 10 минут до встречи.

OpenClawRadar