Unsloth и NVIDIA сотрудничают для ускорения обучения LLM примерно на 25%

✍️ OpenClawRadar📅 Опубликовано: 7 мая 2026 г.🔗 Source
Unsloth и NVIDIA сотрудничают для ускорения обучения LLM примерно на 25%
Ad

Сотрудничество Unsloth с NVIDIA даёт ~25% ускорение обучения (без потери точности) за счёт реализации трёх ключевых оптимизаций: кэширование метаданных упакованных последовательностей, двойная буферизация асинхронного градиентного контрольного чекпоинта и улучшения маршрутизации MoE. Они автоматически включаются на ноутбуках RTX, дата-центровых GPU и DGX Spark с обновлением Unsloth.

Кэширование метаданных упакованных последовательностей

Упакованное обучение объединяет короткие примеры, чтобы избежать потерь на дополнение. Каждый слой трансформера ранее перестраивал те же метаданные последовательности (длины, cu_seqlens, max_seqlen, структуру маски) с нуля, вызывая накладные расходы на синхронизацию устройство-хост. Кэшируя метаданные один раз на пакет и повторно используя их на всех слоях, Unsloth сокращает повторяющуюся работу.

Бенчмарки на Qwen3-14B QLoRA SFT показывают:

  • Прямой проход: +43,3% быстрее
  • Обратный проход: +5,8% быстрее
  • В целом на пакет: +14,3% быстрее

Микробенчмарк на GPU NVIDIA Blackwell показал, что доминирующая стоимость построения маски составляет ~13,7 мс на упакованный пакет. Для Llama-3.2-1B (16 слоёв) это экономит ~199 мс на шаг (11,5% меньше); для Qwen3-0.6B (28 слоёв) ~319 мс (14,8% меньше).

Ad

Двойная буферизация асинхронного градиентного контрольного чекпоинта

Асинхронный градиентный контрольный чекпоинт перекрывает пересчёт с вычислениями. Это даёт 8% ускорение без ущерба для точности.

Маршрутизация MoE: argsort + bincount

Для моделей MoE использование torch.argsort и torch.bincount вместо пользовательских ядер ускоряет обучение gpt-oss на 15%.

Все оптимизации автоматически включаются на поддерживаемом оборудовании. Обновите Unsloth, чтобы их получить.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

АТЛАС: Открытый конвейер вычислений во время тестирования для Qwen3-14B демонстрирует высочайший уровень производительности в программировании
Инструменты

АТЛАС: Открытый конвейер вычислений во время тестирования для Qwen3-14B демонстрирует высочайший уровень производительности в программировании

Студент колледжа разработал ATLAS — открытый конвейер вычислений во время тестирования, построенный на основе Qwen3-14B, который достигает 74,6% pass@1 на задачах LiveCodeBench v5 при стоимости электроэнергии около $0,004 за задачу. Система медленная для сложных проблем, но предлагает сопоставимую производительность с передовыми моделями, такими как GPT-5 (84,6%) и Claude 4.5 Sonnet (71,4%).

OpenClawRadar
Cortex версии 1.2 добавляет обогащение данных с помощью LLM, ответы на вопросы с цитированием и разрешение конфликтов.
Инструменты

Cortex версии 1.2 добавляет обогащение данных с помощью LLM, ответы на вопросы с цитированием и разрешение конфликтов.

Cortex, локальный слой памяти для агентов OpenClaw, выпустил версию 1.2 с включённым по умолчанию обогащением на основе LLM, командой для ответов на вопросы с цитированием, а также улучшенным устранением дубликатов и разрешением конфликтов. Теперь инструмент включает единое управление конфигурацией и предварительную фильтрацию поиска на основе намерений.

OpenClawRadar
GitHub Comic Bot: Превращайте коммиты в ежедневные комиксы о средневековых рыцарях
Инструменты

GitHub Comic Bot: Превращайте коммиты в ежедневные комиксы о средневековых рыцарях

Бот, который читает коммиты GitHub и генерирует четырёхпанельные комиксы с невозмутимым средневековым рыцарем, созданный с помощью Claude Code и Gemini, работает на GitHub Actions с бесплатным тарифом.

OpenClawRadar
Репозиторий бесплатного руководства по запуску продуктов на основе ИИ для пользователей Claude
Инструменты

Репозиторий бесплатного руководства по запуску продуктов на основе ИИ для пользователей Claude

Разработчик выпустил бесплатный репозиторий, содержащий структурированное руководство по запуску ИИ-продуктов, предназначенное для работы с Claude. Репозиторий организует опыт запуска в практические этапы, включая стратегию, подготовку, исполнение, а также содержит шаблоны и ссылки на инструменты.

OpenClawRadar