Unsloth и NVIDIA сотрудничают для ускорения обучения LLM примерно на 25%

Сотрудничество Unsloth с NVIDIA даёт ~25% ускорение обучения (без потери точности) за счёт реализации трёх ключевых оптимизаций: кэширование метаданных упакованных последовательностей, двойная буферизация асинхронного градиентного контрольного чекпоинта и улучшения маршрутизации MoE. Они автоматически включаются на ноутбуках RTX, дата-центровых GPU и DGX Spark с обновлением Unsloth.
Кэширование метаданных упакованных последовательностей
Упакованное обучение объединяет короткие примеры, чтобы избежать потерь на дополнение. Каждый слой трансформера ранее перестраивал те же метаданные последовательности (длины, cu_seqlens, max_seqlen, структуру маски) с нуля, вызывая накладные расходы на синхронизацию устройство-хост. Кэшируя метаданные один раз на пакет и повторно используя их на всех слоях, Unsloth сокращает повторяющуюся работу.
Бенчмарки на Qwen3-14B QLoRA SFT показывают:
- Прямой проход: +43,3% быстрее
- Обратный проход: +5,8% быстрее
- В целом на пакет: +14,3% быстрее
Микробенчмарк на GPU NVIDIA Blackwell показал, что доминирующая стоимость построения маски составляет ~13,7 мс на упакованный пакет. Для Llama-3.2-1B (16 слоёв) это экономит ~199 мс на шаг (11,5% меньше); для Qwen3-0.6B (28 слоёв) ~319 мс (14,8% меньше).
Двойная буферизация асинхронного градиентного контрольного чекпоинта
Асинхронный градиентный контрольный чекпоинт перекрывает пересчёт с вычислениями. Это даёт 8% ускорение без ущерба для точности.
Маршрутизация MoE: argsort + bincount
Для моделей MoE использование torch.argsort и torch.bincount вместо пользовательских ядер ускоряет обучение gpt-oss на 15%.
Все оптимизации автоматически включаются на поддерживаемом оборудовании. Обновите Unsloth, чтобы их получить.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

АТЛАС: Открытый конвейер вычислений во время тестирования для Qwen3-14B демонстрирует высочайший уровень производительности в программировании
Студент колледжа разработал ATLAS — открытый конвейер вычислений во время тестирования, построенный на основе Qwen3-14B, который достигает 74,6% pass@1 на задачах LiveCodeBench v5 при стоимости электроэнергии около $0,004 за задачу. Система медленная для сложных проблем, но предлагает сопоставимую производительность с передовыми моделями, такими как GPT-5 (84,6%) и Claude 4.5 Sonnet (71,4%).

Cortex версии 1.2 добавляет обогащение данных с помощью LLM, ответы на вопросы с цитированием и разрешение конфликтов.
Cortex, локальный слой памяти для агентов OpenClaw, выпустил версию 1.2 с включённым по умолчанию обогащением на основе LLM, командой для ответов на вопросы с цитированием, а также улучшенным устранением дубликатов и разрешением конфликтов. Теперь инструмент включает единое управление конфигурацией и предварительную фильтрацию поиска на основе намерений.

GitHub Comic Bot: Превращайте коммиты в ежедневные комиксы о средневековых рыцарях
Бот, который читает коммиты GitHub и генерирует четырёхпанельные комиксы с невозмутимым средневековым рыцарем, созданный с помощью Claude Code и Gemini, работает на GitHub Actions с бесплатным тарифом.

Репозиторий бесплатного руководства по запуску продуктов на основе ИИ для пользователей Claude
Разработчик выпустил бесплатный репозиторий, содержащий структурированное руководство по запуску ИИ-продуктов, предназначенное для работы с Claude. Репозиторий организует опыт запуска в практические этапы, включая стратегию, подготовку, исполнение, а также содержит шаблоны и ссылки на инструменты.