Unsloth и NVIDIA сотрудничают для ускорения обучения LLM примерно на 25%

Сотрудничество Unsloth с NVIDIA даёт ~25% ускорение обучения (без потери точности) за счёт реализации трёх ключевых оптимизаций: кэширование метаданных упакованных последовательностей, двойная буферизация асинхронного градиентного контрольного чекпоинта и улучшения маршрутизации MoE. Они автоматически включаются на ноутбуках RTX, дата-центровых GPU и DGX Spark с обновлением Unsloth.
Кэширование метаданных упакованных последовательностей
Упакованное обучение объединяет короткие примеры, чтобы избежать потерь на дополнение. Каждый слой трансформера ранее перестраивал те же метаданные последовательности (длины, cu_seqlens, max_seqlen, структуру маски) с нуля, вызывая накладные расходы на синхронизацию устройство-хост. Кэшируя метаданные один раз на пакет и повторно используя их на всех слоях, Unsloth сокращает повторяющуюся работу.
Бенчмарки на Qwen3-14B QLoRA SFT показывают:
- Прямой проход: +43,3% быстрее
- Обратный проход: +5,8% быстрее
- В целом на пакет: +14,3% быстрее
Микробенчмарк на GPU NVIDIA Blackwell показал, что доминирующая стоимость построения маски составляет ~13,7 мс на упакованный пакет. Для Llama-3.2-1B (16 слоёв) это экономит ~199 мс на шаг (11,5% меньше); для Qwen3-0.6B (28 слоёв) ~319 мс (14,8% меньше).
Двойная буферизация асинхронного градиентного контрольного чекпоинта
Асинхронный градиентный контрольный чекпоинт перекрывает пересчёт с вычислениями. Это даёт 8% ускорение без ущерба для точности.
Маршрутизация MoE: argsort + bincount
Для моделей MoE использование torch.argsort и torch.bincount вместо пользовательских ядер ускоряет обучение gpt-oss на 15%.
Все оптимизации автоматически включаются на поддерживаемом оборудовании. Обновите Unsloth, чтобы их получить.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.
Среда выполнения Krasis LLM теперь полностью выполняет как предварительное заполнение, так и декодирование на GPU с различными стратегиями оптимизации, достигая ускорения предварительного заполнения в 8,9 раза и декодирования в 4,7 раза по сравнению с llama.cpp на Qwen3.5-122B с использованием одного GPU 5090.

Открытый мозг: Open-source MCP-сервер добавляет постоянную память с авто-графом и семантическим поиском для Claude
Open Brain — это сервер MCP с открытым исходным кодом, который предоставляет Клоду постоянную память между сессиями с автоматическим извлечением сущностей, семантическим дедуплицированием и авто-графированием связей между мыслями. Он использует Supabase с pgvector и Deno Edge Functions, может быть развернут самостоятельно и включает 16 инструментов MCP для обхода графа, просмотра сущностей и синтеза еженедельных обзоров.

Skillware добавляет prompt_rewriter для детерминированного сжатия токенов в циклах агентов Claude API.
Skillware объединил новый навык prompt_rewriter, который сжимает промпты на 50-80% перед отправкой в Claude API, снижая затраты в агентских циклах при сохранении стабильного поведения благодаря детерминированному сжатию.

OpenClawDreams: Расширение-симулятор снов для агентов OpenClaw
OpenClawDreams — это расширение, которое добавляет фоновый процесс рефлексии и ночной цикл сновидений для агентов OpenClaw. Оно сохраняет зашифрованные сводки разговоров в локальную базу данных SQLite, обрабатывает их во время фоновых циклов и генерирует консолидированные инсайты, которые затем передаются в постоянную память агента.