Unsloth и NVIDIA сотрудничают для ускорения обучения LLM примерно на 25%

✍️ OpenClawRadar📅 Опубликовано: 7 мая 2026 г.🔗 Source
Unsloth и NVIDIA сотрудничают для ускорения обучения LLM примерно на 25%
Ad

Сотрудничество Unsloth с NVIDIA даёт ~25% ускорение обучения (без потери точности) за счёт реализации трёх ключевых оптимизаций: кэширование метаданных упакованных последовательностей, двойная буферизация асинхронного градиентного контрольного чекпоинта и улучшения маршрутизации MoE. Они автоматически включаются на ноутбуках RTX, дата-центровых GPU и DGX Spark с обновлением Unsloth.

Кэширование метаданных упакованных последовательностей

Упакованное обучение объединяет короткие примеры, чтобы избежать потерь на дополнение. Каждый слой трансформера ранее перестраивал те же метаданные последовательности (длины, cu_seqlens, max_seqlen, структуру маски) с нуля, вызывая накладные расходы на синхронизацию устройство-хост. Кэшируя метаданные один раз на пакет и повторно используя их на всех слоях, Unsloth сокращает повторяющуюся работу.

Бенчмарки на Qwen3-14B QLoRA SFT показывают:

  • Прямой проход: +43,3% быстрее
  • Обратный проход: +5,8% быстрее
  • В целом на пакет: +14,3% быстрее

Микробенчмарк на GPU NVIDIA Blackwell показал, что доминирующая стоимость построения маски составляет ~13,7 мс на упакованный пакет. Для Llama-3.2-1B (16 слоёв) это экономит ~199 мс на шаг (11,5% меньше); для Qwen3-0.6B (28 слоёв) ~319 мс (14,8% меньше).

Ad

Двойная буферизация асинхронного градиентного контрольного чекпоинта

Асинхронный градиентный контрольный чекпоинт перекрывает пересчёт с вычислениями. Это даёт 8% ускорение без ущерба для точности.

Маршрутизация MoE: argsort + bincount

Для моделей MoE использование torch.argsort и torch.bincount вместо пользовательских ядер ускоряет обучение gpt-oss на 15%.

Все оптимизации автоматически включаются на поддерживаемом оборудовании. Обновите Unsloth, чтобы их получить.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.
Инструменты

Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.

Среда выполнения Krasis LLM теперь полностью выполняет как предварительное заполнение, так и декодирование на GPU с различными стратегиями оптимизации, достигая ускорения предварительного заполнения в 8,9 раза и декодирования в 4,7 раза по сравнению с llama.cpp на Qwen3.5-122B с использованием одного GPU 5090.

OpenClawRadar
Открытый мозг: Open-source MCP-сервер добавляет постоянную память с авто-графом и семантическим поиском для Claude
Инструменты

Открытый мозг: Open-source MCP-сервер добавляет постоянную память с авто-графом и семантическим поиском для Claude

Open Brain — это сервер MCP с открытым исходным кодом, который предоставляет Клоду постоянную память между сессиями с автоматическим извлечением сущностей, семантическим дедуплицированием и авто-графированием связей между мыслями. Он использует Supabase с pgvector и Deno Edge Functions, может быть развернут самостоятельно и включает 16 инструментов MCP для обхода графа, просмотра сущностей и синтеза еженедельных обзоров.

OpenClawRadar
Skillware добавляет prompt_rewriter для детерминированного сжатия токенов в циклах агентов Claude API.
Инструменты

Skillware добавляет prompt_rewriter для детерминированного сжатия токенов в циклах агентов Claude API.

Skillware объединил новый навык prompt_rewriter, который сжимает промпты на 50-80% перед отправкой в Claude API, снижая затраты в агентских циклах при сохранении стабильного поведения благодаря детерминированному сжатию.

OpenClawRadar
OpenClawDreams: Расширение-симулятор снов для агентов OpenClaw
Инструменты

OpenClawDreams: Расширение-симулятор снов для агентов OpenClaw

OpenClawDreams — это расширение, которое добавляет фоновый процесс рефлексии и ночной цикл сновидений для агентов OpenClaw. Оно сохраняет зашифрованные сводки разговоров в локальную базу данных SQLite, обрабатывает их во время фоновых циклов и генерирует консолидированные инсайты, которые затем передаются в постоянную память агента.

OpenClawRadar