Оптимизация AutoResearch на RTX 5090: Что не сработало и что дало результат

Первоначальные проблемы и рабочий путь
Первоначальная настройка для запуска AutoResearch на системе RTX 5090/Blackwell была "сильно сломана" с крайне низкой производительностью — всего несколько тысяч токенов в секунду и практически бесполезным MFU (Model FLOPs Utilization), несмотря на технически работающий код.
Рабочий путь конфигурации включал:
- Избегание сломанного пути компиляции полной модели в этой настройке
- Сохранение полезных улучшений компиляции оптимизатора слияния там, где они действительно помогали
- Использование стабильного пути внимания SDPA/CuDNN
- Эмпирическую настройку общего размера батча и временного бюджета вместо догадок
- Автоматизацию цикла бенчмарк/извлечение/стратегия/повторный запуск
Что не сработало
Несколько режимов отказа были обманчивыми:
- Путь, который был технически правильным, но катастрофически медленным
- Вводящая в заблуждение интерпретация MFU до тех пор, пока знаменатель не был исправлен для контекста 5090
- Более высокие настройки размера батча на устройство, которые казались полезными, но на самом деле делали всё намного хуже
- Ошибки автоматизации вокруг очистки блокировок/хуков завершения/порядка диспетчеризации
Как отметил разработчик: "Было несколько способов получить запуск, который выглядел живым, но делал что-то глупое."
Что помогло
Реальные улучшения пришли от:
- Повторного включения пути компиляции оптимизатора слияния
- Уменьшения общего размера батча с исходной большей настройки
- Подтверждения 2**17 как лучшей области общего размера батча
- Увеличения временного бюджета после нахождения стабильного режима батча
- Рассмотрения автоматизации как части системы бенчмаркинга, а не второстепенной задачи
Прогресс производительности
Прогресс полезных запусков показал явные улучшения:
- Базовый здоровый запуск: val_bpb: 1.165452, mfu: 40.49%
- Улучшение компиляции оптимизатора слияния: val_bpb: 1.155400, mfu: 42.88%
- TOTAL_BATCH_SIZE = 2**18: val_bpb: 1.108381, mfu: 43.18%
- Подтверждение TOTAL_BATCH_SIZE = 2**17: val_bpb: 1.089424, mfu: 43.03%
- Лучший текущий результат автоцикла: TOTAL_BATCH_SIZE = 2**17, TIME_BUDGET = 1200, множитель LR = 1.0, val_bpb: 0.999445, mfu: 42.56%, total_tokens_M: 387.8, num_steps: 2959
Текущая лучшая конфигурация
Лучший найденный на данный момент результат:
- TOTAL_BATCH_SIZE = 2**17
- TIME_BUDGET = 1200
- Множитель LR = 1.0
Эта комбинация превзошла варианты с большим размером батча, меньший вариант 2**16, тест с более низким LR и более короткие бюджеты обучения.
Ключевые выводы
Главный урок заключался в том, что выигрышная конфигурация не была настройкой "максимум всего". Лучший путь включал стабильный режим батча, более длительный горизонт обучения и тщательное устранение ошибок автоматизации и бэкенда.
Разработчик подчеркнул, что если вы работаете над обучением на Blackwell/5090 и видите странное поведение, "возможно, это не ваше воображение. Некоторые пути просто намного хуже, чем кажутся на первый взгляд". Полезной частью этого упражнения было найти путь, который является стабильным, автоматизируемым, воспроизводимым и достаточно хорошим для построения реальных последующих экспериментов на его основе.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Запуск Qwen3.6-35B-A3B с ~190k контекстом на 8 ГБ VRAM + 32 ГБ ОЗУ – Настройка и бенчмарки
Пользователь Reddit делится рабочей конфигурацией llama.cpp для моделей Qwen3.6-35B-A3B GGUF на RTX 4060 (8 ГБ VRAM) + 32 ГБ DDR5, достигая 37-51 ток/с при контексте 192k с использованием TurboQuant и специальных флагов.

Локальная настройка Claude Code с использованием Qwen3.5 27B через llama.cpp
Разработчик делится своей конфигурацией для локального запуска Claude Code с использованием Qwen3.5 27B и llama.cpp, включая переменные окружения, параметры сервера и результаты тестирования производительности в семи задачах по программированию.

Как импортировать историю ChatGPT в Claude с помощью проектов
Экспортируйте чаты ChatGPT в Markdown и загружайте нужные в Claude Projects, чтобы перенести многолетний контекст, текущие проекты и предпочтения в стиле.

Руководство по созданию домашней лаборатории на V100 SXM2 NVLink: Сборка системы с 64 ГБ объединённой видеопамяти примерно за 1100 долларов.
Подробное руководство описывает, как собрать домашнюю лабораторию на базе V100 SXM2 с 64 ГБ объединённой через NVLink видеопамяти примерно за $1100, используя обратно спроектированное китайское оборудование. В нём рассматриваются вопросы поиска комплектующих, оценки производительности и совместимости программного обеспечения.