Обучение GPT-1 на RTX 2060 Super 8GB – подтверждение концепции локального предварительного обучения

Пользователь Reddit (u/tevlon) успешно обучил оригинальную модель GPT-1 (117 млн параметров) на RTX 2060 Super с 8GB VRAM примерно за 1 час. Проект демонстрирует, что даже бюджетные игровые видеокарты могут предобучать модели размером до 1B, открывая возможности для энтузиастов без облачных кредитов.
Автор отмечает, что GPT-2 слишком велика для локального обучения на таком оборудовании, но GPT-1 в 10 раз меньше и вполне достижима. Главный вывод: каждый геймер с RTX 2060 или аналогичной картой теперь может предобучить модель размером до 1B — и модели меньше 1B (например, Surya OCR от Datalab.to) не являются мусором; они дают полезные специализированные модели.
Код включает алгоритмические улучшения из проекта modded-nanogpt, оставаясь верным оригинальной реализации OpenAI finetune-transformer-lm. Кодовая база в основном написана Claude 4.8 и Codex 5.5 под руководством пользователя.
Ссылки:
- Репозиторий кода: github.com/epoyraz/modded-gpt-1
- Веса модели: huggingface.co/epoyraz/modded-gpt-1
Автор не является ML-исследователем, а работает инженером-программистом и геймером. Модель считается недообученной (всего 1 час), но принцип остается: локальный предтренинг теперь доступен каждому с достойной видеокартой.
Это proof-of-concept, бросающий вызов предположению, что масштабный предтренинг требует облачных кластеров. Если у вас игровая видеокарта с 8GB+ VRAM, вы можете экспериментировать с предтренингом — начните с GPT-1 и масштабируйтесь.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Клод 4.6 Адаптивное мышление: Пользователь Reddit сообщает о трате токенов и предоставляет команды для отключения.
Пользователь Reddit сообщает, что новая функция адаптивного мышления Claude 4.6 может тратить токены и увеличивать задержку в Claude Code, предоставляя команды оболочки для её отключения или ограничения токенов мышления.

Claude Code v2.1.81 добавляет флаг bare для скриптов, исправляет проблемы с аутентификацией и голосовым режимом.
Claude Code v2.1.81 представляет флаг --bare для скриптовых вызовов -p, который пропускает хуки, LSP и синхронизацию плагинов, требуя ANTHROPIC_API_KEY или apiKeyHelper через --settings. В релизе также исправлены проблемы аутентификации в нескольких одновременных сессиях, обработка ошибок в голосовом режиме и добавлена передача разрешений --channels.

Минимакс M2.7 и масштабирование до 100 000+ экземпляров OpenClaw обсуждались на сессии по экосистеме
Джим и ЭндиМЛ провели встречу с командой Minimax, чтобы обсудить модель Minimax M2.7 и то, как они масштабировали свою хостинговую среду для поддержки более 100 000 экземпляров OpenClaw. Сессия привлекла 100-110 пользователей из Discord и более 350 000 зрителей на китайской трансляции.

Гонка за передовым ИИ закончена: сети малых моделей превосходят централизованный ИИ по стоимости и возможностям
Сети небольших моделей ИИ теперь превосходят все передовые системы по скорости, точности и стоимости. Статья утверждает, что централизованные компании ИИ не могут вернуть лидерство из-за «эффекта Гидры» — ансамблирование более дешевых моделей рекурсивно побеждает любую одиночную модель.