Entraînement de GPT-1 sur une RTX 2060 Super 8 Go – Preuve de concept pour le pré-entraînement local

Un utilisateur de Reddit (u/tevlon) a réussi à entraîner le modèle GPT-1 original (117M paramètres) sur une RTX 2060 Super avec 8 Go de VRAM en environ 1 heure. Ce projet démontre que même les GPU gaming d'entrée de gamme peuvent pré-entraîner des modèles de moins de 1B de paramètres, ouvrant la voie aux amateurs sans crédits cloud.
L'auteur note que si GPT-2 est trop volumineux pour un entraînement local sur un tel matériel, GPT-1 est 10 fois plus petit et réalisable. Le point clé : chaque joueur avec une RTX 2060 ou similaire peut désormais pré-entraîner un modèle de taille 1B — et les modèles sous 1B (par exemple Surya OCR de Datalab.to) ne sont pas inutiles ; ils produisent des modèles spécialisés performants.
Le code intègre des améliorations algorithmiques du projet modded-nanogpt tout en restant fidèle à l'implémentation originale d'OpenAI finetune-transformer-lm. Le code a été majoritairement écrit par Claude 4.8 et Codex 5.5, guidés par les instructions de l'utilisateur.
Liens :
- Dépôt de code : github.com/epoyraz/modded-gpt-1
- Poids du modèle : huggingface.co/epoyraz/modded-gpt-1
L'auteur n'est pas un chercheur en ML mais un ingénieur logiciel et un joueur. Le modèle est reconnu comme sous-entraîné (1 heure seulement), mais le principe tient : le pré-entraînement local est désormais accessible à quiconque possède un GPU décent.
Il s'agit d'une preuve de concept qui remet en question l'hypothèse selon laquelle le pré-entraînement à grande échelle nécessite des clusters cloud. Si vous avez un GPU gaming avec 8 Go+ de VRAM, vous pouvez expérimenter le pré-entraînement — commencez avec GPT-1 et passez à l'échelle supérieure.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Évaluation des compétences de Claude et tests de régression avec l'agent Snowflake Cortex
Un agent Claude de gestion du risque de crédit en production sur Snowflake Cortex Agent nécessite des tests de régression pour les changements de compétences. L'équipe évalue actuellement les résultats manuellement par rapport aux requêtes BI existantes et cherche à automatiser.

OpenClaw v2026.6.11 : Corrections pour réponses mal placées, envois bloqués et échecs de modèles
OpenClaw v2026.6.11 corrige les réponses mal placées, les envois bloqués, les reconnexions et les échecs de configuration de modèle sur Telegram, WhatsApp, Matrix et plus.

Claude Code v2.1.51 a modifié la facturation du contexte 1M sans notification
La mise à jour v2.1.51 de Claude Code d'Anthropic a modifié discrètement la facturation pour les fenêtres de contexte de 1 million sur les plans Max. Les tokens de contexte au-delà de 200 000 contournent désormais la capacité d'abonnement et passent directement aux frais d'utilisation supplémentaires, même lorsque le budget d'abonnement reste disponible.

Anthropic restreint l'utilisation des abonnements Claude avec des interfaces tierces, y compris OpenClaw
Anthropic a annoncé qu'à partir du 4 avril à 12h PT/20h BST, les limites d'abonnement Claude ne pourront plus être utilisées avec des outils tiers comme OpenClaw. Les utilisateurs devront activer une utilisation supplémentaire avec une facturation séparée au paiement à l'usage pour ces intégrations.