Modèle de langage Transformer fonctionnant localement sur une Game Boy Color standard
Un développeur a réussi à faire fonctionner un véritable modèle de langage transformer sur une Game Boy Color (GBC) de série — sans téléphone, PC, Wi-Fi ni inférence dans le cloud. L'ensemble du pipeline d'inférence s'exécute localement sur le matériel portable.
Détails clés
- Modèle : TinyStories-260K d'Andrej Karpathy, converti en poids INT8 avec des mathématiques en virgule fixe — aucun support de la virgule flottante requis.
- Matériel : Game Boy Color de série + cartouche flash EZ Flash Junior + carte microSD.
- Chaîne d'outils de compilation : GBDK-2020, produisant une ROM Game Boy au format MBC5.
- Architecture mémoire : Les poids du modèle résident dans la ROM de la cartouche à commutation de banques. Le cache KV est stocké dans la SRAM de la cartouche car la RAM de travail de la GBC est minuscule.
- Saisie de l'invite : Sur l'appareil à l'aide du D-pad/boutons et d'un clavier à l'écran.
- Pipeline d'inférence : Tokenisation de l'invite sur la GBC, puis préremplissage du transformer et génération autorégressive avec mise en cache KV.
- Performances : Extrêmement lent ; la sortie est incohérente en raison d'une quantification lourde et d'approximations mathématiques, mais la boucle transformer centrale fonctionne.
- Code source : Disponible sur GitHub à l'adresse github.com/maddiedreese/gbc-transformer. Une grande partie du code a été construite à l'aide de Codex AI.
Ce projet démontre que même un matériel sévèrement contraint en ressources peut exécuter une inférence transformer avec des astuces agressives de quantification et de gestion mémoire. C'est une preuve de concept, pas un LLM pratique, mais c'est une curiosité technique qui mérite d'être examinée.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Titre local Qwen 3.6 vs modèles frontières sur une primitive de codage : Animation de conduite de toile HTML mono-fichier
Un utilisateur de Reddit a opposé les versions quantifiées locales de Qwen 3.6 aux modèles de pointe (Claude, Gemini, GPT, Kimi) sur une tâche complexe d'animation de conduite dans un canvas HTML en un seul fichier. Le modèle local Qwen 3.6-27B Q4_K_M a produit un mouvement et un calque plus naturels que certains modèles de pointe.

Microsoft met fin au partage des revenus avec OpenAI, impact sur les agents d'IA incertain
Microsoft cessera de partager les revenus avec OpenAI, son principal partenaire en IA, selon un rapport de Bloomberg. Cette décision pourrait affecter la manière dont les développeurs intègrent les agents IA via les services Azure OpenAI.

Les outils de détection de l'IA poussent les étudiants à utiliser l'IA de manière défensive, révèle une étude.
Les outils de détection de l'IA dans l'éducation incitent les étudiants à écrire intentionnellement moins bien pour éviter les faux positifs, certains se tournant défensivement vers des outils d'IA pour vérifier si leur propre écriture sera signalée.

Claude Opus 4.7 sorti avec raisonnement hybride et fenêtre contextuelle de 1 million de tokens
Anthropic a lancé Claude Opus 4.7, un modèle de raisonnement hybride avec une fenêtre de contexte de 1 million de tokens qui offre des performances renforcées en codage, vision et tâches complexes multi-étapes. Le tarif commence à 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie.