Sakana AI lance le laboratoire RSI : amélioration récursive de soi avec des modèles fondamentaux

Sakana AI a officiellement établi son laboratoire d'auto-amélioration récursive (RSI Lab), un groupe de recherche dédié chargé de repenser le processus même de développement de l'IA en utilisant l'IA. Plutôt que de forcer des modèles monolithiques, le laboratoire construit des architectures ouvertes et adaptatives qui s'améliorent collectivement – en s'appuyant sur une lignée de jalons publiés.
Principaux jalons de recherche soutenant le RSI
- LLM-Squared (2024) : Développé avec Oxford et Cambridge, ce cadre permet aux LLMs d'inventer de meilleures façons d'entraîner les LLMs (LLM²). Il a produit DiscoPOP, un algorithme d'optimisation des préférences découvert et écrit entièrement par un LLM à travers une boucle évolutive générationnelle.
- Darwin Gödel Machine (2025) : En collaboration avec UBC, DGM maintient une lignée évolutive de variantes d'agents qui réécrivent de manière autonome leur propre code. Sur SWE-bench, il a plus que doublé les performances de base – une amélioration absolue de 30 points de pourcentage.
- ShinkaEvolve (2025) : Cadre open-source démontrant une évolution de programme efficace en échantillons. A résolu des problèmes d'optimisation complexes en utilisant seulement 150 échantillons et a généré une nouvelle fonction de perte d'équilibrage de charge améliorant les modèles Mixture-of-Experts (MoE).
- ALE-Agent (2025) : Agent d'optimisation qui a obtenu la 1ère place sur 804 participants humains au concours heuristique AtCoder 058. Il exploite le passage à l'échelle massif lors de l'inférence et l'auto-apprentissage par essais-erreurs pour dériver de manière autonome de nouveaux algorithmes.
- Digital Red Queen (2026) : Collaboration avec le MIT établissant une coévolution antagoniste ouverte dans Core War. Les LLMs écrivent des codes concurrents, générant des stratégies logicielles complexes émergentes et une évolution convergente – fondamental pour le RSI en cybersécurité.
- The AI Scientist (2024–2026) : Découverte scientifique entièrement automatisée et ouverte, de la génération d'idées à l'exécution d'expériences, en passant par la rédaction complète d'articles et l'évaluation par les pairs.
Pourquoi cela est important pour les développeurs
Le RSI représente un passage d'une R&D statique menée par l'homme à des moteurs d'intelligence autonomes et auto-améliorants. L'approche du laboratoire – boucles d'optimisation évolutive, agents auto-réécrivants et science automatisée – a un impact direct sur la construction et l'amélioration des agents de codage IA. Plutôt que d'attendre un réglage manuel, ces systèmes affinent continuellement leurs propres architectures.
📖 Lire la source complète : HN AI Agents
👀 See Also

Claude MAX Plan Inclut Désormais une Fenêtre de Contexte de 1 Million de Tokens Sans Frais Supplémentaires
Le plan Claude MAX a été automatiquement mis à niveau pour inclure une fenêtre de contexte d'un million de tokens sans frais d'utilisation API supplémentaires, les utilisateurs signalant une réduction significative de l'utilisation des tokens et l'élimination de la surcharge de gestion de la fenêtre de contexte.

Claude Code v2.1.98 ajoute un assistant Vertex AI, des correctifs de sécurité et un bac à sable pour les sous-processus.
Claude Code v2.1.98 introduit un assistant interactif de configuration Google Vertex AI, ajoute un bac à sable pour sous-processus avec isolation de l'espace de noms PID sur Linux, et corrige de multiples vulnérabilités de sécurité, y compris des contournements de permissions Bash et des risques d'exécution de code arbitraire.

Les startups déclarent dépenser plus en puissance de calcul IA qu'en salaires humains.
Les startups d'IA comme Swan AI déclarent des factures mensuelles de calcul IA dépassant les 113 000 $, leurs PDG décrivant cela comme du 'tokenmaxxing' où les dépenses en IA remplacent les budgets traditionnels d'effectifs.

Comptage des glucides par IA échoue à la reproductibilité : 27 000 requêtes montrent un écart de 429 g sur une seule photo
Une étude portant sur 26 904 requêtes IA à travers 4 modèles a révélé que Gemini 2.5 Pro faisait varier ses estimations de glucides pour une seule photo de paella de 55g à 484g — un écart potentiel de 42,9 unités d'insuline. Claude présentait seulement 2,4 % de variation médiane.