Un dirigeant de Microsoft qualifie l'aspiration de l'IA de « plus grand vol de travail de l'histoire de l'humanité », selon des documents non expurgés de l'affaire NYT c. OpenAI
De nouveaux éléments non expurgés dans la procédure pour violation du droit d'auteur The New York Times c. OpenAI et Microsoft incluent des communications internes de Microsoft et d'OpenAI qui affaiblissent la défense fondée sur l'usage équitable (fair use) des entreprises. TechCrunch rapporte que, selon le document judiciaire, un directeur des sciences appliquées de Microsoft, Brent Hecht, a décrit dans une note de janvier 2023 l'acquisition de données d'entraînement par les entreprises comme « un vol stupéfiant aux proportions sans précédent » et « le plus grand vol de travail de l'histoire de l'humanité ».
Ce que les documents allèguent
- Les entreprises auraient contourné les paywalls sans être détectées, constitué des jeux de données d'entraînement par extraction massive et supprimé les mentions de droit d'auteur des données d'entraînement.
- Les jeux de données de mi-entraînement d'OpenAI contiennent à eux seuls plus de 91 692 copies d'œuvres publiées par le NYT, le Daily News et le Center for Investigative Reporting.
- Un jeu de données dérivé de Common Crawl comprenait plus de 2 millions de documents provenant du seul site nytimes.com.
- Les propres données de Microsoft montrent que son « moteur de réponses » Copilot a fait chuter les taux de clics pour le domaine du NYT jusqu'à 93 % par rapport à la recherche Bing traditionnelle.
Le document interne sur la « boucle de perdition »
Une présentation de Microsoft de janvier 2024 signée Hecht décrivait le déclin du trafic comme une « boucle de perdition » qui « nuirait à la performance de nos modèles et à l'ensemble du web en même temps », et avertissait : « Il est très inhabituel qu'un produit final menace les fondations économiques de ses fournisseurs essentiels, mais c'est la situation que nous avons créée pour notre activité de LLM en ce qui concerne sa “chaîne d'approvisionnement en contenu”. » Un autre document de Microsoft signale un « risque réel » que l'IA générative puisse « perturber significativement l'emploi des personnes mêmes qui ont généré les données sur lesquelles le modèle de fondation a été entraîné ».
Des déclarations qui vont à l'encontre de l'usage équitable
- Le PDG de Microsoft, Satya Nadella, a témoigné cette année que « tout contenu derrière un paywall devrait être sous licence pour quiconque souhaite l'utiliser… pour l'ancrage ou l'entraînement », et a déclaré qu'il aurait exigé d'OpenAI qu'elle réentraîne ses modèles s'il avait su qu'elle avait extrait des données derrière des paywalls.
- Le responsable de ChatGPT chez OpenAI, Nick Turley, a écrit en interne que les éditeurs font face à une « menace existentielle » parce que le chatbot est « largement substitutif » et « le deviendra de plus en plus à mesure qu'ils s'améliorent ».
- Le président d'OpenAI, Greg Brockman, a décrit les modèles comme « excellents en matière d'actualités ». Nadella a reconnu sous serment que discuter avec un bot remplace la visite du site source.
Contexte
L'affaire dure depuis trois ans ; les juges ont généralement penché en faveur des entreprises d'IA sur l'usage équitable, et l'administration Trump a déposé ce mois-ci un mémoire défendant l'entraînement sans licence d'OpenAI. Mise en garde : une grande partie des nouveaux éléments provient du mémoire du Times lui-même, et non des pièces scellées sous-jacentes, et les passages cités sont présentés sans leur contexte d'origine. Pour les développeurs qui déploient des pipelines de RAG ou d'entraînement, ces éléments de découverte rappellent que la provenance des données et les conditions de licence deviennent des preuves devant les tribunaux, et non plus seulement une bonne pratique d'ingénierie.
📖 Lire la source complète : HN AI Agents
👀 See Also
DoltLite Beta : fork SQLite avec contrôle de version de type Git , construit avec 2k agents PRs
DoltLite 0.50.0 est un fork de SQLite avec branchement, fusion et synchronisation de type Git, construit via 2 000 PR d'agents. La version bêta apporte la stabilité du format de stockage et la compatibilité SQL.

Claude Code v2.1.153 intègre Skip LFS, correctifs MCP et autocomplétion d'agent
Claude Code v2.1.153 ajoute l'option skipLfs pour éviter Git LFS, corrige les boucles de reconnexion des serveurs MCP avec état, et améliore l'auto-complétion des commandes slash et des compétences intégrées dans l'agent.

Les agents d'IA ont besoin de primitives de restauration, pas seulement d'autonomie
Un développeur affirme que les frameworks d'agents doivent adopter des concepts de bases de données comme ACID, les sagas et les actions compensatoires pour gérer les échecs partiels, plutôt que de compter sur les LLM pour « se débrouiller ».

Firefox 148 ajoute un bouton d'arrêt d'IA et des contrôles de confidentialité renforcés.
Firefox 148 introduit une fonctionnalité d'interrupteur d'arrêt de l'IA qui permet aux utilisateurs de désactiver toutes les fonctionnalités d'IA, y compris les invites de chatbot et les résumés de liens générés par l'IA. La mise à jour offre également plus de contrôle sur les mises à jour à distance et la collecte de données.