The Daily Commit · Édition de rubrique La une PHP AI Dev EN DE FR ES

TheModelDesk

9 juillet 2026
modèles, agents & inférence locale

Actus

Le New York Times accuse OpenAI d'avoir dissimulé des preuves dans son procès pour droit d'auteur

Le New York Times et The Daily News ont déposé une demande de sanctions contre OpenAI. Ils affirment que l'entreprise a caché l'existence d'outils internes et d'une base de données de 78 millions de conversations utilisés pour suivre les violations de droits d'auteur, contredisant ainsi ses déclarations antérieures.

En juillet 2026, le New York Times et The Daily News ont intensifié leur action en justice contre OpenAI pour violation de droits d'auteur en déposant une demande de sanctions. Les éditeurs accusent l'entreprise de dissimuler des éléments de preuve contredisant les affirmations antérieures d'OpenAI concernant les limitations techniques en matière de recherche dans ses propres données.

Selon la déposition d'avril de l'ingénieur en confidentialité des données d'OpenAI, Vinnie Monaco, l'entreprise avait déjà mené des recherches internes dans son corpus d'entraînement pour identifier les contenus journalistiques protégés par droits d'auteur. Plus significativement encore, OpenAI maintient une base de données d'environ 78 millions de conversations ChatGPT désidentifiées utilisée en interne pour évaluer l'ampleur des violations de droits d'auteur. De plus, l'entreprise avait mis en place un filtre "Bloom" dans le cadre d'une suite d'outils appelée "Project Giraffe", conçue pour détecter et enregistrer les cas où ChatGPT reproduit du contenu existant, déployée peu après le dépôt de la plainte.

Au cours du litige de deux ans, OpenAI avait affirmé ne pas disposer de capacité technique pour rechercher dans ses données d'entraînement et arguait que la récupération, le traitement et la désidentification de ses énormes journaux de conversations seraient opérationnellement lourds et soulèveraient des préoccupations en matière de confidentialité. Les éditeurs cherchaient à accéder à ces données pour vérifier si leur journalisme protégé était présent dans le corpus d'entraînement d'OpenAI et déterminer la fréquence à laquelle ChatGPT générait des réponses contenant ou reproduisant leur contenu.

La découverte de ces outils et bases de données représente une contradiction majeure avec les arguments juridiques antérieurs d'OpenAI. Quand les éditeurs ont initialement demandé 120 millions de journaux de conversation, OpenAI a négocié la réduction à 20 millions. L'entreprise a finalement soumis cet échantillon réduit au tribunal en décembre 2025, mais il contenait tellement de rédactions qu'il était devenu pratiquement inutilisable selon l'appréciation du tribunal.

Lire la source originale (en anglais) ↗

Évaluer cet article : 0

Tribune des lecteurs

Pas encore de contributions — lance le débat.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Édition écran · Mentions légales · Politique de confidentialité