Accueil/News/Intelligence Artificielle
Intelligence Artificielle

ChatGPT : ce que l'enquête Project Lily révèle vraiment

Une enquête décrit la relecture humaine de conversations ChatGPT. Ce que les documents OpenAI confirment, ce qui reste rapporté et comment protéger ses nouveaux échanges.

ChatGPT : ce que l'enquête Project Lily révèle vraiment

Tu ouvres ChatGPT pour lui raconter un problème de santé, un conflit au travail, une difficulté financière. Tu écris comme tu parlerais à quelqu'un, parce que l'interface y invite. Et à aucun moment tu ne te demandes si un être humain lira ce que tu viens de taper.

Une enquête publiée le 14 septembre par 404 Media affirme que c'est pourtant possible. Voilà ce qu'elle dit, ce qu'OpenAI reconnaît de son côté, et ce que tu peux régler toi-même.

Ce que révèle l'enquête Project Lily

L'enquête est signée Joseph Cox et s'appuie, selon 404 Media, sur des documents internes ayant fuité et sur de véritables prompts que la rédaction a pu consulter. Elle est publiée sur le site du média, dont l'essentiel est réservé aux abonnés — ce qui suit provient de la partie librement accessible.

Ses affirmations principales sont les suivantes.

Selon 404 Media, OpenAI recrute des centaines de prestataires chargés de lire un flux important de prompts d'utilisateurs réels. Ces relectures peuvent porter sur des conversations entières entre une personne et le robot conversationnel, et pas seulement sur des messages isolés.

Le but déclaré est d'améliorer les réponses : les prestataires notent et critiquent ce que produit le modèle. Les documents internes consultés par 404 Media montreraient notamment un travail visant à ce que le modèle cesse de se présenter comme une personne et se montre moins complaisant envers son interlocuteur.

Sur la protection des données, l'enquête apporte deux précisions qui vont dans des directions opposées. D'un côté, les prestataires ne voient pas les noms d'utilisateur, et OpenAI cherche à retirer les informations personnelles avant que les prompts n'arrivent devant eux. De l'autre, l'entreprise reconnaît que des éléments sensibles peuvent malgré tout passer.

Un dernier point, qui élargit le sujet : 404 Media indique qu'Anthropic lui a confirmé recourir également à de la relecture humaine pour améliorer ses modèles. La pratique n'est donc pas propre à OpenAI.

Ce qu'OpenAI confirme officiellement

Ce volet ne dépend d'aucune fuite : il est écrit dans la documentation publique.

La page « How your data is used to improve model performance » indique que, pour les services destinés aux particuliers comme ChatGPT, l'entreprise peut utiliser le contenu des utilisateurs pour entraîner ses modèles. Elle précise que ChatGPT progresse en s'entraînant sur les conversations qu'il a avec les gens, sauf si l'utilisateur s'y oppose.

La même page reconnaît un traitement préalable des données : OpenAI dit prendre des mesures pour réduire la quantité d'informations personnelles présentes dans ses jeux de données d'entraînement. Réduire, pas éliminer — ce qui rejoint ce que rapporte 404 Media sur les filtres imparfaits.

Un détail mérite l'attention, parce qu'il est contre-intuitif. Même après avoir refusé l'entraînement, si tu donnes un retour sur une réponse en cliquant sur le pouce levé ou baissé, OpenAI indique que l'intégralité de la conversation associée à ce retour peut être utilisée pour entraîner les modèles.

Attention enfin à la portée exacte du réglage : « Améliorer le modèle pour tout le monde » désactive l'utilisation des nouvelles conversations pour l'entraînement, mais la documentation ne garantit pas qu'aucune conversation ne puisse être examinée à d'autres fins, notamment la sécurité ou l'évaluation du service.

Des humains lisent-ils toutes les conversations ?

Non, et rien ne permet de l'affirmer.

Ce que décrit l'enquête, c'est un dispositif d'évaluation portant sur un flux de conversations — pas une lecture systématique de tous les échanges de tous les comptes. ChatGPT compte plus de 900 millions d'utilisateurs actifs hebdomadaires selon le chiffre repris par 404 Media, un volume qu'aucune équipe humaine ne peut relire intégralement.

La formulation juste est donc celle-ci : une partie des conversations peut être relue par des personnes, selon des critères que ni l'enquête accessible ni la documentation publique ne détaillent. Ce n'est ni « personne ne lit » ni « tout est lu ».

Comment désactiver l'utilisation de tes nouvelles conversations

La procédure est documentée par OpenAI dans sa FAQ sur les contrôles de données.

Sur le web, une fois connecté : clique sur ton icône de profil, ouvre les Paramètres, va dans Contrôles des données, et désactive « Améliorer le modèle pour tout le monde ». Sur mobile, le chemin passe par le menu latéral, puis ton icône de profil, puis Contrôles des données.

OpenAI mentionne une seconde voie équivalente, l'option « Do not train on my content » dans son portail de confidentialité. L'une ou l'autre suffit, il n'est pas nécessaire de faire les deux.

Trois précisions comptent ici.

Le réglage vaut pour l'ensemble du compte et se synchronise entre le web et le mobile. Il est modifiable à tout moment, sans restriction.

Il porte sur les nouvelles conversations. OpenAI écrit qu'après la désactivation, l'entreprise n'entraînera pas ses modèles sur tes nouvelles conversations. Ce n'est donc pas un effacement rétroactif de ce qui a déjà été traité, et il ne faut pas le présenter comme tel.

Tes anciennes discussions restent visibles dans ton historique après la désactivation : le réglage change l'usage qui en est fait pour l'entraînement, pas leur affichage.

Une alternative existe pour les échanges ponctuels : la conversation temporaire. OpenAI indique que ces discussions ne servent pas à entraîner ses modèles, n'apparaissent pas dans l'historique, ne créent pas de mémoire, sont supprimées de ses systèmes au bout de trente jours, et peuvent être examinées uniquement dans le cadre de la surveillance des abus.

Comptes personnels, Business, Enterprise, Education : ce n'est pas la même règle

C'est la confusion la plus répandue, et elle inverse complètement la conclusion.

Pour les services destinés aux particuliers, l'entraînement sur le contenu est actif par défaut, et c'est à l'utilisateur de le désactiver s'il le souhaite.

Pour les offres professionnelles, OpenAI écrit l'inverse : par défaut, l'entreprise n'entraîne pas ses modèles sur les entrées et les sorties des utilisateurs professionnels, ce qui inclut ChatGPT Business, ChatGPT Enterprise et l'API. Les organisations sont exclues du partage de données sauf choix explicite contraire. La FAQ mentionne par ailleurs des contrôles supplémentaires pour les formules Team, Enterprise et Edu.

Autrement dit, un même prompt écrit depuis un compte personnel et depuis un compte d'entreprise ne suit pas le même régime. Si tu utilises ChatGPT pour du travail sensible, c'est le type de compte qui décide, pas la nature du contenu.

Ce que cette affaire ne permet pas d'affirmer

Trois raccourcis à éviter.

Elle ne démontre pas qu'OpenAI vend les conversations. Rien dans les éléments consultés ne parle de vente de données.

Elle ne démontre pas non plus qu'un humain lit chaque échange, ni qu'une lecture automatique intégrale est en place. Ce sont deux affirmations distinctes, et aucune des deux n'est étayée ici.

Enfin, l'enquête de 404 Media reste une enquête de presse fondée sur des documents internes et des témoignages. Elle n'a pas le statut d'une confirmation officielle complète de la part d'OpenAI, même si plusieurs de ses éléments recoupent la documentation publique de l'entreprise.

Mon verdict

Le fond de l'affaire n'est pas une révélation technique : que des humains évaluent les réponses d'un modèle pour l'améliorer est une pratique connue du secteur, et Anthropic la confirme aussi selon 404 Media. Ce qui change, c'est l'échelle et le décalage entre cette réalité et ce que les utilisateurs imaginent en écrivant à un chatbot comme ils écriraient dans un journal intime.

La leçon pratique tient en deux gestes. Va voir le réglage « Améliorer le modèle pour tout le monde » dans tes contrôles de données, et décide en connaissance de cause. Et garde en tête qu'une conversation ordinaire ne doit pas être considérée comme strictement confidentielle par défaut — pour les échanges qui n'ont rien à faire dans un jeu de données, la conversation temporaire est faite pour ça.

Questions fréquentes

Des prestataires peuvent-ils lire mes conversations ChatGPT ?

Selon l'enquête de 404 Media, des prestataires externes relisent des prompts et des conversations réelles pour évaluer les réponses du modèle. Ils ne voient pas les noms d'utilisateur, et OpenAI cherche à retirer les informations personnelles au préalable, mais l'entreprise reconnaît que des éléments sensibles peuvent passer. Cela ne signifie pas que toutes les conversations sont lues.

Comment empêcher l'utilisation de mes conversations pour l'entraînement ?

Dans ChatGPT, ouvre Paramètres, puis Contrôles des données, et désactive « Améliorer le modèle pour tout le monde ». L'option « Do not train on my content » du portail de confidentialité d'OpenAI a le même effet. Le réglage s'applique à tout le compte et peut être modifié à tout moment.

Cette désactivation efface-t-elle mes anciennes conversations ?

Non. OpenAI indique qu'après la désactivation, les nouvelles conversations ne seront pas utilisées pour l'entraînement. Ce n'est pas une suppression rétroactive, et les discussions existantes restent visibles dans ton historique.

Mon compte professionnel suit-il les mêmes règles ?

Non. OpenAI indique ne pas entraîner ses modèles, par défaut, sur les données des utilisateurs professionnels — ChatGPT Business, ChatGPT Enterprise et l'API. Les organisations doivent choisir explicitement de partager leurs données pour que ce soit le cas.

vie privéeChatGPTOpenAIDonnéesproject-lily
Partager :TwitterLinkedIn