Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Aller au contenu Aller au quiz
Lu

Données personnelles et LLM

En route — chaque ligne compte.

~30 min
Programme complet

Données personnelles et LLM

Comprendre quand un usage de l'IA générative traite des données personnelles, quelle base légale le justifie, et comment appliquer minimisation et garanties de transfert avant tout déploiement.

Ch. 2/8 Intermédiaire
Table des matières

    Pourquoi ce chapitre est décisif

    Un système d'IAintelligence artificielleIAEnsemble des techniques permettant à un programme d'accomplir une tâche qui demanderait de l'intelligence humaine. Le terme couvre aussi bien les systèmes à règles écrites que ceux qui apprennent de données.Voir dans le glossaire générative ne traite pas que du texte : il traite, très souvent, des donnéesdonnéesIAEnsemble d'informations structurées ou non utilisées pour entraîner, évaluer ou alimenter un modèle. La qualité, la quantité et la représentativité des données sont les facteurs décisifs pour les performances en apprentissage automatique.Voir dans le glossaire à caractère personnel. Un promptpromptIAConsigne ou contexte fourni à un modèle de langage pour orienter sa réponse. La qualité du prompt conditionne souvent la qualité du résultat.Voir dans le glossaire qui contient un nom, un email, un extrait de dossier client ou une évaluation de performance d'un salarié déclenche l'application du RGPDRGPDConformitéRèglement européen sur la protection des données personnelles. Il s'applique dès qu'un système d'IA traite de telles données, et se cumule avec l'AI Act.Voir dans le glossaire, que l'organisation en ait conscience ou non. La question n'est donc pas « utilisons-nous de l'IA sur des données personnelles ? » mais « savons-nous précisément ce que nous lui envoyons, sur quelle base légale, et où cela finit-il stocké ? »

    Ce chapitre pose le cadre minimal de conformité avant tout déploiement d'un outil d'IA générative en contextefenêtre de contexteIAQuantité de texte qu'un modèle peut prendre en compte simultanément : question, documents fournis et historique. Au-delà, les éléments les plus anciens sortent du champ.Voir dans le glossaire professionnel : base légale, minimisation, transferts internationaux, et responsabilité contractuelle vis-à-vis du fournisseur.

    Qu'est-ce qu'une donnée personnelle dans un pipeline IA ?

    La définition du RGPD est large : toute information se rapportant à une personne physique identifiée ou identifiable. Dans un contexte d'IA générative, cette définition couvre des éléments qu'on oublie facilement de classer comme sensibles.

    • Un nom, un email ou un numéro de téléphone collé dans un prompt.
    • Le corps d'un email client repris tel quel pour générer une réponse.
    • Une évaluation de performance ou un compte-rendu d'entretien annuel soumis à un outil de synthèse.
    • Une combinaison d'attributs indirectement identifiants — « le responsable achats de l'agence de Lyon parti en congé maternité » identifie une personne aussi sûrement qu'un nom.
    • Les réponses générées par le modèle, si elles mentionnent des personnes réelles.
    • Les embeddingsembeddingIAReprésentation numérique dense d'un texte, d'une image ou d'un objet dans un espace vectoriel, utilisée pour la similarité et la recherche sémantique.Voir dans le glossaire ou vecteurs dérivés d'un texte personnel : la transformation mathématique ne fait pas disparaître le caractère personnel de la donnée si elle reste ré-identifiable.

    Les données réellement anonymisées — au sens où toute ré-identification est impossible, même par recoupement — sortent du champ du RGPD. C'est un seuil technique élevé, rarement atteint par un simple retrait de nom.

    Les bases légales mobilisables

    L'article 6 du RGPD prévoit six bases légales. En pratique, trois seulement sont mobilisées de façon réaliste pour l'IA générative en entreprise :

    Base légale Cas d'usage typique Limite pratique
    Exécution du contrat Chatbot de support répondant à une demande contractuelle Ne couvre pas les usages annexes (amélioration du modèle, statistiques)
    Intérêt légitime Analyse interne de documents, synthèse de rapports, aide à la rédaction Exige une analyse de mise en balance (LIA) documentée et opposable
    Obligation légale Détection de fraude, conformité réglementaire Rare en IA générative, plus fréquent en IA de scoring

    Le consentement, sixième base, est théoriquement possible mais rarement valable en contexte professionnel interne : un salarié soumis à un outil imposé par son employeur n'est pas en position de consentir librement, au sens de l'article 4.11 du RGPD.

    Une base légale non documentée au moment du traitement n'a pas de valeur rétroactive. Si un contrôle ou une réclamation intervient, l'absence d'analyse d'intérêt légitime écrite équivaut, en pratique, à l'absence de base légale — même si l'intérêt légitime existait réellement.

    Il faut aussi distinguer deux usages qui n'ont pas la même portée juridique : l'inférenceinférenceIAUtilisation d'un modèle déjà entraîné sur une donnée nouvelle. Peu coûteuse à l'unité mais répétée à chaque requête, elle constitue le coût récurrent d'exploitation.Voir dans le glossaire (utiliser le modèle pour une tâche ponctuelle) et l'entraînement (fine-tuningFine-tuningIAAjustement des poids d'un modèle pré-entraîné sur un jeu de données spécifique pour adapter son comportement à un domaine ou une tâche cible.Voir dans le glossaire d'un modèle sur un corpus contenant des données personnelles). Le second est plus intrusif, plus difficile à réverser, et nécessite quasi systématiquement une analyse d'impactAIPDConformitéAnalyse d'impact relative à la protection des données, obligatoire dès qu'un traitement est susceptible d'engendrer un risque élevé — ce qui couvre la plupart des systèmes de profilage.Voir dans le glossaire.

    Quelle est la finalité de l'usage de l'IA générative ? Exécuter une prestation contractuelle avec la personne Analyser, synthétiser, améliorer un processus interne Répondre à une obligation légale (fraude, contrôle) Exécution du contrat art. 6.1.b RGPD Intérêt légitime art. 6.1.f — LIA obligatoire (analyse de mise en balance) Obligation légale art. 6.1.c RGPD Ces données servent-elles aussi à entraîner (fine-tuner) le modèle ? Oui → base légale distincte + AIPD quasi systématique
    Arbre de décision simplifié pour identifier la base légale applicable à un usage d'IA générative, et le point de bascule vers l'obligation d'AIPD en cas d'entraînement.

    Minimisation : ne donner à la machine que ce dont elle a besoin

    Le principe de minimisation (article 5.1.c du RGPD) impose de ne traiter que les données adéquates, pertinentes et limitées à ce qui est nécessaire. Appliqué à l'IA générative, cela se traduit par des mesures concrètes :

    • Retirer ou masquer les identifiants directs (noms, emails, numéros) avant l'envoi au modèle, via des règles de détection (regex, reconnaissance d'entités nommées).
    • Remplacer les données réelles par des jetons ou des placeholders (« CLIENT_1 », « DATE_X ») réinjectés après génération de la réponse.
    • Privilégier un modèle hébergé localement ou dans un environnement maîtrisé pour les données sensibles, plutôt qu'une API cloud grand public.
    • Limiter la durée de conservation des journaux de conversation au strict nécessaire opérationnel.
    • Désactiver explicitement, chez le fournisseur, l'option d'utilisation des données pour l'entraînement futur du modèle.

    Demandez-vous si un texte purgé de noms propres permet malgré tout d'identifier la personne par recoupement de contexte (poste, date, lieu, événement). Si oui, la minimisation est insuffisante.

    « Le DRH de l'entreprise qui a démissionné en mars après le rachat » identifie une personne précise pour quiconque connaît l'organisation, sans qu'aucun nom n'apparaisse. La minimisation doit porter sur le contexte identifiant, pas seulement sur les identifiants nommés.

    Transferts internationaux : où vont réellement vos données ?

    La majorité des fournisseurs d'IA générative de référence traitent les requêtes sur des infrastructures situées hors de l'Union européenne, notamment aux États-Unis. Ce transfert est encadré par le chapitre V du RGPD, qui impose une garantie juridique avant tout envoi de données personnelles hors UE.

    Trois mécanismes principaux :

    1. Décision d'adéquacité — la Commission européenne reconnaît qu'un pays offre un niveau de protection équivalent. Le Data Privacy Framework UE-USA, adopté en 2023, en est l'exemple le plus pertinent pour l'IA : il succède au Privacy Shield invalidé par l'arrêt Schrems II (CJUE, 2020) en raison des pouvoirs de surveillance de la loi américaine FISA 702.
    2. Clauses contractuelles types (SCC) — clauses standard de la Commission européenne, à intégrer au contrat avec le fournisseur, accompagnées d'une évaluation de l'impact des lois du pays destinataire (transfer impact assessment).
    3. Règles d'entreprise contraignantes (BCR) — mécanisme interne à un groupe, peu pertinent face à un fournisseur tiers.

    Avant de signer avec un fournisseur américain, consultez le registre officiel du Data Privacy Framework. Une entreprise certifiée y figure nommément, avec la date de certification et le périmètre couvert. L'absence d'entrée doit alerter, même si le fournisseur affirme être conforme.

    Cas pratique : un prompt qui expose des données personnelles

    Un agentagentIASystème qui enchaîne des appels d'outils de façon autonome pour atteindre un objectif : il planifie, agit, observe, recommence. Sa fiabilité décroît exponentiellement avec le nombre d'étapes.Voir dans le glossaire de support colle l'intégralité d'un email client — nom, adresse postale, historique d'achat, numéro de commande — dans un outil grand public gratuit pour en générer une réponse plus soignée.

    Les manquements cumulés dans ce scénario :

    • Aucune base légale documentée pour cet usage spécifique de l'outil.
    • Aucun contrat de sous-traitance (DPA) signé avec le fournisseur de l'outil grand public.
    • Transfert de données hors UE sans garantie vérifiée.
    • Absence de minimisation : l'intégralité du contexte identifiant est transmise alors que seul le motif de la demande était nécessaire.
    • Absence d'information du client sur le fait qu'un système d'IA tiers traite ses données (obligation de transparence, articles 13 et 14 du RGPD).
    • Conservation indéfinie possible dans les journaux du fournisseur, si l'option d'exclusion de l'entraînement n'a pas été activée.

    La version conforme du même usage : passer par une offre professionnelle du même fournisseur (API ou palier entreprise) garantissant contractuellement l'absence d'utilisation à des fins d'entraînement, remplacer les données du client par des placeholders avant l'envoi, documenter la finalité du traitement, et journaliser l'usage à des fins d'audit interne.

    Sous-traitance, DPA et responsabilité partagée

    Le RGPD distingue le responsable de traitement (l'organisation qui détermine les finalités et moyens du traitement — généralement vous) et le sous-traitant (le fournisseur qui traite les données pour votre compte, selon vos instructions — généralement l'éditeur de l'outil d'IA).

    Cette qualification bascule si le fournisseur réutilise les données au-delà de vos instructions — par exemple pour entraîner son propre modèle. Il devient alors responsable conjoint, avec des obligations renforcées, et votre contrat doit le refléter.

    Un contrat de sous-traitance (DPA, article 28 du RGPD) doit a minima couvrir :

    • La liste des sous-traitants ultérieurs (subprocessors) et leur localisation.
    • Les mesures de sécurité techniques et organisationnelles appliquées.
    • Le droit d'audit ou, à défaut, la fourniture de certifications (SOC 2, ISO 27001).
    • Les modalités de suppression ou de restitution des données à la fin du contrat.
    • L'engagement contractuel de non-utilisation des données à des fins d'entraînement, si c'est l'exigence retenue.

    Les offres grand public gratuites n'ont généralement pas de DPA disponible : sans contrat de sous-traitance opposable, il est impossible de démontrer la conformité du traitement en cas de contrôle. Un outil sans DPA accessible n'est pas adapté au traitement de données personnelles professionnelles, quelle que soit la qualité du produit.

    Les droits des personnes concernées face à un système d'IA

    Le RGPD reconnaît aux personnes concernées un droit d'accès, de rectification, d'effacement et d'opposition, qui ne s'éteint pas parce que la donnée est passée par un modèle d'IA. En pratique, deux niveaux d'exercice se distinguent :

    • Sur les journaux et données brutes (le prompt tel qu'envoyé, la réponse générée, les métadonnées de connexion) : l'exercice des droits est identique à celui de toute base de données classique — le fournisseur doit permettre l'accès, la suppression ou la rectification sur demande.
    • Sur les paramètres du modèle lorsqu'un fine-tuningaffinageIAPoursuite de l'entraînement d'un modèle existant sur des données propres à un usage. Il enseigne une manière de répondre, non des connaissances fiables — d'où la préférence pour le RAG en entreprise.Voir dans le glossaire a été réalisé sur des données personnelles : l'effacement est techniquement plus complexe, car un modèle entraîné n'« enregistre » pas les données de façon isolée et réversible. Il est recommandé, dans ce cas, de documenter dès la conception une stratégie de suppression (ré-entraînement, filtrage en sortie, ou exclusion préalable des données identifiantes du corpus d'entraînement) plutôt que de découvrir l'impossibilité technique au moment d'une demande d'effacement.

    Prenons le cas d'une entreprise ayant entraîné un assistant interne sur des comptes-rendus d'entretiens RH, qui reçoit une demande d'effacement d'un ancien salarié. Si les données n'ont pas été anonymisées avant l'entraînement, la seule réponse techniquement fiable est souvent de retirer les données à la source, filtrer les sorties mentionnant cette personne, et prévoir un nouveau cycle d'entraînement au prochain rafraîchissement du modèle — l'effacement immédiat et complet dans les poids du modèle n'est généralement pas réalisable.

    Analyse d'impact (AIPD) : quand devient-elle obligatoire ?

    Une analyse d'impact relative à la protection des données (AIPD, ou DPIA) est requise lorsque le traitement présente un risque élevéhaut risqueConformitéCatégorie de l'AI Act regroupant les usages soumis à conditions strictes : recrutement, crédit, éducation, infrastructures critiques. Elle impose documentation, examen des biais et contrôle humain effectif.Voir dans le glossaire pour les droits et libertés des personnes. Trois critères, réunis à partir de deux, déclenchent généralement l'obligation :

    • Traitement à grande échelle de données sensibles (santé, données RH détaillées, données biométriques).
    • Évaluation ou profilage systématique de personnes, y compris à des fins de notation ou de tri automatisé.
    • Usage d'une technologie nouvelle avec un niveau d'incertitude élevé sur les risques — l'IA générative appliquée à des décisions individuelles entre typiquement dans ce cas.

    Une AIPD décrit le traitement, évalue sa nécessité et sa proportionnalité, identifie les risques pour les personnes concernées, et documente les mesures prises pour les réduire. Ce n'est pas un exercice formel : une AIPD superficielle n'a pas plus de valeur juridique qu'une absence d'AIPD si elle ne reflète pas une analyse réelle.

    Ce que l'AI Act ajoute, sans remplacer le RGPD

    Le règlement européen sur l'intelligence artificielleAI ActConformitéRèglement européen sur l'intelligence artificielle, adopté en 2024. Il classe les systèmes en quatre niveaux de risque selon leur usage — jamais selon leur technologie.Voir dans le glossaire (AI Act) introduit des obligations complémentaires pour les systèmes à haut risque — transparence, gestion des biaisbiaisIARégularité correctement apprise dans des données qui ne représentent pas la réalité visée, ou qui enregistrent des décisions passées avec leurs préjugés. Changer d'algorithme ne le corrige pas.Voir dans le glossaire, supervision humaine — mais ne se substitue pas au RGPD. Les deux textes s'appliquent cumulativement : un système d'IA conforme à l'AI Act peut rester en infraction au RGPD s'il traite des données personnelles sans base légale, et inversement.

    Checklist de conformité avant déploiement

    • Base légale identifiée et documentée par usage (pas de base légale générique pour « l'IA »).
    • Minimisation appliquée : anonymisation ou pseudonymisation des données envoyées au modèle.
    • Contrat de sous-traitance (DPA) signé, sous-traitants ultérieurs listés.
    • Localisation des traitements vérifiée, garantie de transfert en place (DPF, SCC).
    • Option de non-utilisation des données pour l'entraînement activée contractuellement.
    • Mentions d'information mises à jour pour informer les personnes concernées.
    • AIPD réalisée si l'un des critères de risque élevé est rempli.
    • Durée de conservation des journaux définie, appliquée techniquement, pas seulement sur le papier.
    • Procédure d'exercice des droits (accès, rectification, effacement) prévue, y compris pour les données passées dans un prompt.

    En résumé

    L'IA générative ne dispense d'aucune des obligations posées par le RGPD : elle les rend simplement plus faciles à ignorer, parce que le geste de coller du texte dans une interface semble anodin. La base légale, la minimisation et la garantie de transfert ne sont pas des formalités à documenter après coup : ce sont les conditions qui déterminent si un déploiement est utilisable en production ou s'il reste, juridiquement, une expérimentation à risque.

    L'essentiel à retenir

    Ce chapitre explique comment le RGPD s'applique concrètement à un usage professionnel d'IA générative : ce qui constitue une donnée personnelle dans un prompt ou une réponse, les bases légales réellement mobilisables (contrat, intérêt légitime, obligation légale), et les limites du consentement en contexte salarié. Il détaille le principe de minimisation avec des techniques opérationnelles d'anonymisation et de pseudonymisation, ainsi que les mécanismes de transfert international de données (Data Privacy Framework, clauses contractuelles types) vers des fournisseurs souvent situés hors UE. Un cas pratique illustre les manquements typiques d'un usage non encadré, et une checklist synthétise les points de contrôle avant tout déploiement d'un outil d'IA générative en production.

    Questions fréquentes

    Puis-je utiliser la version gratuite d'un chatbot IA pour traiter des données clients ?
    En général non, sans précaution particulière : les offres grand public gratuites disposent rarement d'un contrat de sous-traitance (DPA) opposable et utilisent souvent les échanges pour entraîner leurs modèles par défaut. Privilégiez une offre professionnelle avec garantie contractuelle de non-entraînement, ou appliquez une minimisation stricte avant tout envoi.
    Le consentement est-il obligatoire pour utiliser l'IA sur des données RH ?
    Pas nécessairement, et il est souvent inadapté : un salarié soumis à un outil imposé par l'employeur n'est pas en position de consentir librement. L'intérêt légitime, appuyé par une analyse de mise en balance documentée, est en pratique la base légale la plus couramment mobilisée pour ce type d'usage.
    Que faire si un client demande la suppression de ses données passées dans un prompt ?
    Il faut d'abord identifier où ces données ont pu être conservées : journaux de conversation côté fournisseur, historique interne, éventuel corpus d'entraînement. La demande d'effacement doit être transmise au fournisseur si celui-ci conserve les journaux, et documentée dans votre registre des traitements, même si la donnée n'a transité que ponctuellement.
    Les données envoyées à un modèle d'IA sont-elles automatiquement utilisées pour l'entraîner ?
    Cela dépend entièrement de l'offre choisie et des paramètres activés. De nombreux fournisseurs excluent par défaut les usages professionnels (API, offres entreprise) de l'entraînement, mais les offres grand public gratuites l'incluent souvent sauf désactivation explicite. Il faut vérifier ce point dans les conditions contractuelles avant tout déploiement.
    Faut-il réaliser une AIPD pour tout projet impliquant de l'IA générative ?
    Non, uniquement lorsque le traitement présente un risque élevé : données sensibles à grande échelle, profilage systématique, ou usage d'une technologie nouvelle à fort niveau d'incertitude. Un usage ponctuel et limité, correctement minimisé, ne déclenche pas systématiquement cette obligation.
    Quelle est la différence entre anonymisation et pseudonymisation ?
    L'anonymisation rend la ré-identification impossible de façon irréversible, y compris par recoupement, et fait sortir la donnée du champ du RGPD. La pseudonymisation remplace les identifiants directs par des jetons réversibles à l'aide d'une information supplémentaire conservée séparément : la donnée reste personnelle et continue de relever du RGPD.
    Les fournisseurs américains d'IA générative sont-ils automatiquement conformes au RGPD ?
    Non, la conformité n'est pas automatique. Elle dépend de la mise en place effective d'une garantie de transfert (certification Data Privacy Framework ou clauses contractuelles types) et de la signature d'un contrat de sous-traitance couvrant les exigences de l'article 28 du RGPD. L'absence de ces éléments doit être considérée comme un signal d'alerte.

    Progression sauvegardée dans votre navigateur.

    Quiz de validation

    Quiz de validation

    Quiz indisponible (données invalides).

    Besoin d'un accompagnement complet ? De la gap analysis à la certification — nos experts vous guident.
    Devis gratuit
    Ch. 2/8 Données personnelles et LLM 25% ~30 min Mode lecture v2.7.9