Guide RGPD · Anonymisation
Anonymisation des données et pseudonymisation : faire la différence
L'anonymisation des données fait sortir un jeu de données du champ du RGPD ; la pseudonymisation le protège mais le laisse dans le champ. Confondre les deux est l'erreur la plus fréquente. Ce chapitre donne les définitions, les techniques, les trois critères européens pour vérifier une anonymisation et les évolutions récentes de la jurisprudence et du Comité européen de la protection des données (CEPD), avec les points de vigilance du responsable de la sécurité des systèmes d'information (RSSI) et du délégué à la protection des données (DPO).
- Références
- RGPD art. 4, 25, 32 ; avis G29 05/2014
- Critères
- Individualisation, corrélation, inférence
- En cours
- Lignes directrices du CEPD (2025, 2026)
Chapitres du guide
En bref
-
Des données anonymisées ne permettent plus, en pratique et de façon irréversible, d'identifier une personne : le RGPD ne s'y applique plus.
-
Des données pseudonymisées ont seulement perdu leurs identifiants directs ; on peut les rattacher à une personne avec une information complémentaire conservée à part : elles restent des données personnelles.
-
Une anonymisation se vérifie avec trois critères : impossible d'isoler une personne (individualisation), de relier des données la concernant (corrélation), de déduire une information sur elle (inférence).
-
Aucune technique ne suffit seule : l'avis 05/2014 du G29 recommande de combiner randomisation et généralisation, au cas par cas.
-
Depuis l'arrêt CEPD contre CRU (2025), des données pseudonymisées peuvent ne pas être personnelles pour un destinataire qui n'a aucun moyen raisonnable de réidentifier ; elles le restent pour celui qui détient la clé.
Anonymisation et pseudonymisation : les définitions
Le RGPD définit la pseudonymisation à son article 4, point 5 : un traitement qui empêche d'attribuer les données à une personne précise sans recourir à des informations supplémentaires, à condition que ces informations soient conservées séparément et protégées par des mesures techniques et organisationnelles. Remplacer le nom d'un patient par un numéro, et garder la table de correspondance dans un coffre, c'est pseudonymiser.
L'anonymisation n'est pas définie dans les articles, mais le considérant 26 précise que le règlement ne s'applique pas aux informations anonymes, c'est-à-dire qui ne concernent pas une personne identifiée ou identifiable, compte tenu de l'ensemble des moyens raisonnablement susceptibles d'être utilisés pour l'identifier. La Commission nationale de l'informatique et des libertés (CNIL) la décrit comme un traitement qui rend impossible, en pratique, toute identification de la personne, de manière irréversible.
| Pseudonymisation | Anonymisation | |
|---|---|---|
| Principe | Remplacer les identifiants directs par un pseudonyme | Rendre toute identification impossible en pratique |
| Réversible ? | Oui, avec l'information complémentaire (clé, table de correspondance) | Non, par définition |
| Statut au regard du RGPD | Données personnelles : le RGPD s'applique | Données anonymes : le RGPD ne s'applique plus |
| Usage typique | Mesure de sécurité et de minimisation, études internes, tests | Statistiques publiées, données ouvertes, conservation au-delà de la durée prévue |
| Où le RGPD la cite | Articles 25 (dès la conception), 32 (sécurité), 6 (compatibilité d'un traitement ultérieur), 89 (recherche et statistiques) | Considérant 26 |
Pseudonymiser : techniques et bonnes pratiques
La pseudonymisation est avant tout une mesure de sécurité et de minimisation : elle réduit les conséquences d'une fuite et limite ce que voient les personnes qui n'ont pas besoin de l'identité. L'avis 05/2014 du groupe de travail « Article 29 » (G29), qui réunissait les autorités européennes avant le CEPD, en décrit les principales techniques :
| Technique | Principe | Point de vigilance pour le RSSI |
|---|---|---|
| Chiffrement à clé secrète | L'identifiant est chiffré ; le détenteur de la clé peut le déchiffrer. | La sécurité repose entièrement sur la protection et la rotation de la clé. |
| Fonction de hachage simple | L'identifiant est transformé en empreinte de taille fixe. | Faible : si l'ensemble des valeurs possibles est connu (numéros, dates), on retrouve l'identifiant en hachant toutes les valeurs. |
| Hachage avec clé secrète | Le hachage utilise une clé, conservée séparément. | Robuste tant que la clé est protégée ; supprimer la clé rend le lien très difficile à reconstituer. |
| Tokenisation | L'identifiant est remplacé par un jeton aléatoire, la correspondance est stockée dans une base séparée. | Protéger et journaliser l'accès à la base de correspondance. |
Le Comité européen de la protection des données (CEPD) a adopté en janvier 2025 des lignes directrices 01/2025 sur la pseudonymisation, soumises à consultation publique. Il y insiste sur la notion de domaine de pseudonymisation : l'ensemble des personnes et des organisations pour lesquelles les données ne doivent pas être rattachables à une personne. Plus ce domaine est bien défini et cloisonné, plus la pseudonymisation est efficace.
L'arrêt CEPD contre CRU (septembre 2025)
Dans un arrêt du 4 septembre 2025 (affaire C-413/23 P), la Cour de justice de l'Union européenne a jugé que des données pseudonymisées restent des données personnelles pour le responsable qui détient la clé, mais peuvent ne pas l'être pour un destinataire qui ne dispose d'aucun moyen raisonnable de réidentifier les personnes. L'affaire concernait le Conseil de résolution unique, qui avait transmis à un cabinet d'audit des commentaires d'actionnaires pseudonymisés, et portait sur le règlement applicable aux institutions européennes, rédigé dans les mêmes termes que le RGPD. La Cour a aussi précisé que l'obligation d'informer les personnes pèse sur le responsable initial, au moment de la collecte.
Cette approche « relative » ne change rien pour celui qui pseudonymise : ses données restent soumises au RGPD. Elle invite en revanche à documenter, pour chaque destinataire, les moyens dont il dispose réellement pour réidentifier. Le contrat avec le sous-traitant et les engagements de ne pas réidentifier en font partie.
Anonymiser : randomisation et généralisation
Le G29 range les techniques d'anonymisation en deux familles, que la CNIL reprend :
- la randomisation, qui modifie les valeurs pour couper le lien entre les données et la personne tout en préservant la répartition d'ensemble : ajout de bruit, permutation des valeurs entre individus, confidentialité différentielle ;
- la généralisation, qui réduit la précision des valeurs pour qu'une personne se fonde dans un groupe : agrégation, k-anonymat (chaque combinaison de caractéristiques est partagée par au moins k personnes), l-diversité et t-proximité (qui évitent qu'un groupe ait une valeur sensible trop homogène).
L'avis compare ces techniques au regard des trois risques. Sa conclusion est nette : aucune technique ne règle seule les trois, et la pseudonymisation n'en règle aucun. Il faut donc combiner les techniques et choisir au cas par cas, selon l'usage prévu des données.
| Technique | Isoler une personne ? | Relier ses données ? | Déduire une information ? |
|---|---|---|---|
| Pseudonymisation | Oui | Oui | Oui |
| Ajout de bruit | Oui | Peut-être pas | Peut-être pas |
| Substitution (permutation) | Oui | Oui | Peut-être pas |
| Agrégation, k-anonymat | Non | Oui | Oui |
| l-diversité | Non | Oui | Peut-être pas |
| Confidentialité différentielle | Peut-être pas | Peut-être pas | Peut-être pas |
| Hachage, tokenisation | Oui | Oui | Peut-être pas |
Vérifier une anonymisation : les trois critères
Pour savoir si un jeu de données est vraiment anonyme, les autorités européennes appliquent trois critères. La CNIL les illustre ainsi :
| Critère | Question | Exemple d'échec |
|---|---|---|
| Individualisation | Peut-on isoler une personne dans le jeu de données ? | Une ligne unique combinant âge, commune et service désigne de fait un patient. |
| Corrélation | Peut-on relier des données qui concernent la même personne, dans ce jeu ou entre plusieurs jeux ? | Le même pseudonyme apparaît dans deux extractions successives, qu'on peut recouper. |
| Inférence | Peut-on déduire, presque à coup sûr, une information nouvelle sur une personne ? | Si tous les hommes de 20 à 25 ans d'une enquête sont non imposables, on le sait aussi pour le répondant de 24 ans que l'on connaît. |
Si les trois critères sont satisfaits, les données peuvent être considérées comme anonymes. Sinon, il faut une analyse approfondie du risque de réidentification, en tenant compte des données disponibles par ailleurs, des moyens d'un attaquant raisonnable et de l'évolution des techniques. Une anonymisation se réexamine dans le temps : de nouvelles données publiées ailleurs peuvent rendre réidentifiable un jeu qui ne l'était pas.
Ce qui évolue en 2026
Le CEPD a adopté le 7 juillet 2026 un projet de lignes directrices sur l'anonymisation, ouvert à consultation publique jusqu'au 30 octobre 2026. D'après la présentation qu'en fait la CNIL, il tient compte de l'arrêt CEPD contre CRU, conserve les trois critères comme test de référence et propose deux façons d'évaluer le résultat : une approche contextuelle, qui tient compte des capacités réelles de chaque entité susceptible de réidentifier, et une approche simplifiée, plus prudente, qui ignore ces différences. Tant que la version définitive n'est pas adoptée, l'avis 05/2014 reste la référence la plus citée.
Exemple : les statistiques du portail patient
- Analyse détaillée par un cabinet de conseil. Le cabinet doit étudier les parcours de prise de rendez-vous. L'hôpital lui transmet une extraction pseudonymisée : identifiants remplacés par un hachage avec clé secrète conservée par la direction des systèmes d'information, dates de naissance réduites à l'année. Pour l'hôpital, ce sont toujours des données personnelles : le cabinet est sous-traitant, avec un contrat article 28 qui lui interdit toute tentative de réidentification et impose la suppression en fin de mission.
- Tableau de bord publié dans le rapport annuel. Les chiffres sont anonymisés : nombre de rendez-vous pris en ligne par service et par trimestre, tranches d'âge de dix ans, aucun effectif inférieur à un seuil fixé par l'établissement. Le DPO vérifie les trois critères : aucune personne isolable, aucune donnée individuelle à relier, aucune déduction possible sur un patient. Le tableau peut être publié.
Questions fréquentes
Quelle est la différence entre anonymisation et pseudonymisation ?
L'anonymisation rend toute identification impossible en pratique et de façon irréversible : les données sortent du champ du RGPD. La pseudonymisation remplace les identifiants directs par un pseudonyme, mais une information complémentaire (clé, table de correspondance) permet de revenir en arrière : les données restent personnelles et le RGPD s'applique.
Les données pseudonymisées sont-elles des données personnelles ?
Oui pour l'organisme qui détient l'information permettant de réidentifier. Depuis l'arrêt de la Cour de justice du 4 septembre 2025 (CEPD contre CRU), elles peuvent ne pas l'être pour un destinataire qui n'a aucun moyen raisonnable de réidentifier les personnes, ce qui s'apprécie au cas par cas.
Comment savoir si des données sont vraiment anonymes ?
En appliquant les trois critères européens : il ne doit pas être possible d'isoler une personne, de relier des données la concernant, ni de déduire une information sur elle. Si l'un des critères n'est pas rempli, une analyse du risque de réidentification est nécessaire.
Le hachage d'un identifiant suffit-il à anonymiser ?
Non. Le hachage est une technique de pseudonymisation. Un hachage simple est même fragile : si l'on connaît l'ensemble des valeurs possibles (numéros de téléphone, dates), on peut toutes les hacher et retrouver l'identifiant. Et les autres colonnes du jeu de données permettent souvent d'isoler la personne.
Peut-on conserver des données anonymisées sans limite de durée ?
Des données réellement anonymes ne sont plus soumises au RGPD, donc pas à ses durées de conservation. L'anonymisation est d'ailleurs une façon de garder des statistiques au-delà de la durée prévue pour les données personnelles. Encore faut-il qu'elle résiste dans le temps aux nouvelles possibilités de recoupement.
Sources
Ce chapitre résume et reformule les publications officielles ci-dessous. En cas de doute, le texte officiel fait foi.
- Règlement (UE) 2016/679 du 27 avril 2016 (règlement général sur la protection des données), EUR-Lex, 27 avril 2016.
- L'anonymisation de données personnelles, CNIL, mai 2020.
- Avis 05/2014 sur les techniques d'anonymisation (WP216), Groupe de travail « Article 29 » (G29), 10 avril 2014.
- Lignes directrices 01/2025 sur la pseudonymisation (version soumise à consultation publique), Comité européen de la protection des données (CEPD), janvier 2025.
- Arrêt CEPD contre CRU, affaire C-413/23 P (données pseudonymisées), Cour de justice de l'Union européenne, 4 septembre 2025.
- Lignes directrices sur l'anonymisation (projet soumis à consultation publique jusqu'au 30 octobre 2026), Comité européen de la protection des données (CEPD), juillet 2026.
- Le CEPD met en lumière l'anonymisation et le moissonnage pour l'IA générative, CNIL, 9 juillet 2026.
- Lignes directrices 4/2019 relatives à l'article 25 : protection des données dès la conception et protection des données par défaut (version 2.0), Comité européen de la protection des données (CEPD), 20 octobre 2020.
Une plateforme et un service qui s'adaptent à vous
Notre plateforme est conçue pour un paramétrage très fin et une large capacité d'adaptation à vos besoins.