Article fouillé du service LINC de la CNIL sur les différents modèles de base de données de recherche scientifique en santé.
J'en recommande la lecture.
UK Biobank = base de données de santé britannique. Organisation sans but lucratif, financée par des fonds publics et privés. Alimentée par le service de santé public (NHS). Très complète (données biologiques et génétique, imagerie, questionnaires médicaux, etc.). Données accessibles pour tout projet de recherche public ou privé de tout pays.
Basée sur le consentement, contrairement à la Plateforme des données de santé (PDS, = Health Data Hub) française et aux entrepôts de données de santé constitués en douce par les hôpitaux (car informer les ex-patients coûteraient trop cher).
Tentative avortée de revente de données patients sur Alibaba. Plusieurs patients ont pu être réidentifiés par les journalistes à partir du seul couplet mois de naissance et date d'intervention chirurgicale. Les profils revendus incluaient aussi le sexe, l'âge, la situation socio-économique, les habitudes de vie, et les données de santé.
On répète : pseudonymisation != anonymisation.
Origine des données : deux hôpitaux chinois accrédités. Un étudiant chercheur et un employé temporaire, tous deux non-habilités ont utilisé le compte utilisateur d'un collègue.
Des chercheurs légitimes publient également, par inconscience, les données de santé réidentifiables comme source de leurs travaux. 🙄️
En 2025-2026, la Biobank est intervenue 110 fois sur un an pour demander le retrait de données.
Depuis 2024, la Biobank est passée d'un modèle décentralisé de distribution de fichiers (= copies des données !) à un modèle centralisé (= cloud).
Mais de nombreuses dérogations persistent : 200 institutions internationales et/ou 1 200 projets de recherche initiés avant 2024 ont une copie des données (adaptée à leur projet de recherche).
De plus, les résultats des calculs peuvent être téléchargés après un contrôle automatisé minimal, donc le problème reste entier.
Autre modèle : OpenSAFELY de l'univ' d'Oxford dans le cadre du Covid-19.
Les chercheurs n'ont pas accès aux données : ils préparent leurs calculs sur un modèle, le code est validé par des humains, il est exécuté sur les vraies données par Oxford, puis les résultats sont vérifiés par deux humains avant d'être remis aux chercheurs.
À mon avis : charge de travail conséquente pour les équipes de recherche et Oxford + cela exige une très grande qualité des données (= qualification), notamment leur normalisation, pour que les calculs ne plantent pas.
À propos de l'impacte de ces modèles plus contraignants sur la recherche scientifique :
Entretien avec Marie Zins, Commissaire à la CNIL et ancienne directrice l'Unité de service Inserm « Cohortes épidémiologiques en population »
[…]
[…] A l’Inserm, j’ai travaillé pendant de nombreuses années sur les cohortes Constances (220 000 participants) et Gazel (20 000 volontaires), dont j’avais la responsabilité.
[…]
[…] De la même manière, il faut battre en brèche l’idée que ces plateformes d’accès sécurisé ne sont pas adaptées à la recherche car elles ne proposeraient pas les tous les outils d’analyses nécessaires aux chercheurs, en particulier pour des recherches souhaitant recourir à des outils d’intelligence artificielle. Cela ne me semble pas correct : il est tout à fait possible de créer des espaces dans lesquels ces outils sont importés – après un contrôle préalable pour s’assurer qu’ils ne représentent pas un risque pour la sécurité – avec des infrastructures qui s’adaptent rapidement aux besoins exprimés par les chercheurs. Pour parler de mon expérience, nous avons travaillé avec le Centre d’accès sécurisé aux données (CASD), qui couvre tous ces besoins tout apportant d’excellente garantie sur la protection des données. […]
Données pluripersonnelles :
Cette crise met en évidence une réalité scientifique et éthique fondamentale : l’ADN et les antécédents de santé ne sont pas des données personnelles classiques, mais des données pluripersonnelles. Un profil génétique n’appartient pas qu'à une seule personne, il est partagé en grande partie avec sa famille biologique. Choisir de partager son patrimoine génétique implique donc la confidentialité médicale de ses proches : en cas de fuite, ce sont aussi les enfants, les parents et les collatéraux des participants qui se retrouvent exposés sur Internet, sans jamais avoir été consultés, ni avoir donné leur consentement.
Scilabus a causé de cet aspect en matière de tests ADN récréatifs.
Autres mésusages des données de santé :
Lors de l'affaire du CPRD en 2020 au Royaume-Uni, le ministère de la Santé britannique a engrangé 10 millions de livres sterling en vendant des licences d'accès aux dossiers médicaux de millions de patients du NHS à des laboratoires basés aux États-Unis (Merck, Bristol-Myers Squibb, Eli Lilly). Le gouvernement prétendait que ces données étaient anonymes, mais leur niveau de détail permettait de retrouver l'identité des patients. La même année, Amazon a signé un accord de partenariat avec le NHS pour exploiter ces données de santé afin d'entraîner et d'améliorer l'algorithme de son assistant vocal Alexa.
[…]
Lors de l'étude américaine ABCD (Adolescent Brain Cognitive Development) portant sur le développement du cerveau de 20 000 enfants, des chercheurs extrémistes ont récupéré les données médicales pour tenter de produire des recherches pseudo-scientifiques à visée raciste, cherchant à lier génétique et intelligence selon l'ethnie. Ce phénomène s'est étendu à la UK Biobank : le groupe Human Diversity Foundation y aurait accédé pour mener des travaux controversés sur la race et l'intelligence, tandis que la start-up Heliospect Genomics s'en serait servie pour concevoir des outils de sélection d'embryons selon le QI. La Biobank affirme qu'aucune preuve d'utilisation abusive n'a été établie, mais plusieurs généticiens estiment sa réaction trop rapide et dénoncent un manque de contrôle sur l'usage réel des fichiers extraits.