-
Notifications
You must be signed in to change notification settings - Fork 13
Sondage
On parlera dans cette page des sondages ou des enquêtes qui utilise des méthodes d'échantillonnage. Cela correspond par exemple aux enquêtes de l'Insee.
On trouvera ici un document de Maxime Bergeat présentant une approche de ne comparaison entre différentes méthodes d'anonymisation d'un tel fichier de données individuelles. Il introduit en particulier une méthode originale de protection fondée sur un sous-échantillonnage et une correction des pondérations. L'expérimentation est réalisée sur l'enquête "Vols, violences et sécurité". Il existe une présentation associée à ce document.
Le principe même de l'échantillonnage est de disposer d'un fichier représentatif de la population. A titre d'illustration, on imagine un échantillon au 1/5000ème. Chaque personne interrogée représente 5000 personnes de la population. On peut donc considérer que l'on a un fichier 5000-anonyme. Ce n'est pourtant pas si simple puisque l'échantillonnage ne dit pas que les 4999 personnes représentées ont exactement les mêmes caractéristiques, seulement qu'elles partagent des caractéristiques semblables (âge, sexe, type de ménage).
En termes d'anonymisation, on a une balance entre le fait d'avoir une information très précise et donc très identifiante sur une personne et le fait qu’énormément de personne ne sont pas dans l'échantillon. Un autre idée à avoir est que du fait de la non-exhaustivité, les échantillons sont parfois petits.
Anonymiser une enquête/un sondage modifie un peu le raisonnement sur l'anonymisation. Le fait d'interroger un échantillon de la population, à première vue, limite les possibilités de réidentification. En effet, un utilisateur de la base de données qui cherche à trouver une personne dans l'échantillon (une personnalité ou une connaissance) ne peut pas avoir la certitude qu'elles s'y trouve. Sans avoir cette information, il faut avoir une connaissance très fine de l'objet interrogé pour savoir qu'il s'agit de lui et avoir la certitude qu'aucune autre personne qui aurait pu être interrogée dans la population n'a ces caractéristiques.
Cependant, ce raisonnement ne tient plus lorsque l'on sait que la personne est dans l'échantillon (j'ai vu l'enquêteur de l'Insee passer chez mon voisin, il m'en a parlé). A ce moment-là, les informations demandées étant dans ce genre d'enquêtes souvent assez précises, je peux en général, en fonction de l'information dont je dispose retrouver mon voisin et en déduire des informations normalement couvertes par le secret statistique.
Cette page est à developper.