Qu'est-ce que le masquage des données ?
Le masquage des données vise à transformer les données sensibles en représentations protégées, ce qui permet de dissimuler les informations personnelles identifiables (PII), les informations médicales protégées (PHI) et les données financières aux utilisateurs non autorisés, tout en préservant l’exploitabilité des données pour les tâches d’analyse, de développement et d’intelligence artificielle.
Points clés à retenir : masquer les données, réduire l’exposition.
Les données d’une organisation peuvent constituer son actif le plus précieux. Cependant, elles présentent également un grand intérêt pour les pirates. La divulgation de données sensibles peut entraîner non seulement une perte équivalente à la valeur initiale de ces données, mais aussi des sanctions réglementaires et une atteinte à la réputation.
Masquage dynamique, sans copie : le masquage dynamique des données est conçu pour appliquer la rédaction en temps réel, en fournissant des résultats masqués directement à partir de l’ensemble de données d’origine. Cela permet de réduire la charge opérationnelle, ainsi que les risques liés à la cohérence et les coûts de stockage liés à la gestion de multiples copies de données.
Conformité intégrée : le masquage des données contribue au respect des normes RGPD, HIPAA, CCPA, PCI DSS et SOC 2 en empêchant l’exposition des données personnelles et sensibles à des utilisateurs non autorisés, à des modèles d’IA et à des environnements de développement.
Contrôle granulaire basé sur des politiques : les politiques de masquage peuvent être appliquées au niveau des colonnes, des lignes, des tables, des schémas ou de la base de données, avec des profils de masquage différents selon les groupes d’utilisateurs, les rôles et les types d’utilisateurs des données.
Classification et couverture automatiques : la classification automatisée des données permet d’identifier les informations personnelles identifiables (PII), les informations de santé protégées (PHI) et les données financières dans des sources structurées et non structurées sans marquage manuel, ce qui contribue à réduire le délai de couverture et les angles morts.
Multiplateforme et gestion centralisée : une couche unique de politiques de masquage peut être appliquée de manière cohérente aux entrepôts de données, aux bases de données cloud, aux lacs de données et aux environnements d’IA/ML, quel que soit l’emplacement des données ou la manière dont elles sont interrogées.
Des données sécurisées pour le développement et l’IA : le masquage des données permet aux développeurs, aux analystes et aux équipes d’IA de travailler avec des ensembles de données reflétant fidèlement l’environnement de production sans être exposés à des données sensibles, ce qui contribue à accélérer l’innovation sans introduire de risque réglementaire.
Risk d’exposition
Pourquoi le masquage des données est-il important ?
Lorsque l’impact d’une violation de données clients anonymisées s’élève à 115 dollars par enregistrement – contre 160 dollars par enregistrement pour les données à caractère personnel (DCP) –, la valeur du masquage se mesure en dollars. Les organisations victimes d’une fuite de données sensibles s’exposent à des sanctions réglementaires, à une atteinte à leur réputation et à des coûts liés à la violation qui dépassent de loin le coût de la prévention.
Protéger les données à caractère personnel dans tous les environnements
Les données sensibles telles que les informations personnelles identifiables (PII), les informations médicales protégées (PHI) et les dossiers financiers transitent par des plateformes d’analyse, des entrepôts de données dans le cloud, des pipelines d’entraînement d’IA et des environnements de développement. Chaque point de contact peut créer un risque d’exposition. Le masquage des données permet de masquer automatiquement les champs sensibles aux utilisateurs non autorisés au point d’accès, sans qu’il soit nécessaire de conserver des copies ni d’intervenir manuellement.
Assurer la conformité sans ralentir les équipes
Le RGPD, l’HIPAA, le CCPA et la norme PCI DSS exigent des contrôles vérifiables sur la manière dont les données à caractère personnel sont consultées et traitées. Le masquage des données est conçu pour offrir une approche nativement conforme : il permet d’appliquer automatiquement le masquage, de générer des pistes d’audit pour les événements d’accès et d’empêcher que les données réglementées ne parviennent à des systèmes ou à des utilisateurs non autorisés, sans perturber les opérations sur les données.
Sécuriser les données pour les charges de travail d’IA
Les charges de travail d’IA et d’apprentissage automatique nécessitent de vastes ensembles de données pour l’entraînement et les tests ; cependant, l’exposition d’informations personnelles identifiables (PII) ou d’enregistrements sensibles aux modèles d’IA peut entraîner des risques réglementaires et de réputation. Le masquage des données est conçu pour fournir aux équipes de développement et d’IA des ensembles de données réalistes en production, dépourvus d’identifiants sensibles, ce qui permet d’accélérer le développement des modèles sans compromettre la conformité.
Compétences clés
Fonctionnement du masquage des données
Un masquage efficace des données est conçu pour appliquer une expurgation basée sur des règles au point d’accès, ce qui permet de masquer les champs sensibles avant qu’ils n’atteignent des utilisateurs non autorisés, sans dupliquer ni modifier le magasin de données sous-jacent. Le masquage dynamique moderne prend en charge plusieurs méthodes de masquage, une gestion centralisée des règles et une classification automatisée dans tous les environnements.
Masquage dynamique des données en temps réel
Le masquage dynamique des données applique la rédaction en temps réel au fur et à mesure que les données sont interrogées, ce qui permet de renvoyer des résultats masqués aux utilisateurs non autorisés tout en préservant un accès complet pour les rôles autorisés – à partir d’une source de données unique et non modifiée. Contrairement au masquage statique, qui nécessite de gérer plusieurs copies à différents niveaux de masquage, le masquage dynamique permet de réduire la charge de stockage, le risque de désynchronisation et le décalage entre les données sources et les copies masquées.
Profils de masquage granulaires basés sur des politiques
Des profils de masquage sont créés pour définir le traitement de chaque type de données – allant de la censure complète des champs hautement sensibles au hachage pour des cas d’utilisation statistiques, en passant par un masquage partiel qui préserve la structure du domaine tout en masquant les valeurs d’identification. Les profils peuvent être appliqués au niveau des colonnes, des lignes, des tables, des schémas ou des bases de données, et leur portée peut être limitée à des rôles utilisateur spécifiques, à des groupes de fournisseurs d’identité ou à des segments de consommateurs de données.
Classification automatique pour une couverture instantanée
Un masquage efficace des données commence par l’identification de l’emplacement des données sensibles. La classification automatisée permet d’identifier en continu les informations personnelles identifiables (PII), les informations médicales protégées (PHI), les dossiers financiers et d’autres types de données réglementées dans des sources structurées et non structurées, sans nécessiter de balisage manuel ni de mises à jour de schéma. Lorsque de nouvelles tables ou colonnes sont ajoutées, les politiques de masquage peuvent être appliquées automatiquement, ce qui permet de combler les lacunes de couverture avant qu’elles ne créent un risque d’exposition.
En pratique
Cas d’utilisation du masquage des données
Les organisations des secteurs des services financiers et de la santé, ainsi que les équipes chargées des données d’entreprise et de l’IA, ont recours au masquage des données pour protéger les charges de travail sensibles, permettre une collaboration sécurisée autour des données et répondre aux exigences réglementaires de plus en plus strictes.
Masquage des données financières à des fins d’analyse et de conformité
Les institutions financières qui gèrent l’historique des transactions des clients, les données de cartes de paiement et les informations de crédit doivent mettre en œuvre des contrôles d’accès stricts, conformément au RGPD, à la norme PCI DSS et au CCPA. Le masquage dynamique des données permet aux équipes d’analyse et de reporting d’interroger des ensembles de données de production sans accéder aux informations personnelles identifiables (PII) ni aux identifiants financiers, ce qui contribue à préserver l’utilité des données tout en réduisant les risques d’exposition non autorisée aux points d’accès.
Protection des informations de santé protégées (PHI) dans les charges de travail d’IA et d’analyse
Les organismes de santé qui développent des modèles d’IA à partir de données de santé protégées (PHI) sont soumis aux exigences strictes de la loi HIPAA en matière d’accès et d’exposition des données. Le masquage dynamique des données est conçu pour permettre aux professionnels de santé, aux analystes et aux systèmes d’IA de ne recevoir que les données auxquelles ils sont autorisés à accéder, ce qui favorise l’innovation dans le domaine des données de santé tout en garantissant la conformité, sans duplication des ensembles de données sensibles.
Des données sécurisées et fidèles à l’environnement de production pour le développement et l’IA
Les ingénieurs de données, les développeurs de modèles et les équipes d’analyse ont besoin de jeux de données réalistes pour les tests, l’entraînement et le développement ; or, l’utilisation de données de production contenant de véritables informations d’identification personnelles (PII) peut entraîner des risques réglementaires. Le masquage des données permet de fournir des ensembles de données fidèles à l’environnement de production, dans lesquels les champs sensibles sont automatiquement masqués, offrant ainsi aux équipes la fidélité des données dont elles ont besoin sans le risque de non-conformité lié à l’exposition des données réelles.
Foire aux questions
Qu’est-ce que le masquage des données ?
Le masquage des données est le processus qui consiste à transformer des données sensibles – notamment les informations personnelles identifiables (PII), les informations médicales protégées (PHI) et les données financières – en représentations protégées inutilisables par des utilisateurs non autorisés, tout en restant fonctionnelles pour les processus et analyses autorisés. Les méthodes de masquage vont de la suppression totale et du hachage au masquage partiel et à la tokenisation, avec des politiques appliquées au niveau du point d’accès afin de réduire l’exposition sans dupliquer les données sous-jacentes.
Quelle est la différence entre le masquage statique et le masquage dynamique des données ?
Le masquage statique des données crée une copie distincte et pré-masquée des données à un moment donné, qui est ensuite distribuée aux utilisateurs nécessitant un accès restreint. Le masquage dynamique des données applique le masquage en temps réel au moment de la requête – à partir d’une source de données unique et non modifiée –, ce qui permet de renvoyer des résultats masqués aux utilisateurs non autorisés et les données complètes aux rôles autorisés. Le masquage dynamique contribue à réduire les coûts de stockage, de synchronisation et de maintenance liés à la gestion de multiples copies de données.
Quels types de données sont généralement masqués ?
Le masquage des données s’applique le plus souvent aux informations à caractère personnel (ICP) – noms, adresses e-mail, numéros de téléphone, numéros de sécurité sociale –, ainsi qu’aux informations de santé protégées (ISP), aux données financières telles que les numéros de cartes de paiement et les coordonnées bancaires, et à d’autres types de données réglementées soumises aux exigences du RGPD, de l’HIPAA, du CCPA ou de la norme PCI DSS. Le masquage des données peut également s’appliquer à des données commerciales, telles que les modèles tarifaires ou financiers, dont les organisations doivent restreindre l’accès même au sein de leurs équipes internes.
En quoi le masquage des données contribue-t-il à la conformité réglementaire ?
Le RGPD, la loi HIPAA, le CCPA, la norme PCI DSS et la norme SOC 2 exigent tous des contrôles vérifiables concernant les personnes ayant accès aux données à caractère personnel et aux données sensibles. Le masquage des données est conçu pour faciliter la conformité en empêchant que des champs sensibles ne soient exposés à des utilisateurs non autorisés, à des systèmes d’IA ou à des environnements de développement – de manière automatique et sans intervention manuelle. Des journaux d’audit complets des événements de masquage permettent de fournir les preuves requises par les auditeurs et de réduire la charge de travail liée aux rapports de conformité.
Quelle est la différence entre le masquage des données et le chiffrement des données ?
Le chiffrement des données permet de protéger les données en transit et au repos en les rendant illisibles sans clé de déchiffrement ; toutefois, les utilisateurs autorisés disposant de la clé reçoivent la valeur complète et non masquée. Le masquage des données permet de masquer ou de transformer les champs sensibles au niveau du point d’accès, de sorte que les utilisateurs non autorisés ne puissent pas accéder à la valeur sous-jacente, même s’ils ont accès à la base de données. Ces deux approches sont complémentaires : le chiffrement permet de protéger les données au repos et en transit, tandis que le masquage permet de contrôler ce que chaque utilisateur voit au moment de la requête.
Comment Commvault facilite-t-il le masquage des données ?
Les fonctionnalités de sécurité des données et d’IA de Commvault sont conçues pour offrir un masquage dynamique des données, une découverte et une classification automatisées des données, ainsi qu’une gestion centralisée des politiques de masquage dans les environnements hybrides et multicloud. Les entreprises peuvent définir des profils de masquage à n’importe quel niveau de granularité (colonne, ligne, table, schéma ou base de données entière) ; Commvault les appliquera de manière cohérente à l’ensemble des entrepôts de données, bases de données cloud, lacs de données et charges de travail d’IA/ML, avec journalisation des audits et prise en charge automatique des nouvelles sources de données au fur et à mesure de leur ajout.