Article 10 : données et gouvernance des données
L’article 10 fixe les règles de gouvernance des données pour les jeux d’entraînement, de validation et d’essai utilisés par les systèmes d’IA à haut risque. Les fournisseurs doivent veiller à ce que les jeux soient pertinents, suffisamment représentatifs, exempts d’erreurs dans toute la mesure possible, et complets au regard de la destination, y compris des propriétés statistiques appropriées pour les personnes ou groupes concernés. L’article 10, paragraphe 5, permet exceptionnellement de traiter des catégories particulières de données à caractère personnel pour détecter et corriger des biais, sous conditions strictes.
À qui cela s’applique-t-il ?
- -Fournisseurs de systèmes d’IA à haut risque qui s’appuient sur un entraînement ou un réglage alimenté par des données
Scénarios
Un modèle de recrutement est entraîné sur cinq années d’embauches réussies provenant d’un seul pays, puis déployé dans toute l’UE.
Un fournisseur n’a pas accès aux libellés sensibles nécessaires aux essais.
Principes essentiels sur les données
Les jeux d’entraînement, de validation et d’essai suivent l’article 10, paragraphes 2 à 4 :
- Pertinents et suffisamment représentatifs au regard de la destination et du contexte géographique, contextuel, comportemental ou fonctionnel
- Aussi exempts d’erreurs et complets que possible au regard de la destination
- Propriétés statistiques appropriées pour les personnes ou groupes à l’égard desquels le système est destiné à être utilisé
- Examen des biais susceptibles de porter atteinte à la santé et à la sécurité, d’avoir une incidence négative sur les droits fondamentaux ou de se traduire par une discrimination interdite par le droit de l’Union
Vous devez pouvoir justifier les choix dans la documentation technique.
Catégories particulières de données
Le traitement des catégories particulières de données à caractère personnel au titre de l’article 9 du RGPD est étroitement encadré. L’article 10, paragraphe 5, n’autorise un traitement étroit que pour la détection et la correction des biais lorsque d’autres moyens (y compris des données synthétiques ou anonymisées) ne suffisent pas, sous garanties appropriées pour les droits et libertés, y compris des limitations techniques, la pseudonymisation et la sécurité. Coordonnez-vous avec votre délégué à la protection des données.
Lien avec la conservation des documents et les journaux
Les décisions de gouvernance des données doivent être traçables dans la documentation exigée par l’article 11 (documentation technique) et dans la capacité d’enregistrement de l’article 12. La conservation de six mois des journaux relève des articles 19 et 26, paragraphe 6, pas de l’article 12.
Comment l’article 10 s’articule avec les articles 7 à 9 et la section 2
- Article 8, Les règles sur les données font partie du paquet de la section 2 que l’article 8 encadre.
- Article 9, Les essais et indicateurs de l’article 9 doivent être alimentés par des choix de jeux défendables au titre de l’article 10.
- Article 7, Si le champ de l’annexe III évolue, revalidez la représentativité des données pour le nouveau contexte de préjudice.
- Article 6 + Annexe III, La gouvernance des données doit coller à la destination et à la géographie du cas d’usage à haut risque.
- Article 15, Les preuves d’exactitude et de robustesse renvoient à la qualité des jeux.
- Article 113, Dates d’application de la gouvernance opérationnelle des données.
Libellé officiel : article 10
Note de rédaction : le bloc ci-dessous reprend le texte français authentique de l’article 10, tel que publié sur le bureau d’assistance du règlement sur l’IA, à recouper sur EUR-Lex FR.
1. Les systèmes d’IA à haut risque faisant appel à des techniques qui impliquent l’entraînement de modèles d’IA au moyen de données sont développés sur la base de jeux de données d’entraînement, de validation et de test qui satisfont aux critères de qualité visés aux paragraphes 2 à 5 chaque fois que ces jeux de données sont utilisés.
2. Les jeux de données d’entraînement, de validation et de test sont soumis à des pratiques en matière de gouvernance et de gestion des données appropriées à la destination du système d’IA à haut risque. Ces pratiques concernent en particulier : les choix de conception ; les processus de collecte et l’origine des données (et, pour les données à caractère personnel, la finalité initiale) ; les opérations de préparation (annotation, étiquetage, nettoyage, mise à jour, enrichissement, agrégation) ; la formulation d’hypothèses ; l’évaluation de la disponibilité, de la quantité et de l’adéquation des jeux ; l’examen des biais ; les mesures de détection, prévention et atténuation des biais ; la détection des lacunes ou déficiences.
3. Les jeux de données d’entraînement, de validation et de test sont pertinents, suffisamment représentatifs et, dans toute la mesure possible, exempts d’erreurs et complets au regard de la destination. Ils possèdent les propriétés statistiques appropriées, y compris, le cas échéant, en ce qui concerne les personnes ou groupes de personnes à l’égard desquels le système d’IA à haut risque est destiné à être utilisé.
4. Les jeux de données tiennent compte, dans la mesure requise par la destination, des caractéristiques ou éléments propres au cadre géographique, contextuel, comportemental ou fonctionnel spécifique dans lequel le système d’IA à haut risque est destiné à être utilisé.
5. Dans la mesure où cela est strictement nécessaire aux fins de la détection et de la correction des biais, les fournisseurs peuvent exceptionnellement traiter des catégories particulières de données à caractère personnel, sous réserve de garanties appropriées et des conditions cumulatives du paragraphe 5, points a) à f) (lire le JO).
6. Pour les systèmes d’IA à haut risque qui ne font pas appel à des techniques impliquant l’entraînement de modèles d’IA, les paragraphes 2 à 5 s’appliquent uniquement aux jeux de données de test.
Considérants (préambule) sur EUR-Lex
Les considérants du règlement consolidé sur EUR-Lex éclairent la qualité des données, les biais et les garanties de droits fondamentaux pour l’IA à haut risque. Utilisez le préambule officiel.
Liste de conformité
- Inventorier tous les jeux (entraînement / validation / essai), sources, licences et durées de conservation.
- Documenter les lacunes de représentativité et les mesures d’atténuation (repondération, enrichissement, collecte corrective).
- Conduire des évaluations de biais et de robustesse alignées sur la destination et les préjudices de l’annexe III.
- Aligner tout traitement au titre de l’article 10, paragraphe 5, sur l’article 9 du RGPD et les politiques internes.
- Versionner les instantanés de données utilisés pour chaque mise sur le marché d’une version de modèle, liés à la documentation de conformité.
Voyez comment votre récit de données s’aligne sur les exigences à haut risque, lancez l’évaluation gratuite.
Démarrer l’évaluation gratuiteArticles connexes
Article 6 : règles relatives à la classification des systèmes à haut risque
Article 7 : Modifications de l’annexe III
Article 8 : Respect des exigences
Article 9 : Système de gestion des risques
Article 11 : Documentation technique
Article 12 : Enregistrement
Article 13 : Transparence et fourniture d’informations aux déployeurs
Article 15 : Exactitude, robustesse et cybersécurité
Annexe III : domaines des systèmes d’IA à haut risque
Annexe IV : documentation technique des systèmes d’IA à haut risque
Article 113 : Entrée en vigueur et application
Annexes connexes
- Annexe IV, documentation technique
Questions fréquentes
Faut-il un nouveau consentement pour les données d’entraînement ?
Le règlement sur l’IA ne remplace pas le RGPD. La base licite, la transparence et la limitation des finalités viennent toujours du RGPD ; l’article 10 dit quelle qualité et quelle gouvernance vous devez démontrer pour les systèmes à haut risque.
Qu’en est-il des données synthétiques ?
Les données synthétiques peuvent aider à la représentativité ou à la vie privée, mais vous devez valider qu’elles préservent des modes de défaillance réalistes et ne masquent pas des biais introduits par le simulateur. L’article 10, paragraphe 5, point a), vise aussi les données synthétiques ou anonymisées comme alternative aux catégories particulières.
Les fournisseurs peuvent-ils utiliser des catégories particulières de données à caractère personnel pour détecter des biais au titre de l’article 10 ?
Oui, sous conditions strictes. L’article 10, paragraphe 5, permet ce traitement dans la mesure strictement nécessaire à la détection et à la correction des biais, avec des garanties (pseudonymisation, limitations techniques à la réutilisation, registres des activités de traitement) et dans le respect du RGPD et de la directive police-justice.