AI Act Documents:

Artikel 10: Data og datastyring

Træder i kraft 2. december 2027 (højrisiko i henhold til bilag III) / 2. august 2028 (højrisiko i henhold til bilag I), i henhold til Artikel 113(c)
1. »De højrisiko-AI-systemer, der gør brug af teknikker, som omfatter træning af AI-modeller med data, udvikles på grundlag af trænings-, validerings- og afprøvningsdatasæt, der opfylder de kvalitetskriterier, der er omhandlet i denne artikels stk. 2, 3 og 4 og i artikel 4a, stk. 1, når sådanne datasæt anvendes.
2. Trænings-, validerings- og afprøvningsdatasæt skal være underlagt former for datastyrings- og dataforvaltningspraksis, som er tilpasset højrisiko-AI-systemets tilsigtede formål. Disse former for praksis vedrører navnlig:
(a) de relevante valg med hensyn til udformning
(b) dataindsamlingsprocesser og dataenes oprindelse og, hvis der er tale om personoplysningerpersonoplysningerpersonoplysninger som defineret i artikel 4, nr. 1), i forordning (EU) 2016/679Article 3(50), det oprindelige formål med dataindsamlingen
(c) relevant dataforberedelsesbehandling såsom annotation, mærkning, rensning, opdatering, berigelse og aggregering
(d) formuleringen af antagelser, navnlig med hensyn til de oplysninger, som dataene skal måle og repræsentere
(e) en vurdering af tilgængeligheden, mængden og egnetheden af de datasæt, der er nødvendige
(f) undersøgelse med hensyn til mulige bias, der sandsynligvis vil påvirke personers sundhed og sikkerhed, have negativ indvirkning på de grundlæggende rettigheder eller føre til forskelsbehandling, som er forbudt i henhold til EU-retten, navnlig hvis dataoutput påvirker input til fremtidige operationer
(g) passende foranstaltninger til at påvise, forebygge og afbøde de mulige bias, der er identificeret i henhold til litra f)
(h) kortlægning af relevante datamangler eller datautilstrækkeligheder, som forhindrer overholdelse af denne forordning, og hvordan de kan afhjælpes.
3. Trænings-, validerings- og afprøvningsdatasæt skal i betragtning af det tilsigtede formål være relevante, tilstrækkeligt repræsentative og i videst muligt omfang fejlfrie og fuldstændige. De skal have de tilstrækkelige statistiske egenskaber, herunder, hvis det er relevant, med hensyn til de personer eller grupper af personer, på hvilke højrisiko-AI-systemet tilsigtes anvendt. Disse egenskaber kan opfyldes for de enkelte datasæt eller for en kombination heraf.
4. I datasæt tages der, i det omfang det er nødvendigt i lyset af deres tilsigtede formål, hensyn til de egenskaber eller elementer, der er særlige for den specifikke geografiske, kontekstuelle, adfærdsmæssige eller funktionelle ramme, inden for hvilken højrisiko-AI-systemet tilsigtes anvendt.
5.
(a)
(b)
(c)
(d)
(e)
(f)
6. »Ved udvikling af højrisiko-AI-systemer, der ikke gør brug af teknikker, der omfatter træning af AI-modeller, finder denne artikels stk. 2, 3 og 4 og artikel 4a, stk. 1, kun anvendelse på afprøvningsdatasættene.