AI Act Documents:

Článek 10: Data a správa dat

Nabývá účinnosti 2. prosince 2027 (vysoce rizikové podle přílohy III) / 2. srpna 2028 (vysoce rizikové podle přílohy I), podle Článek 113(c)
1. Vysoce rizikové systémy AI, které využívají techniky zahrnující trénování modelů AI obsahujících data, jsou vyvíjeny na základě souborů trénovacích, validačních a testovacích dat, které splňují kritéria kvality uvedená v odstavcích 2, 3 a 4 tohoto článku a v čl. 4a odst. 1, a to kdykoli se tyto datové soubory používají.
2. Soubory trénovacích, validačních a testovacích dat podléhají příslušným postupům v oblasti správy a řízení dat, jež jsou pro zamýšlený účel vysoce rizikového systému AI vhodné. Tyto postupy se týkají zejména:
(a) příslušných možností návrhu;
(b) postupů při sběru dat a původu dat a v případě osobních údajů původního účelu jejich sběru;
(c) příslušných operací zpracování přípravy dat, jako jsou anotace, označování, čištění, aktualizace, obohacování a agregace;
(d) formulace předpokladů, zejména s ohledem na informace, které mají daná data měřit a představovat;
(e) posouzení dostupnosti, množství a vhodnosti potřebných souborů dat;
(f) přezkoumání s ohledem na potenciální zkreslení, která by mohla ovlivnit zdraví a bezpečnost osob, mít nepříznivý dopad na základní práva nebo vést k diskriminaci, která je podle práva Unie zakázána, zejména pokud výstupy dat ovlivňují vstupy pro budoucí operace;
(g) vhodná opatření k odhalení, prevenci a zmírnění případných zkreslení zjištěných podle písmene f);
(h) identifikace relevantních nedostatků nebo chyb v datech, které brání dodržování tohoto nařízení, a způsobu, jak tyto nedostatky a chyby vyřešit.
3. Soubory trénovacích, validačních a testovacích dat jsou s ohledem na svůj zamýšlený účel relevantní, dostatečně reprezentativní a v maximální možné míře bez chyb a úplné. Mají náležité statistické vlastnosti, a to i případně rovněž s ohledem na osoby nebo skupiny osob, v souvislosti s nimiž má být daný vysoce rizikový systém AI používán. Tyto vlastnosti souborů dat lze splnit na úrovni jednotlivých souborů dat nebo na úrovni jejich kombinací.
4. Soubory trénovacích, validačních a testovacích dat zohledňují v rozsahu nezbytném pro jejich zamýšlený účel vlastnosti nebo prvky, které jsou specifické pro konkrétní zeměpisné, kontextuální, behaviorální nebo funkční prostředí, ve kterém má být daný vysoce rizikový systém AI používán.
5.
(a)
(b)
(c)
(d)
(e)
(f)
6. Pro vývoj vysoce rizikových systémů AI, které nevyužívají techniky zahrnující trénování modelů AI, se odstavce 2, 3 a 4 tohoto článku a čl. 4a odst. 1 použijí pouze na soubory testovacích dat.