AI 4 min czytania
Anonimizacja danych
Inne nazwy: anonimizacja, pseudonimizacja, anonimizacja danych osobowych, pseudonimizacja danych, data anonymization
Definicja
Anonimizacja danych to przetworzenie danych osobowych tak, że nikt nie zidentyfikuje osoby żadnym racjonalnie prawdopodobnym sposobem. Dane anonimowe są poza RODO, a dane spseudonimizowane, które da się znów powiązać z osobą dzięki osobno trzymanym informacjom, nadal są danymi osobowymi.
Cytuj hasło
Tekst
"Anonimizacja danych". Order Group, Słownik oprogramowania, 10 października 2026. https://ordergroup.co/pl/slownik/anonimizacja-danych/
HTML
<a href="https://ordergroup.co/pl/slownik/anonimizacja-danych/">Anonimizacja danych</a> - Order Group
Jak działa anonimizacja danych
RODO rozróżnia dwa wyniki. Pseudonimizacja, zdefiniowana w art. 4 pkt 5, to przetworzenie danych osobowych w taki sposób, że nie można ich już przypisać konkretnej osobie bez dodatkowych informacji, pod warunkiem że te informacje są przechowywane osobno i chronione środkami technicznymi i organizacyjnymi. Dane spseudonimizowane nadal są danymi osobowymi. Dane anonimowe to informacje, które nie dotyczą osoby możliwej do zidentyfikowania, a motyw 26 mówi, że RODO ich nie obejmuje. To, czy osobę da się zidentyfikować, ocenia się z uwzględnieniem wszystkich sposobów, których użycie jest racjonalnie prawdopodobne, w tym wyodrębnienia osoby ze zbioru, a także kosztu, czasu i dostępnej technologii.
Grupa Robocza Art. 29 (poprzedniczka EROD) w opinii 05/2014 sprawdziła techniki anonimizacji pod kątem trzech ryzyk: wyodrębnienia jednej osoby ze zbioru, powiązania dwóch rekordów o tej samej osobie i wywnioskowania faktu o osobie. Techniki podzieliła na randomizację (dodawanie szumu, permutacja, prywatność różnicowa) i generalizację (agregacja, k-anonimowość, l-różnorodność, t-bliskość). Każda technika zostawia jakieś ryzyko, więc wynik ocenia się dla konkretnego zbioru i powtarza ocenę, gdy zmieniają się dane albo dostępne narzędzia.
Tekst swobodny jest trudniejszy niż tabele. Imiona, adresy, numery identyfikacyjne i telefony wykrywa się modelami rozpoznawania nazw własnych (NER), wyrażeniami regularnymi i sumami kontrolnymi. Tak działa Microsoft Presidio, narzędzie o otwartym kodzie: analizator znajduje dane, a anonimizator je zastępuje, maskuje, haszuje albo szyfruje. Wykrywanie jest probabilistyczne. Gubi nietypowy zapis i odmienione nazwiska, a identyfikatorów pośrednich w ogóle nie widzi: stanowisko, mała miejscowość i rzadka diagnoza w jednym piśmie mogą wskazać jedną osobę nawet bez nazwiska. Zastąpienie nazwisk znacznikami to więc zwykle pseudonimizacja, a o tym, czy tekst jest anonimowy, rozstrzyga dopiero ocena tego, co w nim zostało.
Co anonimizacja danych oznacza dla oprogramowania
W produkcie z modelem językowym dane osobowe pojawiają się w trzech miejscach: w tekście wysyłanym do modelu, w tym, co system przechowuje, i w każdym korpusie zbieranym do trenowania albo ewaluacji.
- Przed modelem: jeśli model działa na Twojej infrastrukturze (lokalny model językowy), tekst może do niego trafić bez zmian, w granicach celu i podstawy prawnej przetwarzania. Jeśli idzie do zewnętrznego API, najpierw usuń dane osobowe albo je spseudonimizuj i wstaw nazwiska z powrotem do odpowiedzi; tabelę powiązań trzymaj osobno i zaszyfrowaną.
- Przechowywane teksty i historia: zapytania, odpowiedzi i wgrane pliki to dane osobowe. System ma okres retencji, cykliczne zadanie usuwające i test, który dowodzi, że zadanie kasuje pliki, a nie tylko wiersze w bazie.
- Logi: aplikacja, serwer inferencji i system zgłaszania błędów logują zapytania. Ustal, co zapisują, maskuj pola tekstowe i daj logom krótszą retencję niż samej treści.
- Korpus do trenowania i ewaluacji: tylko teksty objęte podstawą prawną do tego celu (przy danych o zdrowiu i innych danych szczególnych kategorii zwykle wyraźną zgodą), zanonimizowane przed eksportem, z ręcznym przeglądem próbki pod kątem tego, co detektor przeoczył.
- Jakość wykrywania mierzy się na własnych dokumentach i we własnym języku: jaki odsetek prawdziwych nazwisk, adresów i numerów detektor znalazł. Pokaz na czystych zdaniach po angielsku niewiele mówi o zeskanowanych pismach po polsku.
- Szyfrowanie danych w spoczynku chroni przechowywane teksty, ale ich nie anonimizuje, bo kto ma klucz, ten je przeczyta.
| Aspekt | Anonimizacja | Pseudonimizacja | Szyfrowanie |
|---|---|---|---|
| Czy da się znowu zidentyfikować osobę | Nie, żadnym sposobem, którego użycie jest racjonalnie prawdopodobne | Tak, z osobno przechowywanymi informacjami | Tak, z kluczem |
| Czy obowiązuje RODO | Nie (motyw 26) | Tak, dla tego, kto ma dodatkowe informacje (art. 4 pkt 5, motyw 26) | Tak |
| Typowe zastosowanie | Korpus do trenowania i ewaluacji, statystyki | Wysłanie tekstu do zewnętrznego modelu i przywrócenie nazwisk w odpowiedzi | Przechowywane dokumenty i historia |
| Główne ryzyko | Kontekst w tekście swobodnym nadal wskazuje osobę | Wyciek tabeli powiązań | Zarządzanie kluczami i dostępem |
Przepisy i standardy
Poza art. 4 pkt 5 i motywem 26 anonimizacji dotyczą w RODO: art. 5 ust. 1 lit. e, czyli ograniczenie przechowywania, z którego wynika okres retencji; art. 25, czyli ochrona danych w fazie projektowania i domyślna ochrona danych; oraz art. 32, który wymienia pseudonimizację i szyfrowanie wśród środków bezpieczeństwa. EROD opublikowała w styczniu 2025 r. wytyczne 01/2025 w sprawie pseudonimizacji do konsultacji publicznych, a później przyjęła ich wersję ostateczną. W opinii 28/2024 z grudnia 2024 r. stwierdziła, że modeli AI wytrenowanych na danych osobowych nie można we wszystkich przypadkach uznać za anonimowe, a to, czy model jest anonimowy, ocenia się indywidualnie. W wyroku z 4 września 2025 r. w sprawie C-413/23 P (EIOD przeciwko SRB) Trybunał Sprawiedliwości UE uznał, że dane spseudonimizowane nie w każdym przypadku i nie dla każdego odbiorcy są danymi osobowymi: odbiorca, który nie ma racjonalnych środków, by zidentyfikować osobę, może mieć dane anonimowe, a administrator, który trzyma dodatkowe informacje, nadal ma dane osobowe. Projekt wytycznych EROD 02/2026 w sprawie anonimizacji, przyjęty 7 lipca 2026 r. i poddany konsultacjom do 30 października 2026 r., opiera się na tym wyroku i ma zaktualizować opinię 05/2014 Grupy Roboczej Art. 29, która do czasu przyjęcia ostatecznej wersji wytycznych pozostaje głównym punktem odniesienia dla technik anonimizacji.
Z naszych projektów
W Generatorze ETR, aplikacji, którą budujemy dla PSONI, użytkownicy wklejają albo wgrywają dokumenty do uproszczenia. Dane wrażliwe są szyfrowane algorytmem Fernet, a treści mają domyślny okres retencji 30 dni. We wrześniu 2026 r. nasz zespół QA potwierdził na środowisku testowym, że cykliczne zadanie je usuwa: tekst z 24 sierpnia był dostępny jeszcze 23 września, a następnego dnia już został wyczyszczony.
Zanonimizowana kopia tekstu, przygotowana przez Microsoft Presidio, powstaje tylko wtedy, gdy użytkownik nie sprzeciwił się wykorzystaniu swoich tekstów do uczenia AI. Zanonimizowane teksty można pobrać jako jeden plik JSON i zbudować z nich korpus do trenowania. Testy pokazały, że anonimizacja działa, ale niedoskonale, dlatego jej poprawa jest zaplanowana na kolejny etap projektu. Jedną z rozważanych opcji jest wytrenowanie HerBERTa, polskiego modelu językowego, do wykrywania danych osobowych.
Źródła
- Regulation (EU) 2016/679 (GDPR), Article 4(5) and Recital 26 - EUR-Lex
- Opinion 05/2014 on Anonymisation Techniques (WP216) - Article 29 Working Party
- Guidelines 01/2025 on Pseudonymisation - European Data Protection Board
- Guidelines 02/2026 on Anonymisation, version 1.0 (public consultation) - European Data Protection Board
- Judgment of the Court of Justice of September 4, 2025, Case C-413/23 P, EDPS v SRB - Court of Justice of the European Union
- Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models - European Data Protection Board
- Microsoft Presidio documentation - Microsoft
Najczęstsze pytania
-
Zwykle nie. Adresy, numery identyfikacyjne, daty i kontekst, na przykład stanowisko albo rzadka choroba, nadal mogą wskazać osobę, więc usunięcie nazwisk daje zwykle dane spseudonimizowane, które wciąż podlegają RODO.
-
Dane naprawdę anonimowe nie (motyw 26). Dane spseudonimizowane tak, przynajmniej dla tego, kto ma dodatkowe informacje albo może je racjonalnie uzyskać, podobnie jak każdy zbiór, w którym osobę da się zidentyfikować sposobami, których użycie jest racjonalnie prawdopodobne.
-
Do samego przetwarzania niekoniecznie, bo tekst nie trafia do dostawcy modelu. Nadal potrzebujesz okresu retencji, kontrolowanych logów i anonimizacji, zanim teksty trafią do trenowania albo ewaluacji.
-
Tylko z podstawą prawną do tego celu (przy danych o zdrowiu i innych danych szczególnych kategorii zwykle wyraźną zgodą), z poszanowaniem sprzeciwu i po anonimizacji z ręcznym przeglądem próbki. EROD w opinii 28/2024 stwierdza, że modeli wytrenowanych na danych osobowych nie można we wszystkich przypadkach uznać za anonimowe.
Budujesz system, w którym liczy się Anonimizacja danych?
Zobacz, jak budujemy oprogramowanie w tej dziedzinie: case studies i technologie, których używamy.