# Anonimizacja danych

Source: https://ordergroup.co/pl/slownik/anonimizacja-danych/
Last updated: 2026-10-10

> Anonimizacja i pseudonimizacja w systemach z modelem językowym: definicje z RODO, co usunąć przed modelem, w logach i w danych do trenowania.

[AI](https://ordergroup.co/pl/slownik/ai/)
4 min czytania

# Anonimizacja danych

Inne nazwy: anonimizacja, pseudonimizacja, anonimizacja danych osobowych, pseudonimizacja danych, data anonymization

Definicja

Anonimizacja danych to przetworzenie danych osobowych tak, że nikt nie zidentyfikuje osoby żadnym racjonalnie prawdopodobnym sposobem. Dane anonimowe są poza RODO, a dane spseudonimizowane, które da się znów powiązać z osobą dzięki osobno trzymanym informacjom, nadal są danymi osobowymi.

Cytuj hasło

Tekst
"Anonimizacja danych". Order Group, Słownik oprogramowania, 10 października 2026. https://ordergroup.co/pl/slownik/anonimizacja-danych/
HTML
`<a href="https://ordergroup.co/pl/slownik/anonimizacja-danych/">Anonimizacja danych</a> - Order Group`

Sprawdzone przez [Łukasz Gajownik](https://ordergroup.co/pl/autorzy/lukasz-gajownik/), Head of AI & Frontend
Ostatni przegląd 10 października 2026

## Jak działa anonimizacja danych

RODO rozróżnia dwa wyniki. Pseudonimizacja, zdefiniowana w art. 4 pkt 5, to przetworzenie danych osobowych w taki sposób, że nie można ich już przypisać konkretnej osobie bez dodatkowych informacji, pod warunkiem że te informacje są przechowywane osobno i chronione środkami technicznymi i organizacyjnymi. Dane spseudonimizowane nadal są danymi osobowymi. Dane anonimowe to informacje, które nie dotyczą osoby możliwej do zidentyfikowania, a motyw 26 mówi, że RODO ich nie obejmuje. To, czy osobę da się zidentyfikować, ocenia się z uwzględnieniem wszystkich sposobów, których użycie jest racjonalnie prawdopodobne, w tym wyodrębnienia osoby ze zbioru, a także kosztu, czasu i dostępnej technologii.

Grupa Robocza Art. 29 (poprzedniczka EROD) w opinii 05/2014 sprawdziła techniki anonimizacji pod kątem trzech ryzyk: wyodrębnienia jednej osoby ze zbioru, powiązania dwóch rekordów o tej samej osobie i wywnioskowania faktu o osobie. Techniki podzieliła na randomizację (dodawanie szumu, permutacja, prywatność różnicowa) i generalizację (agregacja, k-anonimowość, l-różnorodność, t-bliskość). Każda technika zostawia jakieś ryzyko, więc wynik ocenia się dla konkretnego zbioru i powtarza ocenę, gdy zmieniają się dane albo dostępne narzędzia.

Tekst swobodny jest trudniejszy niż tabele. Imiona, adresy, numery identyfikacyjne i telefony wykrywa się modelami rozpoznawania nazw własnych (NER), wyrażeniami regularnymi i sumami kontrolnymi. Tak działa Microsoft Presidio, narzędzie o otwartym kodzie: analizator znajduje dane, a anonimizator je zastępuje, maskuje, haszuje albo szyfruje. Wykrywanie jest probabilistyczne. Gubi nietypowy zapis i odmienione nazwiska, a identyfikatorów pośrednich w ogóle nie widzi: stanowisko, mała miejscowość i rzadka diagnoza w jednym piśmie mogą wskazać jedną osobę nawet bez nazwiska. Zastąpienie nazwisk znacznikami to więc zwykle pseudonimizacja, a o tym, czy tekst jest anonimowy, rozstrzyga dopiero ocena tego, co w nim zostało.

## Co anonimizacja danych oznacza dla oprogramowania

W produkcie z modelem językowym dane osobowe pojawiają się w trzech miejscach: w tekście wysyłanym do modelu, w tym, co system przechowuje, i w każdym korpusie zbieranym do trenowania albo ewaluacji.

- Przed modelem: jeśli model działa na Twojej infrastrukturze ([lokalny model językowy](https://ordergroup.co/pl/slownik/lokalny-llm/)), tekst może do niego trafić bez zmian, w granicach celu i podstawy prawnej przetwarzania. Jeśli idzie do zewnętrznego API, najpierw usuń dane osobowe albo je spseudonimizuj i wstaw nazwiska z powrotem do odpowiedzi; tabelę powiązań trzymaj osobno i zaszyfrowaną.
- Przechowywane teksty i historia: zapytania, odpowiedzi i wgrane pliki to dane osobowe. System ma okres retencji, cykliczne zadanie usuwające i test, który dowodzi, że zadanie kasuje pliki, a nie tylko wiersze w bazie.
- Logi: aplikacja, serwer inferencji i system zgłaszania błędów logują zapytania. Ustal, co zapisują, maskuj pola tekstowe i daj logom krótszą retencję niż samej treści.
- Korpus do trenowania i ewaluacji: tylko teksty objęte podstawą prawną do tego celu (przy danych o zdrowiu i innych danych szczególnych kategorii zwykle wyraźną zgodą), zanonimizowane przed eksportem, z ręcznym przeglądem próbki pod kątem tego, co detektor przeoczył.
- Jakość wykrywania mierzy się na własnych dokumentach i we własnym języku: jaki odsetek prawdziwych nazwisk, adresów i numerów detektor znalazł. Pokaz na czystych zdaniach po angielsku niewiele mówi o zeskanowanych pismach po polsku.
- Szyfrowanie danych w spoczynku chroni przechowywane teksty, ale ich nie anonimizuje, bo kto ma klucz, ten je przeczyta.

Piszesz specyfikację?

Dodaj Anonimizacja danych do checklisty wymagań

Zbierz hasła, których dotyczy Twój projekt, i dostań ich wymagania wobec systemu w jednym mailu, gotowe do zapytania ofertowego.

Anonimizacja, pseudonimizacja i szyfrowanie w systemie z modelem językowym
AspektAnonimizacjaPseudonimizacjaSzyfrowanie

Czy da się znowu zidentyfikować osobęNie, żadnym sposobem, którego użycie jest racjonalnie prawdopodobneTak, z osobno przechowywanymi informacjamiTak, z kluczemCzy obowiązuje RODONie (motyw 26)Tak, dla tego, kto ma dodatkowe informacje (art. 4 pkt 5, motyw 26)TakTypowe zastosowanieKorpus do trenowania i ewaluacji, statystykiWysłanie tekstu do zewnętrznego modelu i przywrócenie nazwisk w odpowiedziPrzechowywane dokumenty i historiaGłówne ryzykoKontekst w tekście swobodnym nadal wskazuje osobęWyciek tabeli powiązańZarządzanie kluczami i dostępem

## Przepisy i standardy

Poza art. 4 pkt 5 i motywem 26 anonimizacji dotyczą w RODO: art. 5 ust. 1 lit. e, czyli ograniczenie przechowywania, z którego wynika okres retencji; art. 25, czyli ochrona danych w fazie projektowania i domyślna ochrona danych; oraz art. 32, który wymienia pseudonimizację i szyfrowanie wśród środków bezpieczeństwa. EROD opublikowała w styczniu 2025 r. wytyczne 01/2025 w sprawie pseudonimizacji do konsultacji publicznych, a później przyjęła ich wersję ostateczną. W opinii 28/2024 z grudnia 2024 r. stwierdziła, że modeli AI wytrenowanych na danych osobowych nie można we wszystkich przypadkach uznać za anonimowe, a to, czy model jest anonimowy, ocenia się indywidualnie. W wyroku z 4 września 2025 r. w sprawie C-413/23 P (EIOD przeciwko SRB) Trybunał Sprawiedliwości UE uznał, że dane spseudonimizowane nie w każdym przypadku i nie dla każdego odbiorcy są danymi osobowymi: odbiorca, który nie ma racjonalnych środków, by zidentyfikować osobę, może mieć dane anonimowe, a administrator, który trzyma dodatkowe informacje, nadal ma dane osobowe. Projekt wytycznych EROD 02/2026 w sprawie anonimizacji, przyjęty 7 lipca 2026 r. i poddany konsultacjom do 30 października 2026 r., opiera się na tym wyroku i ma zaktualizować opinię 05/2014 Grupy Roboczej Art. 29, która do czasu przyjęcia ostatecznej wersji wytycznych pozostaje głównym punktem odniesienia dla technik anonimizacji.

## Z naszych projektów

W Generatorze ETR, aplikacji, którą budujemy dla PSONI, użytkownicy wklejają albo wgrywają dokumenty do uproszczenia. Dane wrażliwe są szyfrowane algorytmem Fernet, a treści mają domyślny okres retencji 30 dni. We wrześniu 2026 r. nasz zespół QA potwierdził na środowisku testowym, że cykliczne zadanie je usuwa: tekst z 24 sierpnia był dostępny jeszcze 23 września, a następnego dnia już został wyczyszczony.

Zanonimizowana kopia tekstu, przygotowana przez Microsoft Presidio, powstaje tylko wtedy, gdy użytkownik nie sprzeciwił się wykorzystaniu swoich tekstów do uczenia AI. Zanonimizowane teksty można pobrać jako jeden plik JSON i zbudować z nich korpus do trenowania. Testy pokazały, że anonimizacja działa, ale niedoskonale, dlatego jej poprawa jest zaplanowana na kolejny etap projektu. Jedną z rozważanych opcji jest wytrenowanie HerBERTa, polskiego modelu językowego, do wykrywania danych osobowych.

## Powiązane hasła

- [Ewaluacja modeli językowych (LLM evaluation)](https://ordergroup.co/pl/slownik/ewaluacja-llm/)

Ewaluacja modeli językowych (LLM evaluation) to systematyczne sprawdzanie odpowiedzi modelu na stałym zestawie wejść według uzgodnionych kryteriów odbioru, testami automatycznymi, oceną przez inny model i przeglądem przez ludzi. Rozstrzyga, czy model, prompt albo wersja nadaje się do wdrożenia.
- [Lokalny model językowy (self-hosted LLM)](https://ordergroup.co/pl/slownik/lokalny-llm/)

Lokalny model językowy (self-hosted LLM) to duży model językowy, którego wagi działają na infrastrukturze pod Twoją kontrolą, na własnych serwerach albo wynajętych GPU. Zapytania i odpowiedzi nie trafiają do dostawcy modelu.

## Źródła

1. [Regulation (EU) 2016/679 (GDPR), Article 4(5) and Recital 26](https://eur-lex.europa.eu/eli/reg/2016/679/oj) - EUR-Lex
2. [Opinion 05/2014 on Anonymisation Techniques (WP216)](https://ec.europa.eu/justice/article-29/documentation/opinion-recommendation/files/2014/wp216_en.pdf) - Article 29 Working Party
3. [Guidelines 01/2025 on Pseudonymisation](https://www.edpb.europa.eu/our-work-tools/documents/public-consultations/2025/guidelines-012025-pseudonymisation_en) - European Data Protection Board
4. [Guidelines 02/2026 on Anonymisation, version 1.0 (public consultation)](https://www.edpb.europa.eu/system/files/2026-07/edpb_guidelines_202602_anonymisation_v1_en_0.pdf) - European Data Protection Board
5. [Judgment of the Court of Justice of September 4, 2025, Case C-413/23 P, EDPS v SRB](https://curia.europa.eu/juris/liste.jsf?num=C-413/23) - Court of Justice of the European Union
6. [Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models](https://www.edpb.europa.eu/our-work-tools/our-documents/opinion-board-art-64/opinion-282024-certain-data-protection-aspects_en) - European Data Protection Board
7. [Microsoft Presidio documentation](https://microsoft.github.io/presidio/) - Microsoft

To hasło sprawdza Łukasz Gajownik. Zapytaj, co oznacza w Twoim projekcie.

[Zapytaj inżyniera](https://ordergroup.co/pl/kontakt/)

## Najczęstsze pytania

![Łukasz Gajownik](https://ordergroup.co/media/images/T02DHCC1Z-UT420UBA7-d74022d27c3c-512.format-webp.webp)

Łukasz Gajownik

Head of AI & Frontend

[Porozmawiaj z inżynierem](https://ordergroup.co/pl/kontakt/)

### Czy usunięcie nazwisk wystarczy, żeby zanonimizować dokument?

Zwykle nie. Adresy, numery identyfikacyjne, daty i kontekst, na przykład stanowisko albo rzadka choroba, nadal mogą wskazać osobę, więc usunięcie nazwisk daje zwykle dane spseudonimizowane, które wciąż podlegają RODO.

### Czy dane zanonimizowane podlegają RODO?

Dane naprawdę anonimowe nie (motyw 26). Dane spseudonimizowane tak, przynajmniej dla tego, kto ma dodatkowe informacje albo może je racjonalnie uzyskać, podobnie jak każdy zbiór, w którym osobę da się zidentyfikować sposobami, których użycie jest racjonalnie prawdopodobne.

### Czy przy lokalnym modelu trzeba anonimizować zapytania?

Do samego przetwarzania niekoniecznie, bo tekst nie trafia do dostawcy modelu. Nadal potrzebujesz okresu retencji, kontrolowanych logów i anonimizacji, zanim teksty trafią do trenowania albo ewaluacji.

### Czy możemy używać tekstów naszych użytkowników do ulepszania modelu?

Tylko z podstawą prawną do tego celu (przy danych o zdrowiu i innych danych szczególnych kategorii zwykle wyraźną zgodą), z poszanowaniem sprzeciwu i po anonimizacji z ręcznym przeglądem próbki. EROD w opinii 28/2024 stwierdza, że modeli wytrenowanych na danych osobowych nie można we wszystkich przypadkach uznać za anonimowe.

Budujesz system, w którym liczy się Anonimizacja danych?

Zobacz, jak budujemy oprogramowanie w tej dziedzinie: case studies i technologie, których używamy.

[Zobacz: Tworzenie oprogramowania AI](https://ordergroup.co/pl/tworzenie-oprogramowania-ai/)

Checklista wymagań

Do każdego hasła wyślemy definicję i to, czego wymaga od Twojego oprogramowania. Bezpłatnie, bez rozmowy handlowej.
Checklista jest pusta. Dodaj hasło plusem przy jego nazwie.
