PII-Erkennung: Welche persönlichen Daten stecken im Text?
PII-Erkennung findet Textstellen, die eine Person identifizieren können. Für deutsche E-Mails, Verträge und Support-Tickets reicht eine Suche nach E-Mail-Adressen oft nicht: Namen, Anschriften und indirekte Hinweise stehen mitten im Satz.
Zuletzt aktualisiert: · Redaktion: Persona — Relativity GmbH
Was bedeutet PII und welche Daten gehören dazu?
PII steht für Personally Identifiable Information. Im Datenschutzkontext geht es um Angaben, die allein oder in Kombination auf eine natürliche Person verweisen. Neben Klarnamen und Kontaktdaten können Kundennummern, persönliche URLs oder ein genaues Geburtsdatum relevant sein. Nicht jede Nummer und nicht jedes Datum hat automatisch Personenbezug.
Persona unterscheidet neun Erkennungskategorien. Zugangsdaten wie API-Schlüssel gehören ebenfalls zum Schutzbedarf, auch wenn ein einzelnes technisches Geheimnis nicht zwingend personenbezogen ist. Die Kategorie beschreibt, was erkannt wurde; sie ersetzt keine Entscheidung darüber, ob und warum Sie diese Daten verarbeiten dürfen.
| Angabe | Beispiel | Worauf prüfen? |
|---|---|---|
| Person | Frau Anna Vogel | Namen ohne Anrede und wiederholte Nennungen |
| Kontakt | anna@example.org | Signaturen, Weiterleitungen und Tippfehler |
| Kennung | Kundennummer 48291 | Fachspezifische Formate und Kontext |
| Indirekter Hinweis | Einzige Teamleiterin im Standort X | Kombination mit anderen Angaben |
Regex, Named Entity Recognition oder Sprachmodell?
Reguläre Ausdrücke passen zu bekannten Formaten wie E-Mail-Adressen oder IBANs. Sie sind nachvollziehbar und lokal ausführbar, übersehen aber Namen ohne typische Einleitung. Named Entity Recognition markiert Entitäten wie Personen oder Orte. Dabei ist ein Ortsname nicht automatisch eine private Adresse und ein Organisationsname nicht automatisch personenbezogen.
Ein spezialisiertes Sprachmodell bezieht den Satzkontext ein. Auch dieses kann Angaben übersehen oder harmlose Wörter markieren. Für den praktischen Einsatz lohnt sich eine Kombination aus passenden Regeln, modellbasierter Erkennung und Prüfung. Das kostenlose Persona-Text-Tool verwendet Browser-Regeln; die API verwendet ein trainiertes Modell. Das sind unterschiedliche Verfahren mit unterschiedlichen Ergebnissen.
So messen Sie die Erkennungsqualität
Erstellen Sie einen Testbestand mit fiktiven oder rechtmäßig verwendeten Beispielen aus Ihren tatsächlichen Dokumenttypen. Markieren Sie die erwarteten Fundstellen einschließlich Anfang und Ende. Prüfen Sie sowohl übersehene Daten als auch falsche Treffer: Eine übersehene Telefonnummer betrifft den Schutz, ein falsch markierter Produktname kann die Antwort unbrauchbar machen.
Bewerten Sie die Kategorien getrennt. Eine gute Gesamtquote kann schwache Namenerkennung verdecken. Nehmen Sie ungewöhnliche Schreibweisen, lange Texte, Umlaute, Copy-and-paste-Artefakte und mehrere Personen in einem Satz auf. Ohne einen solchen Testbestand lässt sich aus einer einzelnen gelungenen Demo keine belastbare Aussage über Ihre Pipeline ableiten.
- Repräsentative Texte auswählen und Soll-Treffer markieren.
- Precision für falsche Treffer und Recall für übersehene Angaben getrennt betrachten.
- Grenzen der Spans prüfen: Ist der gesamte Name erfasst, ohne angrenzende Wörter?
- Nach Änderungen am Modell oder an Regeln denselben Bestand erneut prüfen.
Erkennung vor dem LLM einsetzen
Der Endpunkt /v1/pseudonymize liefert masked, spans, mapping und sensitivity. Die Spans erlauben eine Prüfung der erkannten Textstellen; masked ist der Text mit Platzhaltern. Senden Sie an das nachgelagerte LLM nur den dafür vorgesehenen Text. Die Zuordnung enthält Originalwerte und gehört nicht in denselben Prompt.
Prüfen Sie außerdem Anhänge, Systemprompts und zusätzliche Kontextfelder. Ein geschütztes Nachrichtenfeld hilft wenig, wenn die unveränderte Signatur in einem zweiten Feld mitgeschickt wird. Für hohe Risiken können Sie einen menschlichen Freigabeschritt vorsehen. Der Sensitivitätswert ist eine technische Ausgabe und keine datenschutzrechtliche Freigabe.
Quellen & technische Grundlage
Die technische Beschreibung bezieht sich auf die Persona-Werkzeuge und ihre dokumentierten Grenzen. Prüfen Sie Erkennung und Export vor der Verwendung mit Ihren eigenen Dokumenttypen.
- DSGVO im amtlichen Volltext: Begriffe, Datenminimierung und Sicherheitsmaßnahmen, insbesondere Art. 4, 5, 25 und 32.
- Persona-API-Dokumentation: Endpunkte, Authentifizierung und Antwortfelder.
- Pseudonymisierung und Anonymisierung unterscheiden: Einordnung von Platzhaltern und Zuordnung.
Häufige Fragen
Erkennt Persona deutsche personenbezogene Daten?
+
Die API ist für PII-Erkennung in Freitext ausgelegt und verwendet ein trainiertes Modell. Testen Sie deutsche Namen, Formate und Fachtexte aus Ihrem Anwendungsfall; eine vollständige Erkennung aller Angaben ist nicht garantiert.
Was ist der Unterschied zwischen PII Detection und PII Redaction?
+
Detection findet und klassifiziert Fundstellen. Redaction entfernt oder verdeckt die gefundenen Werte. Pseudonymisierung ersetzt sie durch Platzhalter, deren Zuordnung getrennt erhalten bleiben kann.
Ist die Erkennung im kostenlosen Text-Tool dieselbe wie in der API?
+
Nein. Das Text-Tool nutzt Regeln lokal im Browser. Die API verarbeitet Text mit einem trainierten Modell. Die Ergebnisse können deshalb voneinander abweichen.