RAG-Datenschutz: Wissen abrufen, persönliche Daten begrenzen
Retrieval-Augmented Generation ergänzt den Modellkontext um gefundene Dokumentauszüge. Das kann Antworten hilfreicher machen und zugleich personenbezogene Daten aus internen Dateien an weitere Systeme übertragen. Der Schutz beginnt deshalb schon bei der Aufnahme der Dokumente.
Zuletzt aktualisiert: · Redaktion: Persona — Relativity GmbH
Wo persönliche Daten in einer RAG-Pipeline auftauchen
Ein typischer Datenfluss führt vom Originaldokument über Textextraktion und Chunking zu Embeddings, Suchindex und Modellkontext. Neben dem Fließtext können Titel, Dateinamen, Quellenpfade und Metadaten Namen enthalten. Wenn Sie nur die Chunks bearbeiten, kann ein unveränderter Dateiname weiterhin eine Person identifizieren.
Gehen Sie nicht davon aus, dass eine numerische Repräsentation automatisch anonym ist. Bewerten Sie Embeddings und den damit verbundenen Index im konkreten Verarbeitungskontext. Besonders relevant ist, ob Originaltexte daneben gespeichert werden und wer auf diese Daten oder ihre Zuordnung zugreifen kann.
| Schritt | Zu prüfen | Mögliche Maßnahme |
|---|---|---|
| Import | Text, Bilder, Metadaten | Inhalte minimieren und Freigaben erfassen |
| Embedding | Übertragene Text-Chunks | Vor externen Aufrufen bearbeiten |
| Index | Payloads und Quellenpfade | Berechtigungen und Löschbarkeit vorsehen |
| Retrieval | Treffer für den Nutzer | Zugriff vor Modellübergabe filtern |
Vor dem Embedding oder erst vor der Generierung?
Pseudonymisierung vor dem Embedding reduziert die Originalangaben, die diesen Dienst erreichen. Prüfen Sie aber die Suchqualität: Wenn Personennamen ersetzt sind, funktioniert eine Suche nach Klarnamen nicht unverändert. Manche Anwendungen brauchen eine getrennte, berechtigte Auflösung der Suchanfrage oder sollten auf Personensuche ganz verzichten.
Ein Ersatz erst unmittelbar vor der Generierung schützt den Modellkontext, lässt frühere Verarbeitungsschritte jedoch unverändert. Welche Variante passt, hängt von den beteiligten Diensten und Ihrer Aufgabe ab. Bewerten Sie Suchqualität und Schutz gemeinsam anhand realer Fragen und freigegebener Beispieldokumente.
Chunking und Zuordnung bewusst gestalten
Wenn Sie jeden Chunk unabhängig pseudonymisieren, kann ⟨PERSON_1⟩ in verschiedenen Chunks unterschiedliche Personen bezeichnen. Umgekehrt kann dieselbe Person unterschiedliche Tokens erhalten. Führen Sie Tokens deshalb nicht ohne dokumentierte Strategie zusammen. Die Konsistenz innerhalb eines API-Aufrufs ist keine globale Identitätsverwaltung.
Eine sichere Zuordnung benötigt einen klaren Geltungsbereich, etwa Dokument oder Vorgang. Beschränken Sie den Zugriff und vermeiden Sie ein ungeschütztes, gemeinsames Mapping aller Dokumente. Quellenangaben in der Antwort dürfen keine Originalnamen offenlegen, die im eigentlichen Text bewusst ersetzt wurden.
Zugriff, Löschung und Qualität vor dem Start testen
Testen Sie, ob ein Nutzer nur die Dokumente findet, für die er berechtigt ist. Ein Modellprompt wie „Gib keine vertraulichen Inhalte aus“ ersetzt keinen Filter auf der Suchabfrage. Prüfen Sie außerdem, wie Korrekturen und Löschungen aus dem Originalbestand in Chunks, Embeddings und Caches übernommen werden.
Ein geeigneter Testbestand enthält normale Wissensfragen, Suchanfragen nach Personen und bewusst nicht freigegebene Dokumente. Kontrollieren Sie Treffer, Antwort und Quellen gemeinsam. So erkennen Sie, ob die Datenbegrenzung funktioniert und ob sie für Ihre Anwendung wichtige Informationen entfernt.
- Metadaten und Texte gemeinsam untersuchen.
- Pseudonymisierungszeitpunkt festlegen und Suchqualität messen.
- Dokumentberechtigungen vor dem Modellaufruf durchsetzen.
- Löschung im Index und in Caches verifizieren.
- Mappings und Quellenanzeige auf den richtigen Nutzer beschränken.
Quellen & technische Grundlage
Die technische Beschreibung bezieht sich auf die Persona-Werkzeuge und ihre dokumentierten Grenzen. Prüfen Sie Erkennung und Export vor der Verwendung mit Ihren eigenen Dokumenttypen.
- DSGVO im amtlichen Volltext: Begriffe, Datenminimierung und Sicherheitsmaßnahmen, insbesondere Art. 4, 5, 25 und 32.
- Persona-API-Dokumentation: Endpunkte, Authentifizierung und Antwortfelder.
- Pseudonymisierung und Anonymisierung unterscheiden: Einordnung von Platzhaltern und Zuordnung.
Häufige Fragen
Sind Embeddings automatisch anonym?
+
Das sollte nicht pauschal angenommen werden. Bewerten Sie die Repräsentation zusammen mit Originaldaten, Zusatzinformationen, Zugriffsmöglichkeiten und dem konkreten System.
Soll ich Dokumente vor dem Chunking pseudonymisieren?
+
Das kann konsistente Bezüge innerhalb eines verarbeiteten Textes unterstützen. Prüfen Sie Eingabelimits und das benötigte Zuordnungskonzept. Unabhängige Aufrufe pro Chunk erzeugen keine automatisch dokumentübergreifenden Identitäten.
Löst Pseudonymisierung das Berechtigungsproblem in RAG?
+
Nein. Auch ein Dokument mit Platzhaltern kann vertrauliche Inhalte enthalten. Berechtigungsfilter müssen sicherstellen, dass nur erlaubte Treffer in den Modellkontext gelangen.