Persona

RAG-Datenschutz: Wissen abrufen, persönliche Daten begrenzen

Retrieval-Augmented Generation ergänzt den Modellkontext um gefundene Dokumentauszüge. Das kann Antworten hilfreicher machen und zugleich personenbezogene Daten aus internen Dateien an weitere Systeme übertragen. Der Schutz beginnt deshalb schon bei der Aufnahme der Dokumente.

Zuletzt aktualisiert: · Redaktion: Persona — Relativity GmbH

Prüfen Sie zwei Grenzen getrennt: welche Daten den Embedding-Dienst und Index erreichen, und welche Treffer ein Nutzer später abrufen darf. Pseudonymisierung ersetzt keine Zugriffsprüfung beim Retrieval.

Wo persönliche Daten in einer RAG-Pipeline auftauchen

Vor dem Embedding oder erst vor der Generierung?

Chunking und Zuordnung bewusst gestalten

Zugriff, Löschung und Qualität vor dem Start testen

Quellen & technische Grundlage

Häufige Fragen

Sind Embeddings automatisch anonym?

+

Das sollte nicht pauschal angenommen werden. Bewerten Sie die Repräsentation zusammen mit Originaldaten, Zusatzinformationen, Zugriffsmöglichkeiten und dem konkreten System.

Soll ich Dokumente vor dem Chunking pseudonymisieren?

+

Das kann konsistente Bezüge innerhalb eines verarbeiteten Textes unterstützen. Prüfen Sie Eingabelimits und das benötigte Zuordnungskonzept. Unabhängige Aufrufe pro Chunk erzeugen keine automatisch dokumentübergreifenden Identitäten.

Löst Pseudonymisierung das Berechtigungsproblem in RAG?

+

Nein. Auch ein Dokument mit Platzhaltern kann vertrauliche Inhalte enthalten. Berechtigungsfilter müssen sicherstellen, dass nur erlaubte Treffer in den Modellkontext gelangen.