Die häufigste Methode, mit der ein KI-System sensible Informationen preisgibt, ist nicht ein ausgeklügelter Angriff, sondern die, dass ein Mitarbeiter eine berechtigte Frage stellt und eine Antwort erhält, die ihm nicht zugänglich sein sollte. Technisch gesehen hat das System nicht versagt. Es hat lediglich seine Aufgabe im Rahmen seiner Berechtigungen erfüllt, die über die des Fragestellers hinausgingen.
OWASP identifiziert dieses Risiko als LLM02, Offenlegung sensibler Informationen, in seinen Top 10 für Sprachmodellierungsanwendungen bis 2025. Und es ist diejenige, die sich am häufigsten in Geschäftsumgebungen manifestiert, gerade weil sie nicht erfordert, dass jemand mit böswilliger Absicht handelt.
Die geerbte Genehmigung. Der Assistent fragt das Dokumentenrepository über ein Dienstkonto mit Vollzugriff ab. Jeder Benutzer, der mit dem Assistenten interagiert, erhält dadurch Zugriff auf alle Daten, die dieses Konto einsehen kann. Dies ist der häufigste und einfachste Weg, unbeabsichtigt Zugriff zu erlangen.
Der wahllos erhobene Index. Beim Aufbau der Wissensdatenbank wird ein ganzer Ordner indexiert, um Kontextinformationen bereitzustellen. Darin können sich beispielsweise Gehaltsabrechnungen, eine Vertraulichkeitsvereinbarung oder ein Bericht über eine laufende Transaktion befinden. Das System unterscheidet nicht: Es ruft alle passenden Daten zur Suchanfrage ab.
Der Ausgang ins Freie. Jemand fügt einen Vertragsentwurf oder proprietären Code in ein öffentliches Tool ein, um es verbessern zu lassen. Dies ist der Weg der Schatten-KI, den wir bereits besprochen haben. Schatten-KI, das Risiko, das durch die Firmenkarte entsteht.
Die kumulative Schlussfolgerung. Eine einzelne Antwort liefert keine entscheidenden Erkenntnisse, doch die Kombination mehrerer Antworten ermöglicht es, Informationen zu rekonstruieren, die eigentlich nicht zugänglich sein sollten: die Gehaltsstruktur aus Bruchstücken, die Gewinnspanne eines Kunden aus Vergleichswerten.
Die vierte ist am schwierigsten zu kontrollieren und am wenigsten vorhersehbar, da es keinen bestimmten Zeitpunkt gibt, an dem man sagen könnte, dass etwas durchgesickert ist.
Ansatz | Wie es sich verhält | Risiko |
|---|---|---|
Anwendungsberechtigungen | Das System hat Zugriff auf alles, und die Benutzeroberfläche filtert, was angezeigt wird. | Jede alternative Route umgeht den Filter. |
Berechtigungen in der Abfrage | Die abgerufenen Dokumente sind je nach anfragendem Unternehmen eingeschränkt. | Das ist richtig, aber es setzt gut gepflegte Metadaten voraus. |
Berechtigungen für die Daten | Der Zugriff wird am Ursprungsserver unter Verwendung der Benutzeridentität aufgelöst. | Die einzige, die gegen neue Zugangsformen robust ist. |
Die meisten Unternehmenssysteme wurden mit Anwendungsberechtigungen entwickelt, da der einzige Zugang zu Daten zwanzig Jahre lang über den Bildschirm führte. Ein KI-Assistent eröffnet einen neuen Weg zu denselben Daten – und dieser Weg führt nicht über den Bildschirm.
Daher gilt folgende Regel: Das KI-System sollte die Identität des Benutzers und nicht seine eigene abfragen.. Wenn dies eine Neugestaltung des Berechtigungsmodells erzwingt, bedeutet das, dass das Berechtigungsmodell bereits anfällig war und der Assistent dies lediglich sichtbar gemacht hat.
Der Aufbau einer Wissensdatenbank ist eine Sicherheitsentscheidung, die als technische Aufgabe getarnt ist. Vier Fragen, bevor Sie beginnen:
Der vierte Punkt wird oft aus Sorge um den Datenschutz der Mitarbeiter vernachlässigt. Dies ist eine berechtigte Sorge, die durch eine Aufbewahrungsrichtlinie und eingeschränkten Zugriff auf die Akten – und nicht durch deren Löschung – gelöst werden kann.
Bei der Auswahl eines Tools zum Lesen interner Dokumentationen gibt es drei Fragen, die keine vagen Antworten zulassen:
Werden unsere Daten zum Trainieren von Modellen verwendet? Die Antwort sollte im Vertrag stehen, nicht auf einer Marketingseite, und sie sollte sowohl den Inhalt als auch die Anfragen abdecken.
Wie werden Genehmigungen bearbeitet? Wenn die Antwort lautet, dass sich das Tool mit einem Administratorkonto verbindet, liegt ein Designproblem vor, kein Konfigurationsproblem.
Wo werden die Einbettungen und Protokolle gespeichert? Vektoren, die aus einem vertraulichen Dokument abgeleitet werden, enthalten weiterhin Informationen aus diesem Dokument. OWASP widmet diesem Thema eine eigene Kategorie – LLM08, Schwächen in Vektoren und Einbettungen.
Es ist nicht nötig, etwas auszuschalten. Die empfohlene Reihenfolge:
Es gibt einen Test, der fünf Minuten dauert und das Gespräch besser strukturiert als jede formelle Prüfung: Bitten Sie den Assistenten um etwas, das Sie eigentlich nicht sehen sollten..
Das Durchschnittsgehalt einer Abteilung. Die Vertragsbedingungen eines Kunden, den Sie nicht betreuen. Der Inhalt eines Adressbuchs. Wenn die Anwendung antwortet, wissen Sie bereits, dass das Berechtigungsmodell in der Anwendung und nicht in den Daten definiert ist, und Sie kennen Ihre erste Aufgabe.
Wenn die Negation korrekt ist, prüfen Sie auch, ob sie nicht auf dieselbe, anders formulierte Frage genauso reagiert. Konsequente Beantwortung trotz Umformulierung unterscheidet echte Kontrolle von einer bloßen Anweisung.
Über vier Wege: geerbte Berechtigungen von einem Dienstkonto mit vollem Zugriff, wahlloses Indizieren von Ordnern, die sensible Dokumente enthalten, Ausgabe von Informationen an nicht autorisierte externe Tools und kumulative Schlussfolgerungen aus mehreren einzeln harmlosen Antworten.
Verwenden Sie das Benutzerkonto, niemals Ihr eigenes Dienstkonto mit umfassenden Zugriffsrechten. Wenn das System mit höheren Berechtigungen als denen des Benutzers abfragt und die Benutzeroberfläche die angezeigten Inhalte filtert, umgeht jede alternative Zugriffsmethode diesen Filter.
Welche Quellen explizit einbezogen werden und welche nicht, ob jedem Dokument eine Zugriffsebene zugeordnet ist, wie Inhalte aus dem Index entfernt werden, wenn sich ihre Klassifizierung ändert, und was bei jeder Abfrage protokolliert wird, um ein Datenleck zu erkennen und zu untersuchen.
Wenn die Daten und Abfragen zum Trainieren von Modellen verwendet werden, wie werden Zugriffsrechte geregelt und wo werden die Einbettungen und Protokolle gespeichert? Vektoren, die aus einem vertraulichen Dokument abgeleitet wurden, enthalten weiterhin Informationen aus diesem Dokument.
Fragen Sie nach Informationen, die die anfragende Person nicht einsehen sollte: Gehaltsdetails, Vertragsbedingungen anderer Mitarbeiter oder den Inhalt von Managementakten. Wenn die Person antwortet, liegt die Zugriffskontrolle in der Anwendung, nicht in den Daten selbst. Es empfiehlt sich außerdem, die Frage in anderer Form zu wiederholen.
Es handelt sich um die Rekonstruktion sensibler Informationen aus mehreren Antworten, die einzeln betrachtet keine kritischen Informationen preisgeben. Die Kontrolle gestaltet sich schwierig, da kein spezifischer, identifizierbarer Zeitpunkt für das Auftreten des Datenlecks feststellbar ist; daher ist die Protokollierung von Abfragen das einzige Mittel zur Erkennung.
Wissen Sie, was Ihr KI-Assistent sehen kann? Wir überprüfen die Abfrageidentität, den Indexbereich, die Berechtigungen und die Registrierung und teilen Ihnen mit, welche Informationen heute offengelegt werden. Bewertung anfordern →