Daten-Exfiltration

Abgeschlossen

Bei der Datenexfiltration handelt es sich um die nicht autorisierte Übertragung von Informationen von Computern oder Geräten. In KI-Systemen stellt datenexfiltration einzigartige Risiken dar, da KI-Modelle wertvolle Daten auf mehreren Ebenen enthalten, zugreifen und generieren. MITRE ATLAS katalogisiert Exfiltrationsangriffe unter Taktik AML. TA0010.

Drei Arten von Datenexfiltration im Zusammenhang mit KI sind:

  • Exfiltration des KI-Modells
  • Exfiltration von Trainingsdaten
  • Exfiltration von Interaktionsdaten

Exfiltration des KI-Modells

Modellexfiltration ist die nicht autorisierte Extraktion der Architektur, Gewichtung oder anderer proprietärer Komponenten eines KI-Modells. Angreifer können dies ausnutzen, um das Modell für ihre eigenen Zwecke zu replizieren oder zu missbrauchen, was potenziell die Integrität und das geistige Eigentum beeinträchtigt.

Der Modelldiebstahl kann durch:

  • Direkter Zugriff: Ein Angreifer erhält Zugriff auf Modelldateien, die in einem Repository, Cloudspeicher oder in einer Bereitstellungsumgebung gespeichert sind.
  • API-basierte Extraktion: Ein Angreifer sendet eine große Anzahl sorgfältig gestalteter Abfragen an die API des Modells und verwendet die Antworten, um eine funktionale Kopie des Modells zu rekonstruieren (manchmal als Modelldiebstahl oder Modell-Klonung bezeichnet)
  • Side-Channel-Angriffe: Ein Angreifer beobachtet indirekte Informationen wie Reaktionszeiten, Speicherauslastung oder Stromverbrauch, um Details zur internen Struktur des Modells abzuleiten.

Dreispaltige Diagramm der KI-Datenexfiltrationstypen: Modelldiebstahl, Trainingsdatenextraktion und Interaktionslecks mit einer Hervorhebung des Modelldiebstahls.

Exfiltration von Trainingsdaten

Trainingsdatenexfiltration tritt auf, wenn die zum Erstellen eines KI-Modells verwendeten Daten illegal übertragen oder geleckt werden. Dies umfasst nicht autorisierten Zugriff auf vertrauliche Datasets, die zu Datenschutzverletzungen, behördlichen Verstößen oder Angreiferangriffen führen können, die Kenntnisse der Schulungsdaten ausnutzen.

Angreifer können auch Membership-Inference-Angriffe verwenden, um zu ermitteln, ob bestimmte Datenpunkte in den Trainingsdaten enthalten waren, um beispielsweise zu bestätigen, dass die Krankenakten einer bestimmten Person zur Schulung eines Gesundheitsmodells genutzt wurden.

Dreispaltige Diagramm der KI-Datenexfiltrationstypen: Modelldiebstahl, Trainingsdatenextraktion und Interaktionslecks mit einem Highlight rund um die Extraktion von Schulungsdaten.

Exfiltration von Interaktionsdaten

Wenn Benutzer mit KI-Systemen – insbesondere KI-Agents – interagieren, stellen sie routinemäßig vertrauliche Informationen über Eingabeaufforderungen bereit: Finanzdaten, Kundendetails, interne Strategie oder proprietärer Code. Über das hinaus, was Benutzer direkt eingeben, rufen KI-Agenten auch Organisationsdaten durch abruf-unterstützte Erstellung (RAG), Tool-Aufrufe und Dateianhänge ab. Dadurch wird eine umfangreiche Sammlung vertraulicher Daten erstellt, die weit über den ursprünglichen Schulungssatz hinausgeht.

Interaktionsdaten sind auf verschiedene Arten anfällig für Exfiltration:

  • Ausspähen von Eingaben und Antworten: Ein Angreifer, der Zugriff auf Unterhaltungsprotokolle erhält oder API-Aufrufe abfangen kann, kann die während ihrer Sitzungen geteilten vertraulichen Informationen extrahieren.
  • Indirekte Prompt Injection: Eine schädliche Anweisung, die in einem Dokument oder einer E-Mail verborgen ist, kann dazu führen, dass ein Agent über seine Antworten abgerufene Organisationsdaten preisgibt, ohne dass der Benutzer bemerkt, was passiert ist.
  • Abfangen der Nutzlast beim Toolaufruf: Wenn ein Agent externe Tools oder APIs aufruft, werden Daten zwischen Systemen übergeben. Wenn diese Verbindungen nicht ordnungsgemäß gesichert sind, kann ein Angreifer die Nutzlasten abfangen, um die ausgetauschten Daten zu erfassen.
  • Offenlegung des Gesprächsprotokolls: Gespeicherte Unterhaltungsprotokolle enthalten sowohl die sensiblen Eingaben des Benutzers als auch die Antworten des Systems, die häufig zusammengefasste vertrauliche Informationen enthalten. Diese Logdateien werden zu einem wertvollen Ziel, wenn sie nicht ordnungsgemäß geschützt sind.

Im Gegensatz zu Modell- oder Schulungsdatenexfiltration ist die Interaktionsdatenexfiltration ein fortlaufendes Risiko, das jedes Mal auftritt, wenn ein Benutzer mit einem KI-System arbeitet. Das Volumen und die Vertraulichkeit dieser Daten wächst bei jeder Interaktion.

Dreispaltige Diagramm der KI-Datenexfiltrationstypen: Modelldiebstahl, Trainingsdatenextraktion und Interaktionslecks mit einer Hervorhebung bei Datenlecks.

Die duale Rolle der KI bei der Datenexfiltration

KI spielt sowohl bei der Verhinderung als auch der Ermöglichung der Datenexfiltration eine zentrale Rolle. Während KI-basierte Tools helfen können, anomaliele Datenzugriffsmuster zu erkennen und potenzielle Verstöße zu erkennen, bietet KI Angreifern auch erweiterte Funktionen, um vertrauliche Informationen effizienter zu stehlen. Dieser duale Einfluss schafft eine komplexe Herausforderung für Organisationen.

Entschärfungsstrategien

Datenexfiltration kann durch eine Kombination von Standardsicherheitsmethoden und KI-spezifischen Steuerelementen abgemildert werden:

  • Prinzip der geringsten Berechtigungen: Einschränken des Zugriffs auf Modelle, Schulungsdaten und Interaktionsprotokolle auf nur diejenigen, die es benötigen
  • Datenklassifizierung und Kennzeichnung: Klassifizieren und Kennzeichnen von Daten, auf die von KI-Anwendungen zugegriffen wird, damit Überwachungssysteme geeignete Zugriffssteuerungen erzwingen können
  • Zero-trust-Architektur: Vertraue nicht einfach aufgrund des Netzwerksstandorts; überprüfe jede Zugriffsanforderung.
  • Verschlüsselung: Verschlüsselung von Daten im Ruhezustand und während der Übertragung, einschließlich Gesprächsprotokollen und API-Kommunikation
  • Aufbewahrungsrichtlinien: Beschränkung der Speicherdauer von Interaktionsdaten, um das Gefährdungsfenster zu verkleinern
  • Eingabebereinigung: Bereinigen von Eingaben, bevor sie an externe Tools übergeben werden, um Datenlecks durch Agentaktionen zu verhindern
  • Verhaltensüberwachung: Nachverfolgen des Agentverhaltens für unerwartete Datenzugriffsmuster, die auf einen Exfiltrationsversuch hinweisen können
  • Rate limiting: Begrenzen Sie API-Abfragevolumina, um Modell-Extraktionsangriffe praktisch unmöglich zu machen.