Erdungs-KI-Systeme

Abgeschlossen

Grundbildung ist der Prozess der Verbindung der Antworten eines KI-Systems auf überprüfte, reale Daten, anstatt sich ausschließlich auf das allgemeine Schulungswissen des Modells zu verlassen. Ohne Verankerung leiten generative KI-Modelle ausschließlich aus Mustern ab, die während des Trainings gelernt wurden – was für einen bestimmten Anwendungsfall veraltet, unvollständig oder falsch sein kann. Die Erdung ist sowohl eine Maßnahme zur Qualitätskontrolle als auch zur Sicherheitskontrolle.

Warum Grundsicherungen für Sicherheit wichtig sind

Aus Sicherheitsperspektive stellen nicht geerdete KI-Systeme mehrere Risiken dar:

  • Gefälschte Ausgaben: Ein Modell ohne fundierte Grundlage liefert mit größerer Wahrscheinlichkeit Informationen, die zwar mit Überzeugung vorgetragen, aber sachlich falsch sind, und auf die Nutzer möglicherweise reagieren, ohne die Informationen nachzuprüfen
  • Veraltete Informationen: Modelle, die vor Monaten oder Jahren auf Daten trainiert wurden, können veraltete Anleitungen liefern, besonders gefährlich für Sicherheitsberatung, Complianceanforderungen oder Produktdokumentation
  • Uneingeschränkter Umfang: Ohne Fundierung kann ein Modell Fragen zu einem Thema beantworten, einschließlich Gebiete, in denen es nicht über ausreichendes Wissen verfügt, um verlässlich zu sein.

Durch Grounding wird das Modell gezwungen, mit bestimmten, überprüften Datenquellen zu arbeiten, wodurch die Angriffsfläche für Risiken durch gefälschte Ausgaben reduziert wird und die im System-Prompt definierten Grenzen durchgesetzt werden.

Erdungstechniken

Mehrere Techniken werden häufig verwendet, um KI-Systeme in überprüften Daten zu bodenieren:

Wiederherstellungs-unterstützte Generierung (RAG)

RAG ist die am weitesten verbreitete Erdungstechnik. Es funktioniert durch:

  1. Abrufen relevanter Dokumente oder Daten aus einer Knowledge Base, Datenbank oder Suchindex basierend auf der Abfrage des Benutzers
  2. Erweitern der Eingabeaufforderung mit diesen abgerufenen Informationen
  3. Generieren einer Antwort, die sowohl von den Funktionen des Modells als auch von den spezifischen abgerufenen Daten informiert wird

RAG ermöglicht es der KI, aktuelle kontextspezifische Antworten bereitzustellen, ohne dass das Modell neu trainiert werden muss. Beispielsweise kann ein KI-Assistent, der mit RAG geerdet ist, Fragen zu den internen Richtlinien einer Organisation beantworten, indem er die neuesten Richtliniendokumente zur Abfragezeit abruft.

Sicherheitsüberlegungen für RAG-Implementierungen umfassen:

  • Zugriffssteuerung für Quelldaten: Stellen Sie sicher, dass das Abrufsystem die gleichen Zugriffssteuerungen wie der Benutzer respektiert. Die KI darf keine Dokumente abrufen, die der Benutzer nicht anzusehen autorisiert ist.
  • Quelldatenintegrität: Schützen Sie die Wissensbasis vor Manipulationen. Wenn ein Angreifer die Erdungsdaten ändern kann, kann er die Antworten der KI beeinflussen – eine Form der indirekten Manipulation.
  • Zitat und Rückverfolgbarkeit: Konfigurieren Sie das System so, dass angegeben wird, welche Quellen jede Antwort informiert haben, sodass die Genauigkeit überprüft und erkannt werden kann, wann das Modell von seinen Erdungsdaten abweicht.

Prompt Engineering für Grounding

Fortgeschrittene Prompt-Engineering-Techniken ergänzen RAG durch Anweisungen an das Modell zur Verwendung seiner Basisdaten.

  • Fügen Sie explizite Anweisungen ein, um Antworten nur auf bereitgestellten Kontext zu basieren.
  • Definieren, wie das Modell reagieren soll, wenn die Erdungsdaten nicht die Antwort enthalten ("Basierend auf den verfügbaren Informationen habe ich keine Antwort auf diese Frage")
  • Festlegen von Regeln für die Behandlung von Widersprüchlichen Informationen über Quellen hinweg

Groundedness-Erkennung

Einige KI-Plattformen bieten die Fundierungsnachweis als integrierte Funktion. Dieses Feature wertet die Ansprüche des Modells anhand der bereitgestellten Quellmaterialien aus und kennzeichnet Antworten, die Informationen enthalten, die von den Erdungsdaten nicht unterstützt werden. Die Groundedness-Erkennung fungiert als Sicherheitsüberprüfung nach der Erzeugung von Ausgaben und fängt gefälschte Ausgaben ab, die trotz weiterer Kontrollmaßnahmen durchgekommen sind.

Verankerung bewährter Best Practices

Bei der Implementierung von Grounding in KI-Systemen gilt Folgendes:

  • Halten Sie die Grundlagen auf dem laufenden: Richten Sie Prozesse ein, um die Wissensbasis regelmäßig zu aktualisieren. Veraltete Grounding-Daten können genauso problematisch sein wie gar keine Grounding-Daten.
  • Qualitätsüberprüfung der Quelle: Verwenden Sie nur verlässliche, überprüfte Quellen für das Grounding. Grounding, das auf unzuverlässigen Datenquellen basiert, überträgt diese Unzuverlässigkeit auch auf die Antworten der KI.
  • Überwachung von Kennzahlen zur Geerdetheit: Verfolgen Sie, wie oft die Antworten des Modells geerdet oder nicht geerdet sind. Eine Zunahme der nicht geerdeten Antworten kann auf ein Problem mit der Abrufpipeline oder den Grounding-Daten selbst hinweisen.
  • Kombinieren mit Inhaltsfiltern: Verwenden Sie die Fundiertheitsprüfung zusammen mit Inhaltsfiltern und Metaprompt-Anweisungen für einen mehrschichtigen Ansatz zur Verteidigung.

Diagramm des RAG-Erdungsprozesses von der Benutzerabfrage bis zum Abruf der überprüften Antwort.