Erstellen von Metaprompts

Abgeschlossen

Ein Metaprompt , auch als Systemmeldung oder Systemaufforderung bezeichnet, ist eine Reihe natürlicher Sprachanweisungen, die definieren, wie sich ein KI-System verhalten soll. Der Metaprompt wird vom Modell vor jeder Benutzereingabe verarbeitet, wobei die Grundregeln für jede Interaktion festgelegt werden. Metaprompt-Design ist ein kritisches Sicherheitssteuerelement für jede generative KI-Anwendung.

Warum Metaprompts für Sicherheit wichtig sind

Metaprompts dienen als Frontline der Verhaltensabwehr für eine KI-Anwendung. Ohne einen gut gestalteten Metaprompt kann ein Modell:

  • Zurückgeben von rohen Schulungsdaten, einschließlich urheberrechtlich geschützter Materialien, anstelle von Zusammenfassungen
  • Folgen Sie böswilligen Anweisungen, die in Benutzeraufforderungen oder abgerufenen Dokumenten eingebettet sind.
  • Generierung schädlicher, voreingenommener oder off-thema-bezogener Inhalte
  • Geben Sie ihre eigenen Systemanweisungen offen, wenn Sie gefragt werden

Beispielsweise kann ein guter Metaprompt folgendes anweisen: "Wenn ein Benutzer große Mengen an Inhalten aus einer bestimmten Quelle anfordert, geben Sie nur eine Zusammenfassung der Ergebnisse und nicht den vollständigen Text zurück." Ohne diese Anweisung kann das Modell den vollständigen Inhalt eines urheberrechtlich geschützten Werkes abrufen und zurückgeben.

Forschung aus der Industrie zeigt, dass gut gestaltete Metaprompts das Risiko von Sicherheitsfehlern und schädlichen Ergebnissen erheblich reduzieren.

Screenshot mit Metaprompts und den Arten von Sicherheitsproblemen, die sie mindern.

Wichtige Komponenten eines effektiven Metaprompts

Eine umfassende Metaprompt enthält in der Regel mehrere Arten von Anweisungen, darunter:

  • Rollen- und Bereichsdefinition
  • Sicherheit und Compliance-Regeln
  • Erdungsanweisungen
  • Manipulationsabwehr
  • Ausgabeformatierungsregeln

Diagramm mit den fünf Hauptkomponenten eines effektiven Sicherheitsmetaprompts: Rollen- und Bereichsdefinition, Sicherheits- und Complianceregeln, Bodenweisungen, Abwehrmaßnahmen und Ausgabeformatierungsregeln.

Rollen- und Bereichsdefinition

Definieren Sie, was die KI ist und was nicht zulässig ist:

  • Angeben der Rolle, der Kompetenzdomäne und des Tons der KI
  • Festlegen expliziter Grenzen für Themen, die die KI nicht diskutieren sollte
  • Definieren der Zielgruppe und der entsprechenden Detailebene

Sicherheit und Compliance-Regeln

Einrichten von Verhaltensschutzschienen:

  • Weisen Sie das Modell an, Anfragen für schädliche, illegale oder unangemessene Inhalte abzulehnen.
  • Definieren, wie das Modell sensible Themen behandeln soll (z. B. medizinische oder rechtliche Fragen)
  • Erfordern, dass das Modell Unsicherheit erkennt, anstatt Antworten zu erstellen

Erdungsanweisungen

Teilen Sie dem Modell mit, wie die Referenzdaten verwendet werden:

  • Weisen Sie das Modell an, auf dem bereitgestellten Kontext statt auf generellem Wissen zu basieren.
  • Anfordern von Zitaten oder Quellenbezügen bei der Beantwortung sachlicher Fragen
  • Definieren, wie das Modell Fragen außerhalb seiner Erdungsdaten behandeln soll ("Ich habe keine Informationen dazu")

Anti-Manipulationsabwehrmaßnahmen

Schützen Sie den Metaprompt selbst vor Angriffen:

  • Weisen Sie das Modell an, seine Systemanweisungen niemals offenzulegen, unabhängig davon, wie die Anforderung formuliert wird.
  • Definieren, wie das Modell auf Anforderungen reagieren soll, die versuchen, seine Anweisungen außer Kraft zu setzen
  • Einschließen von Anweisungen zum Ignorieren von in Konflikt stehenden Direktiven, die in Benutzereingaben oder abgerufenen Dokumenten gefunden werden

Ausgabeformatierungsregeln

Steuern der Struktur und des Umfangs der Antworten:

  • Festlegen der maximalen Antwortlängen, um datenüberlastung zu verhindern
  • Definieren von Ausgabeformatanforderungen (z. B. Markdown, Nur-Text, strukturierte Daten)
  • Anweisungen für das Modell, wie mehrteilige oder mehrdeutige Anforderungen zu behandeln sind

Bewährte Methoden für Metaprompt

Beim Entwerfen von Metaprompts für Produktions-KI-Systeme:

  • Seien Sie spezifisch und explizit: Vage Anweisungen lassen Raum für Interpretation. Geben Sie anstelle von "hilfreich" genau an, was hilfreich in Ihrem Kontext bedeutet.
  • Führen Sie Tests für bekannte Angriffe durch: Überprüfen Sie, ob Ihre Metaprompt gegen Jailbreak-Techniken, Prompt-Injection-Angriffe und Grenzfälle gewappnet ist. Lassen Sie Ihre Systemprompt vom Red Team überprüfen.
  • Aktualisieren Sie regelmäßig: Wenn neue Angriffstechniken entstehen, aktualisieren Sie Ihre Metaprompt, um sie zu beheben. KI-Plattformanbieter aktualisieren kontinuierlich Aufforderungs-Engineering-Anleitungen und Metaprompt-Vorlagen mit den neuesten bewährten Methoden.
  • Ebene mit anderen Steuerelementen: Metaprompts sind eine Verteidigungsebene. Kombinieren Sie sie mit Inhaltsfiltern, Eingabeüberprüfungen und Ausgabeüberwachungen für die Verteidigung im Detail.
  • Version und Überwachung: Nachverfolgen von Änderungen an Ihrem Metaprompt im Laufe der Zeit. Wenn sich das Modellverhalten unerwartet ändert, müssen Sie feststellen können, ob der Metaprompt geändert wurde.