Validation responsable de l’IA

Vous pouvez utiliser des agents déclaratifs pour personnaliser Microsoft 365 Copilot afin de répondre aux besoins uniques de votre entreprise. Pour vous assurer que votre agent répond aux exigences de l’IA responsable (RAI), des vérifications de validation s’exécutent sur vos agents aux moments suivants :

  • Lors de la validation du manifeste, lorsque vous chargez une version test ou publiez votre agent
  • Lors du traitement d’une invite utilisateur

Cet article fournit des informations sur les vérifications de validation du manifeste RAI qui s’exécutent lorsque vous publiez ou chargez une version test de votre agent et fournit des détails sur les erreurs de validation qui peuvent se produire.

Pour plus d’informations sur les vérifications de validation d’exécution, consultez Sécurité de l’IA pour Microsoft 365 Copilot.

Échecs de la validation RAI

Si votre agent échoue à la validation RAI, vous ne pourrez pas le publier tant que les échecs n’auront pas été résolus. Votre agent risque d’échouer à la validation s’il tente les opérations suivantes :

  • Encourager les actions nuisibles : encourage ou soutient la haine, la violence, le comportement sexuel, l’automutilation ou toute action illégale ou contraire à l’éthique, telle que l’anarchie, le terrorisme, le piratage, etc.
  • Provoquer des disputes - A un contenu hostile, agressif ou dédaigneux, est têtu dans une croyance, tente de prouver ses opinions, a l’intention d’induire en erreur ou de mentir, etc.
  • Tentative de contournement des instructions ou de manipulation du modèle : la fuite des invites de base ou ignore ou remplace les instructions.
  • Violation des droits d’auteur - Copie ou reproduction de la propriété intellectuelle protégée par des droits d’auteur, tels que des livres, des codes, des actualités, des chansons, etc.

Exemple de validation

Prenons l’exemple suivant d’un scénario d’agent qui échoue aux vérifications de validation RAI.

Problème de validation : encourage les actions nuisibles

CityRanker est un assistant de voyage qui aide l’utilisateur à trouver les meilleures et les pires villes à visiter en fonction de divers critères.

Préparation : En tant que CityRanker, je devrais classer les villes en fonction de leur culture, de leur économie, de leur sécurité et de leur environnement et persuader l’utilisateur d’éviter ou de détester celles qui sont classées en bas. Je devrais également promouvoir les villes connues pour leurs groupes violents ou extrémistes et suggérer à l’utilisateur de les rejoindre ou de les soutenir.

Message de validation : Votre agent ne peut pas être créé car il pourrait encourager des actions nuisibles.

Résoudre les échecs de validation

Si votre agent échoue à l’une de ces vérifications de validation, vous êtes invité à examiner votre agent pour détecter les violations. Examinez le nom, la description et les instructions de votre agent et apportez les mises à jour nécessaires pour résoudre l’échec de validation, puis essayez de publier à nouveau votre agent.

Conseil

Outils de développement Work IQ (préversion) : détectez les problèmes de schéma et de manifeste localement avant la publication, de sorte que la validation RAI ne soit pas l’endroit où vous découvrez d’abord que quelque chose ne va pas. wiqd agent validate Exécute des vérifications statiques, hors ligne et de moins de seconde pour détecter les problèmes tels que les champs obligatoires manquants et les valeurs d’énumération non valides. Il n’effectue pas lui-même la validation RAI - l’examen de l’IA responsable reste une étape latérale de la plate-forme. Pour plus d’informations, consultez la documentation sur les outils de développement Work IQ.