Le filtrage de contenu dans le Generative AI Hub
À jour au 2026-09-25
Qu'est-ce que Le filtrage de contenu dans le Generative AI Hub ?
Le module de filtrage du service d'orchestration exécute deux fournisseurs de sécurité de contenu indépendants — Azure Content Safety (sévérité graduée, détection d'attaques Prompt Shield, détection de code protégé) et Llama Guard 3 (quatorze catégories de risque booléennes) — sur l'entrée, la sortie, ou les deux. Chaque type de filtre est facturé comme une requête distincte, les modèles Azure OpenAI portent un filtre global non contournable sous vos propres seuils, et Prompt Shield ignore les messages system et developer depuis août 2026.
Deux fournisseurs, appliqués où vous le choisissez
Le module de filtrage de contenu dans config.modules.filtering est facultatif et agit sur input, output, ou les deux indépendamment — une entrée non configurée passe directement au modèle, et une sortie non configurée revient sans aucun contrôle. Il prend en charge deux services, Azure Content Safety et Llama Guard 3, et vous pouvez faire tourner les deux ensemble : chaque type de filtre ne peut apparaître qu'une fois par sens (impossible d'empiler deux filtres Azure Content Safety réglés différemment sur la même entrée), mais des types différents s'exécutent en parallèle, et le service d'orchestration attend que tous les filtres configurés terminent avant de renvoyer un résultat. SAP déconseille explicitement de coller des exemples de contenu restreint dans un modèle de prompt en guise de contournement — cela peut en soi fausser les classifieurs vers des faux positifs. C339 place ce module dans le pipeline complet ; cette fiche est le plongeon en profondeur sur les deux fournisseurs eux-mêmes, et fait pendant à C365 sur le module de masquage qui s'exécute juste avant le filtrage d'entrée dans le même pipeline.
Pourquoi c'est important
- Un exercice de red-teaming construit uniquement à partir de prompts de contournement en rôle system passera sans encombre depuis août 2026 — non parce que la défense est solide, mais parce que Prompt Shield n'évalue plus du tout ce rôle.
- Un code client qui ne vérifie que le statut HTTP livrera silencieusement des réponses vides chaque fois que le filtre de sortie se déclenche, puisqu'une sortie filtrée est un 200, pas une erreur.
- Empiler Azure Content Safety et Llama Guard 3 sur les deux sens quadruple silencieusement la facture de filtrage par requête — un détail à inclure dans toute estimation de coût à côté de l'appel au modèle lui-même.
Points clés
- Deux fournisseurs : Azure Content Safety (Hate/Violence/Sexual/SelfHarm à 0/2/4/6, Prompt Shield, détection de code protégé) et Llama Guard 3 (14 catégories booléennes).
- Chaque type de filtre une fois par sens ; des types différents s'exécutent en parallèle ; l'orchestration attend que tous terminent.
- Prompt Shield s'exécute avant la classification des dommages quand les deux sont configurés ; une attaque détectée saute entièrement la classification des dommages.
- Depuis août 2026, Prompt Shield ignore le contenu de rôle system et developer.
- Rejet en entrée = HTTP 400, aucun jeton de modèle consommé. Blocage en sortie = HTTP 200 avec finish_reason: content_filter, pas une erreur.
- Chaque modèle Azure OpenAI porte un filtre global non configurable qui bloque les sévérités 4 et 6 quels que soient vos seuils.
- Chaque type de filtre configuré est facturé comme une requête distincte — empiler fournisseurs et sens multiplie le coût.
- Azure Content Safety a un repli régional automatique en cas d'indisponibilité ; la détection de code protégé ne détecte que le code publié avant sa date de coupure.
Termes employés sur cette page
- Classification des dommages
- La notation de sévérité (0/2/4/6) d'Azure Content Safety pour les contenus Hate, Violence, Sexual et SelfHarm.
- Prompt Shield
- Le détecteur d'attaque par prompt d'Azure Content Safety ; depuis août 2026 il ignore le contenu de rôle system et developer.
- Détection de code protégé
- Un contrôle Azure Content Safety en sortie uniquement pour le code généré correspondant à des dépôts GitHub publics jusqu'à une date de coupure.
- Llama Guard 3
- Un classifieur de risque booléen à 14 catégories (llama_guard_3_8b) ; seules les catégories demandées sont appliquées par l'orchestration.
- finish_reason: content_filter
- Le champ signalant un blocage par filtre de sortie ; le statut HTTP reste 200.
- Filtre de contenu global (Azure OpenAI)
- Un filtre au niveau de la plateforme sur chaque modèle Azure OpenAI qui bloque le contenu de sévérité 4/6 indépendamment de vos propres seuils.
Sources
- SAP AI Core docs (SAP-docs GitHub, Sep 2026) — Content Filtering (Azure Content Safety, Prompt Shield, protected material, Llama Guard 3, billing note)
- SAP AI Core docs — Enhancing Model Consumption with Input Filtering (request/response example, 400 on rejection)
- SAP AI Core docs — Enhancing Model Consumption with Output Filtering (finish_reason content_filter)
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · les pièges courants et leur correctif · l'aide-mémoire · les blocs de code · les chiffres à citer.