Vous pouvez limiter le trafic par le nombre d’appels API ou le nombre de tokens consommés. Pour configurer les limites de débit pour toutes ou spécifiques, suivez les étapes ci-dessous.
-
Connectez-vous à l'interface utilisateur du locataire Netskope et accédez à Settings > Security Cloud Platform > AI Gateway > Rate Limit.
-
Cliquez sur New Override.
-
Dans la page New Rate Limit Override, entrez les valeurs des paramètres suivants.
Paramètres Details Nom Saisissez un nom pour la dérogation de la limite de tarif. C’est un domaine obligatoire. Gateway Select un AI Gateway auquel vous souhaitez appliquer la dérogation de la limite de taux. Sous-ensemble de passerelles/toutes les passerelles Précisez si vous souhaitez appliquer les limites de débit à un sous-ensemble de passerelles ou à toutes les passerelles. Critères de correspondance Spécifiez les critères de correspondance pour la limite de taux à appliquer. Comme critère de correspondance, vous pouvez sélectionner un fournisseur d’IA, un nom de modèle IA et des groupes de jetons. Vous pouvez sélectionner plusieurs groupes de jetons. Si la valeur reste vide, la limite de taux s’applique à tout le trafic (niveau locataire). -
Choisissez comment vous voulez mesurer la limite :
Type Description Appels API Limitez le trafic par le nombre de requêtes. Tokens Limitez le trafic par le nombre de tokens consommés. La consommation de jetons inclut à la fois les jetons d’entrée (prompt) et les jetons de réponse (sortie) combinés. Note: Vous ne pouvez pas changer le Type après la création de la dérogation de la limite de vitesse. Pour basculer entre appels API et tokens, créez un New override.L’option Jetons n’est pas disponible lorsque les critères de correspondance spécifient un seul fournisseur IA dont le schéma est « Autre ». AI Gateway ne peut pas extraire de manière fiable le nombre de tokens à partir des réponses des fournisseurs en utilisant le schéma Autre, donc une limite basée sur les jetons ne s’appliquerait pas correctement. Si les critères de correspondance restent ouverts à tous les fournisseurs (aucun fournisseur IA spécifique n’est sélectionné), cette restriction ne peut pas être appliquée automatiquement au moment de la configuration. Dans ce cas, examinez votre IA
Listez les fournisseurs avant de s’appuyer sur une limite basée sur des jetons, puisque tout fournisseur de schéma « Autre » inclus dans cette portée ne sera pas limité par le nombre de jetons. -
Specify the limit value.
Si Type = appels API If Type = Tokens Si vous avez sélectionné appels API, spécifiez la limite comme un nombre/par requête/jour ou Heure/passerelle. Si vous avez sélectionné Tokens, spécifiez la limite par nombre de tokens/par jour ou Heure/passerelle. 
-
Ajoutez un message de réponse personnalisé dans la boîte de texte Message de réponse. Lorsque la limite de débit définie atteint la limite maximale, AI Gateway envoie ce message personnalisé avec le code de réponse 429.

-
Suivez la consommation de tokens pour vos dérogations de limite de taux sur la page Limite de taux. L’utilisation est disponible au niveau du locataire, du fournisseur d’IA, du modèle et du groupe AI Gateway token.

