Aller au contenu principal

Politique de gestion de l'IA

info

Ce document décrit les systèmes d'IA de GitGuardian ainsi que la gouvernance, les mesures de sécurité et les normes éthiques que nous mettons en œuvre pour garantir leur utilisation sûre et responsable.

Vue d'ensemble

  • Les valeurs des secrets sont expurgées : Nous utilisons le moteur de détection de pointe de GitGuardian pour identifier et expurger les secrets avant que toute donnée ne soit envoyée à des modèles d'IA externes.
  • Exposition minimale du contexte : Lorsqu'un contexte est requis pour certaines fonctionnalités d'IA, seul un extrait autour de l'emplacement de la détection est envoyé, avec les secrets expurgés par le moteur de détection de GitGuardian.
  • Transmission de données sécurisée et régionale : Toutes les données sont transmises de manière sécurisée via des connexions chiffrées et restent dans votre région (UE ou US) : les fournisseurs d'IA externes traitent les requêtes dans la même région géographique que votre instance GitGuardian.
  • Métadonnées limitées : Lorsque des métadonnées sont requises, nous envoyons des caractéristiques d'incident telles que le type de détecteur, la sévérité, le statut de validité et d'autres attributs non sensibles : aucune valeur de secret.
  • Pas d'entraînement, pas de rétention par les fournisseurs d'IA : Vos données ne sont pas utilisées pour entraîner des modèles et ne sont pas conservées par un fournisseur d'IA externe au-delà du minimum nécessaire pour répondre à la requête.
  • Sous-traitants déclarés : Tous les fournisseurs d'IA (AWS Bedrock, Google Cloud Vertex AI, OpenAI) sont formellement déclarés comme sous-traitants. Liste complète : gitguardian.com/legal/subprocessors
  • Vous gardez le contrôle : Vous pouvez router les appels LLM via votre propre cloud (BYOC), ou désactiver entièrement les appels LLM externes.

Principes fondamentaux de l'IA chez GitGuardian

Principes éthiques de l'IA

GitGuardian se conforme à toutes les lois et réglementations applicables en matière d'IA et adhère aux principes éthiques suivants :

  • Protection des données et confidentialité : Les systèmes d'IA respectent la vie privée des utilisateurs et se conforment aux réglementations sur la protection des données.
  • Responsabilité et redevabilité : Une responsabilité claire des résultats de l'IA avec des approbations human-in-the-loop et une traçabilité.
  • Fiabilité et intégrité : Des systèmes fiables avec une amélioration continue.

GitGuardian respecte également toutes les politiques de sécurité standard de GitGuardian, disponibles sur notre Trust Center.

Protection de vos données

La sécurité des secrets est une mission fondamentale de GitGuardian. Chaque modèle et fonctionnalité d'IA est conçu, entraîné, évalué et maintenu sur des benchmarks internes avant déploiement, puis soumis à une validation manuelle.

GitGuardian utilise un mélange de modèles propriétaires auto-hébergés et, dans certains cas, de grands modèles de langage tiers validés.

Nos systèmes sont résistants par conception aux injections de prompt. La plupart des fonctionnalités d'IA implémentent une ou plusieurs des protections suivantes :

  • Séparation des entrées/sorties : Les producteurs d'entrées et les récepteurs de sorties sont séparés. Un attaquant ne peut pas confirmer si son entrée malveillante a produit un effet, ni influencer les réponses d'autres utilisateurs.
  • Entrées et sorties contraintes et validées : Les modèles répondent uniquement dans un périmètre prédéfini (par exemple, classification Oui/Non), empêchant les actions non intentionnelles ou le contenu non contrôlé.
  • Contexte libre limité au périmètre autorisé du demandeur : Le RBAC et le moindre privilège par conception garantissent une isolation stricte des tenants.
  • Garde-fous et surveillance : Les défenses bloquent les tentatives d'injection avant qu'elles n'atteignent le modèle et détectent les comportements non sûrs après génération.

Ces protections sont complétées par l'expurgation des données sensibles, des filtres de sécurité (modération des entrées/sorties) et des validateurs d'entrées/sorties (vérifications de schéma et de politique).

Conformité avec l'EU AI Act

GitGuardian ne développe pas d'IA à usage général, et toutes les implémentations d'IA sont conçues sur mesure pour améliorer la détection, la classification, la priorisation et la remédiation des secrets et des identités non humaines — toujours avec des protections strictes pour protéger les données des clients.

Ces implémentations relèvent d'un système d'IA à risque minimal selon la nomenclature de l'EU AI Act. En pratique, cela signifie qu'elles présentent un risque très limité ou nul pour la confidentialité, les droits ou la sécurité fondamentaux, et sont donc autorisées sans obligations supplémentaires de conformité au-delà de la transparence. GitGuardian fournit des garanties concernant la conformité de ses services aux lois et réglementations applicables par le biais de protections contractuelles.

Utilisation et protection des données

Pour améliorer en continu la détection, la priorisation et la remédiation des secrets, GitGuardian peut utiliser :

  1. Les données clients uniquement pour l'amélioration du service, pas pour l'entraînement.
  2. Les données de performance pour l'entraînement de modèles et d'algorithmes.

Données clients pour l'amélioration du service

Un exemple typique est un ticket de support pour un faux positif qui partage l'incident concerné. Notre équipe de détection l'examine et améliore la logique de détection correspondante.

Données de performance pour l'entraînement

GitGuardian peut utiliser des Données de Performance anonymisées pour entraîner et évaluer des modèles internes. Ceux-ci sont de petits modèles internes, pas des « General Purpose AI ».

Pour éviter toute ambiguïté : les Données de Performance n'identifient aucun client et n'incluent que les retours et métadonnées générés par le service, mais pas le contenu des dépôts, le code source, les noms d'entreprise ou les PII.

L'objectif est d'apprendre des schémas généraux, par exemple qu'un identifiant AWS lié à un environnement de production est généralement plus critique qu'un identifiant à faible impact dans un environnement de test.

  • Périmètre : Les données sont utilisées exclusivement pour l'amélioration des modèles internes de GitGuardian. Elles ne sont jamais utilisées pour entraîner des modèles tiers. La plupart des types de données peuvent exister sous deux formes :
    • Publique : déjà accessible à quiconque sur internet (par exemple, fichiers publics GitHub ou DockerHub)
    • Interne : accessible uniquement via un accès accordé par le Client.
  • Transformation des données : Avant leur inclusion dans les ensembles d'entraînement, les données subissent une expurgation du contenu sensible (secrets, identifiants, informations personnelles).
  • Pratiques de sécurité : Le traitement des données suit toutes les normes de sécurité de GitGuardian, y compris les contrôles d'accès et les politiques de rétention. Les données d'un client ne peuvent pas être exposées à un autre client via les sorties des modèles.

(*) « Données de Performance » désigne, le cas échéant, les données d'utilisation et les informations compilées par GitGuardian sur l'utilisation des Services par le Client, y compris les Données de Service, ainsi que les informations statistiques et de performance liées à la fourniture et à l'exploitation des Services. Les Données de Performance incluent les informations concernant l'utilisation par les Clients et les Utilisateurs des différentes fonctionnalités des Services ainsi que les données analytiques et statistiques qui en découlent, et les données agrégées et anonymisées dérivées des Données Client (lorsque ces données sont traitées en lien avec les Services) de sorte qu'elles n'identifient pas une personne.

Utilisation et propriété des entrées et sorties

GitGuardian s'assure que vos entrées ou sorties ne sont pas :

  • Disponibles pour d'autres clients
  • Envoyées en dehors de votre région de résidence des données (US ou UE) lors de leur traitement par le système d'IA
  • Envoyées à un fournisseur LLM tiers autre que nos fournisseurs LLM standards
  • Stockées par un fournisseur LLM tiers
  • Utilisées pour entraîner ou améliorer un modèle tiers

GitGuardian ne revendique pas la propriété des sorties générées par l'IA mais conserve un droit de licence sur les entrées et sorties afin d'améliorer les fonctionnalités correspondantes. Les clients conservent tous les droits d'utiliser, de modifier et de distribuer la sortie à leur discrétion.

GitGuardian indemnisera les clients contre les réclamations de propriété intellectuelle de tiers liées à l'utilisation des sorties générées par l'IA, à condition que le Client : (i) dispose d'un droit valide d'utiliser ses entrées ; (ii) dispose d'un abonnement actif et payant pour la fonctionnalité d'IA concernée ; (iii) n'avait pas connaissance préalable de la violation alléguée ; (iv) la sortie n'a pas été substantiellement modifiée avant la réclamation.

Modèles d'IA et stratégies de déploiement

GitGuardian utilise une approche à plusieurs niveaux pour équilibrer performance et confidentialité :

  • Modèles propriétaires / Self-Hosted : Modèles personnalisés pour la détection et la priorisation des secrets, hébergés entièrement au sein de l'infrastructure de GitGuardian.
  • Modèles hybrides : Combinaison de modèles propriétaires avec des LLM open source hébergés dans notre environnement sécurisé.
  • LLM tiers : Pour des fonctionnalités spécifiques (par exemple, chat, explications), nous nous intégrons à des fournisseurs de confiance tels qu'AWS Bedrock et OpenAI via des API sécurisées avec Zero Data Retention.

Détails du système d'IA de GitGuardian

Finalités du traitement par l'IASécuriser les secrets et les NHI et aider à la remédiation.
Système(s) d'IA propriétaire(s) ou tiersUtilisation hybride de modèles propriétaires et de LLM tiers (AWS Bedrock, Gemini, OpenAI).
Entrée d'IA

Selon les fonctionnalités d'IA (veuillez vous référer au Catalogue des Fonctionnalités d'IA ci-dessous), l'Entrée d'IA peut être :

  • Contexte limité du secret (public ou interne) — un extrait ou une portion de document centré sur le secret détecté, avec des métadonnées limitées (par exemple, date, nom de fichier).
  • Données de Performance — attributs d'incident non sensibles tels que la validité du secret, le nombre de fois qu'il a fuité, son type/catégorie et sa classification de sévérité (n'inclut pas la valeur du secret, le contenu du dépôt, ni le contexte et les retours issus des interactions utilisateur).
  • Entrée utilisateur — uniquement le texte saisi par l'utilisateur dans le chat ou les requêtes.
  • Description et mots-clés de l'entreprise — description de haut niveau et mots-clés décrivant l'entreprise (par exemple, nom de l'entreprise, domaine), généralement issus de sources OSINT.
  • Données Sources (publiques ou internes) — accès complet au contenu actuel du dépôt, projet ou canal (par exemple, dépôts Git) et aux métadonnées associées (descriptions, utilisateurs anonymisés, interactions).
  • Dashboard GitGuardian — informations disponibles dans le Dashboard pour l'utilisateur authentifié, dans le respect du RBAC et des permissions.
Type de sortie d'IATexte et étiquettes de classification.
Avertissements/Watermarks de la sortie d'IALes fonctionnalités d'IA sont étiquetées comme étant propulsées par l'IA dans notre documentation ainsi que dans l'affichage lorsque cela est pertinent.

Catalogue des fonctionnalités d'IA de GitGuardian

Pour un détail complet de chaque capacité propulsée par l'IA, consultez Fonctionnalités propulsées par l'IA.

Amélioration continue et surveillance

À mesure que notre IA évolue, ces principes évolueront également. Nous continuerons à les réexaminer et à les améliorer pour refléter les meilleures pratiques les plus récentes en matière d'IA responsable.