Red teaming de chaînes d'agents IA
Une méthode publiée, des jeux de données ouverts, et un journal d'exécution que vous pouvez vérifier vous-même.
2 500 € — une semaine, un rapport, une restitution.
Le problème que cette offre adresse
Vos agents IA font ce qu'on leur demande. C'est précisément ce qui pose problème.
Quand plusieurs agents s'enchaînent — l'un lit, l'un décide, l'un exécute — une instruction dissimulée dans un contenu entrant peut traverser la chaîne sans qu'aucun modèle ne soit détourné, sans qu'aucun garde-fou ne se déclenche, sans qu'aucune alerte ne parte. Chaque agent se comporte conformément à ses instructions. Le système, lui, fait autre chose que ce qui était prévu.
Ce mode de défaillance n'est pas couvert par les référentiels de sécurité classiques. ISO 27001 traite les accès, le réseau, le cycle de développement. Un audit d'équité mesure si un modèle est équitable. Aucun ne dit ce qui se passe quand du contenu entrant acquiert une autorité qu'on ne lui a jamais accordée.
Ce sur quoi repose la méthode
Cette offre ne s'appuie pas sur un catalogue de tests génériques, mais sur deux études conduites et publiées par Senthex.
Les deux jeux de données sont publics et reproductibles. Vous pouvez vérifier la méthode avant de l'acheter.
C'est la différence avec un test générique : ce qui vous est appliqué a d'abord été mesuré, publié, et soumis au regard de pairs. Le dépôt contient les exécutions, les prompts et le code d'analyse — rien n'exige de nous faire confiance.
Ce qui est testé
Le périmètre exact se définit ensemble au cadrage. Une mission couvre selon les cas :
La frontière entre instruction et donnée
Ce qui, dans le contexte transmis à vos modèles, fait autorité — et ce qui ne devrait qu'être évalué. C'est le point d'entrée de la quasi-totalité des compromissions observées.
La propagation dans la chaîne
Ce qu'un agent transmet à l'agent suivant, et ce que celui-ci en fait. Une instruction reformulée par un maillon de confiance devient indétectable en aval : c'est le mécanisme central d'ATLAS.
Le blanchiment d'autorité
La capacité d'un contenu entrant à se faire passer pour une décision déjà validée. C'est ce que RELAY mesure, et c'est ce qui fait céder des vérificateurs qui voient pourtant le problème.
Le passage à l'acte
Ce qui sépare une sortie de modèle d'une écriture en base, d'un appel d'outil, d'une transaction. Une chaîne qui se trompe sans pouvoir agir est un incident ; une chaîne qui se trompe et qui agit est une perte.
La traçabilité
Ce que votre système conserve de ce qui s'est passé, et si cette trace est opposable à un tiers.
Comment se déroule une mission
Cadrage
Définition commune du périmètre, des systèmes concernés, de la fenêtre d'intervention et de ce qui est hors limites. Formalisé par une autorisation écrite signée — sans elle, aucune opération ne commence.
Reconnaissance
Cartographie de la chaîne : qui parle à qui, qui décide, qui agit, et quels contenus entrent par où.
Attaque
Déroulé des vecteurs pertinents sur le périmètre convenu, en priorisant ce qui mène à une action irréversible.
Restitution
Un rapport de ce qui a été testé, de ce qui a tenu et de ce qui a cédé, avec criticité et recommandations priorisées. Suivi d'un échange pour le parcourir ensemble.
Le livrable
Vecteurs éprouvés, résultats, criticité, recommandations classées par ordre de traitement. Utilisable en interne comme face à un tiers.
Et une trace vérifiable de la mission elle-même. Les opérations sont conduites à travers l'infrastructure Senthex : chaque requête envoyée est journalisée dans une chaîne de hachage horodatée par une autorité tierce. Vous recevez ce journal avec un vérifieur hors ligne. Vous pouvez donc contrôler vous-même ce qui a été envoyé sur vos systèmes, et quand, sans avoir à nous croire sur parole.
C'est inhabituel dans ce métier, et c'est délibéré : un test de sécurité qui demande la confiance aveugle est difficilement défendable devant un régulateur.
Voir le mécanisme à l'œuvre →Le journal de mission s'appuie sur la capacité audit-as-proof — chaîne SHA-256, ancre RFC 3161, vérifieur hors ligne — qui est une capacité pilote (v1.1.7), pas encore la version publiée. Elle est exercée sur notre propre infrastructure pendant la mission ; nous vous dirons précisément où elle en est au cadrage.
En toute transparence : ce que cette prestation ne fait pas
Une évaluation porte sur un périmètre défini, à un instant donné. Ce n'est ni une certification, ni une garantie d'absence de vulnérabilité : ne rien trouver sur un vecteur ne prouve pas qu'il n'y a rien à y trouver.
Une semaine permet d'éprouver en priorité les vecteurs qui mènent à une action irréversible, pas de couvrir exhaustivement une chaîne complexe. Le rapport dit explicitement ce qui a été testé et ce qui ne l'a pas été.
Toute mission suppose une autorisation écrite préalable définissant le périmètre. Tester un système sans ce cadre est illégal, et nous ne le faisons pas.
Tarifs
Évaluation
Une semaine, un rapport, une restitution. Tarif de lancement.
Licence Senthex Self-Host
Le pare-feu déployé sur votre infrastructure : interception des appels de modèles, blocage au point d'entrée, journal d'audit vérifiable. Support et mises à jour inclus. Vos données ne quittent pas votre environnement.
Programme annuel
La licence self-host, plus deux évaluations semestrielles. Vous disposez à tout moment d'un rapport de robustesse daté de moins de six mois, adossé à un journal vérifiable — l'artefact qu'un client régulé ou un régulateur finira par vous demander par écrit.
Les périmètres larges ou les environnements multiples sont chiffrés au cadrage.
Questions fréquentes
Faut-il une autorisation écrite ?
Oui, sans exception. Le cadrage se conclut par une autorisation écrite signée qui définit le périmètre, les systèmes concernés, la fenêtre d'intervention et ce qui est hors limites. Sans elle, aucune opération ne commence : tester un système sans ce cadre est illégal, et nous ne le faisons pas.
Est-ce que cela nous certifie, ou nous met en conformité ?
Non. Une évaluation porte sur un périmètre défini, à un instant donné — ce n'est ni une certification, ni une garantie d'absence de vulnérabilité. Le rapport est un artefact daté que vous pouvez produire face à un client ou à un auditeur ; il ne remplace ni une évaluation de conformité, ni votre documentation technique.
Que se passe-t-il si vous ne trouvez rien ?
Le rapport dit ce qui a été testé et ce qui a tenu, vecteur par vecteur — c'est un résultat exploitable, pas un échec de mission. Il dit aussi explicitement ce qui n'a pas été couvert : ne rien trouver sur un vecteur ne prouve pas qu'il n'y a rien à y trouver.
Faut-il déjà utiliser Senthex ?
Non. L'évaluation porte sur votre chaîne telle qu'elle tourne aujourd'hui, quels que soient vos fournisseurs de modèles. L'infrastructure Senthex sert à journaliser la mission elle-même, pour que vous puissiez contrôler vous-même ce qui a été envoyé sur vos systèmes, et quand.
Sur quoi la méthode est-elle fondée ?
Sur deux études conduites et publiées par Senthex : ATLAS, sur les cascades d'injection de prompt dans une entreprise multi-agents, et RELAY, sur le blanchiment d'autorité dans une chaîne CI/CD agentique, publiée sur arXiv en cs.CR. Les exécutions, les prompts et le code d'analyse sont publics — vous pouvez vérifier la méthode avant de l'acheter.
Un échange pour cadrer le périmètre, la fenêtre et le devis.
Dites-nous ce que vous faites tourner : combien d'agents, quels outils ils peuvent appeler, et ce qui, chez vous, peut déclencher une action irréversible. Nous revenons avec un périmètre proposé et une fenêtre.