Ilustración editorial para CART propone que cada fallo guíe la siguiente prueba de seguridad de la IA
Imagen generada con gpt-image-2.5-sunburst para InferamaSource ↗
01

D’une liste fixe à une recherche qui s’adapte

CART — l’acronyme de Closed-Loop Adaptive Red Teaming — est un cadre d’évaluation qui propose d’adapter les tests de sécurité au fur et à mesure que des résultats apparaissent. L’idée centrale est qu’un constat ne soit pas seulement une réponse consignée à la fin d’une campagne : il peut aussi aider à choisir la tentative suivante. Le travail est présenté dans un préprint, c’est-à-dire une publication qu’il ne faut pas confondre avec une validation indépendante ni avec une garantie de sécurité.

Le problème auquel CART cherche à répondre est précis. Un ensemble fixe de prompts peut servir à vérifier des risques connus et faciliter des comparaisons reproductibles, mais il ne change pas nécessairement lorsqu’un test révèle une faiblesse inattendue. D’après le résumé de l’étude, CART commence par couvrir largement les risques, poursuit l’exploration des faiblesses qui apparaissent et s’efforce d’éviter que les nouveaux tests ne se réduisent à des variantes répétées d’une même attaque.

Cette approche ne signifie pas que les tests statiques n’ont plus d’utilité. Une batterie fixe peut fournir un point de référence commun ; la méthode adaptative ajoute une recherche guidée par ce qui s’est passé pendant l’évaluation. La question est de savoir si cette adaptation trouve des échecs pertinents qu’une répétition des cas initiaux n’aurait pas détectés, et dans quelles conditions. Le résumé affirme que CART découvre davantage d’échecs et un risque moyen plus élevé que la répétition statique des tests de départ pour toutes les cibles pour lesquelles une référence était disponible. Les éléments résumés ici ne donnent toutefois pas de chiffres permettant de mesurer l’ampleur de cet écart.

La comparaison porte donc sur ce que deux stratégies de test découvrent dans le cadre des évaluations réalisées. Elle ne permet pas, à elle seule, de conclure que les systèmes évalués échouent plus souvent dans les usages quotidiens, ni que CART a couvert tous les risques possibles.

Ce que compare l’approche

La différence méthodologique tient à l’adaptation du prochain cas de test. Ce tableau ne signifie pas qu’une stratégie remplace l’autre dans tous les contextes.

ApprocheCe qu’elle faitCe qu’elle permet d’observerLimite
Répétition statiqueRéexécute un ensemble initial de tests.Les résultats sur des cas connus et une référence reproductible.N’explore pas nécessairement les nouvelles faiblesses qui apparaissent pendant la campagne.
CARTS’appuie sur les résultats de l’évaluation pour orienter les tests suivants, tout en maintenant une recherche large et diversifiée.La capacité de l’adaptation à découvrir des échecs qui n’apparaissent pas lors de la répétition des tests de départ.Les résultats dépendent des tests, des rôles et des cibles évalués.
02

Trois rôles distincts au sein du cycle

Le cadre distingue trois rôles. Le Challenger propose des tests ; le Target est le modèle ou l’agent qui les reçoit ; et le Judge évalue les résultats. Cette séparation permet d’étudier chaque fonction indépendamment et évite de présenter CART comme un modèle unique qui déciderait, répondrait et vérifierait tout à la fois. La cible peut être un modèle textuel ou un agent doté d’outils, mais le résumé disponible ne précise pas les modèles utilisés ni les outils employés.

Dans un cycle adaptatif, le résultat produit par le Target peut fournir des indications sur la vulnérabilité à explorer ensuite. Le Challenger génère de nouveaux tests en tenant compte de ces indications ; le Judge analyse les réponses, tandis que le processus conserve les éléments probants et la provenance des constats. Le résumé souligne justement l’enregistrement des éléments probants et de l’origine de chaque constat, mais les informations disponibles ne précisent ni les champs consignés ni le format de cet enregistrement.

Séparer les rôles ne supprime pas le risque d’erreur. Un juge peut mal classer une réponse, et le choix du Challenger comme celui du Judge peut modifier les éléments probants qui émergent. Le résumé de CART indique que les combinaisons de Challenger et de Judge influencent les résultats découverts. Le nombre d’échecs signalés ne doit donc pas être considéré comme indépendant des choix effectués pour les générer et les évaluer.

Le cycle d’évaluation décrit par CART

  1. 01Commencer par des tests couvrant un large éventail de risques.
  2. 02Envoyer un test au Target, qui peut être un modèle textuel ou un agent doté d’outils dans des limites définies.
  3. 03Évaluer la réponse avec le Judge et conserver les éléments probants ainsi que la provenance associés au constat.
  4. 04S’appuyer sur les résultats pour orienter de nouveaux tests, en cherchant à élargir l’exploration sans répéter le même échec.
  5. 05Avant d’interpréter le résultat, examiner la combinaison de Challenger et de Judge qui a produit les éléments probants.
03

Les résultats rapportés dans le préprint

Le résumé répartit les expériences en trois familles : Frontier, JAH et Agentic. Il indique que, pour chaque cible disposant d’une référence, CART a détecté davantage d’échecs et un risque moyen plus élevé que la répétition statique des tests de départ. Il affirme également que les gains s’étendent aux tests d’agents utilisant des outils. Selon les expériences décrites, cela suggère que l’adaptation au contexte peut révéler des faiblesses qui ne sont pas mises à l’épreuve par la simple répétition directe de prompts.

Cette lecture comporte des limites importantes. Le résumé ne fournit pas ici le nombre de cibles évaluées, le nom des modèles, les taux de détection, les écarts chiffrés entre méthodes ni les détails de chaque famille expérimentale. Le terme « davantage » ne suffit pas non plus à établir l’importance statistique ou pratique de la différence. Pour évaluer ces aspects, il faut consulter les résultats complets et leurs conditions, plutôt que de les déduire du résumé.

Les auteurs précisent également que les résultats décrivent ce que les stratégies de test découvrent, et non la fréquence des échecs dans les déploiements réels. Une campagne de red teaming sélectionne des entrées, des conditions et des critères d’évaluation ; elle n’équivaut pas à l’observation de toutes les interactions qu’un système aurait en production. CART peut donc apporter des éléments sur les performances d’une stratégie de recherche sans fournir d’estimation directe des incidents en situation réelle.

Ce que l’on peut conclure et ce qui reste à établir

QuestionCe qu’indique le résuméCe qu’il ne permet pas d’établir à lui seul
Quelles familles d’évaluation sont décrites ?Frontier, JAH et Agentic.Les détails complets de chaque protocole.
Comment CART se compare-t-il à la référence ?Le résumé fait état de davantage d’échecs et d’un risque moyen plus élevé pour toutes les cibles disposant d’une référence.L’ampleur chiffrée de l’écart et sa portée pratique.
Des agents ont-ils été testés ?Le résumé rapporte des résultats sur des tests d’agents utilisant des outils.Les agents, outils et limites précis qui ont été utilisés.
À quelle fréquence les systèmes échouent-ils en production ?Le travail précise qu’il mesure ce que les stratégies de test découvrent.La fréquence des échecs dans les déploiements réels.
04

Traçabilité, diversité et limites encore ouvertes

Consigner la provenance et les éléments probants d’un constat est important : cela facilite l’examen de la manière dont il a été obtenu et des observations qui justifient sa classification. Sans ces informations, une liste de résultats peut être difficile à interpréter ou à reproduire. CART indique enregistrer les éléments probants et leur origine, mais le résumé ne décrit ni le schéma de données, ni les identifiants, ni la disponibilité des enregistrements, ni la possibilité pour une personne indépendante de reconstruire chaque test.

La diversité nécessite elle aussi une définition opérationnelle. Affirmer que les tests recherchés sont divers ne démontre pas que les cas diffèrent de la manière pertinente : les mots peuvent changer alors que la même vulnérabilité est répétée, ou les cas peuvent sembler proches tout en explorant des mécanismes différents. Le résumé affirme que CART maintient la diversité des nouveaux tests, mais ne fournit pas ici la métrique, le seuil ou la procédure servant à la vérifier. Cette seule description ne permet donc pas de confirmer comment les doublons sont repérés ni comment le système évite de favoriser des variations superficielles.

La reproductibilité reste également une question ouverte. Pour répéter une évaluation, des éléments comme les versions des modèles, les instructions, les outils activés, le budget de recherche, le harnais d’évaluation et les règles de notation peuvent être importants. Les informations fournies ne confirment pas quels éléments de CART ont été publiés, ni si le code, les tests générés et les constats sont accessibles pour une réplication externe. Il ne serait pas correct de présenter cette disponibilité comme acquise sans l’avoir vérifiée.

Dans les déploiements réels, l’interprétation dépend aussi du produit et de sa configuration. Un résultat obtenu sur un point de terminaison expérimental ne décrit pas nécessairement le comportement d’une interface ou d’une configuration de production. L’évaluation devrait préciser ce qui a été testé et dans quelles limites, et envisager des tests supplémentaires sur le système effectivement déployé. Cela ne modifie pas les résultats rapportés par CART, mais délimite les décisions qu’ils peuvent étayer.

05

Une contribution à l’évaluation, pas un certificat de sécurité

La contribution proposée par CART est méthodologique : transformer les résultats d’une campagne en informations qui orientent la prochaine série de tests, au lieu de s’appuyer uniquement sur une liste immuable. Le préprint rapporte des résultats favorables par rapport à une référence statique dans trois familles d’évaluation, notamment des tests faisant intervenir des agents et des outils. Ces éléments justifient de s’intéresser à l’approche, mais ne suffisent pas à affirmer qu’elle détecte tous les risques, qu’elle fonctionne de la même façon avec n’importe quel modèle ou qu’elle améliore à elle seule la sécurité d’un produit.

Pour déterminer dans quelle mesure il est possible de se fier à cette proposition, les questions pratiques sont les suivantes : quelles cibles ont été comparées, dans quelles conditions et avec quels budgets, comment la diversité a été vérifiée, comment les erreurs du juge ont été contrôlées et si des tiers peuvent reproduire les résultats. Il convient aussi de vérifier si les tests correspondent au modèle et au point de terminaison qui seront réellement utilisés. Tant que ces réponses ne sont pas vérifiables, CART doit être considéré comme un cadre prometteur de recherche adaptative, dont les auteurs rapportent des résultats et reconnaissent certaines limites, et non comme une garantie de sécurité.

Critères pour interpréter une évaluation adaptative

  1. 01Identifier les modèles, agents, outils et configurations qui ont été testés.
  2. 02Comparer la stratégie adaptative à une référence clairement définie et examiner l’ampleur des résultats, pas seulement leur direction.
  3. 03Vérifier comment la diversité et la déduplication des tests ont été mesurées.
  4. 04Examiner les contrôles humains ou indépendants appliqués aux jugements automatiques.
  5. 05Confirmer quels éléments probants, codes et enregistrements sont disponibles pour reproduire l’évaluation.
  6. 06Ne pas extrapoler les résultats d’une campagne à la fréquence des échecs en production sans éléments spécifiques.

Questions ouvertes

  • Les informations fournies ne précisent pas l’identité et la version des modèles et agents évalués, ni les limites imposées aux outils.
  • Aucun chiffre détaillé, aucune taille d’échantillon ni aucune estimation de l’incertitude ne sont fournis ici pour quantifier l’avantage par rapport à la référence.
  • La méthode de mesure de la diversité des tests et de déduplication des attaques visant le même échec n’est pas précisée.
  • Les mécanismes humains ou indépendants utilisés pour détecter les faux positifs et les biais du Judge ne sont pas confirmés.
  • La disponibilité du code, des tests générés et des enregistrements pour une réplication externe n’est pas confirmée.
  • Les résultats du préprint n’établissent pas la fréquence des échecs dans des systèmes déployés en conditions réelles.
06

Poursuivre l’exploration

06

Sources consultées

03

Corrections et transparence

Si vous repérez une information incorrecte ou obsolète, envoyez-nous la page et la source à vérifier.

Proposer une correction