Ilustración editorial para CART propone que cada fallo guíe la siguiente prueba de seguridad de la IA
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

De uma lista fixa a uma busca adaptativa

CART — sigla de Closed-Loop Adaptive Red Teaming — é uma estrutura de avaliação que propõe adaptar os testes de segurança à medida que surgem resultados. A ideia central é que uma descoberta não seja apenas uma resposta registrada no fim de uma campanha: ela também pode orientar qual será a próxima tentativa. O trabalho foi apresentado em um preprint, isto é, uma publicação que não deve ser confundida com validação independente ou garantia de segurança.

O problema que a proposta tenta abordar é específico. Uma coleção fixa de prompts pode ajudar a verificar riscos conhecidos e facilitar comparações reproduzíveis, mas não necessariamente muda quando um teste revela uma fraqueza inesperada. Segundo o resumo do estudo, o CART começa com uma cobertura ampla de riscos, passa a explorar as fragilidades que aparecem e procura evitar que os novos testes se reduzam a variações repetidas do mesmo ataque.

Essa abordagem não significa que os testes estáticos deixem de ser úteis. Uma bateria fixa pode oferecer uma referência comum; a abordagem adaptativa acrescenta uma busca orientada pelo que aconteceu durante a avaliação. A questão é se essa adaptação encontra falhas relevantes que uma repetição dos casos iniciais não detectaria, e em quais condições. O resumo afirma que o CART identifica mais falhas e um risco médio mais alto do que a repetição estática dos testes-semente em todos os alvos para os quais havia uma linha de base disponível. O material resumido aqui não apresenta números que permitam medir a dimensão dessa diferença.

A comparação, portanto, diz respeito ao que duas estratégias de teste descobriram nas avaliações realizadas. Por si só, ela não permite concluir que os sistemas avaliados falhem com maior frequência no uso cotidiano, nem que o CART tenha coberto todos os riscos possíveis.

O que a abordagem compara

A diferença metodológica está na adaptação do próximo caso de teste. A tabela não implica que uma estratégia substitua a outra em todos os usos.

AbordagemO que fazO que permite observarLimite
Repetição estáticaExecuta novamente um conjunto inicial de testes.Resultados sobre casos conhecidos e uma referência reproduzível.Não necessariamente explora novas fragilidades que apareçam durante a campanha.
CARTUsa os resultados da avaliação para orientar testes posteriores, mantendo uma busca ampla e diversificada.Se a adaptação identifica falhas que não aparecem ao repetir os testes-semente.Os resultados dependem dos testes, dos papéis e dos alvos avaliados.
02

Três funções separadas no ciclo

A estrutura distingue três papéis. O Challenger propõe os testes; o Target é o modelo ou agente que os recebe; e o Judge avalia os resultados. Essa separação permite estudar cada função individualmente e evita descrever o CART como se fosse um único modelo que decide, responde e verifica ao mesmo tempo. O alvo da avaliação pode ser um modelo de texto ou um agente com ferramentas, embora o resumo disponível não identifique os modelos específicos nem detalhe as ferramentas utilizadas.

Em um ciclo adaptativo, o resultado do Target pode fornecer sinais para decidir qual vulnerabilidade explorar em seguida. O Challenger gera novos testes com base nessa orientação; o Judge analisa as respostas; e o processo preserva as evidências e a procedência das descobertas. O resumo destaca justamente o registro das evidências e da origem de cada descoberta, mas o material disponível não especifica quais campos compõem esse registro nem qual formato ele utiliza.

Separar as funções não elimina o risco de erro. Um juiz pode classificar uma resposta incorretamente, e a escolha do Challenger e do Judge pode alterar quais evidências aparecem. O próprio resumo do CART indica que as combinações de Challenger e Judge afetam as evidências descobertas. Por isso, o número de falhas sinalizadas não deve ser tratado como uma medida independente das decisões tomadas para gerá-las e avaliá-las.

Ciclo de avaliação descrito pelo CART

  1. 01Começar com testes que cubram um conjunto amplo de riscos.
  2. 02Enviar um teste ao Target, que pode ser um modelo de texto ou um agente com ferramentas dentro de limites definidos.
  3. 03Avaliar a resposta com o Judge e preservar as evidências e a procedência associadas à descoberta.
  4. 04Usar os resultados para orientar novos testes, tentando ampliar a exploração sem repetir a mesma falha.
  5. 05Revisar qual combinação de Challenger e Judge produziu as evidências antes de interpretar o resultado.
03

Quais resultados o preprint apresenta

O resumo agrupa os experimentos em três famílias: Frontier, JAH e Agentic. Ele afirma que, para cada alvo com uma linha de base disponível, o CART encontrou mais falhas e um risco médio mais alto do que a repetição estática dos testes-semente. Também relata que as melhorias se estendem a testes de agentes mediados por ferramentas. Segundo os experimentos descritos, isso indica que a adaptação contextual pode revelar fragilidades que não são exercitadas pela repetição direta de prompts.

Há limites importantes para essa interpretação. O resumo não informa aqui o número de alvos avaliados, os nomes dos modelos, as taxas de detecção, as diferenças numéricas entre os métodos ou os detalhes de cada família experimental. Além disso, a palavra “mais” não basta para determinar a relevância estatística ou prática da diferença. Para avaliar esses aspectos, é preciso consultar os resultados completos e as condições dos experimentos, em vez de inferi-los a partir do resumo.

Os autores também alertam que os resultados descrevem o que as estratégias de teste descobrem, e não a frequência com que as falhas ocorrem em implantações reais. Uma campanha de red teaming seleciona entradas, condições e critérios de avaliação; não equivale a observar todas as interações que um sistema teria em produção. Assim, o CART pode fornecer evidências sobre o desempenho de uma estratégia de busca sem oferecer uma estimativa direta de incidentes no uso real.

O que é possível concluir e o que continua em aberto

PerguntaO que o resumo indicaO que não é possível estabelecer apenas com essas informações
Quais famílias de avaliação são descritas?Frontier, JAH e Agentic.Os detalhes completos de cada protocolo.
Como o CART se compara à linha de base?Relata mais falhas e risco médio mais alto em todos os alvos com linha de base disponível.A dimensão numérica da diferença e sua relevância prática.
Foram testados agentes?O resumo apresenta resultados em testes de agentes mediados por ferramentas.Quais agentes, ferramentas e limites específicos foram utilizados.
Com que frequência os sistemas falham em produção?O trabalho esclarece que mede o que as estratégias de teste descobriram.A frequência de falhas em implantações reais.
04

Rastreabilidade, diversidade e limites em aberto

Registrar a procedência e as evidências de uma descoberta é importante porque facilita a revisão de como ela foi produzida e quais observações sustentam sua classificação. Sem essas informações, uma lista de resultados pode ser difícil de interpretar ou reproduzir. O CART afirma que registra evidências e origem, mas o resumo não descreve o esquema de dados, os identificadores, a disponibilidade dos registros nem se uma pessoa independente consegue reconstruir cada teste.

A diversidade também exige uma definição operacional. Dizer que os testes devem ser diversos não demonstra que os casos sejam diferentes no sentido relevante: as palavras podem mudar enquanto a vulnerabilidade permanece a mesma, ou testes aparentemente semelhantes podem explorar mecanismos distintos. O resumo afirma que o CART mantém a diversidade dos novos testes, mas não fornece aqui a métrica, o limiar ou o procedimento usado para verificá-la. Portanto, somente com essa descrição não é possível confirmar como os casos duplicados são identificados ou como se evita valorizar variações superficiais.

A reprodutibilidade também continua em aberto. Para repetir uma avaliação, costumam ser importantes elementos como as versões dos modelos, as instruções, as ferramentas habilitadas, o orçamento de busca, o ambiente de avaliação e as regras de pontuação. O material fornecido não confirma quais elementos do CART foram publicados nem se o código, os testes gerados e as descobertas estão disponíveis para uma replicação externa. Não é correto apresentar essa disponibilidade como fato sem verificá-la.

Em implantações reais, a interpretação também depende do produto e de sua configuração. Um resultado obtido em um endpoint experimental não necessariamente descreve o comportamento de uma interface ou configuração de produção. A avaliação deve deixar claro o que foi testado e sob quais limites, além de considerar testes adicionais no sistema efetivamente implantado. Isso não altera os resultados comunicados pelo CART, mas delimita quais decisões podem se apoiar neles.

05

Uma contribuição para a avaliação, não um certificado de segurança

A contribuição proposta pelo CART é metodológica: transformar os resultados de uma campanha em informação que oriente a próxima rodada de testes, em vez de depender exclusivamente de uma lista imutável. O preprint relata vantagens em relação a uma linha de base estática em três famílias de avaliação, incluindo testes com agentes e ferramentas. Essas evidências justificam o interesse pela abordagem, mas não bastam para afirmar que ela detecta todos os riscos, funciona da mesma forma em qualquer modelo ou, por si só, melhora a segurança de um produto.

Para decidir o quanto confiar na proposta, as perguntas práticas são: quais alvos foram comparados, quais eram as condições e os orçamentos, como a diversidade foi verificada, como os erros do juiz foram controlados e se terceiros conseguem reproduzir os resultados. Também convém verificar se os testes correspondem ao modelo e ao endpoint que serão realmente utilizados. Até que haja respostas verificáveis, o CART deve ser entendido como uma estrutura promissora de busca adaptativa, com resultados relatados pelos autores e limites reconhecidos — não como garantia de segurança.

Critérios para interpretar uma avaliação adaptativa

  1. 01Identificar quais modelos, agentes, ferramentas e configurações foram testados.
  2. 02Comparar a estratégia adaptativa com uma linha de base claramente definida e analisar a magnitude dos resultados, não apenas sua direção.
  3. 03Verificar como foram medidas a diversidade e a deduplicação dos testes.
  4. 04Revisar os controles humanos ou independentes aplicados aos julgamentos automatizados.
  5. 05Confirmar quais evidências, códigos e registros estão disponíveis para uma replicação.
  6. 06Não extrapolar os resultados de uma campanha para a frequência de falhas em produção sem evidências específicas.

Questões em aberto

  • O material fornecido não detalha as identidades e versões dos modelos e agentes avaliados nem os limites das ferramentas.
  • Não são apresentados aqui números detalhados, tamanhos de amostra ou estimativas de incerteza que permitam quantificar a vantagem em relação à linha de base.
  • Não se especifica como a diversidade dos testes é medida nem como são deduplicados os ataques que exploram a mesma falha.
  • Não se confirmam os mecanismos independentes ou humanos usados para detectar falsos positivos e vieses do Judge.
  • Não se confirma se o código, os testes gerados e os registros estão disponíveis para replicação externa.
  • Os resultados do preprint não estabelecem a frequência de falhas em sistemas implantados em condições reais.
06

Continue a explorar

06

Fontes consultadas

03

Correções e transparência

Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.

Propor uma correção