Ilustración editorial para RECLAIM mide si los agentes de IA pueden reproducir resultados de investigación
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

Um teste de reprodução, não uma tarefa isolada de programação

O RECLAIM é um benchmark concebido para medir se um agente de inteligência artificial consegue reproduzir um resultado concreto descrito num artigo de aprendizagem automática. O preprint apresenta um conjunto de 100 artigos da NeurIPS 2025 e define uma tarefa para cada artigo: o agente tem de trabalhar com o texto do artigo e os materiais publicados pelos respetivos autores, dentro de um orçamento de horas de GPU fixado antecipadamente.

A diferença em relação a um teste convencional de programação está no alcance do trabalho. Para chegar a um resultado, um agente pode ter de instalar software, resolver erros, compreender o método, executar experiências e verificar os resultados. A avaliação procura abranger essa cadeia de tarefas, e não apenas determinar se o sistema gera código que parece correto.

A abordagem também define antecipadamente qual o resultado a reproduzir e que condições contam como sucesso. Esta é uma decisão importante: sem um objetivo definido previamente, a comparação entre agentes poderia depender de avaliações diferentes sobre o que constitui uma reprodução satisfatória. O resumo do preprint não especifica as regras exatas utilizadas para cada artigo; por isso, não permite reconstruir a forma como esse critério foi aplicado em todos os casos.

02

Três níveis, definidos pelo que os autores publicaram

O RECLAIM classifica as tarefas de acordo com a disponibilidade de recursos. No nível Run, estão disponíveis o código, os dados e os pesos do modelo. No nível Retrain, os pesos não estão disponíveis, pelo que o agente tem de treinar o modelo. No nível Reimplement, o código não está disponível e o agente tem de escrever uma implementação. Segundo o preprint, é o material disponibilizado pelos autores que determina o nível de dificuldade.

Esta classificação ajuda a interpretar os resultados: nem todas as tarefas partem das mesmas condições. Executar um sistema já preparado, reconstruir os seus pesos através de treino e voltar a implementar um método são trabalhos diferentes. Por isso, uma única taxa de sucesso, sem discriminação por nível, esconderia diferenças relevantes.

A classificação também não significa que todas as tarefas de um mesmo nível tenham necessidades idênticas. Os artigos podem propor métodos e experiências diferentes. O resumo disponível não enumera os recursos de cada artigo nem indica quanto variam os respetivos requisitos. Assim, os níveis descrevem a disponibilidade de determinados materiais, e não uma equivalência perfeita de dificuldade.

Como interpretar os níveis do RECLAIM

A tabela resume a definição dos três níveis apresentada no preprint. Não representa uma classificação independente da dificuldade de cada artigo.

NívelRecursos indicadosTrabalho que cabe ao agente
RunCódigo, dados e pesosExecutar o material publicado e obter o resultado definido
RetrainPesos indisponíveisTreinar o modelo, além de concluir o resto da tarefa
ReimplementCódigo indisponívelEscrever uma implementação do método para tentar reproduzir o resultado
03

Os resultados revelam uma diferença entre níveis

O preprint indica que foram testados quatro agentes, uma vez por artigo. O melhor agente de cada nível reproduziu 41% dos artigos Run, 27% dos artigos Retrain e 15% dos artigos Reimplement. Neste conjunto e segundo o procedimento descrito, o sucesso diminuiu à medida que se retiravam recursos necessários para reconstruir o sistema.

Estas percentagens são resultados do benchmark, não uma medida universal da capacidade de qualquer agente. Também não devem ser lidas como uma comparação direta entre agentes sem informação adicional: o resumo identifica o melhor resultado de cada nível, mas não apresenta os nomes dos quatro sistemas, as pontuações individuais nem detalhes suficientes para reconstruir a variabilidade das tentativas.

O trabalho refere ainda que as tentativas falhadas consumiram, em média, 29% do orçamento atribuído. A interpretação proposta no preprint é que muitos agentes terminaram ainda com orçamento disponível. O dado sugere que o limite de computação, por si só, não explica todas as falhas; não demonstra, por si só, porque parou cada tentativa nem que alteração teria sido suficiente para conseguir reproduzir o resultado.

Outro erro frequente foi implementar o método sem comparar qualquer parte com os valores publicados no artigo. O resumo regista este erro em 63 de 400 execuções. Esta observação aponta para a diferença entre produzir uma implementação plausível e verificá-la com base em evidências: escrever o método não garante que o agente tenha reproduzido as condições relevantes.

Uma leitura prudente das taxas

  1. 01Identificar o nível de recursos: Run, Retrain ou Reimplement.
  2. 02Interpretar a taxa como o resultado do melhor agente nesse nível, e não como a média de todos os agentes.
  3. 03Ter em conta que é reportada uma execução por agente e por artigo.
  4. 04Não transformar a percentagem de reproduções numa afirmação sobre a validade global dos artigos.
04

O que é avaliado e o que fica de fora

O RECLAIM avalia se um agente consegue alcançar um resultado selecionado antecipadamente, com os materiais disponíveis e dentro de um orçamento computacional. Segundo o resumo, uma instância de um modelo de linguagem diferente do agente avalia as execuções com base nos registos e nos resultados produzidos, em vez de se apoiar no relatório escrito pelo agente. O objetivo é avaliar o que aconteceu durante a execução, e não apenas aquilo que o sistema afirma ter feito.

Este âmbito também delimita as conclusões possíveis. Reproduzir um resultado concreto não verifica automaticamente todas as decisões metodológicas de um artigo, a qualidade dos seus dados, a robustez das suas análises nem a validade das suas conclusões científicas. Por outro lado, o facto de uma tarefa não ser concluída no benchmark não demonstra, por si só, que o resultado original esteja incorreto: podem existir causas técnicas, de implementação ou de recursos que o resumo não discrimina.

Esta distinção é importante para leitores e equipas que queiram utilizar o benchmark como indicador de progresso. Uma taxa baixa pode revelar dificuldades dos agentes em reconstruir experiências com informação incompleta; sem evidências adicionais, não deve ser convertida num veredicto sobre o artigo avaliado.

05

A reprodutibilidade da avaliação também precisa de detalhes

Para comparar agentes de forma independente, não basta conhecer a dimensão do benchmark e as taxas de sucesso. Seria necessário dispor da seleção de artigos, do resultado pretendido em cada tarefa, do critério operacional de sucesso, dos orçamentos concretos de GPU e das regras relativas ao tempo. Também são relevantes os nomes e as configurações dos agentes, as instruções que receberam, os ambientes, os materiais disponíveis e os registos ou resultados utilizados para avaliar cada execução.

O resumo do preprint confirma que o RECLAIM define o resultado, o critério de sucesso e um orçamento de horas de GPU para cada artigo, e que a avaliação se baseia em registos e resultados. No entanto, a informação aqui fornecida não especifica os valores desses orçamentos, o método de seleção dos cem artigos, os nomes dos quatro agentes nem se os ambientes e scripts necessários para repetir a avaliação foram publicados. Estes pontos devem ser verificados no documento e nos materiais associados antes de se fazer uma comparação mais detalhada.

A apresentação descreve o RECLAIM como um benchmark que pode ser reconstruído anualmente a partir de novas conferências. Isto oferece uma possível forma de acompanhar as mudanças na capacidade dos agentes, desde que as edições futuras mantenham critérios comparáveis ou documentem as alterações. Não se pode pressupor a comparabilidade entre anos se os artigos, os materiais ou as regras forem diferentes.

Informação necessária para interpretar uma comparação

Estes elementos ajudam a distinguir uma diferença de capacidade de uma diferença nas condições de avaliação.

ElementoO que permite esclarecer
Artigos e resultados pretendidosO que foi pedido para reproduzir e como foram selecionados os casos
Critérios de sucessoQue condições uma execução tinha de cumprir para contar como reprodução
Orçamento e limites de tempoQue recursos foram permitidos em cada tarefa e como se aplicaram os limites
Agentes, instruções e ambienteQue sistemas e condições foram utilizados para obter as taxas reportadas
Registos, resultados e avaliaçãoQue evidências foram disponibilizadas ao avaliador e como se aplicou o critério de sucesso
06

Uma medida de capacidade com âmbito limitado

A principal contribuição do RECLAIM é transformar uma tarefa abrangente — reconstruir um resultado de investigação — num benchmark com objetivos e recursos definidos antecipadamente. Os seus três níveis tornam visível como o trabalho muda quando estão disponíveis o código, os dados e os pesos, quando é necessário treinar ou quando se tem de voltar a implementar. Os resultados publicados mostram que, nesta avaliação, a reprodução se torna menos frequente nos níveis com menos recursos disponíveis.

A interpretação mais sólida é também a mais circunscrita: o RECLAIM reporta o desempenho de quatro agentes em cem tarefas concretas, segundo critérios e orçamentos definidos pelo benchmark. Para avaliar a amplitude dessas evidências, são necessários os detalhes completos da seleção, da avaliação e da execução. E para avaliar a ciência dos artigos, são necessárias análises distintas da reprodução de um resultado.

Questões em aberto

  • A informação fornecida pela fonte não explica como foram selecionados os 100 artigos nem qual é o resultado específico definido para cada um.
  • Os valores dos orçamentos de horas de GPU e os limites de tempo por tarefa não são detalhados.
  • O resumo não identifica os quatro agentes nem apresenta os resultados individuais de cada um.
  • A informação fornecida não confirma se os ambientes, as instruções, os scripts e as regras completas de avaliação estão disponíveis publicamente.
  • O critério geral de sucesso é descrito como definido antecipadamente, mas não são incluídas as regras operacionais aplicadas a cada artigo.
07

Continue a explorar

07

Fontes consultadas

03

Correções e transparência

Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.

Propor uma correção