Ilustración editorial para AIME 2024: qué mide un porcentaje de aciertos en 30 problemas y por qué dos resultados aparentemente iguales pueden no ser comparables
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

O que significa exatamente «AIME 2024»

AIME 2024 é frequentemente apresentado como um único benchmark de raciocínio matemático, mas esse nome condensa várias decisões. Numa implementação de avaliação documentada, o conjunto reúne os problemas da AIME I e da AIME II desse ano: trinta itens no total. Cada problema espera uma resposta numérica inteira expressa com três algarismos, de 000 a 999. A correção pode ser automatizada porque não depende de uma avaliação humana da redação nem de uma grelha sobre os passos intermédios.

Esta composição importa desde o início. Um resultado sobre os trinta problemas não tem a mesma base que outro calculado sobre um único exame de quinze problemas. Também não se deve pressupor que dois conjuntos rotulados como «AIME 2024» usam enunciados, identificadores, adaptações de formato ou chaves de resposta idênticos. Os harnesses de avaliação podem empacotar as suas tarefas e os seus extratores de formas diferentes. O rótulo do benchmark identifica uma família de itens, mas não certifica, por si só, um protocolo comum.

Por isso, uma leitura rigorosa começa por transformar a manchete numa pergunta concreta: foram avaliadas a AIME I, a AIME II ou ambas; quantos problemas foram incluídos; e que implementação transformou a saída textual numa resposta classificável? Sem estas respostas, a percentagem é uma observação incompleta, e não uma comparação fechada.

02

O que uma pontuação mede — e o que deixa de fora

A AIME 2024 fornece um sinal útil sobre a resolução de problemas de competição matemática cuja resposta final pode ser verificada exatamente. O formato reduz uma fonte habitual de ambiguidade: se o avaliador obtém o inteiro correto segundo a regra definida, o item conta como acerto; caso contrário, conta como erro. Esta propriedade torna o teste atrativo para executar muitas avaliações de forma consistente.

No entanto, a pontuação final não observa diretamente todo o processo que conduziu à resposta. Um modelo pode produzir raciocínio correto, mas terminar com um formato que o extrator não reconhece. Pode também chegar ao inteiro correto por meio de uma cadeia de passos defeituosa que a correção exata não inspeciona. Por definição, o benchmark pontua a resposta final recuperada pelo harness, e não a qualidade de uma demonstração matemática.

Daqui não decorre que um bom resultado não tenha valor. Ele indica desempenho numa tarefa delimitada, com problemas de estilo competitivo e respostas inteiras verificáveis. O que não permite estabelecer sozinho é capacidade geral de raciocínio, aptidão para redigir demonstrações auditáveis, precisão em tarefas profissionais, fiabilidade em domínios com informação incompleta ou desempenho perante distribuições novas de problemas. Essas conclusões exigiriam avaliações adicionais e uma relação demonstrada entre o teste e o caso de uso.

Também convém separar competência matemática de produto. Um sistema útil para analistas, cientistas ou engenheiros precisa, conforme o contexto, de interpretar requisitos, declarar pressupostos, usar dados externos de forma rastreável, detetar incerteza e comunicar limitações. Nenhuma destas propriedades é plenamente medida por trinta respostas inteiras.

O que se pode inferir da AIME 2024 — e o que não se pode

ObservaçãoInferência razoávelInferência não justificada sem evidência adicional
Pontuação elevada sob um protocolo documentadoO sistema resolveu muitos itens desse conjunto nessas condiçõesQue raciocina corretamente em qualquer domínio ou tarefa
Resposta final exataO inteiro extraído coincidiu com a chave do itemQue a explicação ou demonstração era válida
Melhoria com ferramentasAs ferramentas e o fluxo usado acrescentaram desempenho nessa execuçãoQue o modelo de base, sem esse fluxo, tem o mesmo nível
Resultado sobre quinze itensExiste uma estimativa sobre esse subconjuntoQue representa de forma idêntica os trinta itens ou outro exame
03

A ficha mínima que deve acompanhar um resultado

Uma afirmação publicável deveria permitir que outra pessoa reconstruísse o que foi medido, mesmo que não consiga repetir todos os cálculos. A primeira linha da ficha é o conjunto: indicar AIME I, AIME II ou ambas, o número de problemas e a fonte ou versão dos enunciados. A segunda é a identidade do sistema: nome exato do modelo, snapshot ou data, fornecedor e, quando aplicável, configuração de raciocínio.

Em seguida, deve ser declarado o modo de geração. Isto inclui o prompt completo ou uma descrição suficiente das suas instruções de formato, a temperatura e outros parâmetros de amostragem, o máximo de tokens, limites de tempo, número de chamadas por problema e qualquer interrupção ou nova tentativa. Quando estes dados faltam, o leitor não consegue distinguir um resultado de uma amostra de uma pesquisa intensiva entre muitas trajetórias.

A ficha deve também separar modelo e ambiente. Havia calculadora, execução de código, navegação, recuperação de documentos ou outras ferramentas? O sistema podia verificar os seus próprios resultados? Um procedimento externo escolheu a melhor resposta? Estas condições podem ser adequadas se refletirem o uso previsto, mas devem constar junto da percentagem, e não ficar escondidas sob o nome do modelo.

Por fim, é necessário descrever o harness. Uma implementação documentada da AIME 2024 usa um prompt de saída na forma «ANSWER: $ANSWER», correção por correspondência exata e alterações no scorer relacionadas com LaTeX e respostas vazias. Detalhes deste tipo mostram porque o parser não é uma questão administrativa: ele decide que texto se converte num inteiro e que saída é declarada inválida. A política para respostas ausentes, respostas múltiplas, texto ambíguo e erros de formato deve ser explícita.

Processo para converter uma manchete numa ficha auditável

  1. 01Identificar o conjunto exato e contar os itens efetivamente pontuados.
  2. 02Registar a versão do modelo, a data da avaliação e os parâmetros de geração.
  3. 03Classificar o resultado como uma amostra, múltiplas amostras, consenso, reranking ou uma combinação.
  4. 04Anotar ferramentas, orçamento de tokens, tempo e número total de chamadas.
  5. 05Documentar prompt, extrator, tratamento de erros e fórmula de agregação.
  6. 06Rotular a comparabilidade com outros resultados como direta, parcial ou não estabelecida.
04

Uma execução pode produzir muitos resultados diferentes

Pass@1 responde a uma pergunta simples: com uma única amostra por problema, quantas respostas finais estavam corretas? É normalmente a leitura mais próxima de uma interação única, desde que também sejam especificados o prompt, a temperatura, o orçamento e as ferramentas. Ainda assim, não é necessariamente o retrato de uma conversa real: pode incluir instruções desenhadas especificamente para o benchmark.

Pass@k muda a pergunta. Em vez de uma oportunidade, são geradas várias respostas por problema e pergunta-se se alguma delas acerta. Este valor pode servir para estudar o potencial de pesquisa do sistema, mas aumenta com o número de tentativas e não equivale à probabilidade de sucesso de uma única resposta entregue a uma pessoa utilizadora. Publicar pass@k sem o valor de k impede interpretar o resultado.

O voto maioritário, ou consenso, gera múltiplas respostas e escolhe a que recebe mais apoio segundo uma regra definida. Pode melhorar a estabilidade quando várias trajetórias chegam à mesma solução, mas não garante a verdade: as tentativas podem partilhar o mesmo erro. O seu desempenho depende do número de amostras, de como respostas equivalentes são agrupadas e do que acontece com formatos que não podem ser extraídos.

O reranking acrescenta outro componente: depois de produzir candidatos, um seletor escolhe um deles. Esse seletor pode ser o próprio modelo, um verificador, uma heurística, uma ferramenta ou um sistema diferente. Por isso, um resultado com reranking mede um pipeline completo. Não deve ser atribuído automaticamente ao modelo gerador isolado. Uma publicação da OpenAI distingue explicitamente resultados de uma amostra, de consenso com dezenas de amostras e de reranking com um número muito maior de amostras; essa distinção é metodologicamente essencial.

As ferramentas introduzem outra bifurcação. Uma calculadora ou um ambiente de código pode reduzir erros aritméticos; uma pesquisa externa pode fornecer informação não contida no prompt. Nenhuma destas opções é intrinsecamente ilegítima, mas «com ferramentas» e «sem ferramentas» respondem a perguntas diferentes. As model cards que publicam ambas as condições oferecem uma referência mais informativa do que uma única percentagem.

05

Porque uma percentagem aparentemente idêntica pode não corresponder ao mesmo número de acertos

Num conjunto de trinta problemas, cada acerto representa uma fração apreciável do total. Se for comunicada uma percentagem com casas decimais, ela pode resultar de uma única execução, de várias repetições, de uma média entre subconjuntos ou de uma agregação sobre configurações. Num conjunto de quinze, os saltos de uma execução individual são ainda maiores. Assim, um valor como 80% não permite deduzir automaticamente um número inteiro de acertos nem o número de problemas avaliados.

O arredondamento é apenas uma parte do problema. Um fornecedor pode comunicar a média de muitas execuções; outro, o melhor resultado de uma execução; um terceiro, a média dos resultados por pergunta depois de amostrar várias vezes. Estas decisões podem ser defensáveis para objetivos diferentes, mas têm de ser nomeadas. Um valor sem denominador, dispersão ou procedimento de agregação não deve ser interpretado como uma medida precisa.

A comparabilidade exige manter constantes, ou pelo menos declarar, os elementos que afetam a dificuldade efetiva: conjunto, versão dos enunciados, modelo, prompt, ferramentas, geração, extração e pontuação. Se algum diferir, a comparação pode continuar a ser indicativa, mas não deve transformar-se sem mais num ranking de capacidade.

Regra prática de comparabilidade

SituaçãoVereditoComo comunicá-la
Os mesmos trinta itens, o mesmo harness, uma amostra e a mesma disponibilidade de ferramentasComparável de forma relativamente diretaIndicar versões do modelo e data
O mesmo conjunto, mas pass@1 face a consenso ou rerankingNão comparável como capacidade de uma única amostraComparar apenas como pipelines, com custo e número de amostras
Quinze itens face a trinta, embora ambos se chamem AIME 2024Comparabilidade parcialMostrar denominadores e evitar um ranking único
A mesma percentagem sem prompt, parser ou tratamento de errosNão estabelecidaPedir documentação antes de concluir
Com ferramentas face a sem ferramentasNão comparável como modelo isoladoSeparar as colunas e descrever as ferramentas
06

Exposição prévia, disponibilidade pública e saturação

A AIME 2024 deve também ser analisada como um conjunto que esteve publicamente disponível. Trabalhos sobre avaliação em competições matemáticas não contaminadas tratam essa disponibilidade como um motivo razoável de preocupação: um modelo ou sistema de recuperação pode ter sido exposto a problemas, soluções, discussões ou variantes durante o seu desenvolvimento. Isto não demonstra que um modelo concreto tenha sido treinado com esses itens, nem permite atribuir qualquer bom resultado à memorização.

A formulação prudente é condicional. A exposição prévia é um risco de validade que deve ser declarado quando não há informação suficiente sobre os dados de treino, os dados de ajuste, a recuperação e a data de corte. A ausência de uma prova pública de exposição também não demonstra independência. Entre estes dois extremos, existe incerteza, e não uma conclusão automática.

Pode pedir-se a um fornecedor evidência proporcional: data de corte dos dados, descrição dos filtros de dados de avaliação, política sobre material de competições, data de disponibilidade do modelo e detalhes de qualquer ferramenta de recuperação. Se não puder fornecê-la, o resultado pode manter-se como evidência contextual, mas com um limite claro: não deveria funcionar como prova única de generalização para problemas inéditos.

A saturação tem ainda uma consequência prática. Quanto mais popular se torna um benchmark, maior é a probabilidade de prompts, soluções, estratégias e configurações de avaliação circularem amplamente. Para decisões de produto, convém tratar a AIME 2024 como um sinal histórico e complementá-la com uma bateria privada, recente e representativa do trabalho real, respeitando as políticas de utilização e reprodução dos materiais da competição.

07

Como usar a AIME 2024 numa decisão de produto

Para uma pessoa responsável tecnicamente, a AIME 2024 pode servir como sinal secundário na pré-seleção de sistemas que resolvem problemas matemáticos estruturados. A sua maior utilidade surge quando é acompanhada de um protocolo claro e quando é comparada com resultados obtidos nas mesmas condições. Não convém transformá-la num limiar único de compra, implementação ou segurança.

A avaliação complementar depende do caso. Se o produto gera análises quantitativas, são pertinentes tarefas próprias com dados, unidades, pressupostos e revisão de cálculos. Se tem de explicar resultados, é necessário avaliar clareza, rastreabilidade e deteção de erros, e não apenas o inteiro final. Se opera com ferramentas, deve medir-se o pipeline completo, incluindo permissões, custo, latência, falhas das ferramentas e verificação. Se a preocupação é conhecimento especializado, um benchmark como o GPQA Diamond pode fornecer um sinal diferente, mas também não substitui testes do fluxo de trabalho específico.

Também é importante separar eficiência e resultado. Dois sistemas com precisão semelhante podem exigir números muito diferentes de amostras, tokens, chamadas ou tempo. Em produção, essas diferenças afetam custo, latência, capacidade e previsibilidade. Uma tabela de benchmarks sem orçamento de inferência pode ocultar uma diferença decisiva para o caso de uso.

Quem comparar uma ficha do DeepSeek-R1, uma ficha do GPT-6 Astra ou de outros modelos deve aplicar a mesma disciplina, sem inferir condições não publicadas a partir da marca. O nome comercial não substitui o snapshot, nem um número atribuído a uma organização substitui a documentação do protocolo. O índice de benchmarks e a ficha específica da AIME 2024 são o local adequado para preservar estas condições junto de cada resultado.

Checklist final antes de reutilizar um resultado da AIME 2024

  1. 01Sabe-se se o resultado cobre quinze ou trinta problemas, e quais são?
  2. 02O modelo ou snapshot exato e a data de execução são identificados?
  3. 03É pass@1, pass@k, consenso, reranking ou um método misto?
  4. 04Quantas amostras, tokens, chamadas e tempo foram usados por problema?
  5. 05Havia ferramentas ou verificadores externos?
  6. 06São publicados o prompt, o harness, o parser e a política para saídas não extraíveis?
  7. 07A percentagem resulta de uma execução, de uma média ou do melhor valor observado?
  8. 08Foi declarada a incerteza sobre exposição prévia e disponibilidade pública?
  9. 09A decisão apoia-se também em avaliações representativas, recentes e próprias?

Questões em aberto

  • As fontes disponíveis não permitem estabelecer se um modelo concreto foi treinado, ajustado ou previamente avaliado com problemas ou soluções da AIME 2024.
  • Nem todos os resultados públicos informam o prompt, a temperatura, o orçamento de tokens, o parser, o número de repetições ou o tratamento de respostas não extraíveis.
  • Um resultado isolado atribuído a um modelo não permite inferir o custo, a latência nem a fiabilidade de um pipeline de produção.
  • A comparabilidade entre implementações diferentes da AIME 2024 pode ser parcial ou não estar estabelecida, mesmo que partilhem o mesmo nome de benchmark.
08

Continue a explorar

08

Fontes consultadas

03

Correções e transparência

Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.

Propor uma correção