Versão exata
Verifique o identificador do modelo, a data e se o alias pode mudar.
Resultados publicados e condições declaradas pelas fontes. Os números só são comparáveis quando versão, configuração, métrica e data coincidem.
| Modelo | Organização | Resultado | Métrica | Condições |
|---|---|---|---|---|
| GPT‑6 Astra | OpenAI | 96,0 % | Exatidão | Resultado do fornecedor. |
| DeepSeek V4.1 Flash | DeepSeek | 90,9 % | Exatidão | DeepSeek Harness, esforço max e configuração publicados. |
| Qwen3‑Max Thinking | Alibaba Qwen | 92,8 % | Exatidão | Escalonamento de inferência publicado pela Qwen. |
Verifique o identificador do modelo, a data e se o alias pode mudar.
Verifique ferramentas, esforço, número de tentativas, prompt e orçamento de inferência.
Valide o resultado com tarefas, idiomas, formatos e erros representativos do seu produto.
Um benchmark público orienta, mas não substitui uma avaliação com os teus dados, ferramentas, orçamento e tolerância ao erro.
Um alias móvel e um snapshot podem produzir resultados diferentes. Regista o modelo, a data e o fornecedor.
O prompt, o raciocínio, as ferramentas, o número de tentativas e o orçamento devem ser equivalentes para comparar.
Uma diferença pequena pode desaparecer entre execuções. Conserva amostras, dispersão e falhas, não apenas a média.
Valida se a melhoria se mantém em idiomas, formatos e casos reais próximos do teu produto.
Uma métrica só é útil quando conhecemos a tarefa, as condições e o erro que importa. O resultado começa com o desenho do teste.
Uma comparação útil entre DeepSeek R1 e DeepSeek V3.2 não começa por um benchmark publicado, mas por uma tarefa própria, um corpus congelado e uma definição explícita de erro material. Este protocolo permite medir se a deliberação adicional do R1 reduz erros e revisões humanas ou se o V3.2 atinge o mesmo patamar com menor latência, consumo e complexidade.
22 set 2026 ↗ ANALISISUm resultado de AIME 2024 parece simples, mas pode resumir protocolos muito diferentes. Este guia explica o que o conjunto representa, como o resultado muda consoante o número de tentativas, a seleção de respostas, as ferramentas e o harness, e que informação pedir antes de comparar modelos.
22 set 2026 ↗