Versão exata
Verifique o identificador do modelo, a data e se o alias pode mudar.
Resultados publicados e condições declaradas pelas fontes. Os números só são comparáveis quando versão, configuração, métrica e data coincidem.
| Modelo | Organização | Resultado | Métrica | Condições |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 52,7 % | Exatidão | Tabela oficial do GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 50,4 % | Exatidão | Tabela oficial do GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 50,3 % | Exatidão | Tabela oficial do GPT‑5.6. |
Verifique o identificador do modelo, a data e se o alias pode mudar.
Verifique ferramentas, esforço, número de tentativas, prompt e orçamento de inferência.
Valide o resultado com tarefas, idiomas, formatos e erros representativos do seu produto.
Um benchmark público orienta, mas não substitui uma avaliação com os teus dados, ferramentas, orçamento e tolerância ao erro.
Um alias móvel e um snapshot podem produzir resultados diferentes. Regista o modelo, a data e o fornecedor.
O prompt, o raciocínio, as ferramentas, o número de tentativas e o orçamento devem ser equivalentes para comparar.
Uma diferença pequena pode desaparecer entre execuções. Conserva amostras, dispersão e falhas, não apenas a média.
Valida se a melhoria se mantém em idiomas, formatos e casos reais próximos do teu produto.
Uma métrica só é útil quando conhecemos a tarefa, as condições e o erro que importa. O resultado começa com o desenho do teste.
O AutomationBench avalia se um agente consegue concluir fluxos entre aplicações SaaS simuladas e levá-los a um estado final verificável. Este guia explica o que essa evidência significa, como interpretar as suas métricas e que testes adicionais são necessários antes de extrapolar um resultado para uma empresa real.
22 set 2026 ↗ PAPERO Agents’ Last Exam avalia agentes em tarefas profissionais dentro de ambientes de sistema operacional, com resultados verificáveis. Seu desenho é útil para estudar a execução de fluxos de trabalho, mas uma taxa agregada de sucesso não demonstra que um emprego possa ser automatizado. Para interpretá-la, são necessários detalhes sobre as tarefas, o ambiente, o harness, o modelo, as ferramentas, o orçamento e a versão avaliada.
22 set 2026 ↗