Versão exata
Verifique o identificador do modelo, a data e se o alias pode mudar.
Resultados publicados e condições declaradas pelas fontes. Os números só são comparáveis quando versão, configuração, métrica e data coincidem.
| Modelo | Organização | Resultado | Métrica | Condições |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 64,6 % | Resolvido | Tabela oficial do GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 63,4 % | Resolvido | Tabela oficial do GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 62,7 % | Resolvido | Tabela oficial do GPT‑5.6. |
| Gemini 3.1 Pro | 54,2 % | Resolvido | Valor reproduzido na tabela comparativa da OpenAI. | |
| GLM‑5.1 | Z.AI | 58,4 % | Resolvido | Resultado publicado pela Z.AI. |
Verifique o identificador do modelo, a data e se o alias pode mudar.
Verifique ferramentas, esforço, número de tentativas, prompt e orçamento de inferência.
Valide o resultado com tarefas, idiomas, formatos e erros representativos do seu produto.
Um benchmark público orienta, mas não substitui uma avaliação com os teus dados, ferramentas, orçamento e tolerância ao erro.
Um alias móvel e um snapshot podem produzir resultados diferentes. Regista o modelo, a data e o fornecedor.
O prompt, o raciocínio, as ferramentas, o número de tentativas e o orçamento devem ser equivalentes para comparar.
Uma diferença pequena pode desaparecer entre execuções. Conserva amostras, dispersão e falhas, não apenas a média.
Valida se a melhoria se mantém em idiomas, formatos e casos reais próximos do teu produto.
Uma métrica só é útil quando conhecemos a tarefa, as condições e o erro que importa. O resultado começa com o desenho do teste.