Que tarefas ele contém?
Cobertura, dificuldade, linguagem, atualidade e possível contaminação.
AmostraUma métrica só é útil quando conhecemos a tarefa, as condições e o erro que importa.
O resultado começa com o desenho do teste.
Cobertura, dificuldade, linguagem, atualidade e possível contaminação.
AmostraPrecisão, preferência humana, custo, tempo ou taxa de sucesso.
MirarPrompt, ferramentas, raciocínio, amostras e orçamento.
EquidadeTransforme necessidades reais em um conjunto pequeno e repetível.
Inclui casos normais, arestas e falhas dispendiosas.
CasosSepara correção, utilidade, segurança e formato.
CritérioModelo, recuperação, ferramentas, latência e custo.
ProduçãoUm benchmark público orienta, mas não substitui uma avaliação com os teus dados, ferramentas, orçamento e tolerância ao erro.
Um alias móvel e um snapshot podem produzir resultados diferentes. Regista o modelo, a data e o fornecedor.
O prompt, o raciocínio, as ferramentas, o número de tentativas e o orçamento devem ser equivalentes para comparar.
Uma diferença pequena pode desaparecer entre execuções. Conserva amostras, dispersão e falhas, não apenas a média.
Valida se a melhoria se mantém em idiomas, formatos e casos reais próximos do teu produto.
Referencias utilizadas para ampliar y revisar esta página.