Laboratório
Entidade que desenvolve ou publica o modelo e mantém a respetiva documentação técnica e de segurança.
Consulte os modelos documentados, as avaliações publicadas e as fontes primárias associadas a esta organização.
Modelo orientado ao trabalho de código e conhecimento, com controles que permitem ajustar o esforço a cada tarefa.
16 SET 2026↗ RACIOCÍNIO PROLONGADORaciocínio e agentes de longa duração.
16 SET 2026↗ EQUILÍBRIO CUSTO/CAPACIDADECódigo, pesquisa e fluxos profissionais com ferramentas.
16 SET 2026↗ ALTA EFICIÊNCIAAlto volume, subagentes e extração estruturada.
16 SET 2026↗ FRONTEIRA ANTERIOR · AGENTESVersão anterior do Opus orientada para código, agentes e utilização de computador, mantida para migração e comparação histórica.
18 SET 2026↗ AGENTES E UTILIZAÇÃO DE COMPUTADORGeração anterior do Sonnet para código, agentes e automatização de interfaces, com resultados oficiais de computer use.
18 SET 2026↗ PROGRAMAÇÃO AGÊNTICA E TRABALHO DE CONHECIMENTONova geração Opus para programação agêntica, utilização do computador e trabalho profissional prolongado, com um contexto de um milhão de tokens.
29 SET 2026↗ INTELIGÊNCIA E VELOCIDADE EQUILIBRADASAtualização do Sonnet para tarefas do dia a dia, código e documentos, com maior velocidade e um milhão de tokens de contexto.
29 SET 2026↗Os números são apresentados com o contexto comunicado pela fonte. Um resultado do fornecedor não equivale a uma comparação independente nem substitui uma avaliação própria.
| Modelo | Benchmark | Resultado | Métrica |
|---|---|---|---|
| Claude Opus 5 | Terminal-Bench Science 0.1 | 29,0 % | Exatidão |
| Claude Opus 5 | CursorBench 3.2 | 70,0 % | Exatidão |
| Claude Opus 5 | AutomationBench | 26,9 % | Exatidão |
| Claude Fable 5.1 | Terminal-Bench Science 0.1 | 52,6 % | Exatidão |
| Claude Fable 5.1 | CursorBench 3.2 | 73,4 % | Exatidão |
| Claude Fable 5.1 | Humanity's Last Exam | 65,0 % | Com ferramentas |
| Claude Sonnet 5 | OSWorld-Verified | Curva por nível de esforço | Sucesso e custo |
| Claude Sonnet 5 | BrowseComp | Curva por nível de esforço | Exatidão e custo |
| Claude Haiku 4.5 | SWE-bench Verified | 73,3 % | Resolvido |
| Claude Haiku 4.5 | Terminal-Bench | 41,75 % | Com raciocínio |
| Claude Opus 4.5 | Evaluaciones Claude Opus 4.5 | Publicadas | Código, agentes e computador |
| Claude Sonnet 4.5 | OSWorld | 61,4 % | Tarefas de computador resolvidas |
| Claude Opus 5.5 | Terminal-Bench 4.0 | 66,4 % | Exatidão |
| Claude Opus 5.5 | GDPval-AA v2.1 | 1.846 | Elo |
| Claude Sonnet 5.5 | Terminal-Bench 4.0 | 70,6 % | Exatidão |
Uma organização, um produto e um modelo não são a mesma unidade. A Inferama separa-os para evitar atribuir capacidades ou condições comerciais ao elemento errado.
Entidade que desenvolve ou publica o modelo e mantém a respetiva documentação técnica e de segurança.
Versão identificável com limites, modalidades e comportamento que podem mudar entre lançamentos.
API, aplicação, nuvem associada ou plano comercial; cada canal pode ter preços, retenção e limites distintos.
Cada afirmação deve conservar a página oficial consultada e a data de verificação.
Um modelo para estimar o gasto de um fluxo com ferramentas por rodada, separar tokens de entrada e saída de cobranças adicionais e comparar o cálculo com os registros de uso.
28 set 2026 ↗ GUIAO preço por milhão de tokens não basta para orçamentar um fluxo com várias etapas. Saiba somar entrada, saída, cache, tentativas novamente e revisão, e definir limites antes de executar.
25 set 2026 ↗ ANALISISA Anthropic informa que o mesmo texto pode se transformar em mais tokens no Sonnet 5 do que no Sonnet 4.6. Um protocolo com um corpus próprio permite verificar se isso reduz o contexto útil ou altera o custo por tarefa em uma integração específica.
23 set 2026 ↗ ANALISISAs pontuações do Sonnet 4.5 em tarefas de pesquisa biológica justificam uma avaliação interna, não uma conclusão sobre sua confiabilidade experimental. Veja o que Protocol QA, LAB-Bench e BixBench medem — e o que não medem — e como elaborar um teste retrospectivo controlado.
23 set 2026 ↗ GUIAO preço por chamada, por si só, não revela quanto custa uma resposta que a equipa aceita. Este guia apresenta uma fórmula reproduzível para somar tokens de entrada e saída, novas tentativas e revisão, com três cenários ilustrativos para o Claude Haiku 4.5.
23 set 2026 ↗ ANALISISUma pontuação num benchmark não demonstra que um modelo consegue operar uma aplicação em segurança. Propomos uma avaliação delimitada para medir o sucesso, os erros, a recuperação, a latência e a necessidade de supervisão.
23 set 2026 ↗