ORGANIZAÇÃO VERIFICADA

Anthropic

Consulte os modelos documentados, as avaliações publicadas e as fontes primárias associadas a esta organização.

01 / MODELOS

Catálogo verificado

02 / AVALIAÇÕES

Resultados publicados

Os números são apresentados com o contexto comunicado pela fonte. Um resultado do fornecedor não equivale a uma comparação independente nem substitui uma avaliação própria.

ModeloBenchmarkResultadoMétrica
Claude Opus 5Terminal-Bench Science 0.129,0 %Exatidão
Claude Opus 5CursorBench 3.270,0 %Exatidão
Claude Opus 5AutomationBench26,9 %Exatidão
Claude Fable 5.1Terminal-Bench Science 0.152,6 %Exatidão
Claude Fable 5.1CursorBench 3.273,4 %Exatidão
Claude Fable 5.1Humanity's Last Exam65,0 %Com ferramentas
Claude Sonnet 5OSWorld-VerifiedCurva por nível de esforçoSucesso e custo
Claude Sonnet 5BrowseCompCurva por nível de esforçoExatidão e custo
Claude Haiku 4.5SWE-bench Verified73,3 %Resolvido
Claude Haiku 4.5Terminal-Bench41,75 %Com raciocínio
Claude Opus 4.5Evaluaciones Claude Opus 4.5PublicadasCódigo, agentes e computador
Claude Sonnet 4.5OSWorld61,4 %Tarefas de computador resolvidas
Claude Opus 5.5Terminal-Bench 4.066,4 %Exatidão
Claude Opus 5.5GDPval-AA v2.11.846Elo
Claude Sonnet 5.5Terminal-Bench 4.070,6 %Exatidão
03 / MÉTODO

Como ler o diretório

Uma organização, um produto e um modelo não são a mesma unidade. A Inferama separa-os para evitar atribuir capacidades ou condições comerciais ao elemento errado.

01

Laboratório

Entidade que desenvolve ou publica o modelo e mantém a respetiva documentação técnica e de segurança.

02

Modelo

Versão identificável com limites, modalidades e comportamento que podem mudar entre lançamentos.

03

Canal de acesso

API, aplicação, nuvem associada ou plano comercial; cada canal pode ter preços, retenção e limites distintos.

04

Fonte e data

Cada afirmação deve conservar a página oficial consultada e a data de verificação.

ANÁLISE

Análises relacionadas

Claude Sonnet 4.5 com ferramentas: calcule o custo de uma tarefa, não apenas de uma chamada
GUIA

Claude Sonnet 4.5 com ferramentas: calcule o custo de uma tarefa, não apenas de uma chamada

Um modelo para estimar o gasto de um fluxo com ferramentas por rodada, separar tokens de entrada e saída de cobranças adicionais e comparar o cálculo com os registros de uso.

28 set 2026
Claude Opus 4.5 em tarefas longas: calcule o custo por trabalho concluído
GUIA

Claude Opus 4.5 em tarefas longas: calcule o custo por trabalho concluído

O preço por milhão de tokens não basta para orçamentar um fluxo com várias etapas. Saiba somar entrada, saída, cache, tentativas novamente e revisão, e definir limites antes de executar.

25 set 2026
Claude Sonnet 5: como medir o efeito do novo tokenizador antes de migrar
ANALISIS

Claude Sonnet 5: como medir o efeito do novo tokenizador antes de migrar

A Anthropic informa que o mesmo texto pode se transformar em mais tokens no Sonnet 5 do que no Sonnet 4.6. Um protocolo com um corpus próprio permite verificar se isso reduz o contexto útil ou altera o custo por tarefa em uma integração específica.

23 set 2026
Claude Sonnet 4.5 nas ciências da vida: o que os resultados demonstram e como revalidá-los
ANALISIS

Claude Sonnet 4.5 nas ciências da vida: o que os resultados demonstram e como revalidá-los

As pontuações do Sonnet 4.5 em tarefas de pesquisa biológica justificam uma avaliação interna, não uma conclusão sobre sua confiabilidade experimental. Veja o que Protocol QA, LAB-Bench e BixBench medem — e o que não medem — e como elaborar um teste retrospectivo controlado.

23 set 2026
Claude Haiku 4.5: como calcular o custo por resposta utilizável
GUIA

Claude Haiku 4.5: como calcular o custo por resposta utilizável

O preço por chamada, por si só, não revela quanto custa uma resposta que a equipa aceita. Este guia apresenta uma fórmula reproduzível para somar tokens de entrada e saída, novas tentativas e revisão, com três cenários ilustrativos para o Claude Haiku 4.5.

23 set 2026
Claude Opus 5 em tarefas de desktop: que evidências são necessárias antes de lhe dar controlo sobre uma interface
ANALISIS

Claude Opus 5 em tarefas de desktop: que evidências são necessárias antes de lhe dar controlo sobre uma interface

Uma pontuação num benchmark não demonstra que um modelo consegue operar uma aplicação em segurança. Propomos uma avaliação delimitada para medir o sucesso, os erros, a recuperação, a latência e a necessidade de supervisão.

23 set 2026
04 / FONTES

Rastreabilidade