ORGANIZACIÓN VERIFICADA

Anthropic

Consulta los modelos documentados, las evaluaciones publicadas y las fuentes primarias asociadas a esta organización.

01 / MODELOS

Catálogo verificado

02 / EVALUACIONES

Resultados publicados

Las cifras se muestran con el contexto comunicado por su fuente. Un resultado del proveedor no equivale a una comparación independiente ni sustituye una evaluación propia.

ModeloBenchmarkResultadoMétrica
Claude Opus 5Terminal-Bench Science 0.129,0 %Exactitud
Claude Opus 5CursorBench 3.270,0 %Exactitud
Claude Opus 5AutomationBench26,9 %Exactitud
Claude Fable 5.1Terminal-Bench Science 0.152,6 %Exactitud
Claude Fable 5.1CursorBench 3.273,4 %Exactitud
Claude Fable 5.1Humanity's Last Exam65,0 %Con herramientas
Claude Sonnet 5OSWorld-VerifiedCurva por esfuerzoÉxito y coste
Claude Sonnet 5BrowseCompCurva por esfuerzoExactitud y coste
Claude Haiku 4.5SWE-bench Verified73,3 %Resuelto
Claude Haiku 4.5Terminal-Bench41,75 %Con pensamiento
Claude Opus 4.5Evaluaciones Claude Opus 4.5PublicadasCódigo, agentes y ordenador
Claude Sonnet 4.5OSWorld61,4 %Tareas de ordenador resueltas
Claude Opus 5.5Terminal-Bench 4.066,4 %Exactitud
Claude Opus 5.5GDPval-AA v2.11.846Elo
Claude Sonnet 5.5Terminal-Bench 4.070,6 %Exactitud
03 / MÉTODO

Cómo leer el directorio

Una organización, un producto y un modelo no son la misma unidad. Inferama los separa para evitar atribuir capacidades o condiciones comerciales al elemento equivocado.

01

Laboratorio

Entidad que desarrolla o publica el modelo y mantiene su documentación técnica y de seguridad.

02

Modelo

Versión identificable con límites, modalidades y comportamiento que pueden cambiar entre lanzamientos.

03

Canal de acceso

API, aplicación, nube asociada o plan comercial; cada canal puede tener precios, retención y límites distintos.

04

Fuente y fecha

Cada afirmación debe conservar la página oficial consultada y la fecha de verificación.

ANÁLISIS

Análisis relacionados

Claude Sonnet 4.5 con herramientas: calcula el coste de una tarea, no solo de una llamada
GUIA

Claude Sonnet 4.5 con herramientas: calcula el coste de una tarea, no solo de una llamada

Una plantilla para estimar el gasto de un flujo de herramientas por rondas, distinguir tokens de entrada y salida de cargos adicionales y contrastar el cálculo con los registros de uso.

28 sep. 2026
Claude Opus 4.5 en tareas largas: calcula el coste por trabajo terminado
GUIA

Claude Opus 4.5 en tareas largas: calcula el coste por trabajo terminado

Una tarifa por millón de tokens no basta para presupuestar un flujo de varios pasos. Aprende a sumar entrada, salida, caché, reintentos y revisión, y a fijar límites antes de ejecutar.

25 sep. 2026
Claude Sonnet 5: cómo medir el efecto de su nuevo tokenizador antes de migrar
ANALISIS

Claude Sonnet 5: cómo medir el efecto de su nuevo tokenizador antes de migrar

Anthropic indica que el mismo texto puede convertirse en más tokens con Sonnet 5 que con Sonnet 4.6. Un protocolo con corpus propio permite comprobar si eso reduce el contexto útil o modifica el coste por tarea en una integración concreta.

23 sep. 2026
Claude Sonnet 4.5 en ciencias de la vida: qué demuestran sus resultados y cómo revalidarlos
ANALISIS

Claude Sonnet 4.5 en ciencias de la vida: qué demuestran sus resultados y cómo revalidarlos

Las puntuaciones de Sonnet 4.5 en tareas de investigación biológica justifican una evaluación interna, no una conclusión sobre su fiabilidad experimental. Qué miden Protocol QA, LAB-Bench y BixBench, qué no miden y cómo diseñar una prueba retrospectiva controlada.

23 sep. 2026
Claude Haiku 4.5: cómo calcular el coste por respuesta utilizable
GUIA

Claude Haiku 4.5: cómo calcular el coste por respuesta utilizable

La tarifa por llamada no revela por sí sola cuánto cuesta una respuesta que el equipo acepta. Esta guía presenta una fórmula reproducible para sumar tokens de entrada y salida, reintentos y revisión, con tres escenarios ilustrativos para Claude Haiku 4.5.

23 sep. 2026
Claude Opus 5 en tareas de escritorio: qué evidencia hace falta antes de darle control de una interfaz
ANALISIS

Claude Opus 5 en tareas de escritorio: qué evidencia hace falta antes de darle control de una interfaz

Una puntuación de benchmark no demuestra que un modelo pueda operar una aplicación de forma segura. Proponemos una evaluación acotada para medir éxito, errores, recuperación, latencia y necesidad de supervisión.

23 sep. 2026
04 / FUENTES

Trazabilidad