Laboratorio
Entidad que desarrolla o publica el modelo y mantiene su documentación técnica y de seguridad.
Consulta los modelos documentados, las evaluaciones publicadas y las fuentes primarias asociadas a esta organización.
Modelo orientado a código y trabajo de conocimiento, con controles que permiten ajustar el esfuerzo a cada tarea.
16 SEP. 2026↗ RAZONAMIENTO PROLONGADORazonamiento y agentes de larga duración.
16 SEP. 2026↗ EQUILIBRIO COSTE/CAPACIDADCódigo, investigación y flujos profesionales con herramientas.
16 SEP. 2026↗ ALTA EFICIENCIAAlto volumen, subagentes y extracción estructurada.
16 SEP. 2026↗ FRONTERA ANTERIOR · AGENTESVersión anterior de Opus orientada a código, agentes y uso de ordenador, conservada para migración y comparación histórica.
18 SEP. 2026↗ AGENTES Y USO DE ORDENADORGeneración anterior de Sonnet para código, agentes y automatización de interfaces, con resultados oficiales de computer use.
18 SEP. 2026↗ CÓDIGO AGENTIVO Y TRABAJO DE CONOCIMIENTONueva generación Opus para código agentivo, uso de ordenador y trabajo profesional prolongado, con contexto de un millón de tokens.
29 SEP. 2026↗ INTELIGENCIA Y VELOCIDAD EQUILIBRADASActualización de Sonnet para tareas cotidianas, código y documentos con mejor velocidad y un millón de tokens de contexto.
29 SEP. 2026↗Las cifras se muestran con el contexto comunicado por su fuente. Un resultado del proveedor no equivale a una comparación independiente ni sustituye una evaluación propia.
| Modelo | Benchmark | Resultado | Métrica |
|---|---|---|---|
| Claude Opus 5 | Terminal-Bench Science 0.1 | 29,0 % | Exactitud |
| Claude Opus 5 | CursorBench 3.2 | 70,0 % | Exactitud |
| Claude Opus 5 | AutomationBench | 26,9 % | Exactitud |
| Claude Fable 5.1 | Terminal-Bench Science 0.1 | 52,6 % | Exactitud |
| Claude Fable 5.1 | CursorBench 3.2 | 73,4 % | Exactitud |
| Claude Fable 5.1 | Humanity's Last Exam | 65,0 % | Con herramientas |
| Claude Sonnet 5 | OSWorld-Verified | Curva por esfuerzo | Éxito y coste |
| Claude Sonnet 5 | BrowseComp | Curva por esfuerzo | Exactitud y coste |
| Claude Haiku 4.5 | SWE-bench Verified | 73,3 % | Resuelto |
| Claude Haiku 4.5 | Terminal-Bench | 41,75 % | Con pensamiento |
| Claude Opus 4.5 | Evaluaciones Claude Opus 4.5 | Publicadas | Código, agentes y ordenador |
| Claude Sonnet 4.5 | OSWorld | 61,4 % | Tareas de ordenador resueltas |
| Claude Opus 5.5 | Terminal-Bench 4.0 | 66,4 % | Exactitud |
| Claude Opus 5.5 | GDPval-AA v2.1 | 1.846 | Elo |
| Claude Sonnet 5.5 | Terminal-Bench 4.0 | 70,6 % | Exactitud |
Una organización, un producto y un modelo no son la misma unidad. Inferama los separa para evitar atribuir capacidades o condiciones comerciales al elemento equivocado.
Entidad que desarrolla o publica el modelo y mantiene su documentación técnica y de seguridad.
Versión identificable con límites, modalidades y comportamiento que pueden cambiar entre lanzamientos.
API, aplicación, nube asociada o plan comercial; cada canal puede tener precios, retención y límites distintos.
Cada afirmación debe conservar la página oficial consultada y la fecha de verificación.
Una plantilla para estimar el gasto de un flujo de herramientas por rondas, distinguir tokens de entrada y salida de cargos adicionales y contrastar el cálculo con los registros de uso.
28 sep. 2026 ↗ GUIAUna tarifa por millón de tokens no basta para presupuestar un flujo de varios pasos. Aprende a sumar entrada, salida, caché, reintentos y revisión, y a fijar límites antes de ejecutar.
25 sep. 2026 ↗ ANALISISAnthropic indica que el mismo texto puede convertirse en más tokens con Sonnet 5 que con Sonnet 4.6. Un protocolo con corpus propio permite comprobar si eso reduce el contexto útil o modifica el coste por tarea en una integración concreta.
23 sep. 2026 ↗ ANALISISLas puntuaciones de Sonnet 4.5 en tareas de investigación biológica justifican una evaluación interna, no una conclusión sobre su fiabilidad experimental. Qué miden Protocol QA, LAB-Bench y BixBench, qué no miden y cómo diseñar una prueba retrospectiva controlada.
23 sep. 2026 ↗ GUIALa tarifa por llamada no revela por sí sola cuánto cuesta una respuesta que el equipo acepta. Esta guía presenta una fórmula reproducible para sumar tokens de entrada y salida, reintentos y revisión, con tres escenarios ilustrativos para Claude Haiku 4.5.
23 sep. 2026 ↗ ANALISISUna puntuación de benchmark no demuestra que un modelo pueda operar una aplicación de forma segura. Proponemos una evaluación acotada para medir éxito, errores, recuperación, latencia y necesidad de supervisión.
23 sep. 2026 ↗