Versión exacta
Comprueba el identificador del modelo, la fecha y si el alias puede cambiar.
Resultados publicados y condiciones declaradas por sus fuentes. Las cifras solo son comparables cuando coinciden versión, configuración, métrica y fecha.
| Modelo | Organización | Resultado | Métrica | Condiciones |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 52,7 % | Exactitud | Tabla oficial de GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 50,4 % | Exactitud | Tabla oficial de GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 50,3 % | Exactitud | Tabla oficial de GPT‑5.6. |
Comprueba el identificador del modelo, la fecha y si el alias puede cambiar.
Revisa herramientas, esfuerzo, número de intentos, prompt y presupuesto de inferencia.
Valida el resultado con tareas, idiomas, formatos y errores representativos de tu producto.
Un benchmark público orienta, pero no sustituye una evaluación con tus datos, herramientas, presupuesto y tolerancia al error.
Un alias móvil y un snapshot pueden producir resultados diferentes. Registra modelo, fecha y proveedor.
Prompt, razonamiento, herramientas, número de intentos y presupuesto deben ser equivalentes para comparar.
Una diferencia pequeña puede desaparecer entre ejecuciones. Conserva muestras, dispersión y fallos, no solo la media.
Valida si la mejora se mantiene en idiomas, formatos y casos reales cercanos a tu producto.
Una métrica solo es útil cuando conocemos la tarea, las condiciones y el error que importa. El resultado empieza por el diseño de la prueba.
AutomationBench evalúa si un agente puede completar flujos entre aplicaciones SaaS simuladas y llevarlos a un estado final verificable. Esta guía explica qué significa esa evidencia, cómo leer sus métricas y qué pruebas adicionales hacen falta antes de extrapolar un resultado a una empresa real.
22 sep. 2026 ↗ PAPERAgents’ Last Exam evalúa agentes en tareas profesionales dentro de entornos de sistema operativo y con resultados verificables. Su diseño es útil para estudiar la ejecución de flujos de trabajo, pero una cifra agregada de éxito no demuestra que un empleo pueda automatizarse. Para interpretarla hacen falta detalles sobre las tareas, el entorno, el arnés, el modelo, las herramientas, el presupuesto y la versión evaluada.
22 sep. 2026 ↗