Versión exacta
Comprueba el identificador del modelo, la fecha y si el alias puede cambiar.
Resultados publicados y condiciones declaradas por sus fuentes. Las cifras solo son comparables cuando coinciden versión, configuración, métrica y fecha.
| Modelo | Organización | Resultado | Métrica | Condiciones |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 64,6 % | Resuelto | Tabla oficial de GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 63,4 % | Resuelto | Tabla oficial de GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 62,7 % | Resuelto | Tabla oficial de GPT‑5.6. |
| Gemini 3.1 Pro | 54,2 % | Resuelto | Cifra reproducida en la tabla comparativa de OpenAI. | |
| GLM‑5.1 | Z.AI | 58,4 % | Resuelto | Resultado publicado por Z.AI. |
Comprueba el identificador del modelo, la fecha y si el alias puede cambiar.
Revisa herramientas, esfuerzo, número de intentos, prompt y presupuesto de inferencia.
Valida el resultado con tareas, idiomas, formatos y errores representativos de tu producto.
Un benchmark público orienta, pero no sustituye una evaluación con tus datos, herramientas, presupuesto y tolerancia al error.
Un alias móvil y un snapshot pueden producir resultados diferentes. Registra modelo, fecha y proveedor.
Prompt, razonamiento, herramientas, número de intentos y presupuesto deben ser equivalentes para comparar.
Una diferencia pequeña puede desaparecer entre ejecuciones. Conserva muestras, dispersión y fallos, no solo la media.
Valida si la mejora se mantiene en idiomas, formatos y casos reales cercanos a tu producto.
Una métrica solo es útil cuando conocemos la tarea, las condiciones y el error que importa. El resultado empieza por el diseño de la prueba.