Versión exacta
Comprueba el identificador del modelo, la fecha y si el alias puede cambiar.
Resultados publicados y condiciones declaradas por sus fuentes. Las cifras solo son comparables cuando coinciden versión, configuración, métrica y fecha.
| Modelo | Organización | Resultado | Métrica | Condiciones |
|---|---|---|---|---|
| DeepSeek R1 | DeepSeek | 79,8 % | Pass@1 publicado | Resultado o evaluación publicado por el proveedor; revisa metodología y condiciones en la fuente. |
Comprueba el identificador del modelo, la fecha y si el alias puede cambiar.
Revisa herramientas, esfuerzo, número de intentos, prompt y presupuesto de inferencia.
Valida el resultado con tareas, idiomas, formatos y errores representativos de tu producto.
Un benchmark público orienta, pero no sustituye una evaluación con tus datos, herramientas, presupuesto y tolerancia al error.
Un alias móvil y un snapshot pueden producir resultados diferentes. Registra modelo, fecha y proveedor.
Prompt, razonamiento, herramientas, número de intentos y presupuesto deben ser equivalentes para comparar.
Una diferencia pequeña puede desaparecer entre ejecuciones. Conserva muestras, dispersión y fallos, no solo la media.
Valida si la mejora se mantiene en idiomas, formatos y casos reales cercanos a tu producto.
Una métrica solo es útil cuando conocemos la tarea, las condiciones y el error que importa. El resultado empieza por el diseño de la prueba.
Un benchmark es una evaluación definida por tareas, datos, protocolo y métricas. Su puntuación describe el desempeño en esas condiciones concretas; por sí sola, no prueba una capacidad general ni garantiza resultados en producción.
25 sep. 2026 ↗ ANALISISUna cifra de AIME 2024 parece sencilla, pero puede resumir protocolos muy distintos. Esta guía explica qué representa el conjunto, cómo cambia el resultado según el número de intentos, la selección de respuestas, las herramientas y el arnés, y qué información pedir antes de comparar modelos.
22 sep. 2026 ↗