Ilustración editorial para AIME 2024: qué mide un porcentaje de aciertos en 30 problemas y por qué dos resultados aparentemente iguales pueden no ser comparables
Imagen generada con gpt-image-2.5-sunburst para InferamaFuente ↗
01

Qué significa exactamente «AIME 2024»

AIME 2024 suele presentarse como un único benchmark de razonamiento matemático, pero el nombre condensa varias decisiones. En una implementación documentada de evaluación, el conjunto reúne los problemas de AIME I y AIME II de ese año: treinta ítems en total. Cada problema espera una respuesta numérica entera expresada con tres dígitos, desde 000 hasta 999. La corrección puede automatizarse porque no depende de una evaluación humana de la redacción ni de una rúbrica sobre los pasos intermedios.

Esa composición importa desde el primer momento. Un resultado sobre los treinta problemas no tiene la misma base que otro calculado sobre un único examen de quince problemas. Tampoco debe asumirse que dos conjuntos etiquetados como «AIME 2024» usan idénticos enunciados, identificadores, adaptaciones de formato o claves de respuesta. Los arneses de evaluación pueden empaquetar sus tareas y sus extractores de maneras diferentes. La etiqueta del benchmark identifica una familia de ítems, no certifica por sí sola un protocolo común.

Por tanto, una lectura rigurosa empieza por convertir el titular en una pregunta concreta: ¿se evaluaron AIME I, AIME II o ambos; cuántos problemas se incluyeron; y qué implementación transformó la salida textual en una respuesta calificable? Sin esas respuestas, el porcentaje es una observación incompleta, no una comparación cerrada.

02

Qué mide una puntuación y qué deja fuera

AIME 2024 ofrece una señal útil sobre la resolución de problemas de competición matemática cuya respuesta final puede comprobarse de forma exacta. El formato reduce una fuente habitual de ambigüedad: si el evaluador obtiene el entero correcto conforme a la regla definida, el ítem cuenta como acierto; si no, cuenta como error. Esta propiedad hace atractiva la prueba para ejecutar muchas evaluaciones de forma consistente.

Sin embargo, la puntuación final no observa directamente todo el proceso que llevó a la respuesta. Un modelo puede producir razonamiento correcto pero terminar con un formato que el extractor no reconoce. También puede llegar al entero correcto mediante una cadena de pasos defectuosa que la corrección exacta no inspecciona. El benchmark, por diseño, puntúa la respuesta final recuperada por el arnés, no la calidad de una demostración matemática.

De ahí no se sigue que un buen resultado carezca de valor. Indica rendimiento en una tarea delimitada, con problemas de estilo competitivo y respuestas enteras verificables. Lo que no permite establecer por sí solo es capacidad general de razonamiento, habilidad para escribir pruebas revisables, precisión en tareas profesionales, fiabilidad en dominios con información incompleta o desempeño ante distribuciones de problemas nuevas. Esas conclusiones requerirían evaluaciones adicionales y una relación demostrada entre la prueba y el caso de uso.

También conviene separar competencia matemática de producto. Un sistema útil para analistas, científicos o ingenieros necesita, según el contexto, interpretar requisitos, declarar supuestos, usar datos externos de forma trazable, detectar incertidumbre y comunicar límites. Ninguna de esas propiedades queda medida plenamente por treinta respuestas enteras.

Qué puede inferirse de AIME 2024 y qué no

ObservaciónInferencia razonableInferencia no justificada sin evidencia adicional
Alta puntuación bajo un protocolo documentadoEl sistema resolvió muchos ítems de ese conjunto con esas condicionesQue razona correctamente en cualquier dominio o tarea
Respuesta final exactaEl entero extraído coincidió con la clave del ítemQue la explicación o demostración fue válida
Mejora con herramientasLas herramientas y el flujo empleado aportaron rendimiento en esa ejecuciónQue el modelo base, sin ese flujo, tiene el mismo nivel
Resultado sobre quince ítemsHay una estimación sobre ese subconjuntoQue representa de forma idéntica los treinta ítems o otro examen
03

La ficha mínima que debe acompañar a un resultado

Una afirmación publicable debería permitir que otra persona reconstruya qué se midió, aunque no pueda repetir todos los cálculos. La primera línea de la ficha es el conjunto: indicar AIME I, AIME II o ambos, el número de problemas y la fuente o versión de los enunciados. La segunda es la identidad del sistema: nombre exacto del modelo, snapshot o fecha, proveedor y, si procede, configuración de razonamiento.

Después debe declararse el modo de generación. Esto incluye el prompt completo o una descripción suficiente de sus instrucciones de formato, la temperatura y otros parámetros de muestreo, el máximo de tokens, límites de tiempo, número de llamadas por problema y cualquier interrupción o reintento. Cuando estos datos faltan, el lector no puede distinguir un resultado de una muestra de una búsqueda intensiva entre muchas trayectorias.

La ficha debe separar también modelo y entorno. ¿Había calculadora, ejecución de código, navegación, recuperación de documentos u otras herramientas? ¿El sistema podía comprobar sus propios resultados? ¿Un procedimiento externo eligió la mejor respuesta? Estas condiciones pueden ser apropiadas si reflejan el uso previsto, pero deben figurar junto al porcentaje y no quedar ocultas bajo el nombre del modelo.

Finalmente, hace falta describir el arnés. Una implementación de AIME 2024 documenta un prompt de salida con la forma «ANSWER: $ANSWER», corrección por coincidencia exacta y cambios en el scorer relacionados con LaTeX y respuestas vacías. Detalles así muestran por qué el parser no es una cuestión administrativa: decide qué texto se convierte en entero y qué salida se declara inválida. La política para respuestas ausentes, múltiples respuestas, texto ambiguo y errores de formato debe estar explícita.

Proceso para convertir un titular en una ficha auditable

  1. 01Identificar el conjunto exacto y contar los ítems realmente puntuados.
  2. 02Registrar la versión del modelo, la fecha de evaluación y los parámetros de generación.
  3. 03Clasificar el resultado como una muestra, múltiples muestras, consenso, reranking o una combinación.
  4. 04Anotar herramientas, presupuesto de tokens, tiempo y número total de llamadas.
  5. 05Documentar prompt, extractor, tratamiento de errores y fórmula de agregación.
  6. 06Etiquetar la comparabilidad con otros resultados como directa, parcial o no establecida.
04

Una ejecución puede producir muchas cifras distintas

Pass@1 responde a una pregunta simple: con una sola muestra por problema, ¿cuántas respuestas finales fueron correctas? Es normalmente la lectura más cercana a una interacción única, siempre que también se especifiquen el prompt, la temperatura, el presupuesto y las herramientas. Aun así, no es necesariamente un retrato de una conversación real: puede incluir instrucciones diseñadas específicamente para el benchmark.

Pass@k cambia la pregunta. En vez de una oportunidad, se generan varias respuestas por problema y se pregunta si alguna de ellas acierta. Este valor puede servir para estudiar el potencial de búsqueda del sistema, pero aumenta con el número de intentos y no equivale a la probabilidad de éxito de una única respuesta entregada a una persona usuaria. Publicar pass@k sin el valor de k impide interpretar la cifra.

El voto mayoritario o consenso genera múltiples respuestas y escoge la que recibe más apoyo bajo una regla definida. Puede mejorar la estabilidad cuando varias trayectorias llegan a la misma solución, pero no garantiza verdad: los intentos pueden compartir el mismo error. Su rendimiento depende del número de muestras, de cómo se agrupan respuestas equivalentes y de qué ocurre con formatos que no se pueden extraer.

El reranking añade otro componente: después de producir candidatos, un selector escoge uno. Ese selector puede ser el propio modelo, un verificador, una heurística, una herramienta o un sistema diferente. Por eso un resultado con reranking mide un pipeline completo. No debe atribuirse automáticamente al modelo generador aislado. Una publicación de OpenAI distingue de forma explícita resultados de una muestra, de consenso con decenas de muestras y de reranking con un número mucho mayor de muestras; esa distinción es metodológicamente esencial.

Las herramientas introducen otra bifurcación. Una calculadora o un entorno de código puede disminuir errores aritméticos; una búsqueda externa puede aportar información no contenida en el prompt. Ninguna opción es intrínsecamente ilegítima, pero «con herramientas» y «sin herramientas» responden a preguntas distintas. Las model cards que publican ambas condiciones ofrecen una referencia más informativa que una cifra única.

05

Por qué un porcentaje aparentemente idéntico puede no equivaler al mismo número de aciertos

En un conjunto de treinta problemas, cada acierto representa una fracción apreciable del total. Si se informa un porcentaje con decimales, puede proceder de una sola ejecución, de varias repeticiones, de una media entre subconjuntos o de una agregación sobre configuraciones. En un conjunto de quince, los saltos de una ejecución individual son todavía mayores. Así, un valor como 80 % no permite deducir automáticamente un número entero de aciertos ni el número de problemas evaluados.

El redondeo es sólo una parte del problema. Un proveedor puede comunicar el promedio de muchas corridas; otro, el mejor resultado de una corrida; un tercero, el promedio de resultados por pregunta después de muestrear varias veces. Esas decisiones pueden ser defendibles para propósitos diferentes, pero han de nombrarse. Una cifra sin denominador, dispersión o procedimiento de agregación no debería interpretarse como una medida precisa.

La comparabilidad exige mantener constantes, o al menos declarar, los elementos que afectan a la dificultad efectiva: conjunto, versión de enunciados, modelo, prompt, herramientas, generación, extracción y puntuación. Si alguno difiere, la comparación puede seguir siendo orientativa, pero no debe convertirse sin más en un ranking de capacidad.

Regla práctica de comparabilidad

SituaciónVeredictoCómo comunicarla
Mismos treinta ítems, mismo arnés, una muestra, misma disponibilidad de herramientasComparable de forma relativamente directaIndicar versiones del modelo y fecha
Mismo conjunto, pero pass@1 frente a consenso o rerankingNo comparable como capacidad de una sola muestraComparar sólo como pipelines, con coste y número de muestras
Quince ítems frente a treinta, aunque ambos se llamen AIME 2024Comparabilidad parcialMostrar denominadores y evitar un ranking único
Mismo porcentaje sin prompt, parser o tratamiento de erroresNo establecidaSolicitar documentación antes de concluir
Con herramientas frente a sin herramientasNo comparable como modelo aisladoSeparar las columnas y describir las herramientas
06

Exposición previa, disponibilidad pública y saturación

AIME 2024 debe analizarse también como un conjunto que ha estado disponible públicamente. Trabajos sobre evaluación de competiciones matemáticas no contaminadas tratan esa disponibilidad como un motivo razonable de preocupación: un modelo o un sistema de recuperación podría haber estado expuesto a problemas, soluciones, discusiones o variantes durante su desarrollo. Esto no demuestra que un modelo concreto haya sido entrenado con esos ítems ni permite atribuir cualquier buen resultado a memorización.

La formulación prudente es condicional. La exposición previa es un riesgo de validez que debe declararse cuando no existe información suficiente sobre los datos de entrenamiento, los datos de ajuste, la recuperación y la fecha de corte. La ausencia de una prueba pública de exposición tampoco demuestra independencia. Entre ambos extremos hay incertidumbre, no una conclusión automática.

A un proveedor se le puede pedir evidencia proporcional: fecha de corte de los datos, descripción de filtrados de datos de evaluación, política sobre material de competiciones, fecha de disponibilidad del modelo y detalles de cualquier herramienta de recuperación. Si no puede facilitarla, el resultado puede mantenerse como evidencia contextual, pero con un límite claro: no debería funcionar como prueba única de generalización a problemas inéditos.

La saturación tiene además una consecuencia práctica. Cuanto más popular se vuelve un benchmark, más probable es que prompts, soluciones, estrategias y configuraciones de evaluación circulen ampliamente. Para decisiones de producto conviene tratar AIME 2024 como una señal histórica y complementarla con una batería privada, reciente y representativa del trabajo real, respetando las políticas de uso y reproducción de los materiales de la competición.

07

Cómo usar AIME 2024 en una decisión de producto

Para un responsable técnico, AIME 2024 puede servir como señal secundaria al preseleccionar sistemas que resuelven problemas matemáticos estructurados. Su mayor utilidad aparece cuando se acompaña de un protocolo claro y cuando se compara con resultados obtenidos en las mismas condiciones. No conviene convertirlo en un umbral único de compra, despliegue o seguridad.

La evaluación complementaria depende del caso. Si el producto genera análisis cuantitativos, son pertinentes tareas propias con datos, unidades, supuestos y revisión de cálculos. Si debe explicar resultados, hay que evaluar claridad, trazabilidad y detección de errores, no sólo el entero final. Si opera con herramientas, debe medirse el pipeline completo, incluidos permisos, coste, latencia, fallos de herramientas y verificación. Si la preocupación es conocimiento experto, un benchmark como GPQA Diamond puede aportar una señal distinta, pero tampoco sustituye pruebas del flujo de trabajo específico.

También es importante separar eficiencia y resultado. Dos sistemas con una precisión similar pueden requerir números muy diferentes de muestras, tokens, llamadas o tiempo. En producción, esas diferencias afectan coste, latencia, capacidad y previsibilidad. Una tabla de benchmarks sin presupuesto de inferencia puede ocultar una diferencia decisiva para el caso de uso.

Los lectores que comparen una ficha de DeepSeek-R1, una ficha de GPT-6 Astra u otros modelos deberían aplicar la misma disciplina, sin inferir condiciones no publicadas a partir de la marca. El nombre comercial no sustituye al snapshot, ni una cifra atribuida a una organización sustituye la documentación del protocolo. El índice de benchmarks y la ficha específica de AIME 2024 son el lugar adecuado para conservar estas condiciones junto a cada resultado.

Checklist final antes de reutilizar una cifra de AIME 2024

  1. 01¿Se conoce si el resultado cubre quince o treinta problemas y cuáles son?
  2. 02¿Se identifica el modelo o snapshot exacto y la fecha de ejecución?
  3. 03¿Es pass@1, pass@k, consenso, reranking o un método mixto?
  4. 04¿Cuántas muestras, tokens, llamadas y tiempo se usaron por problema?
  5. 05¿Había herramientas o verificadores externos?
  6. 06¿Se publican prompt, arnés, parser y política para salidas no parseables?
  7. 07¿El porcentaje procede de una corrida, una media o el mejor valor observado?
  8. 08¿Se declaró la incertidumbre sobre exposición previa y disponibilidad pública?
  9. 09¿La decisión se apoya además en evaluaciones representativas, recientes y propias?

Qué sigue abierto

  • Las fuentes disponibles no permiten establecer si un modelo concreto fue entrenado, ajustado o evaluado previamente con problemas o soluciones de AIME 2024.
  • No todos los resultados públicos informan prompt, temperatura, presupuesto de tokens, parser, número de repeticiones o tratamiento de respuestas no parseables.
  • Una cifra aislada atribuida a un modelo no permite inferir el coste, la latencia ni la fiabilidad de un pipeline de producción.
  • La comparabilidad entre implementaciones distintas de AIME 2024 puede ser parcial o no estar establecida aunque compartan el mismo nombre de benchmark.
08

Continúa explorando

08

Fuentes consultadas

03

Correcciones y transparencia

Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.

Proponer una corrección