La pregunta clave: ¿qué significa que un benchmark esté contaminado?
Decir que un benchmark de inteligencia artificial está contaminado puede describir situaciones distintas. Una pregunta de evaluación podría aparecer literalmente en los datos usados para entrenar un modelo; podría reaparecer con cambios de formato; o el modelo podría haber aprendido durante el entrenamiento patrones muy parecidos a los que exige la prueba. Esas posibilidades no tienen la misma fuerza probatoria ni implican automáticamente el mismo efecto sobre una puntuación.
Conviene separar tres afirmaciones. La primera es que existe un solapamiento entre el material de evaluación y algún conjunto de datos relevante. La segunda es que el modelo tuvo exposición a ese material antes de ser evaluado. La tercera, más exigente, es que esa exposición causó una mejora en el resultado. Un detector puede aportar indicios para las primeras preguntas; demostrar la tercera suele requerir comparar resultados bajo condiciones que permitan aislar el efecto.
Esta distinción es importante para interpretar cualquier alerta. Una coincidencia textual puede señalar exposición potencial, pero no revela por sí sola cuándo se incorporó el texto, si el modelo lo aprendió o cuánto influyó en la respuesta. A la inversa, no encontrar una coincidencia exacta tampoco descarta que existan paráfrasis, datos derivados o familiaridad con el tipo de tarea.
El alcance de este artículo se limita a los trabajos verificados que se enumeran al final. Esos estudios permiten explicar varios métodos y sus supuestos, pero no bastan para comprobar las cifras agregadas, el número de estudios o la fecha de cobertura atribuidos a una revisión sistemática mencionada en la propuesta editorial. Por tanto, aquí no se presentan como hechos verificados ni un corpus de 55 estudios ni un intervalo general de inflación del 6 % al 40 %.
Una distinción operativa entre cuatro formas de contaminación
Para examinar una acusación concreta resulta útil clasificar qué se solapa. Esta clasificación es un marco analítico práctico, no una atribución de una taxonomía común a todos los estudios revisados aquí. Además, las categorías pueden combinarse: una tarea puede haber circulado literalmente y, al mismo tiempo, representar un patrón de problema muy extendido en los datos de entrenamiento.
La coincidencia exacta es el caso más visible: una pregunta, una respuesta de referencia o una solución aparece sin cambios sustanciales en material de entrenamiento. Una búsqueda de texto puede detectar coincidencias, pero su interpretación depende de qué corpus se haya podido inspeccionar, de su cobertura y de las transformaciones aplicadas a los datos. La ausencia de una coincidencia en un corpus incompleto no prueba ausencia de exposición.
La transformación superficial incluye cambios de formato, puntuación, orden o redacción que conservan buena parte del contenido. Una comparación literal puede no encontrarlos. La búsqueda por fragmentos, la normalización textual u otros procedimientos de recuperación pueden revelar candidatos, aunque también generan falsos positivos: expresiones comunes o plantillas de una tarea pueden aparecer en muchos documentos sin que haya una copia del ítem evaluado.
La equivalencia semántica es más difícil de establecer. Dos enunciados pueden pedir el mismo razonamiento con palabras distintas, sin compartir largas secuencias de texto. La semejanza semántica sirve para proponer posibles pares, pero no demuestra que el modelo haya visto uno de ellos ni que esa exposición explique su respuesta. La decisión de que dos ejemplos son equivalentes también puede depender de anotaciones y criterios humanos.
La exposición al tipo de tarea es una afirmación distinta de la copia de ejemplos. Un modelo puede haber recibido muchos problemas, preguntas o fragmentos de código del mismo formato general sin que se identifique una instancia concreta del benchmark en sus datos. Esa familiaridad podría facilitar la respuesta, pero medirla exige definir qué cuenta como exposición y separar ese efecto de capacidades generales adquiridas durante el entrenamiento.
Cinco familias de métodos y sus requisitos
No existe un detector que responda por sí solo a todas las preguntas. Los métodos observan señales diferentes y dependen de distintos niveles de acceso. La tabla siguiente organiza cinco enfoques útiles para leer estudios de contaminación; es una guía comparativa, no una escala universal de fiabilidad. En particular, una señal más directa de coincidencia no necesariamente ofrece una estimación mejor del efecto causal sobre la puntuación.
blocks
Qué observa cada enfoque y qué deja sin resolver
| Familia | Acceso o insumo habitual | Qué puede indicar | Límite principal |
|---|---|---|---|
| Coincidencia textual directa | Ítems del benchmark y corpus de entrenamiento accesibles, o una colección candidata | Presencia de secuencias iguales o muy parecidas en el material inspeccionado | La cobertura del corpus condiciona el resultado; una coincidencia no demuestra uso por el modelo ni impacto en la puntuación |
| Recuperación de documentos | Ítems de prueba y acceso a un corpus donde buscar; puede apoyarse en recuperación de texto | Documentos candidatos que contienen contenido relacionado con los ítems | Los resultados dependen de la colección, la consulta y los umbrales; recuperar un documento no acredita por sí solo que formara parte del entrenamiento |
| Testset Slot Guessing | Acceso a un modelo que permita formular sondeos sobre partes de ejemplos, según el protocolo | Señales de que el modelo puede completar o reconocer elementos de una prueba | Una respuesta acertada puede deberse a capacidad general o conocimiento del formato, no necesariamente a exposición a la instancia |
| Inferencia de pertenencia | Acceso a respuestas o señales del modelo y a ejemplos para contrastar, según el método | Una diferencia estadística compatible con que un ejemplo perteneciera a los datos de entrenamiento | Su validez depende de supuestos sobre el entrenamiento y la distribución; las evaluaciones disponibles muestran límites de fiabilidad |
| Comparación de rendimiento | Resultados del modelo en un benchmark principal y en pruebas de referencia, además de supuestos explícitos | Un patrón de desempeño compatible con contaminación y una posible diferencia de rendimiento | El contraste depende de cómo se elijan las referencias y de los supuestos; no identifica necesariamente la causa del rendimiento |
Qué permiten afirmar los estudios disponibles
La investigación publicada en NAACL en 2024 presenta métodos de recuperación sobre corpus y un protocolo llamado Testset Slot Guessing para investigar contaminación en benchmarks, incluidos escenarios con modelos abiertos y propietarios. Estos métodos amplían las opciones más allá de buscar copias literales, pero la clase de evidencia que producen sigue dependiendo de cómo se definan las consultas, qué corpus se tenga a disposición y qué acceso permita el modelo.
Una encuesta y evaluación publicada en Findings of NAACL en 2025 examina los supuestos de los detectores y evalúa métodos de inferencia de pertenencia. Su resultado más relevante para la lectura crítica es que algunas pruebas se acercaron al azar en corpus utilizados para preentrenamiento. Esto no implica que toda inferencia de pertenencia sea inútil; sí advierte que no basta con llamar a un método «detector» para considerar concluyente su clasificación.
ConStat propone una detección basada en rendimiento que compara resultados en benchmarks principales y de referencia bajo supuestos definidos. La comparación puede ayudar a estimar si el comportamiento observado es compatible con contaminación, pero no convierte automáticamente una diferencia en prueba causal. Para juzgarla hay que examinar qué referencias se eligieron, por qué son comparables y qué explicaciones alternativas podrían producir la misma diferencia.
Un estudio controlado sobre traducción automática modifica deliberadamente la exposición a datos de evaluación para medir cambios en el desempeño de modelos. El trabajo informa que los efectos varían según se contamine la entrada, la salida o ambas. Este diseño es informativo porque manipula la exposición en vez de inferirla solo a partir de resultados observados. Aun así, sus conclusiones corresponden a las condiciones experimentales estudiadas: no se trasladan sin más a otros benchmarks, tareas o procesos de entrenamiento.
En conjunto, estos trabajos muestran por qué conviene formular preguntas acotadas. ¿Se encontró una cadena en un corpus concreto? ¿Se detectó una señal estadística compatible con pertenencia? ¿Se observaron respuestas correctas a sondeos? ¿O se midió un cambio de rendimiento tras introducir contaminación controlada? Son resultados distintos. Presentarlos con el mismo rótulo puede ocultar diferencias importantes en acceso, supuestos y fuerza de la inferencia.
Por qué las estimaciones de inflación no son intercambiables
Una estimación de cuánto aumenta una puntuación por contaminación solo se interpreta junto con el procedimiento que la produjo. Importan el benchmark, la unidad que se considera contaminada, la proporción de ejemplos afectados, la tarea, el modelo y la fase de entrenamiento. También importan los datos de referencia y el diseño del contraste. Dos porcentajes pueden describir cantidades diferentes aunque ambos se denominen «inflación».
Por ejemplo, una estimación puede comparar el desempeño con y sin exposición introducida de manera controlada. Otra puede inferir el posible solapamiento en corpus y proyectar su efecto mediante supuestos. Una tercera podría contrastar puntuaciones de modelos o conjuntos de ítems distintos. Sin información suficiente sobre esos diseños, no es riguroso ordenar sus cifras como si fueran mediciones repetidas de una misma magnitud.
La propuesta editorial menciona un intervalo aproximado del 6 % al 40 % asociado a estimaciones publicadas para MMLU, GSM8K, HumanEval y HellaSwag. Las fuentes verificadas disponibles para esta pieza no permiten confirmar qué estudios sustentan cada extremo, qué definición de inflación se aplicó ni si esas cifras son comparables. Por esa razón, el intervalo no se presenta aquí como un resultado confirmado ni como una medida común de contaminación en los benchmarks.
La misma cautela se aplica a nombres de benchmarks y a cifras agregadas de revisiones. Antes de repetir una estimación, conviene volver al estudio primario y registrar qué se midió: porcentaje de ítems con coincidencias, número de ejemplos recuperados, diferencia de puntuación, proporción de aciertos atribuible a una condición experimental u otra variable. Si la unidad no está clara, la cifra puede dar una impresión de precisión que el diseño no respalda.
Presencia, exposición y causalidad: una escalera de evidencia
Un análisis sólido evita saltar de una señal a una conclusión causal. Primero se describe el hallazgo con precisión: por ejemplo, una búsqueda identificó documentos parecidos en una colección determinada. Después se evalúa si esa colección representa de manera fiable los datos de entrenamiento relevantes y si es posible establecer que el modelo tuvo acceso a los documentos antes de la evaluación. Finalmente, para atribuir un cambio de puntuación a esa exposición, se necesita un contraste que descarte explicaciones alternativas de manera convincente.
La memoria observable del modelo tampoco es idéntica a su historial de entrenamiento. Un sondeo puede provocar que el modelo complete una parte de un ejemplo, pero ese éxito podría depender de conocimientos generales, de regularidades de la tarea o de pistas incluidas en la pregunta. Por el otro lado, que un modelo no reproduzca un ítem no demuestra que nunca lo haya visto: la recuperación puede fallar, especialmente si la consulta cambia o si el modelo no genera una reproducción literal.
Las inferencias causales son más claras en un experimento controlado cuando se manipula la exposición y se mide el rendimiento bajo condiciones comparables. Aun en ese caso, la conclusión es local al protocolo. No basta con que el experimento muestre un efecto posible para adjudicar la puntuación de un modelo concreto a contaminación; habría que conectar el experimento con la exposición real, el modelo, los datos y el benchmark investigados.
Por eso, es útil describir la fuerza de la evidencia en términos graduados: candidato de solapamiento, evidencia de exposición probable o demostración experimental de un efecto bajo condiciones delimitadas. No son etiquetas oficiales universales, sino una forma de dejar claro qué se ha observado y qué inferencia sigue pendiente.
Preguntas prácticas para revisar una acusación de contaminación
Al evaluar una afirmación, el primer paso es localizar el estudio original y distinguir sus resultados de la interpretación de terceros. Una nota de prensa, una tabla comparativa o una síntesis puede ser útil para orientarse, pero la fuerza de la afirmación depende de los datos, el protocolo y las limitaciones del trabajo primario.
También conviene comprobar qué acceso tuvo el equipo. ¿Inspeccionó los datos de entrenamiento o solo un corpus aproximado? ¿Tuvo acceso a probabilidades, pesos o únicamente a respuestas del modelo? ¿El método es reproducible para un modelo cerrado? La ausencia de acceso directo no invalida automáticamente un análisis, pero cambia qué puede concluirse y cuánto depende de supuestos.
La lista siguiente puede servir tanto a quienes publican evaluaciones como a quienes las interpretan. Si varias preguntas quedan sin respuesta, lo adecuado es describir la conclusión como provisional, precisar el tipo de señal observada y evitar atribuir a la contaminación cualquier diferencia de puntuación.
Lista de comprobación para interpretar resultados
- 01Defina el objeto de la afirmación: ¿se habla de solapamiento textual, exposición probable, memoria observable o efecto sobre la puntuación?
- 02Identifique los datos comparados y la cobertura de los corpus; indique qué material no pudo examinarse.
- 03Describa el acceso requerido: corpus, respuestas del modelo, probabilidades o parámetros, según corresponda.
- 04Revise los falsos positivos y los negativos posibles, así como los umbrales y criterios usados para considerar dos ejemplos similares.
- 05Busque un contraste apropiado para el efecto: ¿qué condición alternativa permite estimar qué habría ocurrido sin exposición?
- 06Compruebe si se separan las fases de entrenamiento y el tipo de exposición; no las dé por equivalentes sin evidencia.
- 07Verifique que la cifra comunicada tenga una definición, un denominador y un alcance explícitos.
- 08Ajuste la conclusión al diseño: indique qué se observó, qué se infiere y qué permanece incierto.
Conclusión: tratar la contaminación como un riesgo que requiere evidencia graduada
La contaminación de benchmarks es un problema relevante para interpretar evaluaciones, pero no es una explicación automática de una puntuación alta ni una propiedad que un único detector pueda resolver de manera definitiva. Una coincidencia textual, una señal de pertenencia, una respuesta acertada a un sondeo y un efecto medido en un experimento son evidencias de naturaleza distinta.
Los estudios disponibles aquí ofrecen métodos complementarios y, a la vez, documentan límites: la recuperación depende de los datos inspeccionados, la inferencia de pertenencia puede ser poco fiable bajo ciertas condiciones y las estimaciones basadas en rendimiento requieren supuestos. Los experimentos controlados ayudan a estudiar causalidad, pero sus resultados deben acotarse a las condiciones que realmente probaron.
La práctica más transparente consiste en publicar el método, el acceso, las decisiones de comparación, los posibles errores y la incertidumbre, y en separar explícitamente exposición y efecto. Una ficha de transparencia puede ser útil como propuesta de documentación, pero las fuentes verificadas utilizadas aquí no permiten confirmar el contenido de una ficha específica ni presentarla como estándar adoptado. Para lectores e investigadores, el criterio central sigue siendo sencillo: pedir que cada conclusión se corresponda con la evidencia que la respalda, sin convertir una sospecha en una causa demostrada.
Qué sigue abierto
- No se verificaron, con las fuentes aportadas, el número de estudios ni la fecha de cobertura de la revisión sistemática citada en la propuesta.
- No se pudieron comprobar los estudios primarios que sustentarían las estimaciones aproximadas del 6 % al 40 % para MMLU, GSM8K, HumanEval y HellaSwag, ni las condiciones que permitirían compararlas.
- Las fuentes disponibles no permiten confirmar el contenido de una Contamination Transparency Card específica ni que se haya adoptado como estándar.
- Los resultados de cada método dependen del corpus, el modelo, el acceso y el protocolo; las conclusiones no deben generalizarse automáticamente a otros benchmarks.
Continúa explorando
Fuentes consultadas
Correcciones y transparencia
Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.
Proponer una corrección