¿Qué tareas contiene?
Cobertura, dificultad, idioma, actualidad y posible contaminación.
MuestraUna métrica solo es útil cuando conocemos la tarea, las condiciones y el error que importa.
El resultado empieza por el diseño de la prueba.
Cobertura, dificultad, idioma, actualidad y posible contaminación.
MuestraExactitud, preferencia humana, coste, tiempo o tasa de éxito.
ObjetivoPrompt, herramientas, razonamiento, muestras y presupuesto.
EquidadConvierte necesidades reales en un conjunto pequeño y repetible.
Incluye casos normales, bordes y fallos costosos.
CasosSepara corrección, utilidad, seguridad y formato.
CriterioModelo, recuperación, herramientas, latencia y coste.
ProducciónUn benchmark público orienta, pero no sustituye una evaluación con tus datos, herramientas, presupuesto y tolerancia al error.
Un alias móvil y un snapshot pueden producir resultados diferentes. Registra modelo, fecha y proveedor.
Prompt, razonamiento, herramientas, número de intentos y presupuesto deben ser equivalentes para comparar.
Una diferencia pequeña puede desaparecer entre ejecuciones. Conserva muestras, dispersión y fallos, no solo la media.
Valida si la mejora se mantiene en idiomas, formatos y casos reales cercanos a tu producto.
Referencias utilizadas para ampliar y revisar esta página.