Dos clases de resultados
Los resultados de proveedor o de terceros conservan su fuente, métrica y condiciones publicadas. No los tratamos como una medición propia.
Las evaluaciones de Inferama registran batería, caso, versión exacta del modelo, proveedor, fecha, prompt, parámetros, herramientas, intentos y respuesta.
Puntuación y revisión
Cada ámbito utiliza una rúbrica explícita con criterios observables. Cuando interviene un juez automático, se registra su modelo y se exige revisión adicional en resultados ambiguos o sensibles.
No comparamos directamente cifras obtenidas con distintos conjuntos de tareas, herramientas, presupuestos de inferencia o reglas de puntuación.
Reproducibilidad y límites
Conservamos los datos necesarios para volver a ejecutar una prueba dentro de las restricciones del proveedor. Los modelos no deterministas pueden producir resultados diferentes.
Una evaluación es una muestra fechada, no una garantía universal de calidad ni una recomendación para todos los usos.
Ejecución automática y artefactos
Las pruebas de texto compatibles se envían mediante una credencial cifrada al proveedor correspondiente en lotes limitados. Registramos la respuesta original, latencia, uso, versión y errores; aplicamos reintentos acotados y un máximo diario antes de puntuar con controles deterministas y una rúbrica ciega.
Las pruebas de imagen, vídeo, audio, visión, embeddings, robótica o cualquier caso que exija un archivo quedan identificadas como ejecución manual hasta disponer de un artefacto verificable. Una descripción nunca sustituye la entrega y los artefactos requieren revisión humana antes de cerrar la batería.