BENCHMARK DOCUMENTADO

Terminal-Bench 2.1

Resultados publicados y condiciones declaradas por sus fuentes. Las cifras solo son comparables cuando coinciden versión, configuración, métrica y fecha.

01 / RESULTADOS

Mediciones publicadas

ModeloOrganizaciónResultadoMétricaCondiciones
GPT‑5.6 SolOpenAI88,8 %ExactitudCon el harness y esfuerzo publicados.
GPT‑5.6 TerraOpenAI87,4 %ExactitudCon el harness y esfuerzo publicados.
GPT‑5.6 LunaOpenAI84,7 %ExactitudCon el harness y esfuerzo publicados.
Gemini 3.1 ProGoogle70,7 %ExactitudCifra reproducida en la tabla comparativa de OpenAI.
DeepSeek V4.1 FlashDeepSeek90,6 %ExactitudDeepSeek Harness, esfuerzo max y configuración publicada.
02 / INTERPRETACIÓN

Antes de comparar

01

Versión exacta

Comprueba el identificador del modelo, la fecha y si el alias puede cambiar.

02

Configuración equivalente

Revisa herramientas, esfuerzo, número de intentos, prompt y presupuesto de inferencia.

03

Transferencia a tu caso

Valida el resultado con tareas, idiomas, formatos y errores representativos de tu producto.

03 / MÉTODO

Del marcador a una decisión reproducible

Un benchmark público orienta, pero no sustituye una evaluación con tus datos, herramientas, presupuesto y tolerancia al error.

01

Identifica la versión exacta

Un alias móvil y un snapshot pueden producir resultados diferentes. Registra modelo, fecha y proveedor.

02

Reconstruye las condiciones

Prompt, razonamiento, herramientas, número de intentos y presupuesto deben ser equivalentes para comparar.

03

Busca incertidumbre

Una diferencia pequeña puede desaparecer entre ejecuciones. Conserva muestras, dispersión y fallos, no solo la media.

04

Comprueba transferencia

Valida si la mejora se mantiene en idiomas, formatos y casos reales cercanos a tu producto.

Una métrica solo es útil cuando conocemos la tarea, las condiciones y el error que importa. El resultado empieza por el diseño de la prueba.

04 / FUENTES

Trazabilidad