PRIMERA DECISIÓNEl caso de uso

No el número de parámetros.

CUELLO DE BOTELLAMemoria disponible

RAM o VRAM según el entorno.

PRUEBA MÍNIMA20 tareas reales

Con el mismo criterio de revisión.

01

Empieza por el trabajo, no por el modelo

Un modelo excelente para completar código puede no ser la mejor elección para resumir documentos largos. Define primero la tarea, la sensibilidad de los datos, la latencia aceptable y si necesitas texto, visión o herramientas.

Privacidad

¿Los datos pueden salir del equipo?

Latencia

¿Necesitas respuesta interactiva o procesos por lotes?

Calidad

¿Qué errores invalidan el resultado?

Modalidad

¿Solo texto o también imagen, audio y archivos?

02

Calcula la memoria con margen

El archivo del modelo es solo una parte del consumo. El contexto, la caché y el propio entorno necesitan espacio adicional. Evita planificar al límite y reserva margen para el sistema.

EscenarioPrioridadQué medir
Chat y redacciónLatencia percibidaTiempo al primer token y coherencia
Documentos largosContexto útilRecuperación de detalles y citas
ProgramaciónCorrecciónTests superados y cambios innecesarios
Procesamiento por lotesRendimientoTokens por segundo y coste energético
03

La cuantización es un intercambio, no un atajo gratis

Reducir precisión disminuye el tamaño y puede acelerar la inferencia, pero el impacto en calidad no es uniforme. Dos modelos con el mismo tamaño cuantizado pueden comportarse de forma distinta en tu tarea.

04

Haz una prueba reproducible

Guarda la versión exacta, la configuración y el conjunto de preguntas. El siguiente ejemplo consulta la información del modelo antes de ejecutarlo con Ollama.

TERMINAL
ollama show nombre-del-modelo
ollama run nombre-del-modelo
  1. 01
    Congela el conjunto

    Usa las mismas 20 tareas para todas las variantes.

  2. 02
    Registra el entorno

    Anota hardware, versión, contexto y parámetros.

  3. 03
    Revisa a ciegas

    Oculta el nombre del modelo cuando valores las respuestas.

05

Fuentes y herramientas