PRIMERA DECISIÓNEl caso de uso

No el número de parámetros.

CUELLO DE BOTELLAMemoria disponible

RAM o VRAM según el entorno.

PRUEBA MÍNIMA20 tareas reales

Con el mismo criterio de revisión.

01

Empieza por el trabajo, no por el modelo

Un modelo excelente para completar código puede no ser la mejor elección para resumir documentos largos. Define primero la tarea, la sensibilidad de los datos, la latencia aceptable y si necesitas texto, visión o herramientas.

Privacidad

¿Los datos pueden salir del equipo?

Latencia

¿Necesitas respuesta interactiva o procesos por lotes?

Calidad

¿Qué errores invalidan el resultado?

Modalidad

¿Solo texto o también imagen, audio y archivos?

02

Calcula la memoria con margen

El archivo del modelo es solo una parte del consumo. El contexto, la caché y el propio entorno necesitan espacio adicional. Evita planificar al límite y reserva margen para el sistema.

EscenarioPrioridadQué medir
Chat y redacciónLatencia percibidaTiempo al primer token y coherencia
Documentos largosContexto útilRecuperación de detalles y citas
ProgramaciónCorrecciónTests superados y cambios innecesarios
Procesamiento por lotesRendimientoTokens por segundo y coste energético
03

La cuantización es un intercambio, no un atajo gratis

Reducir precisión disminuye el tamaño y puede acelerar la inferencia, pero el impacto en calidad no es uniforme. Dos modelos con el mismo tamaño cuantizado pueden comportarse de forma distinta en tu tarea.

04

La ventana máxima no es el contexto útil

El límite anunciado describe cuánto puede admitir el sistema, no cuánto recordará con la misma precisión ni cuánto cabe en tu memoria. La caché de atención crece con la conversación y puede convertirse en el consumo dominante aunque los pesos del modelo ya estén cargados.

Empieza con el contexto mínimo que resuelve la tarea. Para documentos extensos, compara enviar todo el archivo con recuperar solo los fragmentos relevantes. Mide si conserva instrucciones, citas y relaciones lejanas; una respuesta fluida no demuestra que haya utilizado correctamente toda la entrada.

Presupuesto de memoria

Registra pesos, caché, runtime y margen del sistema por separado.

Recuperación

Evalúa fragmentos, solapamiento y calidad de las referencias devueltas.

Degradación

Coloca hechos al principio, centro y final para detectar pérdidas de atención.

Latencia

Mide tiempo de prefill y generación con longitudes representativas.

05

Licencia, procedencia y seguridad también deciden

Antes de integrar un archivo de pesos, comprueba la licencia del modelo y de la variante concreta. “Abierto” puede describir acceso a pesos sin conceder los mismos derechos para uso comercial, redistribución, modificación o entrenamiento derivado. Conserva el repositorio, la versión y el texto de licencia consultado.

Trata modelos, plantillas y archivos descargados como dependencias externas. Verifica el origen, revisa formatos que puedan ejecutar código, limita el acceso del proceso y evita conectar herramientas con privilegios amplios durante las primeras pruebas. La ejecución local mejora el control de datos, pero no elimina los riesgos del contenido generado ni de la cadena de suministro.

06

Haz una prueba reproducible

Guarda la versión exacta, la configuración y el conjunto de preguntas. El siguiente ejemplo consulta la información del modelo antes de ejecutarlo con Ollama.

TERMINAL
ollama show nombre-del-modelo
ollama run nombre-del-modelo
  1. 01
    Congela el conjunto

    Usa las mismas 20 tareas para todas las variantes.

  2. 02
    Registra el entorno

    Anota hardware, versión, contexto y parámetros.

  3. 03
    Revisa a ciegas

    Oculta el nombre del modelo cuando valores las respuestas.

07

Fuentes y herramientas