No el número de parámetros.
RAM o VRAM según el entorno.
Con el mismo criterio de revisión.
Empieza por el trabajo, no por el modelo
Un modelo excelente para completar código puede no ser la mejor elección para resumir documentos largos. Define primero la tarea, la sensibilidad de los datos, la latencia aceptable y si necesitas texto, visión o herramientas.
¿Los datos pueden salir del equipo?
¿Necesitas respuesta interactiva o procesos por lotes?
¿Qué errores invalidan el resultado?
¿Solo texto o también imagen, audio y archivos?
Calcula la memoria con margen
El archivo del modelo es solo una parte del consumo. El contexto, la caché y el propio entorno necesitan espacio adicional. Evita planificar al límite y reserva margen para el sistema.
| Escenario | Prioridad | Qué medir |
|---|---|---|
| Chat y redacción | Latencia percibida | Tiempo al primer token y coherencia |
| Documentos largos | Contexto útil | Recuperación de detalles y citas |
| Programación | Corrección | Tests superados y cambios innecesarios |
| Procesamiento por lotes | Rendimiento | Tokens por segundo y coste energético |
La cuantización es un intercambio, no un atajo gratis
Reducir precisión disminuye el tamaño y puede acelerar la inferencia, pero el impacto en calidad no es uniforme. Dos modelos con el mismo tamaño cuantizado pueden comportarse de forma distinta en tu tarea.
La ventana máxima no es el contexto útil
El límite anunciado describe cuánto puede admitir el sistema, no cuánto recordará con la misma precisión ni cuánto cabe en tu memoria. La caché de atención crece con la conversación y puede convertirse en el consumo dominante aunque los pesos del modelo ya estén cargados.
Empieza con el contexto mínimo que resuelve la tarea. Para documentos extensos, compara enviar todo el archivo con recuperar solo los fragmentos relevantes. Mide si conserva instrucciones, citas y relaciones lejanas; una respuesta fluida no demuestra que haya utilizado correctamente toda la entrada.
Registra pesos, caché, runtime y margen del sistema por separado.
Evalúa fragmentos, solapamiento y calidad de las referencias devueltas.
Coloca hechos al principio, centro y final para detectar pérdidas de atención.
Mide tiempo de prefill y generación con longitudes representativas.
Licencia, procedencia y seguridad también deciden
Antes de integrar un archivo de pesos, comprueba la licencia del modelo y de la variante concreta. “Abierto” puede describir acceso a pesos sin conceder los mismos derechos para uso comercial, redistribución, modificación o entrenamiento derivado. Conserva el repositorio, la versión y el texto de licencia consultado.
Trata modelos, plantillas y archivos descargados como dependencias externas. Verifica el origen, revisa formatos que puedan ejecutar código, limita el acceso del proceso y evita conectar herramientas con privilegios amplios durante las primeras pruebas. La ejecución local mejora el control de datos, pero no elimina los riesgos del contenido generado ni de la cadena de suministro.
Haz una prueba reproducible
Guarda la versión exacta, la configuración y el conjunto de preguntas. El siguiente ejemplo consulta la información del modelo antes de ejecutarlo con Ollama.
ollama show nombre-del-modelo
ollama run nombre-del-modelo
- 01Congela el conjunto
Usa las mismas 20 tareas para todas las variantes.
- 02Registra el entorno
Anota hardware, versión, contexto y parámetros.
- 03Revisa a ciegas
Oculta el nombre del modelo cuando valores las respuestas.