No el número de parámetros.
RAM o VRAM según el entorno.
Con el mismo criterio de revisión.
Empieza por el trabajo, no por el modelo
Un modelo excelente para completar código puede no ser la mejor elección para resumir documentos largos. Define primero la tarea, la sensibilidad de los datos, la latencia aceptable y si necesitas texto, visión o herramientas.
¿Los datos pueden salir del equipo?
¿Necesitas respuesta interactiva o procesos por lotes?
¿Qué errores invalidan el resultado?
¿Solo texto o también imagen, audio y archivos?
Calcula la memoria con margen
El archivo del modelo es solo una parte del consumo. El contexto, la caché y el propio entorno necesitan espacio adicional. Evita planificar al límite y reserva margen para el sistema.
| Escenario | Prioridad | Qué medir |
|---|---|---|
| Chat y redacción | Latencia percibida | Tiempo al primer token y coherencia |
| Documentos largos | Contexto útil | Recuperación de detalles y citas |
| Programación | Corrección | Tests superados y cambios innecesarios |
| Procesamiento por lotes | Rendimiento | Tokens por segundo y coste energético |
La cuantización es un intercambio, no un atajo gratis
Reducir precisión disminuye el tamaño y puede acelerar la inferencia, pero el impacto en calidad no es uniforme. Dos modelos con el mismo tamaño cuantizado pueden comportarse de forma distinta en tu tarea.
Haz una prueba reproducible
Guarda la versión exacta, la configuración y el conjunto de preguntas. El siguiente ejemplo consulta la información del modelo antes de ejecutarlo con Ollama.
ollama show nombre-del-modelo
ollama run nombre-del-modelo
- 01Congela el conjunto
Usa las mismas 20 tareas para todas las variantes.
- 02Registra el entorno
Anota hardware, versión, contexto y parámetros.
- 03Revisa a ciegas
Oculta el nombre del modelo cuando valores las respuestas.