Non il numero di parametri.
RAM o VRAM a seconda dell'ambiente.
Con gli stessi criteri di revisione.
Inizia con il lavoro, non con il modello
Un modello eccellente per il completamento del codice potrebbe non essere la scelta migliore per riassumere documenti lunghi. Per prima cosa definisci l'attività, la sensibilità dei dati, la latenza accettabile e se hai bisogno di testo, visione o strumenti.
I dati possono lasciare il dispositivo?
Hai bisogno di risposte interattive o processi batch?
Quali errori invalidano il risultato?
Solo testo o anche immagini, audio e file?
Calcola la memoria con margine
Il file del modello è solo una parte del consumo. Il contesto, la cache e l'ambiente stesso richiedono spazio aggiuntivo. Evitare di pianificare al limite e riservare un margine per il sistema.
| Scenario | Priorità | Cosa misurare |
|---|---|---|
| Chiacchierare e scrivere | Latenza percepita | Tempo per il primo gettone e coerenza |
| Documenti lunghi | Contesto utile | Recupero dettagli e appuntamenti |
| Programmazione | Correzione | Test superati e modifiche inutili |
| Elaborazione batch | Prestazione | Gettoni al secondo e costo energetico |
La quantizzazione è un compromesso, non una scorciatoia gratuita
La riduzione della precisione riduce le dimensioni e può accelerare l'inferenza, ma l'impatto sulla qualità non è uniforme. Due modelli con la stessa dimensione quantizzata potrebbero comportarsi diversamente nell'attività.
La finestra massima non è il contesto utile
Il limite annunciato descrive quanto il sistema può accettare, non quanto ricorderà con la stessa precisione né quanto entra nella tua memoria. La cache dell'attenzione cresce con la conversazione e può diventare il consumo dominante anche se i pesi del modello sono già caricati.
Inizia con il contesto minimo che risolve l'attività. Per documenti estesi, confronta l'invio dell'intero file con il recupero dei soli frammenti rilevanti. Misura se conserva istruzioni, citazioni e relazioni lontane; una risposta fluida non dimostra che abbia usato correttamente tutto l'input.
Registra separatamente pesi, cache, runtime e margine del sistema.
Valuta i frammenti, la sovrapposizione e la qualità dei riferimenti restituiti.
Colloca i fatti all'inizio, al centro e alla fine per rilevare perdite di attenzione.
Misura il tempo di prefill e generazione con lunghezze rappresentative.
Anche licenza, provenienza e sicurezza sono decisive
Prima di integrare un file dei pesi, verifica la licenza del modello e della variante specifica. “Aperto” può descrivere l'accesso ai pesi senza concedere gli stessi diritti per l'uso commerciale, la ridistribuzione, la modifica o l'addestramento derivato. Conserva il repository, la versione e il testo della licenza consultato.
Tratta modelli, template e file scaricati come dipendenze esterne. Verifica l'origine, esamina i formati che possono eseguire codice, limita l'accesso del processo ed evita di collegare strumenti con privilegi estesi durante le prime prove. L'esecuzione locale migliora il controllo dei dati, ma non elimina i rischi del contenuto generato né della catena di fornitura.
Effettuare un test riproducibile
Salva la versione esatta, la configurazione e il set di domande. Nell'esempio seguente vengono interrogate le informazioni sul modello prima di eseguirlo con Ollama.
ollama show nombre-del-modelo
ollama run nombre-del-modelo
- 01Congela il set
Utilizza le stesse 20 attività per tutte le varianti.
- 02Registra l'ambiente
Annotare hardware, versione, contesto e parametri.
- 03Controllo cieco
Nascondi il nome del modello quando valuti le risposte.