Pas le nombre de paramètres.
RAM ou VRAM selon l'environnement.
Avec les mêmes critères d'évaluation.
Commencez par le travail, pas par le modèle
Un excellent modèle de complétion de code n’est peut-être pas le meilleur choix pour résumer de longs documents. Définissez d’abord la tâche, la sensibilité des données, la latence acceptable et si vous avez besoin de texte, de vision ou d’outils.
Les données peuvent-elles quitter l’appareil ?
Avez-vous besoin d'une réponse interactive ou de processus par lots ?
Quelles erreurs invalident le résultat ?
Uniquement du texte ou également des images, du son et des fichiers ?
Calculer la mémoire avec marge
Le fichier modèle ne représente qu'une partie de la consommation. Le contexte, le cache et l'environnement lui-même nécessitent de l'espace supplémentaire. Évitez de planifier à la limite et réservez une marge pour le système.
| Paysage | Priorité | Que mesurer |
|---|---|---|
| Discuter et écrire | Latence perçue | Délai d'obtention du premier jeton et cohérence |
| Documents longs | Contexte utile | Récupération des coordonnées et des rendez-vous |
| Programmation | Correction | Tests réussis et modifications inutiles |
| Traitement par lots | Performance | Jetons par seconde et coût énergétique |
La quantification est un compromis, pas un raccourci gratuit
Réduire la précision diminue la taille et peut accélérer l’inférence, mais l’impact sur la qualité n’est pas uniforme. Deux modèles ayant la même taille quantifiée peuvent se comporter différemment dans votre tâche.
La fenêtre maximale n’est pas le contexte utile
La limite annoncée décrit ce que le système peut accepter, non ce dont il se souviendra avec la même précision ni ce qui tient dans votre mémoire. Le cache d’attention croît avec la conversation et peut devenir la consommation dominante même lorsque les poids du modèle sont déjà chargés.
Commencez avec le contexte minimal qui résout la tâche. Pour les documents volumineux, comparez l’envoi du fichier entier avec la récupération des seuls fragments pertinents. Mesurez s’il conserve les instructions, les citations et les relations lointaines ; une réponse fluide ne démontre pas qu’il a correctement utilisé l’intégralité de l’entrée.
Consignez séparément les poids, le cache, le runtime et la marge du système.
Évaluez les fragments, le chevauchement et la qualité des références renvoyées.
Placez des faits au début, au milieu et à la fin pour détecter les pertes d’attention.
Mesurez le temps de prefill et de génération avec des longueurs représentatives.
La licence, la provenance et la sécurité comptent aussi dans la décision
Avant d’intégrer un fichier de poids, vérifiez la licence du modèle et de la variante concernée. « Ouvert » peut décrire l’accès aux poids sans accorder les mêmes droits d’usage commercial, de redistribution, de modification ou d’entraînement dérivé. Conservez le dépôt, la version et le texte de licence consulté.
Traitez les modèles, les modèles de documents et les fichiers téléchargés comme des dépendances externes. Vérifiez l’origine, examinez les formats susceptibles d’exécuter du code, limitez l’accès du processus et évitez de connecter des outils disposant de privilèges étendus lors des premiers essais. L’exécution locale améliore le contrôle des données, mais n’élimine pas les risques liés au contenu généré ni à la chaîne d’approvisionnement.
Faire un test reproductible
Enregistre la version exacte, la configuration et l'ensemble de questions. L'exemple suivant interroge les informations du modèle avant de l'exécuter avec Ollama.
ollama show nombre-del-modelo
ollama run nombre-del-modelo
- 01Geler l'ensemble
Utilisez les mêmes 20 tâches pour toutes les variantes.
- 02Enregistrer l'environnement
Notez le matériel, la version, le contexte et les paramètres.
- 03Contrôle aveugle
Masquez le nom du modèle lors de l’évaluation des réponses.