Nicht die Anzahl der Parameter.
Je nach Umgebung RAM oder VRAM.
Mit den gleichen Bewertungskriterien.
Beginnen Sie mit der Arbeit, nicht mit dem Modell
Ein hervorragendes Modell zur Codevervollständigung ist möglicherweise nicht die beste Wahl für die Zusammenfassung langer Dokumente. Definieren Sie zunächst die Aufgabe, die Datensensibilität, die akzeptable Latenz und ob Sie Text, Vision oder Tools benötigen.
Können die Daten das Gerät verlassen?
Benötigen Sie interaktive Antworten oder Batch-Prozesse?
Welche Fehler machen das Ergebnis ungültig?
Nur Text oder auch Bild, Audio und Dateien?
Speicher mit Marge berechnen
Die Modelldatei ist nur ein Teil des Verbrauchs. Der Kontext, der Cache und die Umgebung selbst benötigen zusätzlichen Platz. Vermeiden Sie eine Planung bis zum Limit und reservieren Sie Marge für das System.
| Landschaft | Priorität | Was zu messen ist |
|---|---|---|
| Chatten und schreiben | Wahrgenommene Latenz | Zeit bis zum ersten Token und Konsistenz |
| Lange Dokumente | Hilfreicher Kontext | Abruf von Details und Terminen |
| Programmierung | Korrektur | Bestandene Tests und unnötige Änderungen |
| Stapelverarbeitung | Leistung | Token pro Sekunde und Energiekosten |
Quantisierung ist ein Kompromiss und keine kostenlose Abkürzung
Eine Verringerung der Präzision verringert die Größe und kann die Schlussfolgerung beschleunigen, die Auswirkung auf die Qualität ist jedoch nicht einheitlich. Zwei Modelle mit derselben quantisierten Größe verhalten sich bei Ihrer Aufgabe möglicherweise unterschiedlich.
Das maximale Fenster ist nicht der nutzbare Kontext
Das angekündigte Limit beschreibt, wie viel das System aufnehmen kann, nicht wie viel es mit derselben Genauigkeit erinnert oder wie viel in deinen Arbeitsspeicher passt. Der Aufmerksamkeits-Cache wächst mit der Unterhaltung und kann zum dominierenden Verbrauch werden, obwohl die Modellgewichte bereits geladen sind.
Beginne mit dem minimalen Kontext, der die Aufgabe löst. Vergleiche bei umfangreichen Dokumenten das Senden der gesamten Datei mit dem Abrufen nur der relevanten Ausschnitte. Miss, ob Anweisungen, Zitate und weit entfernte Beziehungen erhalten bleiben; eine flüssige Antwort beweist nicht, dass die gesamte Eingabe korrekt genutzt wurde.
Erfasse Gewichte, Cache, Runtime und Systemreserve getrennt.
Bewerte Ausschnitte, Überlappungen und die Qualität der zurückgegebenen Referenzen.
Platziere Fakten am Anfang, in der Mitte und am Ende, um Aufmerksamkeitsverluste zu erkennen.
Miss die Prefill- und Generierungszeit mit repräsentativen Längen.
Lizenz, Herkunft und Sicherheit sind ebenfalls entscheidend
Prüfe vor der Einbindung einer Gewichtungsdatei die Lizenz des Modells und der konkreten Variante. „Offen“ kann den Zugriff auf Gewichte beschreiben, ohne dieselben Rechte für kommerzielle Nutzung, Weiterverbreitung, Änderung oder abgeleitetes Training einzuräumen. Bewahre das Repository, die Version und den konsultierten Lizenztext auf.
Behandle Modelle, Vorlagen und heruntergeladene Dateien als externe Abhängigkeiten. Prüfe die Herkunft, untersuche Formate, die Code ausführen können, beschränke den Prozesszugriff und vermeide es, während der ersten Tests Tools mit weitreichenden Berechtigungen anzubinden. Die lokale Ausführung verbessert die Datenkontrolle, beseitigt jedoch weder die Risiken generierter Inhalte noch jene der Lieferkette.
Machen Sie einen reproduzierbaren Test
Speichert die genaue Version, Konfiguration und den Fragensatz. Das folgende Beispiel fragt Modellinformationen ab, bevor es mit Ollama ausgeführt wird.
ollama show nombre-del-modelo
ollama run nombre-del-modelo
- 01Frieren Sie das Set ein
Nutzen Sie für alle Varianten die gleichen 20 Aufgaben.
- 02Registrieren Sie die Umgebung
Beachten Sie Hardware, Version, Kontext und Parameter.
- 03Blindcheck
Blenden Sie den Modellnamen aus, wenn Sie Antworten bewerten.