Ilustración editorial para Cómo elegir un modelo de IA local con tus propias tareas
Imagen generada con gpt-image-2.5-sunburst para InferamaQuelle ↗
01

Die hilfreiche Frage lautet nicht: Welches Modell ist allgemein das beste?

Wenn Sie mehrere lokale Modelle zur Auswahl haben, reichen eine veröffentlichte Punktzahl oder eine überzeugende Vorführung nicht aus, um zu wissen, welches Modell sich für Ihren Arbeitsablauf eignet. Die entscheidende Frage ist konkreter: Welches dieser Modelle erledigt die Aufgabe, die Sie tatsächlich ausführen möchten, mit Ihrem Gerät und der Konfiguration, die Sie verwenden werden, in akzeptabler Weise?

Ein Abnahmetest beantwortet diese Frage mithilfe einer überschaubaren Auswahl echter oder repräsentativer Aufgaben, Kriterien, die vor dem Betrachten der Antworten festgelegt werden, und vergleichbarer Ausführungsbedingungen. Ein Team, das Anfragen kategorisieren möchte, könnte zum Beispiel prüfen, ob jedes Modell die richtige Kategorie zuweist und eine Ausgabe liefert, die sich vom eigenen System verarbeiten lässt. Bei der Bewertung geht es nicht darum, die am besten klingende Antwort auszuwählen, sondern überprüfbare Anforderungen zu kontrollieren.

Mit einer kleinen Stichprobe entsteht keine allgemeingültige Rangliste von Modellen. Ein solcher Test kann praktische Unvereinbarkeiten aufdecken – etwa ein Format, das nicht eingehalten wird, oder Fehler bei einer häufigen Art von Eingabe. Er beweist jedoch nicht, dass ein Kandidat bei anderen Aufgaben, mit anderen Nutzenden oder auf anderer Hardware zuverlässig ist. Die Schlussfolgerungen müssen auf das beschränkt bleiben, was tatsächlich geprüft wurde.

Das Ziel unterscheidet sich außerdem vom Vergleich verschiedener Quantisierungen: Während dieses Tests sollte die relevante Konfiguration gleich bleiben, statt zwischen vier, sechs oder acht Bit zu entscheiden. Es handelt sich auch nicht um einen Parallelitätstest, bei dem gleichzeitige Anfragen untersucht werden, und nicht um eine Datenschutzprüfung, bei der der Netzwerkverkehr im Mittelpunkt steht. Ist einer dieser Punkte entscheidend, braucht es dafür eine eigene Bewertung.

02

Legen Sie zuerst die Aufgabe und die Abnahmeschwelle fest

Beschreiben Sie die Arbeit, die Sie auslagern möchten, bevor Sie Kandidaten herunterladen. Vermeiden Sie vage Ziele wie „gut antworten“ oder „intelligent sein“. Legen Sie fest, welche Eingabe das Modell erhält, welches Ergebnis Sie erwarten und welche Fehler einer Verwendung entgegenstehen würden. Je stärker die Beschreibung einer Aufgabe in Ihrem Arbeitsablauf ähnelt, desto leichter lassen sich Beispiele entwickeln, mit denen sich die Kandidaten unterscheiden lassen.

Definieren Sie außerdem, was „akzeptabel“ bedeutet. Ein Entwurf kann nützlich sein, obwohl er noch geprüft werden muss. Bei einer Datenextraktion, die automatisch in eine Datenbank übernommen wird, müssen dagegen möglicherweise alle Felder vollständig und in jedem kritischen Fall korrekt formatiert sein. Das sind Entscheidungen des Teams und keine universellen Eigenschaften eines Modells. Halten Sie sie fest, bevor Sie Antworten vergleichen. So verringern Sie das Risiko, die Messlatte zugunsten eines Kandidaten nachträglich zu verschieben.

Trennen Sie Kriterien, die unterschiedliche Ergebnisse beschreiben. Inhaltliche Richtigkeit, Befolgung von Anweisungen und Formatgültigkeit sind nicht austauschbar. Eine Antwort kann korrekt sein und trotzdem das geforderte Schema verletzen; eine andere kann perfekt formatiert sein, aber einen falschen Wert enthalten. Werden diese Aspekte ohne Erklärung zu einer einzigen Bewertung zusammengefasst, gehen Informationen verloren, die für die Entscheidung wichtig sein können.

Wenn mehrere Personen bewerten, sollten sie vorab vereinbaren, wie sie mit unterschiedlichen Einschätzungen umgehen. Bei subjektiven Aufgaben ist es hilfreich, wenn zwei Personen zumindest einen Teil der Beispiele unabhängig voneinander bewerten und ihre Gründe anschließend vergleichen. Bei Uneinigkeit sollten sie festhalten, welche Regel unklar war, und diese präzisieren, bevor sie kleine Unterschiede zwischen Modellen interpretieren. Eine stilistische Vorliebe muss nicht als objektive Wahrheit ausgegeben werden.

Von einer allgemeinen Absicht zu einem überprüfbaren Kriterium

Passen Sie die Beispiele an Ihre Aufgabe an; sie sind keine universellen Anforderungen.

Vage AbsichtÜberprüfbare FrageMögliches Abnahmekriterium
Dokumente zusammenfassenEnthält die Zusammenfassung die erforderlichen Punkte, ohne fehlende Informationen hinzuzufügen?Die festgelegten Punkte sind enthalten, und es erscheinen keine Aussagen, die nicht durch den Text gestützt werden.
Informationen extrahierenLiefert das Modell die angeforderten Felder im vorgesehenen Format?Die Pflichtfelder sind korrekt, und die Ausgabe lässt sich mit dem vereinbarten Verfahren verarbeiten.
Bei internen Anfragen helfenUnterscheidet das Modell zwischen vorhandenen Informationen und solchen, die nicht vorliegen?Es antwortet auf Grundlage des bereitgestellten Materials oder weist darauf hin, dass Informationen fehlen.
03

Wählen Sie Kandidaten aus und legen Sie die Bedingungen fest

Vergleichen Sie Kandidaten, die für denselben Einsatzzweck infrage kommen. Notieren Sie für jedes Modell die genaue Kennung und verfügbare Version sowie Runtime, Gerät, Ausführungsumgebung und relevante Parameter. Ohne diese Angaben kann ein beobachteter Unterschied an der Umgebung statt am Modell liegen. Außerdem wird es für andere schwierig, den Test zu wiederholen.

Halten Sie die Bedingungen, die Sie kontrollieren können, gleich: Hardware, Runtime und deren Version, Anweisungstext, Eingabebeispiele, Kontextlimit, Generierungsparameter und Verarbeitung der Ausgabe. Benötigt ein Modell eine andere Konfiguration, um überhaupt zu starten, dokumentieren Sie diese Ausnahme und prüfen Sie, ob der Vergleich damit noch dieselbe Frage beantwortet. Ändern Sie nicht mitten im Test Parameter, um die Antworten eines Favoriten zu verbessern, ohne die übrigen Kandidaten anschließend unter gleichwertigen Bedingungen erneut auszuführen.

Bei Generatoren, deren Ausgaben zwischen Durchläufen variieren können, sollten Sie auch die für die Generierung relevanten Parameter festhalten und ausgewählte Fälle wiederholen. Eine Wiederholung beseitigt nicht jede Unsicherheit, kann aber zeigen, ob das Ergebnis von einer zufällig günstigen Ausgabe abhängt. Die Dokumentation von Ollama beschreibt beispielsweise konfigurierbare Generierungsparameter im Modelfile-Format. Welche Optionen in Ihrer Runtime verfügbar sind und was sie bedeuten, sollten Sie in der aktuellen Dokumentation der verwendeten Version prüfen.

Angaben zu Speicher und Latenz sollten nicht nur aus einer Zahl bestehen, sondern auch die Messmethode beschreiben. Notieren Sie, welcher Vorgang gemessen wurde, welches Werkzeug Sie eingesetzt haben, wie viele Wiederholungen es gab und ob das System parallel andere Aufgaben erledigte. Eine lokale Messung kann für eine Entscheidung auf dem betreffenden Gerät nützlich sein, lässt sich aber nicht automatisch auf ein anderes Gerät übertragen.

Minimales Ausführungsprotokoll

Füllen Sie für jeden Kandidaten ein Protokoll aus und behalten Sie dieselben Werte während des Vergleichs bei.

  1. 01Notieren Sie den genauen Modellnamen, die Modellkennung und die Version.
  2. 02Halten Sie Runtime, Runtime-Version und verwendetes Gerät fest.
  3. 03Speichern Sie Prompt, Parameter, Kontextlimit und alle relevanten Optionen für die Generierung.
  4. 04Bewahren Sie jede Eingabe, Antwort und Wiederholung unter einer Fallkennung auf.
  5. 05Erfassen Sie Dauer und Speicherverbrauch getrennt und geben Sie Messmethode und Bedingungen an.
04

Stellen Sie eine kleine, repräsentative Aufgabensammlung zusammen

Wählen Sie nicht nur einfache Beispiele aus und auch nicht bloß Fälle, an die Sie sich erinnern, weil ein Kandidat sie gut gelöst hat. Sammeln Sie typische Eingaben für den geplanten Einsatz und ergänzen Sie Situationen, die häufig Schwierigkeiten bereiten. Eine erste Stichprobe darf klein sein, wenn jeder Fall einen klaren Zweck hat. Wichtig ist, sie nicht als statistisch repräsentativ für die gesamte Arbeit darzustellen.

Nehmen Sie mindestens drei Arten von Eingaben auf: häufige Fälle, Grenzfälle und Beispiele, bei denen das Modell erkennen sollte, dass die verfügbaren Informationen nicht ausreichen. Wenn die Aufgabe von Formatvorgaben abhängt, sollten Sie Fälle ergänzen, mit denen sich deren Einhaltung prüfen lässt. Wenn sie auf vom Nutzer bereitgestellten Inhalten beruht, prüfen Sie, ob das Modell sich an diese Inhalte hält, statt Lücken mit Annahmen zu füllen.

Bereiten Sie für jedes Beispiel eine erwartete Antwort oder einen Bewertungsleitfaden vor, bevor Sie die Modelle ausführen. Nicht immer muss eine einzige Formulierung als einzig richtige Antwort feststehen: Bei einer Zusammenfassung kann es sinnvoller sein, die erforderlichen Fakten und unzulässigen Ergänzungen aufzulisten. Bei einer strukturierten Extraktion können dagegen konkrete Werte und ein bestimmtes Format erwartet werden.

Achten Sie auf die Qualität der Testsammlung. Vermeiden Sie vertrauliche Informationen, wenn sie nicht notwendig sind, entfernen Sie personenbezogene Kennungen, die nicht zum Fall gehören, und bewahren Sie die Eingaben so auf, dass die Bewertenden wissen, welche Daten verfügbar waren. Ändern Sie ein Beispiel nach Sichtung der Ergebnisse, kennzeichnen Sie es als neue Version. Vermischen Sie nicht stillschweigend den ursprünglichen Test mit einem überarbeiteten.

05

Bewerten Sie getrennte Dimensionen und dokumentieren Sie Fehler

Eine praktische Bewertungsrubrik unterscheidet mindestens zwischen Aufgabenkorrektheit, Befolgung von Anweisungen, Nutzbarkeit des Formats und kritischen Fehlern. Legen Sie fest, was für Ihren Einsatzzweck als kritischer Fehler gilt. Eine falsche Extraktion, die ohne Prüfung weiterverarbeitet würde, kann beispielsweise andere Folgen haben als eine wenig elegante Formulierung in einem Entwurf. Eine allgemeine Risikoliste ersetzt nicht die Definition des eigenen Teams.

Messen Sie zusätzlich zur Aufgabenqualität Latenz und beobachteten Speicherverbrauch getrennt. Diese Größen beantworten unterschiedliche Fragen: Ist das Ergebnis brauchbar? Wie lange dauert es nach der gewählten Messmethode? Welche Ressourcen schien das System bei der Ausführung zu verbrauchen? Vermeiden Sie es, sie zu einer einzigen Bewertung zu vermischen, sofern Sie nicht erklären, wie die Gewichtung zustande kam und warum sie einem tatsächlichen Bedarf entspricht. Häufig ist eine Ergebnistabelle pro Dimension mit einer anschließenden Betrachtung der Zielkonflikte hilfreicher.

Halten Sie für jeden Fehler den Fall, die Antwort, das verletzte Kriterium und den zugewiesenen Schweregrad fest. Gruppieren Sie Fehler nach Art, etwa Auslassung, erfundene Information, ungültiges Format oder missachtete Anweisung, sofern diese Kategorien zur Aufgabe passen. So lässt sich ein wiederkehrendes Muster von einem einzelnen Fehltritt unterscheiden. Verbergen Sie keinen kritischen Fehler hinter einem hohen Durchschnittswert bei einfachen Fällen.

Leistungsmessungen brauchen einen methodischen Hinweis. Das Werkzeug llama-bench für llama.cpp dokumentiert Wiederholungen und Statistiken wie Mittelwert und Standardabweichung sowie getrennte Messwerte für die Verarbeitung des Prompts und die Generierung. Die Dokumentation weist außerdem auf Grenzen der erfassten Messungen hin. Das zeigt, weshalb Sie genau beschreiben sollten, was gemessen wurde, statt jede Zahl als allgemeingültiges Maß für Geschwindigkeit zu behandeln.

Ergebnisse nach Dimension protokollieren

Diese Vorlage gibt weder Gewichtungen noch Schwellenwerte vor. Legen Sie sie passend zum Einsatzzweck fest und bewahren Sie die Beobachtungen auf, die für ihre Interpretation nötig sind.

DimensionWas festzuhalten istEntscheidungsfrage
KorrektheitGelungene Fälle, Auslassungen und falsche AussagenEntspricht der Inhalt der Bewertungsreferenz?
AnweisungenBefolgte und missachtete AnforderungenWurden die angegebenen Bedingungen eingehalten?
Nutzbares FormatGültigkeit und Vorhandensein der PflichtfelderKann der nächste Schritt im Arbeitsablauf die Ausgabe verwenden?
Kritische FehlerFall, Fehlertyp und erwartete FolgenGibt es einen Fehler, der einer Annahme des Kandidaten entgegensteht?
Latenz und SpeicherMessung, Werkzeug, Wiederholungen und BedingungenIst die beobachtete Leistung auf diesem Gerät ausreichend?
06

Führen Sie den Test durch, prüfen Sie die Ergebnisse und entscheiden Sie mit begrenztem Anspruch

Führen Sie jeden Fall mit demselben Prompt und den festgehaltenen Bedingungen aus. Bewahren Sie die ursprünglichen Ausgaben einschließlich fehlerhafter Ergebnisse auf. Eine Antwort vor der Bewertung zu bearbeiten oder zu verwerfen, macht den Test weniger reproduzierbar. Wenn die Ausgaben variieren können, wiederholen Sie ausgewählte Fälle nach einem festgelegten Verfahren und speichern Sie jede Ausgabe, nicht nur die, die am repräsentativsten erscheint.

Um Verzerrungen zu reduzieren, bewerten Sie die Antworten nach Möglichkeit, ohne den Namen des Modells anzuzeigen. Ist das nicht möglich, wenden Sie zumindest auf alle Kandidaten dieselbe Rubrik an und protokollieren Sie Meinungsverschiedenheiten. Bei einer menschlichen Bewertung helfen ausdrückliche Kriterien und – wenn möglich – zusätzliche Bewertende dabei, subjektive Entscheidungen zu erkennen. Wenn Sie die Übereinstimmung zwischen Bewertenden angeben, erklären Sie, was verglichen und wie mit Unterschieden umgegangen wurde.

Entscheiden Sie anschließend für jeden Kandidaten, ob er für einen begrenzten Einsatz übernommen, angepasst und erneut getestet oder verworfen wird. Eine Anpassung verändert die Testbedingungen: Bewahren Sie die vorherige Version auf und führen Sie den Vergleich nachvollziehbar erneut durch. Die Wahl kann von einer Ausschlussbedingung abhängen – etwa davon, dass jedes Pflichtfeld gültig sein muss – und nicht davon, wer die höchste Gesamtpunktzahl erzielt.

Eine verantwortungsvolle Entscheidung kann auch lauten: „Keiner erfüllt die Anforderungen.“ Wenn Fehler wesentliche Kriterien betreffen, müssen Sie nicht den am wenigsten schlechten Kandidaten auswählen, nur um den Vergleich abzuschließen. Erscheint ein Kandidat geeignet, bleibt die Schlussfolgerung dennoch vorläufig und auf die getesteten Beispiele, die Konfiguration und das Gerät beschränkt.

Entscheidungszyklus

Nutzen Sie das Ergebnis, um den nächsten Schritt zu bestimmen, nicht um eine allgemeine Rangliste zu verkünden.

  1. 01Prüfen Sie, ob alle Kandidaten dieselben Fälle unter den vereinbarten Bedingungen ausgeführt haben.
  2. 02Bewerten Sie jede Dimension getrennt und kennzeichnen Sie kritische Fehler.
  3. 03Untersuchen Sie Fehlermuster und Abweichungen zwischen Wiederholungen.
  4. 04Vergleichen Sie die Ergebnisse mit den vorab festgelegten Abnahmekriterien.
  5. 05Übernehmen Sie einen Kandidaten für einen begrenzten Einsatz, passen Sie ihn an und testen Sie erneut, verwerfen Sie ihn oder kommen Sie zu dem Ergebnis, dass keiner die Anforderungen erfüllt.
07

Grenzen, Pflege und weiterführende Ressourcen

Ein kleiner Test ist anfällig für Auswahlverzerrungen: Die Beispiele können eine bestimmte Formulierung, ein Fachgebiet oder eine Art von Eingabe bevorzugen. Auch Prompt und Konfiguration beeinflussen das Ergebnis. Veröffentlichen Sie, welche Fälle, Kriterien und Ausführungsbedingungen Sie verwendet haben. Übertragen Sie die Schlussfolgerungen nicht ohne zusätzliche Belege auf andere Aufgaben, Versionen, Geräte oder Nutzergruppen.

Überarbeiten Sie den Test, wenn sich der Einsatz ändert. Eine neue Datenquelle, ein anderes Eingabeformat oder die Automatisierung einer Antwort, die zuvor von einer Person geprüft wurde, kann die Bedeutung von Fehlern verändern. Bewahren Sie Versionen der Testsammlung und der Bewertungsrubrik auf, damit spätere Vergleiche eingeordnet werden können. Eine ältere Punktzahl garantiert nicht, dass das Verhalten nach einer Änderung des Systems weiterhin akzeptabel ist.

Evaluierungswerkzeuge können dabei helfen, Aufgaben und Messgrößen zu organisieren, entscheiden aber nicht, was in Ihrem Fall als Erfolg gilt. Das Projekt lm-evaluation-harness dokumentiert Aufgaben, Metriken, benutzerdefinierte Prompts und lokale Evaluationen. Es kann als Referenz oder Werkzeug nützlich sein, wenn es zum Bedarf passt. Eine Punktzahl aus einer Standardaufgabe ersetzt jedoch keine eigenen Beispiele und belegt nicht, dass ein Modell Ihre Anforderungen erfüllt.

Dieser Leitfaden behandelt die Frage, ob Kandidaten für eine konkrete Aufgabe angenommen oder verworfen werden sollen. Für weitere Informationen können Sie den Leitfaden zu lokalen Modellen, den Vergleich und den Entdeckungsbereich heranziehen. Wenn Ihre nächste Frage Quantisierung, Parallelität oder Datenschutz betrifft, behandeln Sie sie als eigene Entscheidung. Ändern Sie den Schwerpunkt, ohne zugleich das Prüfverfahren anzupassen, beantwortet der Vergleich womöglich nicht mehr die ursprüngliche Frage.

Offene Fragen

  • Die Ergebnisse hängen von der Testsammlung, dem Prompt, den Parametern, der Runtime und dem Gerät ab. Es werden keine Schlussfolgerungen zu bestimmten Modellen gezogen.
  • Wie viele Fälle und Wiederholungen angemessen sind, hängt von der Aufgabe und der beobachteten Variabilität ab. Dieser Leitfaden legt keine universellen Schwellenwerte fest.
  • Optionen und Dokumentation der Runtimes können sich ändern. Prüfen Sie die offizielle Dokumentation für die von Ihnen verwendete Version.
  • Lokale Messungen von Latenz und Speicherverbrauch lassen sich nicht direkt auf andere Geräte oder Bedingungen übertragen.
08

Weiter entdecken

08

Verwendete Quellen

03

Korrekturen und Transparenz

Wenn du falsche oder veraltete Angaben findest, sende uns die Seite und die zu prüfende Quelle.

Korrektur vorschlagen