Welche Aufgaben sind darin enthalten?
Umfang, Schwierigkeitsgrad, Sprache, Aktualität und mögliche Kontamination.
ProbeEine Metrik ist nur dann nützlich, wenn wir die Aufgabe, die Bedingungen und den Fehler kennen, auf die es ankommt.
Das Ergebnis beginnt bereits bei der Gestaltung des Tests.
Umfang, Schwierigkeitsgrad, Sprache, Aktualität und mögliche Kontamination.
ProbeGenauigkeit, menschliche Präferenz, Kosten, Zeit oder Erfolgsquote.
ZielEingabeaufforderung, Tools, Begründung, Beispiele und Budget.
EigenkapitalVerwandeln Sie echte Bedürfnisse in ein kleines, wiederholbares Set.
Beinhaltet Normalfälle, Kanten und kostspielige Ausfälle.
FälleTrennt Korrektheit, Nützlichkeit, Sicherheit und Format.
KriteriumModell, Wiederherstellung, Tools, Latenz und Kosten.
ProduktionEin öffentlicher Benchmark bietet Orientierung, ersetzt jedoch keine Bewertung mit deinen Daten, Tools, deinem Budget und deiner Fehlertoleranz.
Ein beweglicher Alias und ein Snapshot können unterschiedliche Ergebnisse liefern. Erfasse Modell, Datum und Anbieter.
Prompt, Reasoning, Tools, Anzahl der Versuche und Budget müssen für einen Vergleich gleichwertig sein.
Ein kleiner Unterschied kann zwischen Ausführungen verschwinden. Bewahre Stichproben, Streuung und Fehler auf, nicht nur den Mittelwert.
Validiere, ob die Verbesserung über Sprachen, Formate und reale Fälle hinweg Bestand hat, die deinem Produkt nahekommen.
Referencias utilizadas para ampliar y revisar esta página.