Versione esatta
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Risultati pubblicati e condizioni dichiarate dalle fonti. I dati sono confrontabili solo quando versione, configurazione, metrica e data coincidono.
| Modello | Organizzazione | Risultato | Metrica | Condizioni |
|---|---|---|---|---|
| Claude Opus 5 | Anthropic | 70,0 % | Accuratezza | Risultato pubblicato da Anthropic. |
| Claude Fable 5.1 | Anthropic | 73,4 % | Accuratezza | Impegno max; risultato pubblicato da Anthropic. |
| Grok 4.6 | xAI | 69,9 % | Accuratezza | Grok 4.6 High. |
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Verifica strumenti, sforzo, numero di tentativi, prompt e budget di inferenza.
Convalida il risultato con attività, lingue, formati ed errori rappresentativi del tuo prodotto.
Un benchmark pubblico orienta, ma non sostituisce una valutazione con i tuoi dati, strumenti, budget e tolleranza all'errore.
Un alias mobile e uno snapshot possono produrre risultati diversi. Registra modello, data e fornitore.
Prompt, ragionamento, strumenti, numero di tentativi e budget devono essere equivalenti per poter confrontare.
Una piccola differenza può scomparire tra un'esecuzione e l'altra. Conserva campioni, dispersione ed errori, non solo la media.
Convalida se il miglioramento si mantiene in lingue, formati e casi reali vicini al tuo prodotto.
Una metrica è utile solo quando conosciamo l’attività, le condizioni e l’errore che conta. Il risultato inizia con la progettazione del test.