Versione esatta
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Risultati pubblicati e condizioni dichiarate dalle fonti. I dati sono confrontabili solo quando versione, configurazione, metrica e data coincidono.
| Modello | Organizzazione | Risultato | Metrica | Condizioni |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 88,8 % | Accuratezza | Con l'harness e il livello di impegno pubblicati. |
| GPT‑5.6 Terra | OpenAI | 87,4 % | Accuratezza | Con l'harness e il livello di impegno pubblicati. |
| GPT‑5.6 Luna | OpenAI | 84,7 % | Accuratezza | Con l'harness e il livello di impegno pubblicati. |
| Gemini 3.1 Pro | 70,7 % | Accuratezza | Valore riprodotto nella tabella comparativa di OpenAI. | |
| DeepSeek V4.1 Flash | DeepSeek | 90,6 % | Accuratezza | DeepSeek Harness, impegno max e configurazione pubblicata. |
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Verifica strumenti, sforzo, numero di tentativi, prompt e budget di inferenza.
Convalida il risultato con attività, lingue, formati ed errori rappresentativi del tuo prodotto.
Un benchmark pubblico orienta, ma non sostituisce una valutazione con i tuoi dati, strumenti, budget e tolleranza all'errore.
Un alias mobile e uno snapshot possono produrre risultati diversi. Registra modello, data e fornitore.
Prompt, ragionamento, strumenti, numero di tentativi e budget devono essere equivalenti per poter confrontare.
Una piccola differenza può scomparire tra un'esecuzione e l'altra. Conserva campioni, dispersione ed errori, non solo la media.
Convalida se il miglioramento si mantiene in lingue, formati e casi reali vicini al tuo prodotto.
Una metrica è utile solo quando conosciamo l’attività, le condizioni e l’errore che conta. Il risultato inizia con la progettazione del test.