Versione esatta
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Risultati pubblicati e condizioni dichiarate dalle fonti. I dati sono confrontabili solo quando versione, configurazione, metrica e data coincidono.
| Modello | Organizzazione | Risultato | Metrica | Condizioni |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 64,6 % | Risolto | Tabella ufficiale di GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 63,4 % | Risolto | Tabella ufficiale di GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 62,7 % | Risolto | Tabella ufficiale di GPT‑5.6. |
| Gemini 3.1 Pro | 54,2 % | Risolto | Valore riprodotto nella tabella comparativa di OpenAI. | |
| GLM‑5.1 | Z.AI | 58,4 % | Risolto | Risultato pubblicato da Z.AI. |
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Verifica strumenti, sforzo, numero di tentativi, prompt e budget di inferenza.
Convalida il risultato con attività, lingue, formati ed errori rappresentativi del tuo prodotto.
Un benchmark pubblico orienta, ma non sostituisce una valutazione con i tuoi dati, strumenti, budget e tolleranza all'errore.
Un alias mobile e uno snapshot possono produrre risultati diversi. Registra modello, data e fornitore.
Prompt, ragionamento, strumenti, numero di tentativi e budget devono essere equivalenti per poter confrontare.
Una piccola differenza può scomparire tra un'esecuzione e l'altra. Conserva campioni, dispersione ed errori, non solo la media.
Convalida se il miglioramento si mantiene in lingue, formati e casi reali vicini al tuo prodotto.
Una metrica è utile solo quando conosciamo l’attività, le condizioni e l’errore che conta. Il risultato inizia con la progettazione del test.