Versione esatta
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Risultati pubblicati e condizioni dichiarate dalle fonti. I dati sono confrontabili solo quando versione, configurazione, metrica e data coincidono.
| Modello | Organizzazione | Risultato | Metrica | Condizioni |
|---|---|---|---|---|
| GPT‑5.6 Sol | OpenAI | 52,7 % | Accuratezza | Tabella ufficiale di GPT‑5.6. |
| GPT‑5.6 Terra | OpenAI | 50,4 % | Accuratezza | Tabella ufficiale di GPT‑5.6. |
| GPT‑5.6 Luna | OpenAI | 50,3 % | Accuratezza | Tabella ufficiale di GPT‑5.6. |
Verifica l’identificatore del modello, la data e se l’alias può cambiare.
Verifica strumenti, sforzo, numero di tentativi, prompt e budget di inferenza.
Convalida il risultato con attività, lingue, formati ed errori rappresentativi del tuo prodotto.
Un benchmark pubblico orienta, ma non sostituisce una valutazione con i tuoi dati, strumenti, budget e tolleranza all'errore.
Un alias mobile e uno snapshot possono produrre risultati diversi. Registra modello, data e fornitore.
Prompt, ragionamento, strumenti, numero di tentativi e budget devono essere equivalenti per poter confrontare.
Una piccola differenza può scomparire tra un'esecuzione e l'altra. Conserva campioni, dispersione ed errori, non solo la media.
Convalida se il miglioramento si mantiene in lingue, formati e casi reali vicini al tuo prodotto.
Una metrica è utile solo quando conosciamo l’attività, le condizioni e l’errore che conta. Il risultato inizia con la progettazione del test.
AutomationBench valuta se un agente riesce a completare flussi di lavoro tra applicazioni SaaS simulate e a portarli a uno stato finale verificabile. Questa guida spiega che cosa significa questa evidenza, come leggere le metriche e quali verifiche aggiuntive servono prima di estendere un risultato a un'azienda reale.
22 set 2026 ↗ PAPERAgents’ Last Exam valuta agenti su attività professionali svolte in ambienti di sistema operativo e con risultati verificabili. Il suo progetto è utile per studiare l’esecuzione di flussi di lavoro, ma una percentuale aggregata di successo non dimostra che un’occupazione possa essere automatizzata. Per interpretarla servono dettagli sulle attività, sull’ambiente, sull’harness, sul modello, sugli strumenti, sul budget e sulla versione valutata.
22 set 2026 ↗