Laboratorio
Entità che sviluppa o pubblica il modello e ne mantiene la documentazione tecnica e di sicurezza.
Consulta i modelli documentati, le valutazioni pubblicate e le fonti primarie associate a questa organizzazione.
Modello orientato al lavoro sul codice e sulla conoscenza, con controlli che consentono di adattare lo sforzo a ciascun compito.
16 SET 2026↗ RAGIONAMENTO PROLUNGATORagionamento e agenti di lunga durata.
16 SET 2026↗ EQUILIBRIO COSTO/CAPACITÀCodice, ricerca e flussi professionali con strumenti.
16 SET 2026↗ ALTA EFFICIENZAVolumi elevati, sottoagenti ed estrazione strutturata.
16 SET 2026↗ FRONTIERA PRECEDENTE · AGENTIVersione precedente di Opus orientata a codice, agenti e uso del computer, mantenuta per migrazione e confronto storico.
18 SET 2026↗ AGENTI E USO DEL COMPUTERGenerazione precedente di Sonnet per codice, agenti e automazione delle interfacce, con risultati ufficiali di computer use.
18 SET 2026↗ PROGRAMMAZIONE AGENTICA E LAVORO DELLA CONOSCENZANuova generazione Opus per la programmazione agentica, l’uso del computer e il lavoro professionale prolungato, con una finestra di contesto di un milione di token.
29 SET 2026↗ INTELLIGENZA E VELOCITÀ EQUILIBRATEAggiornamento di Sonnet per le attività quotidiane, il codice e i documenti, con maggiore velocità e un milione di token di contesto.
29 SET 2026↗I dati sono mostrati con il contesto comunicato dalla fonte. Un risultato del fornitore non equivale a un confronto indipendente e non sostituisce una valutazione propria.
| Modello | Benchmark | Risultato | Metrica |
|---|---|---|---|
| Claude Opus 5 | Terminal-Bench Science 0.1 | 29,0 % | Accuratezza |
| Claude Opus 5 | CursorBench 3.2 | 70,0 % | Accuratezza |
| Claude Opus 5 | AutomationBench | 26,9 % | Accuratezza |
| Claude Fable 5.1 | Terminal-Bench Science 0.1 | 52,6 % | Accuratezza |
| Claude Fable 5.1 | CursorBench 3.2 | 73,4 % | Accuratezza |
| Claude Fable 5.1 | Humanity's Last Exam | 65,0 % | Con strumenti |
| Claude Sonnet 5 | OSWorld-Verified | Curva per livello di sforzo | Successo e costo |
| Claude Sonnet 5 | BrowseComp | Curva per livello di sforzo | Accuratezza e costo |
| Claude Haiku 4.5 | SWE-bench Verified | 73,3 % | Risolto |
| Claude Haiku 4.5 | Terminal-Bench | 41,75 % | Con ragionamento |
| Claude Opus 4.5 | Evaluaciones Claude Opus 4.5 | Pubblicate | Codice, agenti e computer |
| Claude Sonnet 4.5 | OSWorld | 61,4 % | Attività al computer risolte |
| Claude Opus 5.5 | Terminal-Bench 4.0 | 66,4 % | Accuratezza |
| Claude Opus 5.5 | GDPval-AA v2.1 | 1.846 | Elo |
| Claude Sonnet 5.5 | Terminal-Bench 4.0 | 70,6 % | Accuratezza |
Un'organizzazione, un prodotto e un modello non sono la stessa unità. Inferama li separa per evitare di attribuire capacità o condizioni commerciali all'elemento sbagliato.
Entità che sviluppa o pubblica il modello e ne mantiene la documentazione tecnica e di sicurezza.
Versione identificabile con limiti, modalità e comportamento che possono cambiare tra i rilasci.
API, applicazione, cloud associato o piano commerciale; ogni canale può avere prezzi, conservazione e limiti diversi.
Ogni affermazione deve conservare la pagina ufficiale consultata e la data di verifica.
Un modello per stimare la spesa di un flusso con strumenti per round, distinguere i token di input e output dai costi aggiuntivi e confrontare il calcolo con i registri di utilizzo.
28 set 2026 ↗ GUIAIl prezzo per milione di token non basta per stimare il costo di un flusso composto da più passaggi. Impara a sommare input, output, cache, tentativi ripetuti e revisione, e a fissare limiti prima dell’esecuzione.
25 set 2026 ↗ ANALISISAnthropic segnala che con Sonnet 5 lo stesso testo può essere convertito in più token rispetto a Sonnet 4.6. Un protocollo basato su un corpus proprio permette di verificare se questo riduce il contesto utile o modifica il costo per attività in una specifica integrazione.
23 set 2026 ↗ ANALISISI punteggi di Sonnet 4.5 in attività di ricerca biologica giustificano una valutazione interna, non una conclusione sulla sua affidabilità sperimentale. Cosa misurano Protocol QA, LAB-Bench e BixBench, cosa non misurano e come progettare una prova retrospettiva controllata.
23 set 2026 ↗ GUIAIl prezzo per chiamata, da solo, non rivela quanto costa una risposta che il team può effettivamente accettare. Questa guida presenta una formula riproducibile per sommare token di input e output, tentativi ripetuti e revisione, con tre scenari illustrativi per Claude Haiku 4.5.
23 set 2026 ↗ ANALISISUn punteggio di benchmark non dimostra che un modello sappia usare un’applicazione in sicurezza. Proponiamo una valutazione circoscritta per misurare successi, errori, recupero, latenza e necessità di supervisione.
23 set 2026 ↗