Cosa è cambiato
Anthropic ha lanciato Claude Opus 5 il 24 luglio 2026. Il posizionamento indicato dall’azienda è netto: non viene presentato soltanto come un modello per risposte rapide, ma come uno strumento destinato a risolvere attività di programmazione e di conoscenza che richiedono di riesaminare risultati, usare strumenti e mantenere il contesto per più passaggi. Il modello è disponibile tramite API con l’identificatore claude-opus-5 e, secondo la documentazione vigente, risulta attivo. La data di ritiro indicata come più precoce possibile è il 24 luglio 2027; non è una data di ritiro confermata, bensì una soglia minima nell’ambito della politica di ciclo di vita di Anthropic.
La principale modifica commerciale riguarda il prezzo dell’API: 5 dollari per milione di token in ingresso e 25 dollari per milione di token in uscita, le stesse tariffe base che Anthropic attribuisce a Opus 4.8. A ciò si aggiunge un parametro di «impegno» che consente di decidere quanto ragionamento e consumo di token assegnare a ciascuna richiesta. La promessa implicita è che un impegno inferiore possa contenere spesa e latenza, mentre i livelli più alti puntano a privilegiare la qualità nelle attività più difficili.
La scheda tecnica colloca la finestra di contesto a un milione di token e l’output massimo ordinario a 128.000 token; l’API batch, ancora contrassegnata come beta, può arrivare a 300.000 token in uscita. Il modello accetta testo e immagini in ingresso e genera testo. Il limite affidabile delle sue conoscenze e dei dati di addestramento è fissato a maggio 2026. Non dovrebbe quindi essere trattato come fonte autonoma di informazioni aggiornate su fatti successivi a tale data: per questi casi richiede accesso a fonti esterne, strumenti di ricerca o documentazione fornita dall’organizzazione che lo utilizza.
Esistono inoltre cambiamenti operativi che incidono sulle integrazioni già esistenti. La documentazione di Anthropic segnala che parametri quali temperature, top_p e top_k sono deprecati per i modelli Claude 4.7 e successivi; se configurati al di fuori dei valori predefiniti, possono produrre un errore. Per i team che aggiornano un’applicazione, la migrazione non consiste quindi nel solo cambio di nome del modello: occorre rivedere parametri, test di regressione, budget di token e regole di supervisione.
Capacità ed evidenze: cosa afferma il fornitore
Anthropic sostiene che Opus 5 ottenga risultati di primo livello in alcune valutazioni di programmazione e lavoro della conoscenza. Fra i test messi in evidenza figurano Frontier-Bench v0.1, CursorBench 3.2, ARC-AGI 3, Zapier AutomationBench e OSWorld 2.0. In programmazione, afferma che superi gli altri modelli valutati in Frontier-Bench e che, con impegno massimo, si collochi a meno di mezzo punto percentuale dal punteggio massimo di Claude Fable 5 in CursorBench, con metà del costo per attività. Nell’automazione e nell’uso del computer, l’azienda dichiara di ottenere un rapporto tra risultati e costo migliore rispetto agli altri modelli inclusi nei propri grafici.
L’azienda comunica anche miglioramenti rispetto a Opus 4.8 in valutazioni interne sulle scienze della vita, comprese attività di chimica organica e bioinformatica. In particolare, riporta una differenza di 10,2 punti percentuali in un benchmark interno di inferenza delle strutture molecolari dalla spettroscopia e di 7,7 punti in un’attività relativa alle varianti proteiche. Questi dati descrivono misurazioni di Anthropic e non equivalgono, da soli, a una convalida clinica, scientifica o regolatoria dell’uso del modello nella ricerca applicata.
Le evidenze pubblicate combinano materiali di tipo diverso: benchmark con nomi e risultati riassunti, prove eseguite da Anthropic e testimonianze di aziende che hanno partecipato all’accesso anticipato. Le testimonianze possono offrire esempi di adozione, ma non sono confronti indipendenti né sostituiscono una valutazione riproducibile nelle condizioni di ciascuna organizzazione. Inoltre, la stessa nota di lancio precisa che almeno una delle misurazioni di Frontier-Bench è stata eseguita in un ambiente interno, con cinque tentativi per attività e con Opus 4.8 come fallback quando i classificatori di sicurezza respingevano richieste rivolte a Opus 5 o Fable 5.
Quest’ultima precisazione è rilevante per interpretare i grafici. Un punteggio ottenuto in un sistema con nuovi tentativi, strumenti, una specifica configurazione di impegno o un modello di fallback non va letto come la capacità isolata di un singolo modello in una singola chiamata. Non è neppure sicuro trasferire una posizione in un benchmark a un processo aziendale reale. In produzione intervengono fattori spesso non pienamente catturati dai test: qualità del contesto, autorizzazioni degli strumenti, stato dei dati, formato delle istruzioni, tolleranza all’errore, necessità di tracciabilità e costo delle revisioni umane.
La guida di prompting di Anthropic offre un segnale pratico sull’uso previsto del modello. Raccomanda di strutturare istruzioni complesse con tag XML, fornire esempi pertinenti e diversificati e ordinare con cura i documenti lunghi. Per input superiori a 20.000 token, consiglia di porre prima le informazioni estese e poi la domanda; raccomanda inoltre di richiedere citazioni testuali dei documenti forniti prima di svolgere l’analisi. Sono pratiche utili per ridurre l’ambiguità, ma non garantiscono l’accuratezza fattuale né eliminano la necessità di controlli esterni.
Limiti e rischi documentati
Il lancio non elimina le restrizioni di sicurezza. Anthropic afferma che Opus 5 non supera la soglia delle capacità a duplice uso rischiose in biologia e cybersicurezza e che resta indietro rispetto a Mythos 5 nella ricerca biologica e nella cybersicurezza offensiva. Riconosce tuttavia miglioramenti rilevanti nell’individuazione delle vulnerabilità software, come conseguenza della sua capacità generale. Distingue tale rilevamento dalla creazione di exploit: secondo la valutazione OSS-Fuzz, Opus 5 si avvicina a Mythos 5 nel localizzare vulnerabilità, ma resta considerevolmente indietro nello sviluppo di exploit.
Per controllare questo rischio, Anthropic applica classificatori a determinate richieste di cybersicurezza. La politica descritta consente di localizzare vulnerabilità nel codice sorgente, ma blocca l’analisi basata su binari, i test di penetrazione e la generazione di exploit. Quando una richiesta viene segnalata in Claude.ai, Claude Code o Claude Cowork, il comportamento predefinito è reindirizzarla a Opus 4.8. Anche l’API può abilitare fallback automatici. Questa architettura limita alcuni usi, ma introduce un tema di governance: un’organizzazione deve registrare quale modello ha effettivamente risposto, poiché comportamento, costo e restrizioni possono differire da quelli inizialmente previsti.
Anthropic riconosce anche limiti importanti nella ricerca biologica autonoma di lunga durata, proprio l’ambito che identifica come più rilevante per i rischi biologici. L’esistenza di salvaguardie e test di sicurezza non rende il sistema infallibile. I controlli automatici possono produrre blocchi ingiustificati, classificazioni errate o risposte generate da un modello alternativo. Al contrario, una richiesta che non attivi un classificatore non risulta per questo validata come corretta, sicura o appropriata per una decisione ad alto impatto.
Nelle attività informative persistono i rischi tipici dei modelli linguistici: risposte plausibili ma errate, citazioni inesistenti o attribuite male, omissione di condizioni rilevanti ed errori nell’interpretazione dei dati. Il limite delle conoscenze a maggio 2026 aggiunge un vincolo temporale concreto. Per analisi legali, mediche, finanziarie, scientifiche o di sicurezza, Opus 5 dovrebbe operare come supporto sottoposto a revisione esperta e verifica su fonti primarie, non come sostituto del giudizio professionale.
Esiste anche un costo di dipendenza tecnologica. La documentazione di Anthropic avverte che i modelli possono essere attivi, legacy, deprecati o ritirati e che le richieste a modelli ritirati falliranno. Sebbene l’azienda indichi che informerà con almeno 60 giorni di anticipo del ritiro di modelli pubblici i clienti con distribuzioni attive, è opportuno progettare applicazioni con test di compatibilità, astrazione del fornitore, metriche per versione e piani di rollback. La continuità del servizio non dovrebbe dipendere dal fatto che un modello specifico mantenga indefinitamente lo stesso comportamento.
Impatto pratico: come decidere se è adatto
Per i team di sviluppo, la proposta di Opus 5 è più pertinente quando il lavoro richiede comprendere un repository, indagare un difetto, proporre modifiche coordinate, eseguire strumenti e convalidare risultati. Il suo potenziale valore non si misura dalla qualità di una breve risposta, ma dal costo totale per chiudere un’attività: token, chiamate agli strumenti, latenza, tempo di revisione umana, errori evitati e ripetizione delle esecuzioni. Un test utile dovrebbe impiegare incidenti, moduli, documentazione e criteri di accettazione rappresentativi, senza esporre segreti o dati personali non necessari.
Nel lavoro della conoscenza, il modello può essere utile per sintetizzare fascicoli estesi, confrontare documenti, estrarre strutture da tabelle, preparare bozze o individuare questioni da sottoporre a revisione. L’approccio più prudente consiste nell’obbligare a separare evidenze, inferenze e raccomandazioni; richiedere riferimenti al materiale consegnato; e stabilire che l’output non venga usato per eseguire azioni esterne senza conferma. La capacità di mantenere il contesto non risolve da sola un problema di qualità dei dati: se i documenti sono contraddittori, incompleti o datati in modo errato, una sintesi ben scritta può restare sbagliata.
La regolazione dell’impegno permette di sperimentare su un portafoglio di attività. Le richieste di routine possono essere valutate con livelli inferiori, mentre il debugging complesso, il ragionamento numerico o l’analisi documentale ad alto impatto possono giustificare un livello maggiore e controlli aggiuntivi. Tuttavia, l’opzione più economica non minimizza sempre il costo finale e quella più intensa non fornisce sempre la risposta migliore. È opportuno misurare tasso di successo, token in ingresso e in uscita, tempo di risposta, interventi umani, errori critici e variabilità tra esecuzioni. I confronti vanno effettuati con il processo attuale, non soltanto con un altro modello.
La guida tecnica stessa suggerisce di evitare, nella migrazione a Opus 5, istruzioni ereditate che chiedano un’autoverifica eccessiva, perché potrebbero aggiungere token e latenza. Ciò non equivale a eliminare la revisione esterna. Un conto è un’istruzione interna che chiede al modello di ricontrollare il proprio lavoro; tutt’altra cosa è un controllo indipendente: test automatizzati, convalida dei dati, revisione del codice, doppia firma o approvazione umana prima di un’operazione irreversibile.
La decisione di adozione dovrebbe includere un pilota circoscritto. È consigliabile selezionare un insieme di attività con esiti verificabili, definire una soglia di qualità e un budget, testare diversi livelli di impegno, registrare quando intervengono filtri o fallback e rivedere campioni degli insuccessi. Se il modello utilizza strumenti in grado di scrivere, distribuire, acquistare, modificare autorizzazioni o inviare comunicazioni, i permessi devono essere minimi e reversibili. L’autonomia dovrebbe crescere gradualmente e solo dopo aver dimostrato affidabilità in un ambiente controllato.
Conclusioni
Claude Opus 5 rappresenta, secondo le informazioni di Anthropic, un aggiornamento incentrato sul rendere più praticabile l’uso di un modello avanzato per programmazione, automazione e analisi della conoscenza senza aumentare la tariffa base rispetto a Opus 4.8. La finestra di contesto di un milione di token, il controllo dell’impegno e l’attenzione ai flussi in più passaggi delineano un prodotto pensato per integrazioni più ampie di una chat convenzionale.
Tuttavia, le affermazioni sulle prestazioni vanno lette nel loro contesto. Provengono in larga parte dal fornitore e dipendono da benchmark, harness di valutazione, livelli di impegno e, in alcuni casi, meccanismi di fallback. I risultati sono indizi rilevanti, ma non una dimostrazione universale di superiorità né una garanzia di prestazioni in uno specifico ambiente. Per un’organizzazione, la domanda decisiva non è se Opus 5 guidi una classifica, ma se migliori in modo misurabile un processo concreto con rischi e costi accettabili.
Il modello non elimina neppure i problemi di sicurezza, aggiornamento fattuale, allucinazioni o dipendenza dalle versioni. Anthropic documenta restrizioni nella cybersicurezza, limiti nella ricerca autonoma prolungata e una data di cutoff delle conoscenze. Usato con dati ben governati, test propri, osservabilità e revisione umana proporzionata al rischio, può essere uno strumento di supporto per attività complesse. Usato come autorità autonoma o come sostituto dei controlli, i suoi limiti restano determinanti.
Questioni aperte
- Non è stata effettuata una valutazione indipendente dei benchmark, dei grafici o delle testimonianze dei clienti citati da Anthropic nella presentazione.
- Le metriche di costo per attività dipendono dalla configurazione di impegno, dagli strumenti disponibili, dai nuovi tentativi, dalla lunghezza del contesto e dal prezzo della supervisione umana; non possono essere estrapolate automaticamente a tutti i casi.
- La documentazione consultata indica una data minima di ritiro, non una data definitiva, e le piattaforme gestite da partner possono applicare calendari di ciclo di vita differenti.
- La documentazione non consente di inferire con precisione il tasso di errore in uno specifico dominio, lingua, repository o insieme documentale senza test locali.
- I classificatori e i fallback automatici possono modificare la risposta finale rispetto a un’esecuzione diretta di Opus 5; l’incidenza reale dipende dalla configurazione e dal tipo di richiesta.
Continua a esplorare
Fonti consultate
Correzioni e trasparenza
Se trovi un dato errato o non aggiornato, inviaci la pagina e la fonte da verificare.
Proponi una correzione