Ilustración editorial para ChatGPT Deep Research, Gemini Deep Research, Perplexity y Claude Research: cómo compararlos
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

Che cosa si confronta e che cosa non si può concludere in anticipo

Un assistente di ricerca sul web non è semplicemente un motore di ricerca che restituisce un elenco di pagine. Gli si chiede di trovare informazioni, organizzarle e sintetizzarle in un testo con riferimenti che una persona possa esaminare. La valutazione, quindi, non dovrebbe fermarsi alla presenza di link nel rapporto: occorre verificare se ogni fonte sostiene l’affermazione a cui è associata, se sono state trovate fonti pertinenti e se il testo rappresenta fedelmente eventuali divergenze.

Questa guida propone di confrontare ChatGPT Deep Research, Gemini Deep Research, Perplexity Pro Search e Claude Research attraverso incarichi equivalenti. Non proclama un vincitore e non presenta come dimostrato che uno strumento sia più preciso, completo o rapido degli altri. La documentazione disponibile descrive le funzioni dichiarate dai fornitori, ma non offre un test comparativo comune per tutti e quattro i prodotti. Inoltre, tra le fonti verificate qui non è presente documentazione su Claude Research sufficiente a confermarne le opzioni, la disponibilità o il funzionamento. Le sue caratteristiche vanno quindi verificate direttamente prima di avviare una valutazione: non bisogna dedurle per analogia.

La distinzione tra una funzione annunciata e un risultato verificato è fondamentale. Il fatto che un prodotto descriva una ricerca in più fasi, la ricerca sul web, la selezione delle fonti o la presenza di link non dimostra che, per una specifica domanda, abbia trovato le fonti migliori. Per scoprirlo occorre svolgere gli stessi compiti, mantenere traccia delle condizioni di prova e controllare manualmente un campione delle affermazioni principali.

02

Progettare una prova equa e riproducibile

Un confronto utile comincia dalla registrazione delle condizioni, non da una raccolta informale di schermate. Annota data e ora, nome e versione visibile della funzione utilizzata, tipo di account o piano, controlli attivati, testo esatto di ogni incarico ed eventuali documenti caricati. Conserva anche l’intera risposta, compresi i riferimenti, gli avvisi sui limiti e le domande di approfondimento. Piani, quote e funzioni cambiano: se non vengono registrati, una differenza nei risultati potrebbe dipendere dall’accesso e non dal comportamento del sistema.

Usa quattro incarichi con obiettivi distinti. Per le informazioni recenti, chiedi un dato con una data di riferimento e una fonte primaria. Per una domanda con più parti, elenca ogni sottoquesito e chiedi che la risposta indichi quali prove coprono ciascuno. Per una ricerca limitata a determinati siti, stabilisci in anticipo quali domini si possono usare e controlla se i riferimenti finali rispettano il vincolo. Per i documenti personali, usa lo stesso file negli strumenti che ne consentono il caricamento e chiedi che il rapporto distingua le prove documentali da quelle reperite sul web. Se una funzione non è disponibile, registrala come non valutabile in quelle condizioni: non sostituirla con una modalità diversa senza dichiararlo.

Usare la stessa formulazione riduce le differenze interpretative, anche se non le elimina. È utile svolgere un secondo ciclo con una formulazione equivalente per individuare risultati instabili. Non modificare gli incarichi a metà della prova per favorire uno strumento, né trattare come equivalenti modalità o piani che non lo sono. Se non è possibile uniformare la configurazione, il confronto deve descrivere questa limitazione, non nasconderla.

Protocollo minimo

  1. 01Definire quattro incarichi: dato recente, ricerca con più parti, ricerca per dominio e analisi di documenti personali.
  2. 02Annotare, per ogni prodotto, data, piano, funzione, impostazioni di ricerca, file e limiti visibili.
  3. 03Inserire lo stesso incarico, salvare la risposta completa e non cambiare la configurazione durante il ciclo.
  4. 04Verificare le affermazioni centrali sulle pagine originali e registrare le citazioni corrette, deboli, irrilevanti o non funzionanti.
  5. 05Ripetere gli incarichi più importanti e distinguere le differenze stabili dalle variazioni tra esecuzioni.
03

Che cosa misurare nelle fonti, nelle citazioni e nelle divergenze

La qualità dei riferimenti va valutata affermazione per affermazione. Per ogni frase verificabile del rapporto, individua la citazione associata e apri la pagina originale. Controlla che la pagina contenga il dato, che si riferisca alla stessa popolazione, allo stesso periodo e allo stesso contesto, e che la formulazione del rapporto non esageri ciò che la fonte consente di concludere. Una pagina può essere pertinente al tema generale e tuttavia non sostenere la cifra specifica o il nesso causale attribuitole dall’assistente.

Registra separatamente le citazioni che si aprono e sono pertinenti, quelle che sostengono solo una parte dell’affermazione, quelle non abbastanza attinenti e quelle che non è possibile consultare. Se un’affermazione riunisce più fatti, scomponila prima di valutarne il supporto. Un tasso aggregato senza questo controllo può essere fuorviante: molti riferimenti corretti per dati secondari non compensano un’affermazione centrale priva di sostegno.

Conta anche la varietà delle prove. Una fonte primaria — per esempio una norma, un insieme di dati originale o il documento dell’istituzione responsabile del dato — non svolge sempre la stessa funzione di un’analisi giornalistica o di una rassegna accademica. Non è necessario richiedere una fonte primaria per ogni domanda, ma occorre identificare il tipo di prova utilizzata e verificare se vi siano fonti indipendenti. Se due fonti divergono, il rapporto dovrebbe spiegare che cosa non coincide, perché e che cosa non è possibile risolvere sulla base delle prove disponibili, invece di presentare una sola versione come consenso.

Il tempo necessario per la verifica completa conclude la valutazione. Misura quanto impiega una persona a controllare le affermazioni principali, trovare il passaggio pertinente e decidere se la citazione è sufficiente. Questo tempo non è una misura assoluta della qualità: dipende dall’argomento, dall’accessibilità delle fonti e dall’esperienza di chi effettua il controllo. È però una variabile pratica per i gruppi che devono consegnare rapporti verificabili entro scadenze precise.

Matrice per valutare ogni rapporto

CriterioChe cosa osservareChe cosa registrare
CoperturaSe risponde a tutte le parti dell’incarico e segnala ciò che resta irrisolto.Parti coperte, omesse e non verificabili.
Supporto delle citazioniSe la fonte originale sostiene direttamente l’affermazione associata, con ambito e periodo corretti.Diretto, parziale, insufficiente, irrilevante o inaccessibile.
Qualità e varietàPresenza di fonti primarie pertinenti, fonti indipendenti e prospettive divergenti.Tipo e provenienza della fonte, divergenze individuate.
TracciabilitàFacilità di apertura della fonte, reperimento del passaggio e associazione alla frase pertinente.Link funzionante, passaggio individuabile e ambiguità.
Impegno di revisioneTempo necessario per verificare i risultati più importanti.Minuti per rapporto e difficoltà riscontrate.
04

Quattro compiti che mettono in luce le differenze pratiche

Per trovare un dato recente, l’incarico deve specificare che cosa si intende per “recente” e quale tipo di supporto occorre. Chiedi la data del dato, l’ente che lo pubblica e un link alla fonte originale. Poi controlla se il risultato confonde la data di pubblicazione con quella di rilevazione, se tratta un dato provvisorio come definitivo o se cita una notizia che non conduce alla fonte primaria. Questa prova valuta attualità e tracciabilità, non la capacità generale di fare ricerca.

Per una domanda articolata in più fasi, scrivi un elenco di sottoquesiti e chiedi una sintesi che mantenga visibili le differenze tra loro. Una risposta scorrevole può nascondere che una parte è sostenuta da prove solide e un’altra da una fonte debole. Controlla anche se la conclusione deriva dalle fonti o se aggiunge un’inferenza non indicata come tale. Per agevolare la verifica, chiedi che ogni punto importante sia accompagnato dal riferimento specifico che lo sostiene.

Nella prova di ricerca limitata a determinati siti, decidi prima se vuoi consentire esclusivamente un elenco di domini oppure se vuoi dar loro priorità senza escludere gli altri. Sono istruzioni diverse. Poi esamina le fonti della risposta: la possibilità di impostare determinati siti non garantisce, di per sé, che tutti i riferimenti finali provengano da essi. La documentazione di OpenAI descrive un’opzione di Deep Research per limitare la ricerca a siti considerati affidabili; la guida di Gemini documenta controlli e selezione delle fonti. Si tratta di informazioni sulle opzioni dichiarate, non della verifica che ogni esecuzione le rispetti.

Per i documenti personali, usa un file privo di dati sensibili e contenente affermazioni verificabili. Chiedi all’assistente di separare esplicitamente ciò che ha ricavato dal documento da ciò che ha trovato sul web. Controlla se le citazioni rimandano al file, a pagine web o a entrambi, e se il rapporto attribuisce correttamente ogni prova. La documentazione ufficiale di Gemini descrive il caricamento dei file e la selezione delle fonti come opzioni; OpenAI descrive anch’essa l’uso di file forniti dall’utente in Deep Research. La disponibilità concreta e il comportamento vanno verificati nell’account sottoposto alla prova.

Perplexity presenta Pro Search come una modalità con selezione di modelli e modalità di ricerca, tra cui Web, Academic, Finance e Files, e afferma che le risposte rimandano a fonti originali. Queste descrizioni aiutano a progettare una prova che registri la modalità utilizzata. Non sostituiscono il controllo delle pagine originali e non consentono di prevedere la percentuale di citazioni corrette. Un confronto valido deve annotare modalità, piano e condizioni, e poi valutare ogni riferimento con gli stessi criteri applicati agli altri prodotti.

05

Come interpretare le funzioni e i limiti di accesso

Le pagine ufficiali sono adatte a confermare ciò che ciascun fornitore dichiara sui propri prodotti, ma non costituiscono una valutazione indipendente. OpenAI descrive Deep Research come un flusso di ricerca in più fasi con citazioni e distingue questa modalità da una ricerca più rapida. Anche la guida di OpenAI Academy illustra il flusso. Google indica che Google Search è incluso per impostazione predefinita come fonte in Gemini Deep Research e documenta opzioni relative alle fonti, alla modifica del piano di ricerca e al caricamento di file. Perplexity descrive Pro Search, le sue modalità e il collegamento a fonti originali. Queste dichiarazioni aiutano a configurare la prova; non giustificano una classificazione degli strumenti in base alla precisione.

I limiti di accesso devono far parte dei risultati. Registra se un account può usare la funzione, quale piano richiede il fornitore, quali quote sono indicate e se sono disponibili il caricamento di file o i controlli sulle fonti. Non estendere il risultato ottenuto con un account a tutti gli utenti. Le pagine dei piani possono cambiare e una quota indicata oggi non va presentata come permanente. Verifica nuovamente le condizioni subito prima della pubblicazione e specifica la data del controllo.

Anche le prove accademiche disponibili tra le fonti fornite hanno una portata limitata. Uno studio su arXiv esamina la credibilità delle fonti e il supporto delle risposte in ChatGPT e Perplexity, ma non include Claude né Gemini. I suoi risultati riguardano i prodotti e le condizioni analizzati in quel lavoro: non vanno trasferiti automaticamente alle versioni attuali e non devono essere usati per proclamare un vincitore in questo confronto. Uno studio precedente può aiutare a formulare criteri, ma valutare i prodotti attuali richiede dati propri e un metodo esplicito.

In particolare, la mancanza di una fonte verificata su Claude Research impedisce di descriverne qui capacità o disponibilità come fatti. Lo strumento può essere incluso nella prova se si confermano la documentazione ufficiale e l’accesso attuale; fino a quel momento, ogni affermazione sui suoi controlli, sulle fonti o sulle citazioni resta da verificare. Questa cautela evita di colmare le lacune con supposizioni.

Matrice decisionale in base al compito

EsigenzaChe cosa privilegiareChe cosa verificare prima di scegliere
Trovare un dato recenteData di aggiornamento, fonte primaria e corrispondenza tra dato e citazione.Periodo di riferimento, cambiamenti metodologici e accessibilità della fonte.
Ricercare una domanda complessaCopertura dei sottoquesiti, gestione delle divergenze e distinzione tra prove e inferenze.Se ogni conclusione importante ha un supporto diretto e sufficiente.
Limitare la ricercaControlli chiari per limitare o privilegiare i domini e riferimenti finali tracciabili.Se il sistema ha davvero rispettato l’elenco concordato.
Combinare web e documenti personaliAttribuzione chiara delle prove e riferimenti che permettano di tornare al documento originale.Disponibilità del caricamento, trattamento dei file e distinzione tra le fonti.
Consegnare un rapporto verificabileCitazioni leggibili, link funzionanti e poco impegno necessario per il controllo.Tempo effettivo di revisione e proporzione di affermazioni supportate.
06

Scegliere senza proclamare un vincitore assoluto

La scelta dipende dal compito, dal rischio di errore e dal tempo che si può dedicare alla revisione. Per una nota interna a basso rischio può bastare un rapporto le cui affermazioni principali siano facili da verificare. Per una pubblicazione, un’analisi normativa o una decisione professionale, può essere necessario confrontare fonti primarie, documentare le divergenze e conservare una traccia di controllo. Lo strumento con più link non è necessariamente il più tracciabile, e una risposta più lunga non equivale a una copertura più completa.

Prima di adottare una soluzione, stabilisci una soglia di accettazione. Per esempio, definisci quale percentuale delle affermazioni centrali deve avere un supporto diretto, quali fonti sono obbligatorie per un certo tipo di dato e quali errori impongono di rifare la ricerca. La soglia deve dipendere dall’uso previsto e va applicata allo stesso modo a tutti i prodotti. Se uno strumento non soddisfa un requisito imprescindibile — per accesso, controlli o citazioni insufficienti — la conclusione corretta è che, nelle condizioni testate, non si adatta a quel flusso di lavoro, non che sia universalmente inferiore.

Conserva risultati, istruzioni e verifiche così da poter ripetere la valutazione quando cambiano i prodotti o i piani. La matrice serve a confrontare prove osservate, non a trasformare un test limitato in una classifica universale. Se i risultati variano molto tra un’esecuzione e l’altra, segnala questa variabilità; se mancano dati per uno strumento, indica che il confronto è incompleto. La decisione più difendibile è quella che spiega che cosa è stato testato, che cosa è stato possibile verificare e che cosa resta incerto.

Questioni aperte

  • Non è stata fornita documentazione verificata su Claude Research; funzioni, fonti, controlli e disponibilità restano da accertare.
  • Le fonti fornite non contengono un test comune e aggiornato dei quattro prodotti né risultati osservati con incarichi equivalenti.
  • Piani, quote e opzioni di accesso possono cambiare; vanno verificati in ciascun account e prima della chiusura editoriale.
  • La documentazione dei prodotti descrive le opzioni dichiarate, ma non consente da sola di determinare l’accuratezza delle citazioni o la completezza dei rapporti.
07

Continua a esplorare

07

Fonti consultate

03

Correzioni e trasparenza

Se trovi un dato errato o non aggiornato, inviaci la pagina e la fonte da verificare.

Proponi una correzione