Ilustración editorial para Qué demuestra —y qué no— el estudio sobre el tiempo que la IA ahorra a los científicos
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

Un rapporto sugli usi dell’IA, non una prova di un aumento delle scoperte

AI in Science: Early Insights esamina come viene utilizzata l’intelligenza artificiale nel lavoro scientifico. La pagina di MIT FutureTech indica il 16 settembre 2026 come data di pubblicazione del rapporto e lo attribuisce a una collaborazione con Google e Google DeepMind. Lo studio combina tre tipi di evidenze: un campione di 15 milioni di interazioni con Gemini, un inventario di oltre 2.600 modelli specializzati e un sondaggio tra più di 600 scienziati negli Stati Uniti e nel Regno Unito.

Questa combinazione permette di osservare il fenomeno da prospettive diverse, ma non trasforma il rapporto in un esperimento che dimostri che l’IA causa un aumento della produzione scientifica. Le interazioni registrano l’attività svolta con un prodotto; l’inventario descrive gli strumenti disponibili; il sondaggio raccoglie le risposte delle persone. Nessuna di queste misure, da sola, stabilisce che vengano pubblicati più risultati, che siano migliori o che grazie all’IA avvengano più scoperte.

La distinzione è importante perché svolgere più rapidamente un’attività non significa necessariamente concludere prima un progetto scientifico. Il tempo liberato può essere dedicato a esaminare i risultati, condurre esperimenti, esplorare altre ipotesi o affrontare attività rimandate in precedenza. Per capire che cosa accade nei singoli casi servono misure dei risultati e confronti adeguati, oltre a dati sull’uso degli strumenti.

02

Tre fonti che rispondono a domande diverse

La prima componente è il campione di interazioni con Gemini. Può contribuire a descrivere quali tipi di attività compaiono nell’uso di questo sistema, ma non rappresenta automaticamente tutta l’attività scientifica né tutti gli impieghi dell’IA. Le conversazioni con un prodotto non includono necessariamente il lavoro svolto con altri strumenti, sistemi privati o processi che non passano da un’interfaccia conversazionale. La cifra di 15 milioni indica la dimensione del campione descritto, non il numero di scienziati coinvolti.

La seconda componente è un inventario di oltre 2.600 modelli specializzati. La loro presenza permette di inquadrare l’analisi oltre i modelli generalisti: esistono sistemi progettati per attività o ambiti specifici. Tuttavia, contare i modelli non equivale a misurare quanti laboratori li usino, con quale frequenza vengano impiegati o quali risultati producano. Per arrivare a queste conclusioni servirebbero dati sull’adozione e sulla valutazione, che non si possono dedurre soltanto dalle dimensioni dell’inventario.

La terza fonte è un sondaggio tra più di 600 scienziati negli Stati Uniti e nel Regno Unito. Fornisce informazioni sulle esperienze e sulle stime dichiarate dai partecipanti. La sua interpretazione dipende da come sono state reclutate le persone, da chi ha risposto e da come erano formulate le domande. Le informazioni disponibili nelle fonti fornite non consentono di stabilire in questa sede quanto il campione sia rappresentativo, quale sia stato il tasso di risposta o se siano state applicate ponderazioni. Le risposte, quindi, non vanno presentate come una misurazione dell’intera comunità scientifica.

Che cosa può mostrare ciascuna fonte e che cosa non dimostra da sola

FonteChe cosa aiuta a osservareLimite interpretativo
Interazioni con GeminiAttività e tipi di interazione registrati nel campioneNon equivalgono a tutti gli usi dell’IA e, da sole, non identificano i risultati scientifici
Inventario dei modelli specializzatiDisponibilità di strumenti per attività o ambiti specificiIl numero di modelli non misura adozione, efficacia o impatto
Sondaggio tra scienziatiEsperienze e stime comunicate da chi ha rispostoDipende dal campionamento, dalle risposte e dal carattere autodichiarato dei dati
03

Quasi sette ore alla settimana: una stima dichiarata

La cifra più facile da decontestualizzare è quella delle quasi sette ore settimanali che gli intervistati dichiarano di risparmiare. Secondo il rapporto, si tratta di una stima comunicata dai partecipanti. Non va descritta come se un cronometro avesse registrato quanto tempo impiegavano prima e dopo aver introdotto l’IA, né come una misura indipendente della produttività.

L’autodichiarazione è utile per sapere come le persone percepiscono l’effetto di uno strumento. Può anche riflettere attività specifiche che vengono completate più rapidamente. Tuttavia, dipende dalla memoria, dall’interpretazione individuale di che cosa significhi «risparmiare tempo» e dal confronto che ciascuno fa con una situazione ipotetica senza IA. In assenza di una baseline osservata, non si può sapere con la stessa precisione se il risparmio dichiarato corrisponda al tempo effettivamente liberato.

Da questa cifra non si deduce nemmeno che ogni scienziato risparmi lo stesso tempo, che il risparmio si mantenga in qualsiasi disciplina o che le ore vengano interamente convertite in ulteriore attività di ricerca. Una parte può essere impiegata per correggere le risposte, ripetere le analisi o verificare le informazioni. Altre attività possono ridurre il lavoro amministrativo o facilitare una prima esplorazione, senza necessariamente abbreviare l’intero ciclo di ricerca.

La formulazione più fedele, quindi, è che gli intervistati stimano un risparmio vicino alle sette ore alla settimana. Per trasformare questa percezione in un’affermazione sulla produttività servono ulteriori evidenze: misurazioni longitudinali, definizioni comparabili delle attività e risultati osservabili, oltre a un gruppo di confronto o a una baseline che aiutino a capire che cosa sarebbe accaduto senza lo strumento.

04

Modelli generalisti e specializzati non sono misure intercambiabili

Lo studio riunisce informazioni su Gemini e un inventario di modelli specializzati: due categorie che è opportuno tenere distinte. Un modello linguistico generalista può essere usato per attività diverse, come redigere o riassumere testi. Un modello specializzato è progettato per un’attività o un ambito più circoscritto. Il fatto che entrambi rientrino nel panorama dell’IA scientifica non significa che vengano utilizzati nello stesso modo, che siano intercambiabili o che le loro prestazioni possano essere confrontate con un unico indicatore.

La tassonomia delle attività scientifiche associata al lavoro di MIT FutureTech offre un contesto per organizzare le attività considerate lavoro scientifico. Questo quadro può aiutare a classificare le attività, ma una classificazione non dimostra che l’IA le svolga correttamente o riduca la durata complessiva di una ricerca. Per valutare uno strumento specifico contano l’attività, l’ambito, i criteri di valutazione e l’intervento umano richiesto.

Nella pratica, l’utilità può variare anche all’interno dello stesso progetto. Uno strumento può supportare una fase di ricerca o analisi e, allo stesso tempo, richiedere verifiche sostanziali prima che i risultati vengano usati per una decisione sperimentale. Perciò non basta chiedersi se un modello sia «utile alla scienza»: occorre precisare per quale attività, con quali controlli e sulla base di quali evidenze di prestazione.

Domande utili per confrontare gli strumenti scientifici

DomandaPerché è importante
Quale attività specifica svolge?Evita di confrontare strumenti con funzioni e obiettivi diversi
Come si verifica la risposta?Permette di considerare il lavoro di revisione e validazione, non solo il primo risultato
Quale risultato viene valutato?Distingue rapidità, accuratezza, riproducibilità e utilità per il progetto
A chi si possono generalizzare i risultati?Chiarisce se le evidenze valgono per uno strumento, una disciplina o una popolazione più ampia
05

Validazione e sperimentazione restano parte del lavoro

Il rapporto segnala che la validazione dei risultati e la verifica delle ipotesi continuano a richiedere tempo. Questa osservazione ridimensiona una lettura semplicistica secondo cui automatizzare una parte del processo elimina gli ostacoli della ricerca. Un suggerimento generato dall’IA può richiedere verifiche; un’ipotesi plausibile non è un risultato confermato; un’analisi digitale non sostituisce automaticamente l’osservazione o la sperimentazione necessarie per rispondere a una domanda.

La differenza tra lavoro digitale e lavoro fisico è particolarmente rilevante. Nel suo articolo sullo studio, Scientific American sottolinea che l’IA può accelerare alcune attività di ricerca senza accelerare allo stesso ritmo gli esperimenti di laboratorio. È un contesto utile per riflettere sui colli di bottiglia, anche se un articolo di stampa secondario non sostituisce i dati o il metodo del rapporto originale.

Anche la validazione clinica comporta requisiti specifici: un’idea o un risultato iniziale non dimostrano che un intervento sia sicuro o efficace nelle persone. In generale, il passaggio da una proposta a una conclusione affidabile dipende da procedure di verifica adeguate al campo. Le fonti disponibili permettono di osservare che validazione e sperimentazione restano attività da svolgere, ma non autorizzano a quantificare qui quanto tempo richieda ciascuna fase né ad attribuire lo stesso collo di bottiglia a tutte le discipline.

Una sequenza per non confondere una proposta con un’evidenza

  1. 01Precisare quale attività o ipotesi si intende affrontare con lo strumento.
  2. 02Esaminare il risultato e verificarlo con metodi e fonti adeguati all’ambito.
  3. 03Quando opportuno, mettere alla prova l’ipotesi con esperimenti o valutazioni cliniche.
  4. 04Riportare separatamente il tempo impiegato, le verifiche svolte e il risultato ottenuto.
06

Limiti: selezione, ambito geografico e causalità

Il sondaggio riguarda scienziati negli Stati Uniti e nel Regno Unito; per questo non va considerato automaticamente rappresentativo dei ricercatori di altri paesi, istituzioni o discipline. Le differenze in termini di risorse, accesso agli strumenti, norme professionali e infrastrutture possono influire sia sull’uso sia sull’esperienza. Le fonti fornite non riportano qui informazioni sufficienti per valutare la rappresentatività o estendere le risposte all’intera comunità scientifica.

È inoltre necessario considerare chi accetta di partecipare a un sondaggio sull’IA. Nel contestualizzare lo studio, Scientific American avverte che il reclutamento tramite panel potrebbe favorire la partecipazione di utenti assidui di questi strumenti. Questa possibilità è una cautela sul processo di selezione, non la prova che il sondaggio sia orientato in una direzione specifica. Per valutarne la portata servirebbe conoscere il metodo di reclutamento, il tasso di risposta e le caratteristiche di partecipanti e non partecipanti.

Infine, il rapporto riunisce diversi tipi di evidenze, ma l’associazione tra uso dell’IA e risparmio dichiarato non prova un rapporto di causalità. Per sostenere una conclusione causale servirebbero disegni di ricerca in grado di distinguere l’effetto dello strumento da altri fattori, come l’esperienza pregressa, il tipo di attività, la disponibilità di personale o le risorse di calcolo. I risultati dovrebbero inoltre essere valutati includendo qualità e affidabilità, non soltanto rapidità o risparmio percepito.

07

Quali dati renderebbero più solida la conclusione

Una valutazione successiva potrebbe registrare attività comparabili nel tempo e distinguere il lavoro iniziale da quello necessario per la revisione e la validazione. Potrebbe inoltre indicare con precisione chi ha partecipato, come è stato selezionato, a quali domande ha risposto e come sono state trattate le risposte. La trasparenza su questi aspetti aiuterebbe a valutare a quale popolazione si possano applicare i risultati.

Per capire se il risparmio percepito si traduca in più ricerca servirebbero indicatori dei risultati, da interpretare con cautela: per esempio, la durata di fasi definite, la qualità delle analisi, la riproducibilità o la quota di risultati che supera una verifica pertinente. Nessun singolo indicatore riassume il valore di una ricerca; la rapidità non dovrebbe sostituire l’affidabilità come criterio.

La conclusione sostenibile sulla base di queste fonti è più circoscritta, ma comunque rilevante: esistono evidenze dell’uso di strumenti di IA e di scienziati che percepiscono un risparmio di tempo, mentre la validazione e la sperimentazione restano componenti sostanziali del processo. L’entità esatta dell’effetto, la sua distribuzione tra le discipline e il suo impatto sulla produzione scientifica richiedono ulteriori misurazioni. Presentare la cifra di quasi sette ore come una stima degli intervistati, e non come produttività dimostrata, preserva questa distinzione essenziale.

Questioni aperte

  • Le fonti fornite non consentono di stabilire qui quanto sia rappresentativo il sondaggio, quale sia stato il tasso di risposta o se siano state applicate ponderazioni.
  • Le informazioni disponibili non specificano i periodi, i criteri di selezione o la distribuzione delle 15 milioni di interazioni con Gemini.
  • Con i dati forniti non si può determinare quanto del risparmio dichiarato corrisponda a tempo effettivamente liberato, una volta inclusi revisione e validazione.
  • Il rapporto non consente, da solo, di dedurre che l’uso dell’IA causi più pubblicazioni, risultati migliori o scoperte.
  • La copertura secondaria segnala la possibile sovrarappresentazione di utenti assidui di IA nel panel; con i dati qui disponibili non è possibile quantificarne la portata.
08

Continua a esplorare

08

Fonti consultate

03

Correzioni e trasparenza

Se trovi un dato errato o non aggiornato, inviaci la pagina e la fonte da verificare.

Proponi una correzione