Ilustración editorial para Qué demuestra —y qué no— el estudio sobre el tiempo que la IA ahorra a los científicos
Imagen generada con gpt-image-2.5-sunburst para InferamaSource ↗
01

Un rapport sur les usages de l’IA, pas une preuve de découvertes plus nombreuses

AI in Science: Early Insights étudie la manière dont l’intelligence artificielle est utilisée dans le travail scientifique. La page de MIT FutureTech date le rapport du 16 septembre 2026 et l’attribue à une collaboration avec Google et Google DeepMind. L’étude combine trois types de données : un échantillon de 15 millions d’interactions avec Gemini, un inventaire de plus de 2 600 modèles spécialisés et une enquête menée auprès de plus de 600 scientifiques aux États-Unis et au Royaume-Uni.

Cette combinaison permet d’observer le phénomène sous différents angles, mais elle ne transforme pas le rapport en expérience démontrant que l’IA entraîne une hausse de la production scientifique. Les interactions enregistrent une activité sur un produit ; l’inventaire décrit les outils disponibles ; et l’enquête recueille les réponses de personnes. Aucune de ces mesures, prise isolément, n’établit qu’un plus grand nombre de résultats sont publiés, qu’ils sont de meilleure qualité ou que l’IA est à l’origine de davantage de découvertes.

Cette distinction est importante : accomplir une tâche plus rapidement ne signifie pas nécessairement qu’un projet scientifique dure moins longtemps. Le temps gagné peut être consacré à examiner les résultats, réaliser des expériences, explorer d’autres hypothèses ou traiter des tâches auparavant reportées. Pour savoir ce qui se passe dans chaque cas, il faut des mesures des résultats et des comparaisons adaptées, ainsi que des données sur l’utilisation des outils.

02

Trois sources qui répondent à des questions différentes

Le premier volet est constitué par l’échantillon d’interactions avec Gemini. Il peut aider à décrire les types de tâches rencontrées lors de l’utilisation de ce système, mais il ne représente automatiquement ni toute l’activité scientifique ni l’ensemble des usages de l’IA. Les conversations avec un produit ne comprennent pas nécessairement le travail effectué avec d’autres outils, des systèmes privés ou des processus qui ne passent pas par une interface conversationnelle. Le chiffre de 15 millions indique la taille de l’échantillon décrit, et non le nombre de scientifiques ayant participé.

Le deuxième volet est un inventaire de plus de 2 600 modèles spécialisés. Il permet de replacer l’analyse dans un contexte qui dépasse les modèles généralistes : il existe des systèmes conçus pour des tâches ou des domaines précis. Mais dénombrer les modèles ne revient pas à mesurer combien de laboratoires les utilisent, à quelle fréquence ils y ont recours ni quels résultats ils obtiennent. Il faudrait des données d’adoption et d’évaluation pour tirer de telles conclusions ; elles ne peuvent pas être déduites du seul volume de l’inventaire.

La troisième source est une enquête auprès de plus de 600 scientifiques des États-Unis et du Royaume-Uni. Elle apporte des informations sur les expériences et les estimations déclarées par les participants. Son interprétation dépend de la manière dont les personnes ont été recrutées, de celles qui ont répondu et de la formulation des questions. Les informations disponibles dans les sources fournies ne permettent pas d’établir ici la représentativité de l’échantillon, le taux de réponse ni l’application éventuelle de pondérations. Les réponses ne doivent donc pas être présentées comme une mesure de l’ensemble de la communauté scientifique.

Ce que chaque source peut apporter — et ce qu’elle ne permet pas d’établir à elle seule

SourceCe qu’elle aide à observerLimite d’interprétation
Interactions avec GeminiL’activité et les types d’interactions enregistrés dans cet échantillonNe correspondent pas à l’ensemble des usages de l’IA et ne permettent pas, à elles seules, d’identifier des résultats scientifiques
Inventaire de modèles spécialisésLa disponibilité d’outils conçus pour des tâches ou des domaines spécifiquesLe nombre de modèles ne mesure ni leur adoption, ni leur efficacité, ni leur impact
Enquête auprès de scientifiquesLes expériences et estimations rapportées par les personnes interrogéesDépend de l’échantillonnage, du taux de réponse et du caractère autodéclaré des données
03

Près de sept heures par semaine : une estimation déclarée

Le chiffre le plus facile à sortir de son contexte est celui des près de sept heures par semaine que les personnes interrogées disent économiser. Selon le rapport, il s’agit d’une estimation communiquée par les participants. Il ne faut pas la présenter comme si un chronomètre avait mesuré le temps nécessaire avant et après l’adoption de l’IA, ni comme une mesure indépendante de la productivité.

Les déclarations des participants sont utiles pour connaître la manière dont ils perçoivent l’effet d’un outil. Elles peuvent aussi refléter des tâches précises qui sont accomplies plus rapidement. Cependant, elles dépendent de la mémoire, de l’interprétation individuelle de ce que signifie « gagner du temps » et de la comparaison que chaque personne fait avec une situation hypothétique sans IA. En l’absence d’une situation de référence observée, il est impossible de savoir avec la même précision si le gain déclaré correspond au temps réellement libéré.

On ne peut pas non plus déduire de ce chiffre que chaque scientifique économise autant de temps, que le gain se maintient dans toutes les disciplines ou que les heures sont entièrement réinvesties dans des travaux de recherche supplémentaires. Une partie peut servir à corriger des réponses, à refaire des analyses ou à vérifier des informations. D’autres tâches administratives peuvent être réduites, ou une première exploration facilitée, sans que le cycle complet de recherche soit nécessairement raccourci.

La formulation la plus fidèle est donc que les personnes interrogées estiment économiser près de sept heures par semaine. Pour transformer cette perception en affirmation sur la productivité, il faut davantage de données : des mesures longitudinales, des définitions comparables des tâches et des résultats observables, ainsi qu’un groupe de comparaison ou une situation de référence permettant de comprendre ce qui se serait passé sans l’outil.

04

Les modèles généralistes et spécialisés ne sont pas des mesures interchangeables

L’étude rassemble des informations sur Gemini et sur un inventaire de modèles spécialisés : il convient de distinguer ces deux catégories. Un modèle de langage généraliste peut servir à différentes tâches, par exemple rédiger ou résumer des textes. Un modèle spécialisé est conçu pour une tâche ou un domaine plus restreint. Le fait que ces deux catégories figurent dans le paysage de l’IA scientifique ne signifie pas qu’elles sont utilisées de la même façon, qu’elles se substituent l’une à l’autre ou que leurs performances peuvent être comparées à l’aide d’un indicateur unique.

La taxonomie des tâches scientifiques associée aux travaux de MIT FutureTech apporte un cadre pour classer les activités considérées comme du travail scientifique. Elle peut aider à organiser les tâches, mais cette classification ne démontre pas que l’IA les réalise correctement ni qu’elle réduit la durée totale d’une recherche. Pour évaluer un outil en particulier, il faut tenir compte de la tâche, du domaine, des critères d’évaluation et de l’intervention humaine nécessaire.

Dans la pratique, l’utilité peut varier au sein d’un même projet. Un outil peut aider lors d’une étape de recherche ou d’analyse et nécessiter, en parallèle, des vérifications substantielles avant que ses résultats soient intégrés à une décision expérimentale. Il ne suffit donc pas de demander si un modèle est « utile à la science » : il faut préciser pour quelle tâche, selon quels contrôles et sur la base de quelles preuves de performance.

Questions utiles pour comparer des outils scientifiques

QuestionPourquoi est-ce important ?
Quelle tâche précise l’outil effectue-t-il ?Évite de comparer des outils ayant des fonctions et des objectifs différents
Comment la réponse est-elle vérifiée ?Permet de prendre en compte le travail de révision et de validation, et pas seulement la première réponse
Quel résultat est évalué ?Distingue la rapidité, l’exactitude, la reproductibilité et l’utilité pour le projet
À qui le résultat peut-il être généralisé ?Précise si les données s’appliquent à un outil, à une discipline ou à une population plus large
05

La validation et l’expérimentation restent des composantes du travail

Le rapport indique que la validation des résultats et la mise à l’épreuve des hypothèses continuent de prendre du temps. Cette observation nuance une lecture simpliste selon laquelle l’automatisation d’une partie du processus éliminerait les obstacles à la recherche. Une suggestion générée par l’IA peut nécessiter des vérifications ; une hypothèse plausible n’est pas un résultat confirmé ; et une analyse numérique ne remplace pas automatiquement les observations ou les expériences nécessaires pour répondre à une question.

La différence entre le travail numérique et le travail expérimental est particulièrement importante. Dans son article consacré à l’étude, Scientific American souligne que l’IA peut accélérer certaines tâches de recherche sans accélérer au même rythme les expériences en laboratoire. Ce contexte aide à réfléchir aux goulets d’étranglement, mais un article de presse secondaire ne remplace ni les données ni la méthodologie du rapport d’origine.

La validation clinique implique également des exigences spécifiques : une idée ou un résultat préliminaire ne démontre pas qu’une intervention est sûre ou efficace chez l’être humain. De façon générale, passer d’une proposition à une conclusion fiable suppose des procédures de vérification adaptées au domaine. Les sources disponibles permettent de signaler que la validation et l’expérimentation restent des tâches à accomplir, mais elles ne permettent pas de quantifier ici le temps consacré à chaque étape ni d’attribuer le même goulet d’étranglement à toutes les disciplines.

Une séquence pour ne pas confondre proposition et preuve

  1. 01Préciser la tâche ou l’hypothèse que l’on souhaite examiner à l’aide de l’outil.
  2. 02Examiner la réponse et la vérifier à l’aide de méthodes et de sources adaptées au domaine.
  3. 03Le cas échéant, confronter l’hypothèse à des expériences ou à une évaluation clinique.
  4. 04Rendre compte séparément du temps passé, des vérifications réalisées et du résultat obtenu.
06

Limites : sélection, portée géographique et causalité

L’enquête porte sur des scientifiques des États-Unis et du Royaume-Uni ; il ne faut donc pas la considérer automatiquement comme représentative des chercheurs d’autres pays, établissements ou disciplines. Les différences de ressources, d’accès aux outils, de normes professionnelles et d’infrastructures peuvent influer à la fois sur les usages et sur les expériences. Les sources fournies ne donnent pas ici assez d’informations pour évaluer la représentativité de l’échantillon ou transposer les réponses à toute la communauté scientifique.

Il faut également se demander qui accepte de participer à une enquête sur l’IA. En contextualisant l’étude, Scientific American fait observer qu’un recrutement par l’intermédiaire de panels peut favoriser la participation des utilisateurs fréquents de ces outils. Cette possibilité appelle à la prudence quant à la sélection ; elle ne prouve pas que l’enquête soit biaisée dans un sens déterminé. Pour évaluer l’ampleur du phénomène, il faudrait connaître la méthode de recrutement, le taux de réponse et les caractéristiques des participants comme des non-participants.

Enfin, le rapport réunit plusieurs types de données, mais l’association entre l’utilisation de l’IA et le gain de temps déclaré ne prouve pas un lien de causalité. Pour étayer une conclusion causale, il faudrait des méthodes capables de distinguer l’effet de l’outil d’autres facteurs, comme l’expérience préalable, le type de tâche, les effectifs disponibles ou les ressources informatiques. Il faudrait aussi évaluer les résultats en tenant compte de leur qualité et de leur fiabilité, et pas uniquement de la rapidité ou du gain de temps perçu.

07

Quelles données permettraient d’étayer davantage la conclusion ?

Une évaluation ultérieure pourrait suivre dans le temps des tâches comparables et distinguer le travail initial de celui nécessaire à la révision et à la validation. Elle pourrait aussi préciser qui a participé, comment les personnes ont été sélectionnées, quelles questions leur ont été posées et comment les réponses ont été traitées. La transparence sur ces aspects aiderait à déterminer à quelle population les résultats peuvent s’appliquer.

Pour savoir si le gain de temps perçu se traduit par davantage de recherche, il faudrait des indicateurs de résultats, interprétés avec prudence : par exemple, la durée d’étapes définies, la qualité des analyses, leur reproductibilité ou la proportion des résultats qui réussissent une validation pertinente. Aucun indicateur isolé ne résume la valeur d’une recherche ; la rapidité ne doit pas remplacer la fiabilité comme critère.

La conclusion que ces sources permettent de soutenir est plus limitée, mais importante : il existe des preuves d’utilisation d’outils d’IA et certains scientifiques déclarent percevoir un gain de temps, tandis que la validation et l’expérimentation demeurent des composantes substantielles du processus. L’ampleur exacte de l’effet, sa répartition entre les disciplines et ses conséquences sur la production scientifique nécessitent des mesures supplémentaires. Présenter le chiffre de près de sept heures comme une estimation des personnes interrogées, et non comme une productivité démontrée, permet de préserver cette distinction essentielle.

Questions ouvertes

  • Les sources fournies ne permettent pas d’établir ici la représentativité de l’enquête, son taux de réponse ni l’application éventuelle de pondérations.
  • Les périodes, les critères de sélection et la répartition des 15 millions d’interactions avec Gemini ne sont pas précisés dans les informations disponibles.
  • Les informations fournies ne permettent pas de déterminer quelle part du gain de temps déclaré correspond à du temps effectivement libéré une fois la révision et la validation prises en compte.
  • Le rapport ne permet pas, à lui seul, de déduire que l’utilisation de l’IA entraîne davantage de publications, de meilleurs résultats ou des découvertes.
  • L’article de presse secondaire évoque une possible surreprésentation des utilisateurs fréquents de l’IA dans le panel ; l’ampleur de ce phénomène ne peut pas être évaluée à partir des données disponibles ici.
08

Poursuivre l’exploration

08

Sources consultées

03

Corrections et transparence

Si vous repérez une information incorrecte ou obsolète, envoyez-nous la page et la source à vérifier.

Proposer une correction