Ilustración editorial para ChatGPT Deep Research, Gemini Deep Research, Perplexity y Claude Research: cómo compararlos
Imagen generada con gpt-image-2.5-sunburst para InferamaSource ↗
01

Ce que l’on compare — et ce qu’on ne peut pas conclure à l’avance

Un assistant de recherche sur le Web n’est pas simplement un moteur de recherche qui renvoie une liste de pages. On lui demande de trouver des informations, de les organiser et de rédiger une synthèse accompagnée de références qu’une personne peut examiner. L’évaluation ne devrait donc pas s’arrêter au constat que le rapport contient des liens : il faut vérifier si chaque source étaye l’affirmation à laquelle elle est associée, si des sources pertinentes ont été trouvées et si le texte rend fidèlement compte des divergences.

Ce guide propose de comparer ChatGPT Deep Research, Gemini Deep Research, Perplexity Pro Search et Claude Research à partir de demandes équivalentes. Il ne désigne pas de gagnant et ne présente pas comme démontré qu’un outil serait plus précis, plus complet ou plus rapide qu’un autre. La documentation disponible décrit les fonctions annoncées par les fournisseurs, mais ne fournit pas de test comparatif commun aux quatre produits. En outre, les sources vérifiées ici ne comprennent pas de documentation sur Claude Research permettant de confirmer ses options, sa disponibilité ou son fonctionnement. Il faut donc vérifier directement ces caractéristiques avant de commencer l’évaluation, sans les déduire par analogie.

La distinction entre une fonction annoncée et un résultat vérifié est essentielle. Le fait qu’un produit décrive une recherche en plusieurs étapes, une recherche sur le Web, une sélection de sources ou des liens ne prouve pas qu’il ait trouvé les meilleures sources pour une demande donnée. Pour le savoir, il faut exécuter les mêmes tâches, consigner les conditions du test et vérifier manuellement un échantillon des principales affirmations.

02

Concevoir un test équitable et reproductible

Une comparaison utile commence par un relevé des conditions, et non par un ensemble informel de captures d’écran. Notez la date et l’heure, le nom et la version visibles de la fonction utilisée, le type de compte ou d’abonnement, les paramètres activés, le texte exact de chaque demande et tout document ajouté. Conservez également la réponse complète, y compris les références, les avertissements de limite et les questions de suivi. Les abonnements, les quotas et les fonctions évoluent ; sans ces informations, une différence de résultat peut s’expliquer par le niveau d’accès plutôt que par le comportement du système.

Utilisez quatre demandes correspondant à des objectifs différents. Pour une information récente, demandez une donnée avec une date de référence et une source primaire. Pour une question en plusieurs parties, énumérez chaque sous-question et demandez à la réponse d’indiquer les éléments qui étayent chacune d’elles. Pour une recherche limitée à certains sites, définissez au préalable les domaines autorisés et vérifiez si les références finales respectent cette restriction. Pour des documents personnels, utilisez le même fichier avec les outils qui permettent de le charger et exigez que le rapport distingue les éléments tirés du document de ceux provenant du Web. Si une fonction n’est pas disponible, notez qu’elle n’est pas évaluable dans ces conditions : ne la remplacez pas par un autre mode sans le signaler.

Une formulation identique réduit les différences d’interprétation, sans les éliminer. Il est utile de faire un second passage avec une formulation équivalente afin de repérer les résultats fragiles. Ne modifiez pas les demandes en cours de test pour favoriser un outil et ne considérez pas comme équivalents des modes ou des abonnements qui ne le sont pas. Lorsque les paramètres ne peuvent pas être harmonisés, décrivez cette limite au lieu de la dissimuler.

Protocole minimal

  1. 01Définissez quatre tâches : trouver une donnée récente, mener une recherche en plusieurs étapes, effectuer une recherche par domaines et analyser des documents personnels.
  2. 02Pour chaque produit, consignez la date, l’abonnement, la fonction, les paramètres de recherche, les fichiers et les limites visibles.
  3. 03Saisissez la même demande, enregistrez la réponse complète et ne modifiez pas les paramètres pendant le passage.
  4. 04Vérifiez les principales affirmations à partir des pages d’origine et notez les citations exactes, fragiles, non pertinentes ou inaccessibles.
  5. 05Répétez les demandes importantes et distinguez les différences constantes des variations entre les exécutions.
03

Que mesurer dans les sources, les citations et les désaccords

La qualité des références s’évalue affirmation par affirmation. Pour chaque phrase vérifiable du rapport, identifiez la citation associée et ouvrez la page d’origine. Vérifiez si elle contient bien l’information, si elle concerne la même population, la même période et le même contexte, et si la formulation du rapport va au-delà de ce que la source permet de conclure. Une page peut être pertinente pour le sujet général sans étayer le chiffre précis ou le lien de causalité que l’assistant lui attribue.

Consignez séparément les citations accessibles et pertinentes, celles qui n’étayent qu’une partie de l’affirmation, celles dont le lien avec celle-ci est insuffisant et celles qui sont impossibles à consulter. Si une affirmation réunit plusieurs faits, décomposez-la avant d’évaluer son appui. Un taux global calculé sans cette vérification peut être trompeur : de nombreuses références correctes pour des détails secondaires ne compensent pas une affirmation centrale dépourvue de soutien.

La diversité des éléments probants compte également. Une source primaire — par exemple un texte réglementaire, un jeu de données original ou le document d’une institution responsable de la donnée — n’a pas toujours le même rôle qu’une analyse journalistique ou une revue universitaire. Il n’est pas nécessaire d’exiger une source primaire pour chaque question, mais il faut préciser le type d’éléments utilisés et vérifier s’il existe des sources indépendantes. Si deux sources se contredisent, le rapport devrait exposer ce qui diffère, pourquoi et ce que les éléments disponibles ne permettent pas de trancher, plutôt que de présenter une seule version comme un consensus.

Le temps nécessaire à l’audit complète l’évaluation. Mesurez le temps qu’il faut à une personne pour vérifier les principales affirmations, trouver le passage pertinent et décider si la citation suffit. Ce temps n’est pas une mesure absolue de qualité : il dépend du sujet, de l’accessibilité des sources et de l’expérience de la personne chargée de la vérification. Il s’agit toutefois d’un indicateur pratique pour les équipes qui doivent produire des rapports vérifiables dans des délais précis.

Matrice d’évaluation de chaque rapport

CritèrePoints à observerInformations à consigner
CouvertureLa réponse traite-t-elle toutes les parties de la demande et indique-t-elle ce qui reste à résoudre ?Parties traitées, omises et impossibles à vérifier.
Étaiement des citationsLa source d’origine étaye-t-elle directement l’affirmation associée, dans le bon périmètre et pour la bonne période ?Direct, partiel, insuffisant, non pertinent ou inaccessible.
Qualité et diversitéPrésence de sources primaires pertinentes, de sources indépendantes et de perspectives divergentes.Type et origine des sources, désaccords repérés.
TraçabilitéFacilité d’accès à la source, de repérage du passage et d’identification de la phrase concernée.Lien fonctionnel, passage localisable et ambiguïtés.
Effort de vérificationTemps nécessaire pour contrôler les principaux résultats.Minutes par rapport et difficultés rencontrées.
04

Quatre tâches qui mettent en évidence les différences pratiques

Pour trouver une donnée récente, la demande doit préciser ce que signifie « récent » et le type d’appui attendu. Demandez la date de la donnée, l’organisme qui la publie et un lien vers la source d’origine. Vérifiez ensuite si le résultat a confondu la date de publication avec la période de mesure, pris un chiffre provisoire pour un chiffre définitif ou cité un article qui ne mène pas à la donnée primaire. Ce test porte sur l’actualité et la traçabilité, et non sur la capacité générale de recherche.

Pour une question en plusieurs étapes, rédigez une liste de sous-questions et demandez une synthèse qui laisse visibles leurs différences. Une réponse fluide peut masquer qu’une partie repose sur des éléments solides et une autre sur une source fragile. Vérifiez aussi si la conclusion découle des sources ou si elle ajoute une inférence qui n’est pas signalée comme telle. Pour faciliter l’audit, demandez que chaque point important soit accompagné de la référence précise qui l’étaye.

Pour le test de recherche limitée à certains sites, décidez d’abord si vous voulez autoriser exclusivement une liste de domaines ou simplement les privilégier sans exclure les autres. Ce sont deux consignes différentes. Inspectez ensuite les sources de la réponse : le fait qu’un système propose un réglage des sites ne garantit pas, à lui seul, que toutes les références finales proviennent de ces sites. La documentation d’OpenAI décrit une option permettant de limiter la recherche de Deep Research à des sites de confiance, et l’aide de Gemini présente des paramètres et une sélection de sources. Il s’agit d’informations sur les options annoncées, et non d’une vérification de leur respect à chaque exécution.

Pour les documents personnels, utilisez un fichier sans données sensibles et contenant des affirmations vérifiables. Demandez à l’assistant de séparer explicitement les éléments tirés du document de ceux trouvés sur le Web. Vérifiez si les citations renvoient au fichier, à des pages Web ou aux deux, et si le rapport attribue correctement chaque élément. La documentation officielle de Gemini présente le chargement de fichiers et la sélection de sources parmi les options disponibles ; OpenAI décrit également l’utilisation de fichiers fournis dans Deep Research. La disponibilité et le comportement effectifs doivent être confirmés dans le compte évalué.

Perplexity présente Pro Search comme un mode proposant le choix de modèles et différents modes de recherche, notamment Web, Academic, Finance et Files, et indique que ses réponses renvoient à des sources d’origine. Ces descriptions aident à concevoir un test qui consigne le mode utilisé. Elles ne remplacent pas la vérification des pages d’origine et ne permettent pas de prévoir la proportion de citations exactes. Une comparaison valable doit noter le mode, l’abonnement et les conditions, puis évaluer chaque référence selon le même critère que pour les autres produits.

05

Interpréter les fonctions et les limites d’accès

Les pages officielles permettent de confirmer ce que chaque fournisseur déclare au sujet de ses produits, mais elles ne constituent pas une évaluation indépendante. OpenAI décrit Deep Research comme un processus de recherche en plusieurs étapes avec des citations, et distingue ce mode d’une recherche plus rapide. Le guide d’OpenAI Academy explique également ce processus. Google indique que Google Search est inclus par défaut comme source dans Gemini Deep Research et documente des options de sources, la modification du plan de recherche et le chargement de fichiers. Perplexity décrit Pro Search, ses modes et les liens vers des sources d’origine. Ces déclarations servent à configurer le test ; elles ne justifient pas de classer les outils selon leur précision.

Les limites d’accès doivent faire partie des résultats. Notez si un compte peut utiliser la fonction, quel abonnement le fournisseur exige, quels quotas sont affichés et si le chargement de fichiers ou les contrôles de sources sont disponibles. Ne généralisez pas le résultat d’un compte à l’ensemble des utilisateurs. Les pages décrivant les abonnements peuvent changer, et un quota indiqué aujourd’hui ne doit pas être présenté comme permanent. Vérifiez de nouveau les conditions juste avant publication et précisez la date de cette vérification.

Les éléments universitaires disponibles parmi les sources fournies ont eux aussi une portée limitée. Une étude publiée sur arXiv examine la crédibilité des sources et l’étayage des réponses dans ChatGPT et Perplexity, mais ne porte ni sur Claude ni sur Gemini. Ses résultats correspondent aux produits et aux conditions étudiés dans ce travail ; ils ne doivent pas être transposés automatiquement aux versions actuelles ni servir à proclamer un gagnant dans cette comparaison. Une étude antérieure peut aider à formuler des critères, mais l’évaluation des produits actuels exige des données propres et une méthode explicite.

En particulier, l’absence de source vérifiée sur Claude Research ne permet pas de présenter ici ses capacités ou sa disponibilité comme des faits. L’outil peut être intégré au test si sa documentation officielle et son accès en vigueur sont confirmés. D’ici là, toute affirmation concernant ses contrôles, ses sources ou ses citations reste à vérifier. Cette prudence évite de combler les lacunes par des suppositions.

Matrice de décision selon la tâche

BesoinÉléments à privilégierPoints à vérifier avant de choisir
Trouver une donnée récenteDate de mise à jour, source primaire et correspondance entre la donnée et la citation.Période de référence, changements méthodologiques et accessibilité de la source.
Étudier une question complexeCouverture des sous-questions, traitement des désaccords et distinction entre éléments probants et inférences.Chaque conclusion importante est-elle étayée directement et suffisamment ?
Limiter la rechercheParamètres clairs pour restreindre ou privilégier des domaines et références finales traçables.Le système a-t-il réellement respecté la liste convenue ?
Combiner le Web et des documents personnelsAttribution claire des éléments et références permettant de retrouver le document d’origine.Disponibilité du chargement, traitement des fichiers et distinction entre les sources.
Produire un rapport vérifiableCitations lisibles, liens fonctionnels et effort de contrôle raisonnable.Temps réel de vérification et proportion d’affirmations étayées.
06

Choisir sans désigner de gagnant absolu

Le choix dépend de la tâche, du risque d’erreur et du temps disponible pour la vérification. Pour une note interne à faible enjeu, un rapport dont les principales affirmations sont faciles à contrôler peut suffire. Pour une publication, une analyse réglementaire ou une décision professionnelle, il peut être nécessaire de confronter des sources primaires, de documenter les désaccords et de conserver une trace de l’audit. L’outil qui fournit le plus de liens n’est pas forcément le plus traçable, et une réponse plus longue ne signifie pas qu’elle couvre mieux le sujet.

Avant d’adopter une solution, définissez un seuil d’acceptation. Vous pouvez, par exemple, déterminer quelle proportion des affirmations centrales doit être directement étayée, quelles sources sont indispensables pour un type de donnée donné et quelles erreurs imposent de recommencer la recherche. Ce seuil doit dépendre de l’usage prévu et s’appliquer de la même manière à tous les produits. Si un outil ne peut pas satisfaire une exigence indispensable — pour des raisons d’accès, de contrôles ou de citations insuffisantes —, la conclusion appropriée est qu’il ne convient pas à ce flux de travail dans les conditions testées, et non qu’il est universellement inférieur.

Conservez les résultats, les consignes et les vérifications afin de pouvoir répéter l’évaluation lorsque les produits ou les abonnements évoluent. La matrice sert à comparer les éléments observés, pas à transformer un petit test en classement universel. Si les résultats varient beaucoup d’une exécution à l’autre, signalez cette variabilité ; si des données manquent pour un outil, indiquez que la comparaison est incomplète. La décision la plus défendable est celle qui explique ce qui a été testé, ce qui a pu être vérifié et ce qui reste incertain.

Questions ouvertes

  • Aucune documentation vérifiée sur Claude Research n’a été fournie ; ses fonctions, ses sources, ses contrôles et sa disponibilité restent à confirmer.
  • Les sources fournies ne comprennent ni test commun et actuel des quatre produits ni résultats observés à partir de demandes équivalentes.
  • Les abonnements, quotas et options d’accès peuvent évoluer ; ils doivent être vérifiés dans chaque compte et au moment de la finalisation éditoriale.
  • La documentation produit décrit les options annoncées, mais ne permet pas à elle seule d’établir l’exactitude des citations ou l’exhaustivité des rapports.
07

Poursuivre l’exploration

07

Sources consultées

03

Corrections et transparence

Si vous repérez une information incorrecte ou obsolète, envoyez-nous la page et la source à vérifier.

Proposer une correction