Délimitez la décision que vous allez tester
Le criblage des titres et des résumés consiste à déterminer quels notices issues d’une recherche bibliographique semblent satisfaire aux critères d’éligibilité et doivent passer à l’étape suivante. Il ne confirme pas qu’une étude est effectivement éligible : le résumé ne contient souvent pas assez d’informations, et la décision définitive exige alors de consulter le texte intégral. Le pilote proposé ici porte donc sur une tâche limitée : classer les notices afin de décider lesquelles nécessitent un examen ultérieur. Il ne vise ni à réaliser une revue systématique complète ni à remplacer son protocole.
La question utile n’est pas « l’IA peut-elle effectuer le criblage ? », mais plutôt : « quelle méthode aide cette équipe, avec ces critères et ces notices, sans accroître le risque de laisser de côté des études pertinentes ? ». Pour y répondre, il faut examiner les erreurs, la cohérence, la traçabilité et le temps de travail humain. Le fait qu’un outil produise rapidement une étiquette ne prouve ni son exactitude ni l’existence d’un gain de temps net.
Il convient de distinguer trois approches. Dans le criblage manuel, les personnes lisent les notices et consignent leurs décisions, par exemple dans un tableur. Un outil spécialisé est conçu pour des tâches liées aux revues bibliographiques, mais ses fonctions doivent être vérifiées dans le produit et la version qui seront effectivement utilisés. Un modèle généraliste peut recevoir des consignes pour classer du texte ; il ne faut toutefois pas supposer qu’il fournit un processus de criblage, un historique des décisions ou des contrôles adaptés à une revue. Dans les trois cas, la configuration compte.
Définissez les critères et les cas de test avant toute comparaison
Avant d’ouvrir un outil, traduisez la question de recherche en critères d’inclusion et d’exclusion applicables à chaque notice. Précisez la population, l’intervention ou l’exposition, le comparateur, les résultats, le plan d’étude, le contexte ainsi que les limites de langue ou de période qui font réellement partie du protocole. Tous ces éléments ne sont pas pertinents pour chaque revue. L’essentiel est d’indiquer quelles informations déterminent l’éligibilité et quoi faire lorsqu’elles manquent.
Ajoutez des consignes pour les cas ambigus. Si le résumé ne permet pas de confirmer un critère, faut-il conserver la notice pour l’examen du texte intégral ou l’exclure ? Comment traiter une étude qui semble pertinente, mais dont le plan n’est pas précisé ? Que faire lorsque le titre paraît répondre aux critères alors que le résumé les contredit ? Si l’équipe ne tranche pas ces questions à l’avance, deux méthodes peuvent sembler en désaccord alors qu’elles appliquent en réalité des règles différentes ou incomplètes.
Préparez un ensemble comprenant des notices clairement éligibles, clairement non éligibles et douteuses. Un guide institutionnel consacré à la sélection des études recommande de tester les critères sur ces trois catégories ; nous adaptons ici cette orientation à la comparaison de plusieurs méthodes. Conservez les titres et résumés tels qu’ils ont été obtenus, à l’exception des transformations nécessaires et documentées pour protéger des données ou harmoniser le format. Ne choisissez pas uniquement des exemples faciles : le pilote doit révéler les limites des consignes.
Établissez une décision de référence à partir d’examens humains indépendants et prévoyez une procédure de résolution des désaccords. Cette référence n’est pas une vérité infaillible : c’est une décision documentée, prise conformément au protocole, qui laisse apparaître les incertitudes. Si les personnes chargées du criblage ne sont pas d’accord, faites arbitrer le cas, clarifiez la règle pertinente et consignez toute modification. Appliquez ensuite cette même règle aux trois approches.
Préparation minimale de l’ensemble de test
- 01Figez une version de la question de recherche et des critères d’éligibilité.
- 02Sélectionnez des notices éligibles, non éligibles et ambiguës, et expliquez comment elles ont été choisies.
- 03Demandez à deux personnes d’appliquer les critères sans consulter les étiquettes produites par les outils.
- 04Résolvez les désaccords et conservez la justification ainsi que la règle appliquée.
- 05Séparez les notices utilisées pour ajuster les consignes de celles qui serviront à les évaluer.
Comparez les trois approches sans prêter aux outils des capacités non vérifiées
Le criblage manuel permet d’appliquer directement les critères définis par l’équipe, mais suppose de lire et d’enregistrer chaque décision. Un tableur peut aider à organiser les notices et à consigner les étiquettes si l’équipe le configure à cette fin ; il ne fournit pas, à lui seul, une décision méthodologique et ne résout pas les désaccords. Pour que la comparaison soit équitable, définissez à l’avance les colonnes, les étiquettes autorisées et les personnes habilitées à modifier une décision.
Les outils spécialisés sont des candidats à tester, et non une garantie de qualité. Rayyan, Elicit, SciSpace et scite.ai apparaissent dans les sources fournies comme des outils liés aux revues ou à l’analyse bibliographique. Cette mention peut servir à établir une première liste, mais elle ne confirme pas que chacun propose actuellement le criblage des titres et résumés, que son fonctionnement corresponde au protocole ou que les fonctions soient accessibles dans les mêmes conditions. Avant de concevoir le test, vérifiez directement chaque tâche dans le produit et dans sa documentation à jour.
Un modèle généraliste peut permettre d’expérimenter des consignes explicites fondées sur les critères. Toutefois, le résultat dépendra du texte transmis, des instructions, de la configuration et de la réponse produite. Ne présumez pas que le modèle attribuera la même catégorie à chaque exécution, fournira une justification vérifiable ou conservera un historique suffisant. Vérifiez ces propriétés directement, puis consignez la version, la date et les paramètres disponibles. Si le système varie d’une exécution à l’autre, cette variation fait partie du résultat et ne doit pas être dissimulée.
Fournissez les mêmes informations d’éligibilité à chaque approche. Si un outil ne permet pas d’exporter une décision, de conserver une explication ou de reproduire exactement une configuration, consignez cette limite opérationnelle. Ne compensez pas une fonction absente par une supposition sur ce que le fournisseur pourrait proposer.
Première comparaison : points à vérifier pour chaque approche
| Approche | Éléments testés | Ce qu’il ne faut pas présumer | Enregistrement minimal |
|---|---|---|---|
| Criblage manuel avec tableur | Application des critères par des personnes et processus de saisie convenu. | Le tableur garantit la cohérence ou tranche les cas douteux. | Décision, personne ayant examiné la notice, motif et statut de chaque notice. |
| Outil spécialisé | Fonctions de criblage confirmées dans le produit et le compte de test. | Disponibilité actuelle, prix, exportation, justification ou adéquation au protocole. | Produit et version, configuration, décisions et options d’exportation vérifiées. |
| Modèle généraliste d’IA | Classement de titres et résumés à partir de consignes fixes. | Reproductibilité, traçabilité, accès durable ou exactitude suffisante. | Modèle ou version visible, consignes complètes, date, résultat et vérification humaine. |
Concevez un test comparable et reproductible
Utilisez le même ensemble de notices, les mêmes critères et les mêmes règles de traitement des incertitudes pour les trois approches. Rédigez des consignes uniques et compréhensibles. Si un outil exige une adaptation du format, préservez le sens et documentez cette adaptation. N’améliorez pas les consignes d’une approche après avoir vu ses erreurs sans refaire les tests des autres : la méthode qui aurait bénéficié de davantage d’ajustements serait avantagée.
Distinguez la mise au point de l’évaluation. Vous pouvez utiliser un premier groupe de notices pour clarifier les consignes et repérer les problèmes de format, puis réserver un autre groupe pour vérifier les résultats avec les instructions figées. Si le corpus disponible est petit, signalez cette limite et ne présentez pas quelques cas comme une démonstration concluante des performances générales. Le pilote doit apporter des éléments pertinents pour le processus de l’équipe, pas désigner un vainqueur universel.
Dans la mesure où l’organisation du travail le permet, veillez à ce que les personnes ayant établi la décision de référence ne voient pas d’abord les étiquettes du système. Comparez ensuite chaque résultat à cette référence et réexaminez manuellement toutes les exclusions proposées par une IA dans l’échantillon d’évaluation. Ce contrôle est particulièrement important : une exclusion erronée peut écarter une étude qui aurait été pertinente. Conservez également les désaccords. Ils peuvent révéler qu’un critère doit être précisé ou qu’un cas doit être arbitré.
Testez la reproductibilité lorsqu’une méthode peut produire des résultats différents. Réexécutez une partie du test avec la même configuration et comparez les décisions. Si la configuration d’un outil ne peut pas être figée, notez les contrôles réellement disponibles. L’absence de contrôle ne prouve pas à elle seule qu’une classification est incorrecte, mais elle limite la possibilité de reproduire et d’auditer le pilote.
Mesurez les erreurs, la cohérence et la charge de travail
Ne réduisez pas l’évaluation à un taux de bonnes réponses. Comptez les faux négatifs du point de vue du criblage : les notices que l’approche exclut alors que la décision de référence les conserve pour l’examen du texte intégral. Comptez également les faux positifs : les notices conservées par l’approche alors que la référence les exclut. Signalez les cas incertains et les désaccords qui ont nécessité un examen ou un arbitrage. Présentez les décomptes avec la taille de l’ensemble et expliquez comment la référence a été construite.
Les erreurs n’ont pas toutes les mêmes conséquences pratiques. Pour une équipe qui veut éviter de manquer des études potentiellement pertinentes, un faux négatif peut être plus préoccupant que l’examen de quelques notices supplémentaires. Ce degré de priorité doit être annoncé avant de consulter les résultats, et non choisi après coup pour justifier l’approche préférée. Si le protocole exige des décisions indépendantes de plusieurs personnes, le pilote ne doit pas supprimer cette exigence sans justification méthodologique approuvée.
Consignez séparément le temps consacré à la préparation, à l’importation, à l’exécution, à la vérification des résultats, à la résolution des cas ambigus et à l’exportation ou au nettoyage des données. Comparez la charge humaine totale, pas seulement le temps nécessaire à l’outil pour produire des étiquettes. Évaluez aussi si l’équipe peut reconstituer le parcours d’une notice : qui a pris la décision, selon quel critère, à partir de quelles informations et si la décision a été modifiée par la suite.
Une méthode qui réduit le temps de lecture initial peut demander davantage de vérifications. À l’inverse, un processus manuel peut être plus simple pour un petit corpus ou pour des critères difficiles à formaliser. Le pilote doit mettre ces coûts en évidence dans le contexte réel de l’équipe. Ne présentez pas une différence observée dans un test limité comme une caractéristique universelle du produit.
Grille d’évaluation du pilote
| Indicateur | Question examinée | Comment le consigner |
|---|---|---|
| Faux négatifs | Combien de notices à conserver pour le texte intégral selon la référence ont été exclues ? | Décompte et liste des identifiants à examiner. |
| Faux positifs | Combien de notices exclues par la référence ont été conservées ? | Décompte, critères concernés et estimation du travail supplémentaire. |
| Incertitudes et désaccords | Quels cas ont nécessité une intervention humaine pour être résolus ? | Décompte, motif, arbitrage et éventuelles modifications des critères. |
| Cohérence | Les étiquettes sont-elles restées les mêmes lors d’une nouvelle exécution ? | Nombre et type de décisions modifiées dans des conditions consignées. |
| Travail humain et traçabilité | Quel effort a été nécessaire pour valider et reconstituer les décisions ? | Temps par étape et champs disponibles pour l’audit. |
Tenez compte des limites, des données et des décisions qui exigent une supervision
Un titre ou un résumé incomplet peut masquer une information déterminante. Si un critère n’apparaît pas dans la notice, le système ne peut pas le résoudre de manière fiable sans consulter une autre source. Lui demander de combler le manque peut conduire à une inférence qui semble assurée sans être étayée par le texte. Prévoyez une catégorie d’incertitude et utilisez-la. Lorsque l’éligibilité dépend de détails méthodologiques absents du résumé, conservez la notice pour l’examen du texte intégral.
Les critères peuvent également être mal définis sur le plan opérationnel. Des expressions comme « population pertinente » ou « étude de qualité suffisante » ne suffisent pas si l’équipe n’a pas précisé quels éléments du texte permettent de les reconnaître. Si les personnes et les systèmes interprètent une règle différemment, revoyez d’abord la règle au lieu d’attribuer le problème au seul outil. Après toute modification, consignez la version des critères et réappliquez-les à l’ensemble réservé selon une procédure cohérente.
Avant de charger des notices, vérifiez les conditions applicables à l’accès, au traitement des données, au stockage, à la conservation et à la réutilisation du service envisagé. Les sources fournies ne précisent pas les conditions actuelles d’accès, les prix ou le traitement des données des produits candidats : ces points doivent être vérifiés directement. Si les documents contiennent des informations sensibles ou sont soumis à des restrictions institutionnelles, consultez les règles de votre organisation et n’envoyez aucune donnée avant d’avoir obtenu l’autorisation requise.
L’équipe doit conserver la responsabilité de l’approbation des critères, de la résolution des cas ambigus et de la décision finale d’éligibilité. Un guide universitaire consacré à l’IA dans la synthèse des données probantes présente l’utilisation de ces outils comme complément du jugement expert. Il constitue une orientation, et non la preuve qu’une fonction particulière est sûre ou efficace. Faire preuve de transparence, c’est consigner ce qui a été automatisé, ce qui a été vérifié, ce qui a changé et les limites du test.
Choisissez à l’aide d’une matrice de décision, pas d’une promesse
À la fin du pilote, comparez les résultats aux priorités établies à l’avance. Si l’équipe ne peut pas accepter de faux négatifs, écartez toute configuration qui en produit sans dispositif de vérification capable de les détecter. Si la traçabilité est essentielle, exigez un processus qui permette de retrouver les étiquettes et d’expliquer toute modification. Si l’objectif est de gagner du temps, incluez le temps de supervision au calcul, et pas seulement celui d’exécution de l’outil.
Conservez le criblage manuel lorsque le corpus reste gérable, que les critères exigent une interprétation contextuelle ou qu’aucune approche automatisée ne satisfait aux exigences minimales de sécurité et de consignation. Envisagez un outil spécialisé si ses fonctions utiles ont été vérifiées, si le pilote mené sur vos propres notices est satisfaisant et si le processus permet d’exporter et d’auditer les résultats. Testez un modèle généraliste uniquement avec des consignes contrôlées, des données dont l’utilisation est autorisée et une vérification suffisante pour éviter que ses résultats deviennent des exclusions non contrôlées.
Si les résultats sont prometteurs, intégrez l’outil en modifiant explicitement la procédure : documentez son rôle, les versions utilisées, les contrôles humains, la gestion des désaccords et la manière de corriger les erreurs. Réévaluez le processus si les critères, le produit, le modèle ou sa configuration changent. Si les éléments disponibles ne suffisent pas, signalez l’incertitude et élargissez le pilote au lieu d’affirmer qu’une approche est supérieure.
Dans le parcours éditorial d’Inferama, cet article peut être relié aux pages Découvrir, Comparer et Apprendre. Cette navigation ne modifie pas les exigences méthodologiques : une décision doit s’appuyer sur les données consignées pendant le pilote et sur les besoins du protocole, non sur une description commerciale ou une liste de fonctions non vérifiées.
Matrice pratique pour décider de la suite
| Résultat observé | Décision prudente | Condition avant de poursuivre |
|---|---|---|
| Erreurs d’exclusion inacceptables ou difficiles à détecter | Maintenir une décision humaine ; ne pas automatiser les exclusions. | Examiner les critères et les cas d’échec, puis répéter un test contrôlé. |
| Erreurs maîtrisables, traçabilité suffisante et charge totale réduite | Envisager un usage limité de l’outil en soutien au criblage. | Valider la procédure, consigner l’intervention humaine et surveiller les cas incertains. |
| Fonctions ou conditions du produit non vérifiées | Ne pas comparer comme si la capacité était confirmée. | Vérifier directement le processus, l’exportation, l’accès et le traitement des données. |
| Résultats variables, corpus réduit ou référence contestée | Signaler l’incertitude et élargir ou revoir le pilote. | Séparer l’ajustement des consignes de l’évaluation et documenter les arbitrages. |
Questions ouvertes
- Les sources fournies ne vérifient pas les fonctions actuelles de criblage des titres et résumés de Rayyan, Elicit, SciSpace ou scite.ai.
- Les conditions d’accès en vigueur, les prix, les limites d’utilisation et les politiques de traitement des données des produits candidats ne sont pas indiqués.
- Aucun résultat comparatif indépendant ni résultat de pilote propre ne permet d’affirmer qu’une approche est généralement plus précise ou plus rapide.
- La qualité de la décision de référence dépend des critères et de la procédure d’arbitrage définis par chaque équipe.
Poursuivre l’exploration
Sources consultées
Corrections et transparence
Si vous repérez une information incorrecte ou obsolète, envoyez-nous la page et la source à vérifier.
Proposer une correction