Ilustración editorial para Cribado de estudios con IA: cómo elegir entre revisión manual, herramientas especializadas y modelos generales
Imagen generada con gpt-image-2.5-sunburst para InferamaFuente ↗
01

Delimita la decisión que vas a probar

Cribar títulos y resúmenes consiste en decidir qué registros de una búsqueda bibliográfica parecen cumplir los criterios de elegibilidad y deben pasar a la siguiente fase. No equivale a confirmar que un estudio es elegible: con frecuencia, el resumen no contiene información suficiente y la decisión definitiva requiere consultar el texto completo. Por eso, el piloto que se propone aquí evalúa una tarea acotada: clasificar registros para decidir cuáles necesitan una revisión posterior, no completar una revisión sistemática ni reemplazar su protocolo.

La pregunta práctica no es «¿puede la IA cribar?», sino «¿qué método ayuda a este equipo, con estos criterios y este conjunto de registros, sin aumentar el riesgo de perder estudios pertinentes?». Una respuesta útil debe considerar errores, consistencia, trazabilidad y tiempo de trabajo humano. Que una herramienta produzca una etiqueta rápida no demuestra que esa etiqueta sea correcta ni que el ahorro neto sea relevante.

Conviene distinguir tres opciones. En el cribado manual, las personas leen los registros y anotan sus decisiones, por ejemplo en una hoja de cálculo. Una herramienta especializada está diseñada para tareas relacionadas con la revisión bibliográfica, pero sus funciones concretas deben verificarse en el producto y en la versión que se vaya a utilizar. Un modelo general de IA puede recibir instrucciones para clasificar texto, pero no debe suponerse que ofrece un flujo de cribado, un registro de decisiones o controles adecuados para una revisión. En todos los casos, la configuración importa.

02

Define criterios y casos de prueba antes de comparar

Antes de abrir una herramienta, convierte la pregunta de revisión en criterios de inclusión y exclusión aplicables a registros individuales. Especifica población, intervención o exposición, comparador, resultados, diseño del estudio, contexto y cualquier límite temporal o lingüístico que realmente forme parte del protocolo. No todos esos elementos serán pertinentes para cada revisión; lo importante es expresar qué información decide la elegibilidad y qué hacer cuando falta.

Añade instrucciones para los casos ambiguos. Por ejemplo: si el resumen no permite confirmar un criterio, ¿se conserva para texto completo o se excluye? ¿Cómo se trata un estudio que parece pertinente, pero no indica el diseño? ¿Qué ocurre cuando el título parece cumplir los criterios y el resumen los contradice? Si el equipo no resuelve estas preguntas de antemano, dos métodos pueden parecer discrepantes cuando, en realidad, están aplicando reglas distintas o incompletas.

Prepara un conjunto de registros que incluya ejemplos claramente elegibles, claramente no elegibles y dudosos. Una guía institucional de selección recomienda pilotar los criterios con registros de esas tres clases; aquí se adapta esa orientación al propósito adicional de comparar alternativas. El conjunto debe conservar los títulos y resúmenes tal como se obtuvieron, salvo las transformaciones necesarias y documentadas para proteger datos o normalizar formato. No selecciones solo ejemplos fáciles: el piloto debe revelar dónde las instrucciones se quedan cortas.

Establece una decisión de referencia mediante revisión humana independiente y un procedimiento para resolver desacuerdos. La referencia no es una verdad infalible: es una decisión documentada conforme al protocolo, con dudas visibles. Si los revisores discrepan, adjudica el caso, aclara la regla pertinente y registra el cambio; después, vuelve a aplicar la misma regla a las tres alternativas.

Preparación mínima del conjunto de prueba

  1. 01Congela una versión de la pregunta y de los criterios de elegibilidad.
  2. 02Selecciona registros elegibles, no elegibles y ambiguos; documenta cómo los elegiste.
  3. 03Pide a dos personas que apliquen los criterios sin consultar las etiquetas de las herramientas.
  4. 04Resuelve desacuerdos y conserva la justificación y la regla utilizada.
  5. 05Separa los registros usados para ajustar instrucciones de los que reservarás para comprobarlas.
03

Compara los tres enfoques sin atribuir capacidades no comprobadas

El cribado manual ofrece una referencia directa a los criterios del equipo, pero exige lectura y registro de cada decisión. Una hoja de cálculo puede servir para ordenar registros y documentar etiquetas si el equipo la prepara para ese fin; no aporta, por sí sola, una decisión metodológica ni resuelve discrepancias. Para que la comparación sea justa, define de antemano las columnas, las etiquetas permitidas y quién puede modificar una decisión.

Las herramientas especializadas son candidatas para un piloto, no una garantía de calidad. Rayyan, Elicit, SciSpace y scite.ai aparecen en las fuentes aportadas como herramientas relacionadas con revisiones o análisis bibliográfico. Esa mención orienta una lista inicial, pero no confirma que cada una incluya actualmente cribado de títulos y resúmenes, que lo haga del modo que necesita tu protocolo o que las funciones estén disponibles bajo las mismas condiciones de acceso. Verifica cada tarea dentro del producto y en documentación vigente antes de diseñar la prueba.

Un modelo general puede ser útil para probar instrucciones explícitas sobre los criterios, pero cualquier resultado dependerá del texto enviado, las instrucciones, la configuración y la respuesta que produzca. No des por hecho que repita la misma clasificación en cada ejecución, cite una razón verificable o conserve un historial suficiente. Comprueba esas propiedades directamente y registra la versión, la fecha y los parámetros disponibles. Si el sistema cambia entre ejecuciones, esa variación es parte del resultado, no un detalle que deba ocultarse.

Aplica la misma información de elegibilidad a cada alternativa. Cuando una herramienta no permita exportar una decisión, conservar una explicación o repetir exactamente una configuración, anótalo como una limitación operativa. No intentes compensar una función ausente con una suposición sobre lo que el proveedor probablemente ofrece.

Comparación inicial: qué comprobar en cada alternativa

EnfoqueQué se pruebaQué no se debe presuponerRegistro mínimo
Manual con hoja de cálculoAplicación humana de criterios y flujo de anotación acordado.Que la hoja controle la consistencia o resuelva los casos dudosos.Decisión, revisor, motivo y estado de cada registro.
Herramienta especializadaFunciones de cribado que se confirmen en el producto y la cuenta de prueba.Disponibilidad actual, precio, exportación, explicación o adecuación al protocolo.Producto y versión, configuración, decisiones y opciones de exportación verificadas.
Modelo general de IAClasificación con instrucciones fijas sobre títulos y resúmenes.Repetibilidad, trazabilidad, acceso persistente o exactitud suficiente.Modelo o versión visible, instrucciones completas, fecha, salida y revisión humana.
04

Diseña una prueba comparable y reproducible

Usa el mismo conjunto de registros, los mismos criterios y las mismas reglas para resolver incertidumbres en las tres alternativas. Escribe una instrucción única y comprensible; si una herramienta necesita adaptar el formato, conserva intacto el significado y documenta la adaptación. No mejores las instrucciones de una opción después de ver sus errores sin repetir las pruebas de las demás: eso favorecería a la alternativa que recibió más ajustes.

Separa el desarrollo de la prueba de su evaluación. Puedes emplear un grupo inicial para aclarar instrucciones y detectar problemas de formato; reserva otro grupo para comprobar el resultado con las instrucciones congeladas. Si el corpus disponible es pequeño, informa de esa limitación y evita presentar unos pocos casos como prueba concluyente de rendimiento general. El objetivo del piloto es obtener evidencia pertinente para el flujo concreto del equipo, no proclamar un ganador universal.

Haz que quienes establecieron la decisión de referencia no vean primero las etiquetas del sistema, siempre que la organización del trabajo lo permita. Después compara cada salida con esa referencia y revisa manualmente todas las exclusiones propuestas por una IA en la muestra de evaluación. Ese control es especialmente importante porque una exclusión equivocada puede retirar de la revisión un estudio que habría sido pertinente. Conserva también los desacuerdos: son una señal de que el criterio necesita mayor precisión o de que el caso exige adjudicación.

Prueba la repetibilidad cuando el método pueda producir salidas distintas. Repite una parte del conjunto con la misma configuración y compara decisiones. En el caso de una herramienta cuya configuración no pueda fijarse, registra qué controles ofrece realmente. La ausencia de control no demuestra por sí sola que una clasificación sea incorrecta, pero sí limita cuánto puede reproducirse y auditarse el piloto.

05

Mide errores, consistencia y carga de trabajo

No reduzcas la evaluación a una cifra de aciertos. Cuenta los falsos descartes: registros que la alternativa excluye, pero que la decisión de referencia mantiene para texto completo. Cuenta también los falsos incluidos: registros que la alternativa conserva, aunque la referencia los excluya. Informa de los casos inciertos y de los desacuerdos que requirieron revisión o adjudicación. Presenta los recuentos junto con el tamaño del conjunto y explica cómo se construyó la referencia.

Los errores no tienen el mismo efecto práctico. Para un equipo que prioriza no perder estudios potencialmente relevantes, un falso descarte puede ser más preocupante que revisar algunos registros adicionales. Ese énfasis debe declararse como criterio de decisión antes de ver los resultados, no elegirse a posteriori para justificar la opción preferida. Si el protocolo requiere decisiones independientes de varias personas, el piloto no debería reemplazar ese requisito sin una justificación metodológica aprobada.

Registra el tiempo por separado: preparación, importación, ejecución, revisión de salidas, resolución de casos ambiguos y exportación o limpieza de datos. Compara el trabajo humano total, no solo el tiempo que una herramienta tarda en producir etiquetas. También mide si el equipo puede reconstruir qué ocurrió con un registro: quién decidió, con qué criterio, a partir de qué información y si hubo una modificación posterior.

Una alternativa con menos tiempo de lectura inicial puede requerir más trabajo de verificación. A la inversa, un flujo manual podría resultar más sencillo en un corpus pequeño o con criterios difíciles de formalizar. El piloto debe mostrar esos costes en el contexto real del equipo. No presentes una diferencia observada en una prueba limitada como una propiedad universal del producto.

Cuadro de evaluación del piloto

IndicadorPregunta que respondeCómo registrarlo
Falsos descartes¿Cuántos registros de referencia para texto completo fueron excluidos?Recuento y lista de identificadores para revisión.
Falsos incluidos¿Cuántos registros excluidos por referencia se conservaron?Recuento, criterios implicados y trabajo adicional estimado.
Incertidumbres y desacuerdos¿Qué casos no se resolvieron sin intervención humana?Recuento, motivo, adjudicación y cambios de criterio.
Consistencia¿Se repitieron las etiquetas al volver a ejecutar la prueba?Número y tipo de decisiones que cambiaron bajo condiciones registradas.
Trabajo humano y trazabilidad¿Cuánto esfuerzo exigió validar y reconstruir decisiones?Tiempo por fase y campos de auditoría disponibles.
06

Considera límites, datos y decisiones que requieren supervisión

Un título o resumen incompleto puede ocultar información decisiva. El sistema no puede resolver de forma fiable un criterio que no aparece en el registro si no se consulta otra fuente; pedirle que complete el vacío puede producir una inferencia que parezca segura sin estar respaldada por el texto. Define una salida de incertidumbre y úsala. Cuando la elegibilidad dependa de detalles metodológicos ausentes del resumen, conserva el registro para la fase de texto completo.

Los criterios también pueden estar mal operacionalizados. Expresiones como «población pertinente» o «estudio de calidad adecuada» no bastan si el equipo no ha indicado qué evidencia textual las satisface. Si personas y sistemas interpretan de forma distinta una regla, revisa la regla antes de atribuir el problema solo a la herramienta. Después de cualquier cambio, documenta la versión de los criterios y vuelve a aplicar el conjunto reservado según un procedimiento coherente.

Antes de cargar registros, revisa las condiciones aplicables de acceso, tratamiento de datos, almacenamiento, retención y reutilización del servicio que se pretende probar. Las fuentes aportadas no proporcionan condiciones actuales de acceso, precio o tratamiento de datos para los productos candidatos; esos aspectos requieren comprobación directa. Si los materiales contienen información sensible o existen restricciones institucionales, consulta las normas de la organización y no envíes datos hasta obtener autorización.

Mantén bajo responsabilidad del equipo la aprobación de los criterios, la resolución de casos ambiguos y la decisión final de elegibilidad. Una guía universitaria sobre IA en síntesis de evidencia plantea el uso de estas herramientas junto al juicio experto; sirve como orientación, no como prueba de que una función determinada sea segura o eficaz. La transparencia consiste en registrar qué se automatizó, qué se revisó, qué cambió y qué limitaciones tuvo la prueba.

07

Elige con una matriz de decisión, no con una promesa

Al terminar, compara los resultados con las prioridades acordadas antes del piloto. Si el equipo no puede tolerar falsos descartes, descarta cualquier configuración que los produzca sin una revisión capaz de detectarlos. Si la trazabilidad es esencial, exige que el flujo permita recuperar las etiquetas y explicar cualquier modificación. Si el ahorro de tiempo es el objetivo, incluye el tiempo de supervisión y no solo la ejecución de la herramienta.

Mantén el cribado manual cuando el conjunto sea manejable para el equipo, los criterios requieran interpretación contextual o ninguna alternativa automatizada supere las condiciones mínimas de seguridad y registro. Considera una herramienta especializada si sus funciones pertinentes están verificadas, el piloto con tus propios registros es aceptable y el flujo permite exportar y auditar resultados. Prueba un modelo general solo con instrucciones controladas, datos autorizados y revisión suficiente para evitar que sus salidas se conviertan en exclusiones sin comprobar.

Si el resultado es prometedor, integra la herramienta como una modificación explícita del procedimiento: documenta su papel, las versiones utilizadas, los controles humanos, la gestión de desacuerdos y la forma de corregir errores. Vuelve a evaluar el flujo si cambian los criterios, el producto, el modelo o la configuración. Si la evidencia es insuficiente, informa de la incertidumbre y amplía el piloto en lugar de afirmar que una opción es superior.

Para seguir el proceso editorial de Inferama, esta guía puede conectarse desde las páginas de Descubrimiento, Comparación y Aprendizaje. La utilidad de esa navegación no cambia el estándar metodológico: la decisión debe justificarse con registros del piloto y con las necesidades del protocolo, no con una descripción comercial o una lista de funciones sin verificar.

Matriz práctica para decidir el siguiente paso

Resultado observadoDecisión prudenteCondición antes de avanzar
Errores de exclusión no aceptables o difíciles de detectarMantener decisión humana; no automatizar exclusiones.Revisar criterios y casos fallidos; repetir una prueba controlada.
Errores controlables, trazabilidad suficiente y trabajo total menorConsiderar un uso limitado como apoyo al cribado.Aprobar el procedimiento, registrar intervención humana y vigilar casos inciertos.
Funciones o condiciones del producto sin verificarNo comparar como si la capacidad estuviera confirmada.Comprobar el flujo, exportación, acceso y tratamiento de datos directamente.
Resultados variables, corpus reducido o referencia discutidaDeclarar incertidumbre y ampliar o rediseñar el piloto.Separar ajuste de instrucciones y evaluación; documentar adjudicaciones.

Qué sigue abierto

  • Las fuentes aportadas no verifican las funciones actuales de cribado de títulos y resúmenes de Rayyan, Elicit, SciSpace o scite.ai.
  • No se aportan condiciones vigentes de acceso, precios, límites de uso ni políticas de tratamiento de datos de los productos candidatos.
  • No hay resultados comparativos independientes o de un piloto propio que permitan afirmar que un enfoque sea más preciso o rápido en general.
  • La calidad de la decisión de referencia depende de los criterios y del procedimiento de adjudicación establecidos por cada equipo.
08

Continúa explorando

08

Fuentes consultadas

03

Correcciones y transparencia

Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.

Proponer una corrección