Ilustración editorial para ChatGPT Deep Research, Gemini Deep Research, Perplexity y Claude Research: cómo compararlos
Imagen generada con gpt-image-2.5-sunburst para InferamaFuente ↗
01

Qué se compara y qué no puede concluirse de antemano

Un asistente de investigación web no es simplemente un buscador que devuelve una lista de páginas. Se le pide que encuentre información, la organice y redacte una síntesis con referencias que una persona pueda inspeccionar. La evaluación, por tanto, no debería terminar al comprobar que el informe incluye enlaces: hay que verificar si cada fuente respalda la afirmación junto a la que aparece, si se han localizado fuentes pertinentes y si el texto representa con fidelidad las discrepancias.

Esta guía propone comparar ChatGPT Deep Research, Gemini Deep Research, Perplexity Pro Search y Claude Research mediante encargos equivalentes. No declara un ganador ni presenta como probado que una herramienta sea más precisa, completa o rápida que otra. La documentación disponible describe funciones de los proveedores, pero no aporta una prueba comparativa común para los cuatro productos. Además, en las fuentes verificadas aquí no hay documentación de Claude Research que permita confirmar sus opciones, disponibilidad o funcionamiento. Por eso, sus características deben comprobarse directamente antes de iniciar una evaluación; no se deben inferir por analogía.

La diferencia entre una función anunciada y un resultado comprobado es central. Que un producto describa investigación en varias etapas, búsqueda web, selección de fuentes o enlaces no demuestra que haya encontrado las mejores fuentes en una consulta concreta. Para saberlo, hace falta ejecutar las mismas tareas, conservar las condiciones de prueba y revisar manualmente una muestra de las afirmaciones principales.

02

Diseñar una prueba justa y reproducible

Una comparación útil empieza con un registro de las condiciones, no con una colección informal de capturas. Anota la fecha y hora, el nombre y la versión visible de la función utilizada, el tipo de cuenta o plan, los controles activados, el texto exacto de cada encargo y cualquier documento cargado. Conserva también la salida completa, incluidas las referencias, los avisos de límite y las preguntas de seguimiento. Los planes, las cuotas y las funciones cambian; si no se registran, una diferencia de resultado puede deberse al acceso y no al comportamiento del sistema.

Usa cuatro encargos con objetivos diferentes. Para información reciente, pide un dato con fecha de corte y una fuente primaria. Para una pregunta con varias partes, enumera cada subpregunta y solicita que la respuesta indique qué evidencia cubre cada una. Para una búsqueda restringida, define de antemano los dominios que se pueden usar y comprueba si las referencias finales respetan la restricción. Para documentos propios, usa el mismo archivo en las herramientas que permitan cargarlo y exige que el informe diferencie evidencia documental de evidencia web. Si una función no está disponible, regístrala como no evaluable bajo esas condiciones: no la reemplaces por una modalidad distinta sin señalarlo.

La misma redacción reduce, aunque no elimina, las diferencias de interpretación. Conviene hacer una segunda ronda con una formulación equivalente para detectar resultados frágiles. No se deben cambiar los encargos a mitad de la prueba para favorecer una herramienta, ni tratar como equivalentes modos o planes que no lo son. Cuando no se pueda igualar la configuración, la comparación debe describir esa limitación en lugar de ocultarla.

Protocolo mínimo

  1. 01Fijar cuatro encargos: dato reciente, investigación con varias partes, búsqueda por dominios y análisis de documentos propios.
  2. 02Anotar fecha, plan, función, ajustes de búsqueda, archivos y límites visibles para cada producto.
  3. 03Introducir el mismo encargo, guardar la respuesta completa y no modificar la configuración durante la ronda.
  4. 04Verificar las afirmaciones centrales contra las páginas originales y registrar citas correctas, débiles, irrelevantes o rotas.
  5. 05Repetir los encargos importantes y separar las diferencias estables de las variaciones entre ejecuciones.
03

Qué medir en las fuentes, las citas y los desacuerdos

La calidad de las referencias se evalúa afirmación por afirmación. Para cada frase verificable del informe, identifica la cita asociada y abre la página original. Comprueba si la página contiene el dato, si se refiere a la misma población, periodo y contexto, y si la redacción del informe exagera lo que la fuente permite concluir. Una página puede ser pertinente para el tema general y, aun así, no respaldar la cifra concreta o la relación causal que el asistente le atribuye.

Registra por separado las citas que abren y son pertinentes, las que respaldan solo una parte de la afirmación, las que no guardan relación suficiente y las que no se pueden consultar. Si una afirmación reúne varios hechos, desglósala antes de calificar su apoyo. Una tasa agregada sin esa revisión puede resultar engañosa: muchas referencias correctas para datos secundarios no compensan una afirmación central sin respaldo.

También importa la diversidad de evidencia. Una fuente primaria —por ejemplo, una norma, un conjunto de datos original o el documento de una institución responsable del dato— no cumple siempre la misma función que un análisis periodístico o una revisión académica. No es necesario exigir una fuente primaria para cualquier pregunta, pero sí identificar qué tipo de evidencia se utiliza y si hay fuentes independientes. Si dos fuentes discrepan, el informe debería exponer qué difiere, por qué y qué no se puede resolver con la evidencia disponible, en vez de presentar una única versión como consenso.

El tiempo de auditoría completa la evaluación. Mide cuánto tarda una persona en comprobar las afirmaciones principales, localizar el pasaje relevante y decidir si la cita basta. Este tiempo no es una medida absoluta de calidad: depende del tema, de la accesibilidad de las fuentes y de la experiencia de quien revisa. Sí es una variable práctica para equipos que deben entregar informes verificables con plazos concretos.

Matriz para puntuar cada informe

CriterioQué observarRegistro recomendado
CoberturaSi responde a todas las partes del encargo y señala lo que queda sin resolver.Partes cubiertas, omitidas y no verificables.
Respaldo de citasSi la fuente original apoya directamente la afirmación asociada, con el alcance y el periodo correctos.Directo, parcial, insuficiente, irrelevante o inaccesible.
Calidad y diversidadPresencia de fuentes primarias pertinentes, fuentes independientes y perspectivas discrepantes.Tipo de fuente, procedencia y desacuerdos identificados.
TrazabilidadFacilidad para abrir la fuente, encontrar el pasaje y entender a qué frase corresponde.Enlace funcional, pasaje localizable y ambigüedades.
Esfuerzo de revisiónTiempo necesario para comprobar los hallazgos más importantes.Minutos por informe y dificultades encontradas.
04

Cuatro tareas que revelan diferencias prácticas

Para localizar un dato reciente, el encargo debe especificar qué se entiende por reciente y qué clase de respaldo se necesita. Pide la fecha del dato, la entidad que lo publica y un enlace a la fuente original. Después comprueba si el resultado confundió fecha de publicación con fecha de medición, si tomó una cifra provisional como definitiva o si citó una noticia que no conduce al dato primario. Esta prueba evalúa actualidad y trazabilidad, no la capacidad general de investigar.

En una pregunta multietapa, escribe una lista de subpreguntas y exige una síntesis que mantenga visibles las diferencias entre ellas. Una respuesta fluida puede ocultar que una parte está sustentada por evidencia sólida y otra por una fuente débil. Comprueba también si la conclusión se desprende de las fuentes o si añade una inferencia que no está marcada como tal. Para facilitar la auditoría, solicita que cada punto importante vaya acompañado de la referencia específica que lo apoya.

En la prueba de búsqueda restringida a sitios, decide primero si se quiere permitir exclusivamente una lista de dominios o si se quiere priorizarlos sin excluir el resto. Son instrucciones distintas. Después inspecciona las fuentes de la respuesta: un sistema puede permitir una configuración de sitios sin que eso, por sí mismo, garantice que todas las referencias finales procedan de ellos. La documentación de OpenAI describe una opción de búsqueda de Deep Research restringida a sitios de confianza, y la ayuda de Gemini documenta controles y selección de fuentes. Son datos sobre opciones declaradas, no una verificación de que cada ejecución las respete.

Para documentos propios, usa un archivo sin datos sensibles y que contenga afirmaciones comprobables. Pide que el asistente separe expresamente lo extraído del documento de lo que encuentre en la web. Revisa si las citas conducen al archivo, a páginas web o a ambos, y si el informe atribuye correctamente cada evidencia. La documentación oficial de Gemini describe carga de archivos y selección de fuentes como opciones; OpenAI también describe el uso de archivos aportados en Deep Research. La disponibilidad concreta y el comportamiento deben confirmarse en la cuenta sometida a prueba.

Perplexity presenta Pro Search como una modalidad con selección de modelos y modos de búsqueda, entre ellos Web, Academic, Finance y Files, y afirma que sus respuestas enlazan a fuentes originales. Esas descripciones ayudan a diseñar una prueba que registre el modo utilizado. No sustituyen la revisión de las páginas originales ni permiten anticipar la proporción de citas correctas. Una comparación válida debe anotar el modo, el plan y las condiciones, y luego evaluar cada referencia con el mismo criterio usado para los demás productos.

05

Cómo interpretar las funciones y los límites de acceso

Las páginas oficiales son adecuadas para confirmar lo que cada proveedor declara sobre sus productos, pero no constituyen una evaluación independiente. OpenAI describe Deep Research como un flujo de investigación multietapa con citas y distingue esa modalidad de una búsqueda más rápida. Su guía de OpenAI Academy también explica ese flujo. Google indica que Google Search se incluye por defecto como fuente en Deep Research de Gemini y documenta opciones de fuentes, edición del plan de investigación y carga de archivos. Perplexity describe Pro Search, sus modos y la vinculación con fuentes originales. Estas afirmaciones sirven para configurar la prueba; no justifican ordenar las herramientas por precisión.

Los límites de acceso deben formar parte de los resultados. Registra si una cuenta puede usar la función, qué plan exige el proveedor, qué cuotas aparecen y si la carga de archivos o los controles de fuentes están disponibles. No extrapoles el resultado de una cuenta a todos los usuarios. Las páginas de planes pueden cambiar y una cuota indicada hoy no debe presentarse como permanente. Verifica de nuevo las condiciones inmediatamente antes de publicar y especifica la fecha de comprobación.

La evidencia académica disponible entre las fuentes aportadas también tiene un alcance limitado. Un estudio de arXiv trata la credibilidad de las fuentes y el respaldo de respuestas en ChatGPT y Perplexity, pero no incluye Claude ni Gemini. Sus resultados corresponden a los productos y condiciones estudiados en ese trabajo; no deben trasladarse automáticamente a versiones actuales ni utilizarse para proclamar un ganador en esta comparación. Un estudio previo puede ayudar a formular criterios, pero la prueba de los productos actuales requiere datos propios y un método explícito.

En particular, la ausencia de una fuente verificada sobre Claude Research impide describir aquí sus capacidades o disponibilidad como hechos. La herramienta puede incorporarse a la prueba si se confirma su documentación oficial y el acceso vigente, pero hasta entonces cualquier afirmación sobre sus controles, fuentes o citas queda pendiente de verificación. Esa cautela evita completar lagunas mediante suposiciones.

Matriz de decisión según la tarea

NecesidadQué priorizarQué comprobar antes de elegir
Encontrar un dato recienteFecha de actualización, fuente primaria y correspondencia entre dato y cita.Periodo de referencia, cambios metodológicos y accesibilidad de la fuente.
Investigar una pregunta complejaCobertura de subpreguntas, tratamiento de desacuerdos y separación entre evidencia e inferencia.Si cada conclusión importante tiene apoyo directo y suficiente.
Restringir la búsquedaControles claros para limitar o priorizar dominios y referencias finales trazables.Si el sistema respetó realmente la lista acordada.
Combinar web y documentos propiosAtribución clara de la evidencia y referencias que permitan volver al documento original.Disponibilidad de carga, tratamiento de archivos y distinción entre fuentes.
Entregar un informe auditableCitas legibles, enlaces funcionales y bajo esfuerzo de comprobación.Tiempo real de revisión y proporción de afirmaciones respaldadas.
06

Elegir sin declarar un ganador absoluto

La elección depende de la tarea, del riesgo de equivocarse y de cuánto tiempo se puede dedicar a revisar. Para una nota interna de bajo riesgo puede bastar un informe cuyas afirmaciones principales sean fáciles de comprobar. Para una publicación, un análisis regulatorio o una decisión profesional, puede ser necesario contrastar fuentes primarias, documentar los desacuerdos y conservar un registro de auditoría. La herramienta con más enlaces no es necesariamente la más trazable, y una respuesta más extensa no equivale a una cobertura más completa.

Antes de adoptar una solución, fija un umbral de aceptación. Por ejemplo, define qué proporción de las afirmaciones centrales debe contar con respaldo directo, qué fuentes son obligatorias para cierto tipo de dato y qué errores requieren rehacer la búsqueda. El umbral debe depender del uso previsto y aplicarse por igual a todos los productos. Si una herramienta no puede cumplir una condición imprescindible —por acceso, controles o citas insuficientes—, la conclusión apropiada es que no encaja en ese flujo bajo las condiciones probadas, no que sea universalmente inferior.

Conserva resultados, instrucciones y verificaciones para repetir la evaluación cuando cambien los productos o los planes. La matriz sirve para comparar evidencias observadas, no para convertir una prueba pequeña en una clasificación universal. Si los resultados varían mucho entre ejecuciones, informa esa variabilidad; si faltan datos para una herramienta, marca la comparación como incompleta. La decisión más defendible es la que explica qué se probó, qué se pudo comprobar y qué permanece incierto.

Qué sigue abierto

  • No se aportó documentación verificada de Claude Research; sus funciones, fuentes, controles y disponibilidad quedan pendientes de comprobación.
  • Las fuentes aportadas no contienen una prueba común y actual de los cuatro productos ni resultados observados con encargos equivalentes.
  • Los planes, cuotas y opciones de acceso pueden cambiar; deben verificarse en cada cuenta y al cierre editorial.
  • La documentación de producto describe opciones declaradas, pero no permite determinar por sí sola la exactitud de las citas o la exhaustividad de los informes.
07

Continúa explorando

07

Fuentes consultadas

03

Correcciones y transparencia

Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.

Proponer una corrección