Ilustración editorial para ChatGPT Deep Research, Gemini Deep Research, Perplexity y Claude Research: cómo compararlos
Imagen generada con gpt-image-2.5-sunburst para InferamaFonte ↗
01

O que está a ser comparado e o que não se pode concluir à partida

Um assistente de pesquisa na web não é simplesmente um motor de busca que devolve uma lista de páginas. Pede-se-lhe que encontre informação, a organize e redija uma síntese com referências que uma pessoa possa consultar. Por isso, a avaliação não deve terminar quando se verifica que o relatório inclui ligações: é preciso confirmar se cada fonte sustenta a afirmação junto da qual aparece, se foram encontradas fontes pertinentes e se o texto representa fielmente as divergências.

Este guia propõe comparar ChatGPT Deep Research, Gemini Deep Research, Perplexity Pro Search e Claude Research através de tarefas equivalentes. Não declara um vencedor nem apresenta como comprovado que uma ferramenta seja mais precisa, completa ou rápida do que outra. A documentação disponível descreve funcionalidades dos fornecedores, mas não fornece um teste comparativo comum aos quatro produtos. Além disso, as fontes aqui verificadas não incluem documentação sobre Claude Research que permita confirmar as suas opções, disponibilidade ou funcionamento. Por isso, essas características devem ser verificadas diretamente antes de iniciar uma avaliação; não devem ser inferidas por analogia.

A distinção entre uma funcionalidade anunciada e um resultado comprovado é fundamental. O facto de um produto descrever uma pesquisa em várias etapas, pesquisa na web, seleção de fontes ou ligações não demonstra que tenha encontrado as melhores fontes para uma consulta concreta. Para o saber, é necessário executar as mesmas tarefas, conservar as condições do teste e verificar manualmente uma amostra das afirmações principais.

02

Conceber um teste justo e reproduzível

Uma comparação útil começa com o registo das condições, não com uma coleção informal de capturas de ecrã. Anote a data e a hora, o nome e a versão visível da funcionalidade utilizada, o tipo de conta ou plano, os controlos ativados, o texto exato de cada tarefa e quaisquer documentos carregados. Guarde também a resposta completa, incluindo as referências, os avisos de limite e as perguntas de seguimento. Os planos, as quotas e as funcionalidades mudam; sem registo, uma diferença no resultado pode dever-se ao acesso, e não ao comportamento do sistema.

Utilize quatro tarefas com objetivos diferentes. Para informação recente, peça um dado com uma data de referência e uma fonte primária. Para uma pergunta com várias partes, enumere cada subpergunta e peça à resposta que indique que evidência cobre cada uma. Para uma pesquisa limitada, defina antecipadamente os domínios permitidos e verifique se as referências finais respeitam essa restrição. Para documentos próprios, utilize o mesmo ficheiro nas ferramentas que permitam carregá-lo e exija que o relatório distinga a evidência documental da evidência obtida na web. Se uma funcionalidade não estiver disponível, registe-a como não avaliável nessas condições: não a substitua por uma modalidade diferente sem o assinalar.

A mesma formulação reduz as diferenças de interpretação, embora não as elimine. É aconselhável fazer uma segunda ronda com uma redação equivalente para detetar resultados frágeis. Não altere as tarefas a meio do teste para favorecer uma ferramenta, nem trate como equivalentes modalidades ou planos que não o são. Quando não for possível igualar a configuração, a comparação deve descrever essa limitação em vez de a ocultar.

Protocolo mínimo

  1. 01Defina quatro tarefas: dado recente, pesquisa com várias partes, pesquisa por domínios e análise de documentos próprios.
  2. 02Registe, para cada produto, a data, o plano, a funcionalidade, as definições de pesquisa, os ficheiros e os limites visíveis.
  3. 03Introduza a mesma tarefa, guarde a resposta completa e não altere a configuração durante a ronda.
  4. 04Verifique as afirmações centrais nas páginas originais e registe citações corretas, fracas, irrelevantes ou quebradas.
  5. 05Repita as tarefas mais importantes e distinga as diferenças consistentes das variações entre execuções.
03

O que medir nas fontes, nas citações e nas divergências

A qualidade das referências deve ser avaliada afirmação por afirmação. Para cada frase verificável do relatório, identifique a citação associada e abra a página original. Confirme se a página contém o dado, se diz respeito à mesma população, período e contexto, e se a redação do relatório exagera aquilo que a fonte permite concluir. Uma página pode ser pertinente para o tema geral e, ainda assim, não sustentar o valor concreto ou a relação causal que o assistente lhe atribui.

Registe separadamente as citações que abrem e são pertinentes, as que sustentam apenas parte da afirmação, as que não têm uma relação suficiente com ela e as que não podem ser consultadas. Se uma afirmação reunir vários factos, divida-a antes de avaliar o respetivo suporte. Uma taxa agregada sem esta revisão pode induzir em erro: muitas referências corretas para dados secundários não compensam uma afirmação central sem sustentação.

A diversidade da evidência também é importante. Uma fonte primária — por exemplo, uma norma, um conjunto de dados original ou o documento da instituição responsável pelo dado — nem sempre desempenha a mesma função que uma análise jornalística ou uma revisão académica. Não é necessário exigir uma fonte primária para todas as perguntas, mas é importante identificar que tipo de evidência está a ser utilizado e se existem fontes independentes. Se duas fontes divergirem, o relatório deve explicar o que difere, porquê e o que não é possível resolver com a evidência disponível, em vez de apresentar uma única versão como se fosse consensual.

O tempo de auditoria completa a avaliação. Meça quanto tempo uma pessoa demora a verificar as afirmações principais, localizar a passagem relevante e decidir se a citação é suficiente. Este tempo não é uma medida absoluta de qualidade: depende do tema, da acessibilidade das fontes e da experiência de quem faz a revisão. É, contudo, uma variável prática para equipas que precisam de entregar relatórios verificáveis dentro de prazos concretos.

Matriz para avaliar cada relatório

CritérioO que observarRegisto recomendado
CoberturaSe responde a todas as partes da tarefa e assinala o que fica por resolver.Partes cobertas, omitidas e não verificáveis.
Suporte das citaçõesSe a fonte original sustenta diretamente a afirmação associada, com o âmbito e o período corretos.Direto, parcial, insuficiente, irrelevante ou inacessível.
Qualidade e diversidadePresença de fontes primárias pertinentes, fontes independentes e perspetivas divergentes.Tipo de fonte, proveniência e divergências identificadas.
RastreabilidadeFacilidade para abrir a fonte, encontrar a passagem e perceber a que frase corresponde.Ligação funcional, passagem localizável e ambiguidades.
Esforço de revisãoTempo necessário para verificar os resultados mais importantes.Minutos por relatório e dificuldades encontradas.
04

Quatro tarefas que revelam diferenças práticas

Para localizar um dado recente, a tarefa deve especificar o que significa «recente» e que tipo de suporte é necessário. Peça a data do dado, a entidade que o publica e uma ligação para a fonte original. Em seguida, verifique se o resultado confundiu a data de publicação com a data da medição, se tratou um valor provisório como definitivo ou se citou uma notícia que não conduz ao dado primário. Este teste avalia atualidade e rastreabilidade, não a capacidade geral de pesquisa.

Numa pergunta com várias etapas, escreva uma lista de subperguntas e exija uma síntese que mantenha visíveis as diferenças entre elas. Uma resposta fluida pode ocultar que uma parte está sustentada por evidência sólida e outra por uma fonte fraca. Verifique também se a conclusão decorre das fontes ou se acrescenta uma inferência que não está assinalada como tal. Para facilitar a auditoria, peça que cada ponto importante seja acompanhado da referência específica que o sustenta.

No teste de pesquisa limitada a determinados sites, decida primeiro se pretende permitir apenas uma lista de domínios ou se pretende dar-lhes prioridade sem excluir os restantes. São instruções diferentes. Depois, inspecione as fontes da resposta: um sistema pode permitir uma configuração de sites sem que isso garanta, por si só, que todas as referências finais provenham deles. A documentação da OpenAI descreve uma opção de pesquisa do Deep Research limitada a sites de confiança, e a ajuda do Gemini documenta controlos e seleção de fontes. Trata-se de informação sobre opções declaradas, não de uma verificação de que cada execução as respeita.

Para documentos próprios, utilize um ficheiro sem dados sensíveis e com afirmações verificáveis. Peça ao assistente que distinga expressamente o que extraiu do documento daquilo que encontrou na web. Verifique se as citações conduzem ao ficheiro, a páginas da web ou a ambos, e se o relatório atribui corretamente cada evidência. A documentação oficial do Gemini descreve o carregamento de ficheiros e a seleção de fontes como opções; a OpenAI também descreve a utilização de ficheiros fornecidos pelo utilizador no Deep Research. A disponibilidade concreta e o comportamento devem ser confirmados na conta submetida ao teste.

A Perplexity apresenta o Pro Search como uma modalidade que permite selecionar modelos e modos de pesquisa, entre eles Web, Academic, Finance e Files, e afirma que as respostas incluem ligações para fontes originais. Estas descrições ajudam a conceber um teste que registe o modo utilizado. Não substituem a consulta das páginas originais nem permitem antecipar a proporção de citações corretas. Uma comparação válida deve registar o modo, o plano e as condições e, em seguida, avaliar cada referência segundo o mesmo critério aplicado aos outros produtos.

05

Como interpretar as funcionalidades e os limites de acesso

As páginas oficiais são adequadas para confirmar o que cada fornecedor declara sobre os seus produtos, mas não constituem uma avaliação independente. A OpenAI descreve o Deep Research como um fluxo de pesquisa em várias etapas, com citações, e distingue essa modalidade de uma pesquisa mais rápida. O guia da OpenAI Academy também explica esse fluxo. A Google indica que o Google Search é incluído por predefinição como fonte no Deep Research do Gemini e documenta opções de fontes, edição do plano de pesquisa e carregamento de ficheiros. A Perplexity descreve o Pro Search, os seus modos e a ligação a fontes originais. Estas afirmações ajudam a configurar o teste; não justificam classificar as ferramentas pela sua precisão.

Os limites de acesso devem fazer parte dos resultados. Registe se uma conta pode utilizar a funcionalidade, que plano o fornecedor exige, que quotas são apresentadas e se o carregamento de ficheiros ou os controlos de fontes estão disponíveis. Não generalize o resultado de uma conta a todos os utilizadores. As páginas de planos podem mudar, e uma quota indicada hoje não deve ser apresentada como permanente. Volte a verificar as condições imediatamente antes da publicação e indique a data da verificação.

A evidência académica disponível entre as fontes fornecidas também tem um âmbito limitado. Um estudo no arXiv aborda a credibilidade das fontes e o suporte das respostas no ChatGPT e na Perplexity, mas não inclui Claude nem Gemini. Os resultados dizem respeito aos produtos e às condições estudados nesse trabalho; não devem ser automaticamente extrapolados para versões atuais nem utilizados para declarar um vencedor nesta comparação. Um estudo anterior pode ajudar a formular critérios, mas avaliar os produtos atuais exige dados próprios e um método explícito.

Em particular, a ausência de uma fonte verificada sobre Claude Research impede que se descrevam aqui as suas capacidades ou disponibilidade como factos. A ferramenta pode ser incluída no teste se a sua documentação oficial e o acesso atual forem confirmados; até lá, qualquer afirmação sobre os seus controlos, fontes ou citações fica por verificar. Esta prudência evita preencher lacunas com suposições.

Matriz de decisão por tarefa

NecessidadeO que deve ser prioritárioO que verificar antes de escolher
Encontrar um dado recenteData de atualização, fonte primária e correspondência entre o dado e a citação.Período de referência, alterações metodológicas e acessibilidade da fonte.
Pesquisar uma pergunta complexaCobertura das subperguntas, tratamento das divergências e distinção entre evidência e inferência.Se cada conclusão importante tem suporte direto e suficiente.
Limitar a pesquisaControlos claros para limitar ou priorizar domínios e referências finais rastreáveis.Se o sistema respeitou efetivamente a lista acordada.
Combinar a web com documentos própriosAtribuição clara da evidência e referências que permitam voltar ao documento original.Disponibilidade do carregamento, tratamento dos ficheiros e distinção entre fontes.
Entregar um relatório auditávelCitações legíveis, ligações funcionais e pouco esforço de verificação.Tempo real de revisão e proporção de afirmações sustentadas.
06

Escolher sem declarar um vencedor absoluto

A escolha depende da tarefa, do risco de erro e do tempo disponível para revisão. Para uma nota interna de baixo risco, pode bastar um relatório cujas afirmações principais sejam fáceis de verificar. Para uma publicação, uma análise regulatória ou uma decisão profissional, pode ser necessário cruzar fontes primárias, documentar divergências e conservar um registo de auditoria. A ferramenta com mais ligações não é necessariamente a mais rastreável, e uma resposta mais extensa não equivale a uma cobertura mais completa.

Antes de adotar uma solução, defina um limiar de aceitação. Por exemplo, determine que proporção das afirmações centrais deve ter suporte direto, que fontes são obrigatórias para determinado tipo de dado e que erros exigem repetir a pesquisa. O limiar deve depender da utilização prevista e ser aplicado da mesma forma a todos os produtos. Se uma ferramenta não conseguir cumprir uma condição imprescindível — por falta de acesso, de controlos ou por citações insuficientes —, a conclusão adequada é que não se ajusta a esse fluxo de trabalho nas condições testadas, e não que seja universalmente inferior.

Conserve os resultados, as instruções e as verificações para poder repetir a avaliação quando os produtos ou os planos mudarem. A matriz serve para comparar evidências observadas, não para transformar um teste pequeno numa classificação universal. Se os resultados variarem muito entre execuções, comunique essa variabilidade; se faltarem dados para uma ferramenta, assinale que a comparação está incompleta. A decisão mais defensável é aquela que explica o que foi testado, o que foi possível verificar e o que continua incerto.

Questões em aberto

  • Não foi fornecida documentação verificada sobre Claude Research; as suas funcionalidades, fontes, controlos e disponibilidade continuam por confirmar.
  • As fontes fornecidas não incluem um teste atual e comum aos quatro produtos nem resultados observados com tarefas equivalentes.
  • Os planos, as quotas e as opções de acesso podem mudar; devem ser verificados em cada conta e no fecho editorial.
  • A documentação dos produtos descreve opções declaradas, mas não permite, por si só, determinar a exatidão das citações ou a exaustividade dos relatórios.
07

Continue a explorar

07

Fontes consultadas

03

Correções e transparência

Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.

Propor uma correção