Concluir uma tarefa não demonstra que cada consulta visual era necessária
Os agentes visuais podem pedir uma imagem ampliada ou recortada durante uma tarefa — por exemplo, para ler um detalhe que não se distingue na imagem inicial. Se responderem corretamente depois, uma avaliação baseada apenas no resultado pode considerar que a chamada foi bem-sucedida. Mas ficam por responder duas perguntas: o agente precisava daquela informação para resolver a tarefa? E, depois de a receber, utilizou-a realmente?
Um preprint intitulado «When Should a VLM Look? Paying Only for Visual Calls That Were Needed and Used» defende que estas perguntas são importantes, porque uma chamada bem-sucedida não prova, por si só, que fosse necessária nem que os píxeis obtidos tenham sido usados. Os autores apresentam o CounterCredit, um método de treino que procura avaliar ambas as condições em cada chamada que devolve uma imagem.
Esta distinção é relevante para interpretar as pontuações de um agente. Um sistema pode acertar numa pergunta e, ainda assim, ter feito uma consulta redundante; também pode pedir uma região da imagem e não basear nela a resposta. Em ambos os casos, recompensar automaticamente a chamada pelo acerto final poderia atribuir-lhe um valor injustificado. Trata-se de uma questão de avaliação e de conceção do treino, não de uma demonstração de que todos os agentes visuais atuais se comportam dessa forma.
Como o CounterCredit separa necessidade e utilização
Segundo o preprint, o CounterCredit aplica as duas verificações ao estado concreto imediatamente anterior a cada chamada. Para estimar a necessidade, compara o ramo em que o agente consulta a imagem com a opção de responder de imediato, sem fazer essa consulta. Para estimar a utilização da evidência, compara a imagem devolvida com recortes aleatórios do mesmo tamanho, que a substituem na mesma chamada. A proposta procura distinguir o valor de olhar do valor da informação visual específica recebida.
O sistema utiliza a própria pontuação da política para a resposta correta, descrita no resumo como uma pontuação da resposta de referência. Se a chamada passar as duas verificações, recebe uma recompensa de devolução; as restantes chamadas executadas pagam um custo, a que o trabalho chama «renda». Os autores indicam que limitam esse custo para que qualquer trajetória correta continue a ficar acima de qualquer trajetória incorreta. Descrevem também uma vantagem GRPO de canal duplo, que mantém o custo nas suas próprias unidades.
Estas operações são critérios do método proposto, não observações diretas da intenção interna do modelo. A comparação com uma resposta imediata e a substituição por recortes aleatórios são testes definidos pelos autores. A sua validade depende, por isso, de essas comparações representarem adequadamente aquilo que se pretende medir.
As duas verificações de uma chamada
- 01Registar o estado do agente imediatamente antes da chamada visual.
- 02Verificar a necessidade: comparar o ramo que consulta a imagem com a opção de responder sem a consultar.
- 03Verificar a utilização: substituir a imagem recebida por recortes aleatórios do mesmo tamanho e comparar a pontuação.
- 04Aplicar uma devolução apenas se a necessidade e a utilização forem confirmadas; caso contrário, aplicar o custo previsto pelo método.
Que números apresenta e a que testes dizem respeito
O resumo do preprint apresenta vários resultados, que importa manter associados aos respetivos conjuntos de avaliação. No checkpoint de arranque a frio, os autores afirmam que apenas 10% a 12% das chamadas visuais foram simultaneamente necessárias e utilizadas. Para agentes publicados, descrevem taxas de chamadas supérfluas entre 36% e 87% em benchmarks individuais. O resumo acrescenta que cerca de dois terços do que um sistema baseado no resultado recompensa é atribuído a chamadas que não foram necessárias nem utilizadas.
Com o mesmo ponto de partida, conjunto de instruções e orçamento, o CounterCredit alcança 89,5% no V*, 80,2% no HR-Bench-4K e 76,4% no HR-Bench-8K. Os autores comparam estes valores com o GRPO baseado apenas no resultado e indicam uma vantagem de 6,3 a 9,4 pontos, com 1,78 chamadas por pergunta, contra 1,84. Informam também que o método reduz a taxa de chamadas supérfluas para o intervalo entre 31% e 36%, o valor mais baixo entre os agentes avaliados.
O trabalho refere ainda que a mesma receita eleva de 75,4 para 80,8 a média de um modelo base Qwen3-VL-8B. Estes números são resultados comunicados pelos autores no preprint. Não equivalem a uma medição universal da qualidade dos agentes, nem permitem concluir, por si só, que o método melhore tarefas que não fizeram parte da avaliação.
Resultados comunicados no resumo do preprint
| Teste ou comparação | Resultado comunicado | Âmbito |
|---|---|---|
| Checkpoint de arranque a frio | Entre 10% e 12% das chamadas foram necessárias e utilizadas | Chamadas do checkpoint avaliado |
| Agentes publicados | Entre 36% e 87% de chamadas supérfluas | Varia consoante o benchmark individual |
| V* | 89,5% | Pontuação comunicada para o benchmark |
| HR-Bench-4K e HR-Bench-8K | 80,2% e 76,4% | Pontuações comunicadas para cada benchmark |
| Chamadas por pergunta | 1,78 com o CounterCredit, contra 1,84 com GRPO baseado em recompensa pelo resultado | Comparação descrita pelos autores |
| Qwen3-VL-8B base | Média de 75,4 para 80,8 | Resultado comunicado para a receita aplicada |
O que os benchmarks significam — e o que não significam
O V* é um benchmark relacionado com a pesquisa visual guiada; o trabalho que o apresenta permite rastrear a origem desse teste. O HR-Bench-4K e o HR-Bench-8K são conjuntos de avaliação da perceção de imagens de alta resolução, apresentados noutro trabalho. O facto de o CounterCredit obter determinadas pontuações nesses conjuntos permite descrever o seu desempenho nesses casos concretos, mas não demonstra automaticamente que terá o mesmo comportamento na navegação, na assistência visual do dia a dia ou noutras tarefas.
Há outra precaução a ter em conta: a taxa de chamadas supérfluas e a pontuação final respondem a perguntas diferentes. Uma taxa mais baixa sugere que, segundo o critério do estudo, foram feitas menos chamadas que não cumpriam ambos os requisitos. Por si só, não prova que as respostas sejam mais seguras, que o sistema utilize melhor qualquer tipo de imagem ou que o custo total seja inferior em todas as condições. Também não se devem confundir os resultados do checkpoint inicial, os dos agentes publicados e a experiência com o Qwen3-VL-8B: são comparações apresentadas separadamente.
Um preprint com questões em aberto sobre reprodução e generalização
O trabalho foi apresentado como preprint e a ficha fornecida assinala que está em revisão. Por isso, os seus números devem ser tratados como resultados iniciais dos autores, não como conclusões estabelecidas por um processo de revisão por pares já concluído. A documentação disponível para este artigo sustenta a descrição do método e os números do resumo, mas não basta para determinar, de forma independente, se cada opção de avaliação é robusta perante outros modelos, imagens ou tarefas.
Também não é possível concluir, com base nas fontes disponíveis para este artigo, se há código e dados públicos suficientes para reproduzir o conjunto de experiências, nem se grupos independentes repetiram os resultados. A ausência dessa informação nas fontes consultadas não demonstra que esses recursos ou testes não existam; significa que não é adequado afirmá-lo sem uma fonte que o confirme.
Para saber se o CounterCredit se generaliza, seriam úteis comparações independentes com outros modelos e políticas, benchmarks adicionais e testes com diferentes orçamentos e ferramentas. Seria igualmente importante publicar os pormenores necessários para repetir as decisões de avaliação, comparar variantes dos critérios de necessidade e utilização e apresentar os resultados por tarefa, em vez de apenas como médias. Esses testes ajudariam a esclarecer se o método reduz chamadas redundantes sem penalizar consultas importantes noutros cenários.
Por enquanto, a conclusão mais rigorosa é limitada: o preprint apresenta uma forma explícita de recompensar chamadas que considera necessárias e aproveitadas, e comunica melhorias nos benchmarks estudados em comparação com uma referência baseada apenas no resultado. O alcance dessas melhorias fora dos testes continua por determinar.
Questões em aberto
- As fontes fornecidas não confirmam se o código e os dados necessários para reproduzir todas as experiências estão disponíveis publicamente.
- As fontes fornecidas não comprovam avaliações independentes que repliquem os resultados.
- Não se sabe se as métricas e melhorias se mantêm com outros modelos, ferramentas, orçamentos ou tarefas para além dos benchmarks citados.
- O estado da revisão pode mudar; a ficha da fonte principal identifica o trabalho como preprint em revisão.
Continue a explorar
Fontes consultadas
Correções e transparência
Se encontrar informação incorreta ou desatualizada, envie-nos a página e a fonte que devemos rever.
Propor uma correção