
Definição numa frase
Entrenamiento que obtiene sus señales de supervisión de la propia estructura de los datos, por ejemplo prediciendo partes ocultas de un texto.
Definição: supervisão criada a partir dos dados
A aprendizagem autossupervisionada é uma abordagem de aprendizado de máquina em que o sistema obtém o sinal de treinamento da estrutura ou do conteúdo dos próprios dados, em vez de depender de rótulos anotados especificamente por pessoas para cada exemplo. Uma maneira comum de fazer isso é ocultar, transformar ou dividir uma amostra e treinar o modelo para prever uma parte com base em outra. A tarefa de previsão resultante costuma ser chamada de tarefa de pretexto ou objetivo autossupervisionado.
A palavra «autossupervisionada» descreve de onde vem o sinal usado durante determinada etapa de treinamento; não significa que o modelo aprenda sem nenhuma intervenção humana, sem decisões de projeto ou sem avaliação. Alguém escolheu os dados, definiu o objetivo, decidiu quais transformações aplicar e estabeleceu como medir o resultado. Essas decisões podem não exigir um rótulo manual individual para cada item, mas ainda assim influenciam o que o sistema aprende.
Isso também não equivale a dizer que o conjunto de dados não contém nenhuma informação rotulada. Um projeto pode combinar etapas: primeiro, aprender representações por meio de objetivos autossupervisionados com dados não anotados; depois, ajustar ou avaliar o modelo com exemplos rotulados. Por isso, é útil perguntar a qual etapa se refere o termo «autossupervisionado» e quais dados foram usados em cada uma.
A definição operacional é simples: se o objetivo de treinamento é construído a partir da amostra ou de relações entre amostras, sem exigir uma anotação humana específica para esse objetivo em cada caso, o método pode ser autossupervisionado. Isso, por si só, não determina a arquitetura, o tamanho do modelo, a qualidade das representações nem o desempenho em uma aplicação posterior.
Como funciona: da amostra a uma representação avaliável
Um fluxo autossupervisionado pode ser descrito em três etapas. Primeiro, define-se qual relação entre os dados será útil para o treinamento: por exemplo, qual palavra poderia ocupar uma posição ocultada, quais duas visualizações vêm da mesma imagem ou quais fragmentos de áudio correspondem a uma representação mascarada. Em seguida, o modelo faz previsões e é otimizado para aproximá-las do objetivo derivado dos dados. Por fim, verifica-se o que ele aprendeu: avalia-se o modelo, reutilizam-se suas representações ou ajustam-se seus parâmetros com dados de uma tarefa específica.
A representação aprendida é uma descrição interna dos dados que o modelo usa para resolver a tarefa treinada. Ela pode ser útil para outros problemas, mas a transferência não é automática. Uma representação que ajuda a distinguir as relações enfatizadas pelo objetivo de pretexto talvez não preserve as informações necessárias para uma tarefa diferente. Portanto, a avaliação posterior deve corresponder ao uso pretendido do sistema.
A tarefa de pretexto não é uma etapa neutra. Se uma parte é ocultada, alguém escolhe o que ocultar; se duas visualizações são geradas, alguém decide quais transformações aplicar; se exemplos são contrastados, define-se o que conta como positivo ou negativo. Essas escolhas dão destaque a determinadas regularidades. Como orientação prática, quanto maior a distância entre a regularidade aprendida e o desempenho exigido pela aplicação, mais importante é medir a transferência diretamente.
Ciclo de trabalho
- 01Selecionar os dados e definir qual estrutura ou relação será usada como sinal.
- 02Construir o objetivo: ocultar, transformar, emparelhar ou contrastar partes dos dados.
- 03Treinar o modelo para resolver esse objetivo sem exigir um rótulo manual específico para cada exemplo.
- 04Avaliar a representação em tarefas pertinentes e, se necessário, ajustá-la com dados rotulados.
- 05Revisar erros, cobertura e possíveis diferenças entre os dados de treinamento e o uso previsto.
Exemplo em linguagem: prever tokens ocultos com o BERT
O BERT é um exemplo técnico de modelagem de linguagem autossupervisionada. Em seu objetivo de modelagem de linguagem mascarada, alguns tokens de uma sequência são ocultados e o modelo é treinado para prevê-los usando o contexto disponível. Assim, cria-se uma tarefa de previsão a partir do próprio texto, sem pedir a uma pessoa que anote manualmente a palavra correta em cada posição.
Por exemplo, diante de uma frase como «A cientista publicou o resultado no [oculto]», o modelo precisa usar as palavras ao redor do espaço para estimar qual token foi ocultado. O exemplo é esquemático: durante o treinamento, são processados muitos trechos de texto, e o objetivo consiste em recuperar as posições mascaradas. Na configuração original de pré-treinamento, o BERT também apresentou uma tarefa de previsão da frase seguinte; essa tarefa adicional não deve ser confundida com a definição geral de aprendizagem autossupervisionada.
O objetivo ensina o modelo a aproveitar o contexto textual para resolver as previsões propostas. Por si só, porém, não demonstra que o sistema compreenda uma frase como uma pessoa compreenderia nem que responda com precisão a qualquer pergunta. Para uma aplicação, é preciso avaliar o comportamento em tarefas pertinentes e verificar se o ajuste posterior melhora o que é necessário.
Exemplo em visão: comparar visualizações de uma imagem com o SimCLR
Em visão computacional, uma abordagem pode criar duas versões transformadas da mesma imagem e treinar um modelo para relacionar suas representações em um espaço aprendido. O SimCLR é um exemplo de aprendizagem contrastiva de representações visuais: seu objetivo usa pares de visualizações transformadas, e a composição dessas transformações influencia a tarefa que o modelo acaba aprendendo a resolver.
Imagine uma fotografia de uma bicicleta. A partir dela, são geradas duas visualizações por meio de transformações escolhidas pelo método. O treinamento busca fazer o modelo reconhecer que ambas estão relacionadas por pertencerem à mesma imagem, em contraste com outras amostras do lote. Não é necessário fornecer um rótulo manual como «bicicleta» para construir esse objetivo. A relação entre as visualizações é o sinal de treinamento.
A escolha das transformações importa. Se duas versões preservam as características relevantes para o uso pretendido, a tarefa pode favorecer representações úteis para esse uso; se eliminam ou distorcem informações importantes, o objetivo pode dar destaque a outras propriedades. Isso não permite concluir de antemão que qualquer conjunto de transformações será adequado: é preciso examinar seus efeitos no domínio e avaliar o modelo nas tarefas específicas.
Por isso, dizer que «o modelo aprendeu com imagens sem rótulos» é uma descrição incompleta. Para interpretar o resultado, convém saber quais transformações foram usadas, como a comparação foi definida e quais avaliações posteriores mediram a transferência.
Exemplo em áudio: representações da fala com o wav2vec 2.0
A aprendizagem autossupervisionada também é aplicada à fala. O wav2vec 2.0 aprende representações a partir de áudio sem exigir transcrições para construir seu objetivo de pré-treinamento. Em termos gerais, calcula representações latentes do áudio, mascara parte delas e treina o sistema com uma tarefa contrastiva para identificar as representações-alvo correspondentes.
Esse procedimento pode aprender regularidades acústicas a partir de gravações sem transcrever cada trecho. Depois, as representações podem ser usadas ou ajustadas para tarefas que exigem texto de referência, como o reconhecimento automático de fala. Nessa segunda etapa, podem ser usados dados transcritos: a presença de uma etapa posterior rotulada não muda o fato de que o objetivo anterior era autossupervisionado.
Essa distinção importa ao descrever um sistema completo. Dizer que um modelo de fala foi pré-treinado de forma autossupervisionada não informa quantas transcrições foram usadas no ajuste, como ele foi avaliado nem qual desempenho apresenta com diferentes sotaques, condições de gravação ou idiomas. Essas questões exigem informações e testes adicionais; não podem ser deduzidas apenas pelo nome do método.
Conceitos próximos que não são sinônimos
Aprendizagem não supervisionada é um termo amplo para métodos que procuram estrutura em dados sem rótulos-alvo fornecidos da maneira convencional. A aprendizagem autossupervisionada costuma ser tratada como uma abordagem relacionada: ela constrói um sinal de previsão a partir dos dados. Como o uso dos termos pode variar conforme a área e o contexto, as categorias podem se sobrepor. Por isso, é mais preciso explicar o objetivo específico do que depender apenas de um rótulo geral.
A aprendizagem semissupervisionada combina dados rotulados e não rotulados no processo de aprendizagem. Não é sinônimo de aprendizagem autossupervisionada. O FixMatch, por exemplo, descreve um método semissupervisionado que usa dados rotulados e aproveita dados não rotulados por meio de consistência e pseudorrótulos. Já um método autossupervisionado pode gerar seu objetivo a partir dos dados sem precisar de um rótulo manual específico para cada exemplo desse objetivo.
Um pseudorrótulo é um rótulo gerado por um modelo ou procedimento e usado como objetivo para outros exemplos; isso não equivale automaticamente a um sinal autossupervisionado derivado diretamente da estrutura da amostra. Alguns métodos semissupervisionados empregam pseudorrótulos como parte de sua estratégia. O que precisa ser descrito é a origem e o uso desse rótulo.
Pré-treinamento nomeia uma etapa do ciclo de vida do modelo, não uma única forma de aprender. Ele pode ser realizado com objetivos autossupervisionados, mas «pré-treinado» não significa necessariamente «autossupervisionado». Da mesma forma, um objetivo autossupervisionado pode ser usado sem que a palavra pré-treinamento descreva por completo o sistema. Paradigma de aprendizagem e etapa de treinamento respondem a perguntas diferentes.
Um guia para distinguir os termos
| Termo | Que pergunta responde? | Distinção prática |
|---|---|---|
| Autossupervisionado | De onde vem o objetivo de treinamento? | De relações ou estruturas derivadas dos próprios dados. |
| Semissupervisionado | Que combinação de dados é aproveitada? | Combina dados rotulados e não rotulados; pode empregar pseudorrótulos. |
| Pseudorrótulos | Como um rótulo é atribuído a um exemplo? | Um rótulo gerado é usado como objetivo; pode fazer parte de um método semissupervisionado. |
| Pré-treinamento | Em que etapa o modelo é treinado? | É uma etapa anterior a outro uso ou ajuste; por si só, não especifica o tipo de supervisão. |
Limites, vieses e erros frequentes
Um objetivo autossupervisionado pode ser fácil de otimizar e, ainda assim, não ensinar o que é necessário para a tarefa final. A qualidade de uma representação ou o resultado em uma avaliação do próprio pré-treinamento não constituem prova universal de bom desempenho em tarefas posteriores. A transferência precisa ser verificada com avaliações adequadas ao uso; não deve ser presumida a partir de um único número.
A ausência de rótulos manuais para o objetivo também não elimina vieses. Os dados podem refletir desequilíbrios de cobertura, erros de captura, convenções históricas ou diferenças entre as populações representadas. A filtragem do corpus, as transformações aplicadas, a seleção de exemplos e os critérios de avaliação são decisões que podem influenciar os resultados. «Autossupervisionado» não é uma garantia de neutralidade.
Outro erro frequente é apresentar a abordagem como aprendizagem totalmente autônoma. Mesmo quando o sinal é derivado dos dados, alguém precisa escolher o corpus e o objetivo, treinar o sistema e decidir o que conta como resultado satisfatório. Também é incorreto inferir que um modelo não usou dados rotulados em nenhuma etapa apenas porque seu pré-treinamento foi autossupervisionado.
Por fim, não se deve confundir a capacidade de resolver uma tarefa auxiliar com utilidade prática. Prever tokens ocultos, relacionar visualizações ou aprender representações de áudio são objetivos definidos. Cada um revela algo sobre aquilo que o sistema otimizou, mas não substitui a avaliação de precisão, robustez ou adequação no contexto de destino.
Critérios práticos para interpretar uma afirmação
Diante da afirmação de que um modelo aprendeu de forma autossupervisionada, pergunte primeiro qual objetivo foi construído a partir dos dados: elementos foram ocultados? Transformações foram comparadas? Representações foram mascaradas? Em seguida, identifique em que etapa esse objetivo foi usado e se houve ajuste posterior com rótulos. Essa distinção evita misturar o paradigma de aprendizagem com o ciclo de vida do modelo.
Depois, verifique quais dados e transformações participaram. A tarefa pode refletir regularidades úteis, mas também as limitações do corpus e das decisões de projeto. Confira qual avaliação sustenta a transferência para a aplicação que interessa; um resultado de pré-treinamento, por si só, não é suficiente para demonstrá-la.
Para comparar métodos, descreva o sinal de treinamento e as condições de avaliação antes de comparar nomes. Em uma comparação do glossário ou em um guia comparativo, convém manter separadas as categorias de autossupervisionado, semissupervisionado e pré-treinamento. Para explorar outros conceitos do glossário, consulte os verbetes relacionados, como aprendizagem autossupervisionada, e os termos de arquitetura ou avaliação que ajudem a explicar o sistema completo.
Na prática, uma descrição rigorosa deve especificar: o que foi tomado como objetivo, quais dados foram usados, quais transformações ou relações geraram o sinal, quais etapas posteriores incorporaram rótulos e como o desempenho final foi avaliado. Se alguma dessas informações não estiver documentada, a conclusão deve se limitar ao que se sabe. A regra final é simples: «autossupervisionado» explica como um sinal de treinamento foi obtido; não garante o que o modelo aprenderá nem como se comportará além dessa tarefa.
Lista breve de verificação
- 01Identificar o objetivo derivado dos dados.
- 02Separar pré-treinamento, ajuste e avaliação.
- 03Verificar se houve dados rotulados em outras etapas.
- 04Examinar a cobertura do corpus e o papel das transformações.
- 05Procurar resultados em tarefas posteriores e em condições relevantes para o uso previsto.
- 06Apresentar as conclusões sem transformar o nome do método em uma garantia.