Como a IA generativa entende a linguagem natural?
Treinamento: Os grandes modelos de linguagem (LLMs), aprendem como as palavras e frases se relacionam entre si identificando padrões aprendidos em bilhões de textos. A última geração de LLMs tem vocabulários que consistem em centenas de milhares de tokens, com base em grandes volumes de dados de treinamento de toda a Internet.

Soma dos vetores: Embedding da palavra + Embedding da posição na frase


Essa etapa acima foi necessária pois na próxima que vem a seguir os termos serão lidos todos ao mesmo tempo, então esse recurso adiciona números extras aos dados para marcar onde cada palavra está.
A Etapa do transformador que são as redes neurais chamado de Transformers (deep learning) e é composto por duas subcamadas no bloco Encoder (codificador): um mecanismo de atenção (self-attention) multi-cabeça e uma Rede feedforward Network (FFN).
A camada de atenção (self-attention) facilita a comunicação entre tokens para coletar informações contextuais, através do percentual de relações de relevância entre cada token (palavra resultante da quebra de uma frase) com as demais tokens (demais palavras da frase).
Ele usa a função matemática Softmax para transformar o vetor de similaridade em um vetor de distribuição de probabilidade através de inserções dos números que varia de 0% a 100% (ou 0,0 a 1,0), indicando o peso contextual que um token dá a outro.
O resultado é que cada palavra começa a entender a frase inteira e o seu papel no contexto. O modelo aprendeu baseado em uma distribuição de probabilidade.

E como última cetapa do ENCODER tem o Feed Forward Network (FFN) que tem o papel de desempenhar a computação por token e refinar a representação individual de cada token.


Esse vetor final vai para próxima etapa Decoder no próxima artigo!
Se repararem eu ando com hiper foco em IA, mas como não poderia é fascinante!!

Informações sobre a autora: