Como a IA generativa entende a linguagem natural?

A IA generativa, como por exemplo o Copilot, Chat GPT e Gemini, são um tipo de inteligência artificial que criam conteúdos originais seja textos, imagens, vídeos, códigos, músicas etc.
Treinamento: Os grandes modelos de linguagem (LLMs), aprendem como as palavras e frases se relacionam entre si identificando padrões aprendidos em bilhões de textos. A última geração de LLMs tem vocabulários que consistem em centenas de milhares de tokens, com base em grandes volumes de dados de treinamento de toda a Internet.
O icônico ‘Teste de Turing’ da IA foi inventado por Alan Turing em 1950 serve como método de avaliação para decidir se um modelo alcançou a inteligência artificial.
Imagina que temos o modelo anteriormente treinado, toda mágica começa pelo prompt do usuário onde podem ser inseridos por um humano uma pergunta, um comando ou uma frase no aplicativo de chat em linguagem natural. Um prompt é simplesmente a entrada que você dá a uma LLM para obter uma resposta.
Exemplo Prompt  José come abacaxi no céu azul.
O Modelo inicia o Processamento de Linguagem Natural (NLP-Natural Language Processing) com a conversão de tokens (que são unidades menores de uma frase ou texto com objetivo de criar um vocabulário)
Token + ID:
José → ID1 come → ID2 abacaxi → ID23 olhando→ ID4  o → ID5 céu→ ID6 azul  → ID7
Após haverá a transformação de cada token em uma lista de números chamado vetor, porque computadores só entendem números. Como esse vetor é o resultado gerado quando um modelo de IA representa o mapeamento de uma palavra com outras palavras semelhantes, ou seja, o arranjo numérico que reflete relações de significado, ele é chamado de Embedding de Palavra que  pode ser pensado como um ponto em um espaço multidimensional, onde cada dimensão representa um aspecto ou característica particular da palavra.
A seguir é realizado o Embedding da posição de cada palavra/token/vetor na frase, que é uma técnica usada pelos modelos, para ensinar a ordem das palavras em uma frase. Aqui usa as funções  seno + cosseno.

Soma dos vetores: Embedding da palavra + Embedding da posição na frase

Essa etapa acima foi necessária pois na próxima que vem a seguir os termos serão lidos todos ao mesmo tempo, então esse recurso adiciona números extras aos dados para marcar onde cada palavra está.

A Etapa do transformador que são as redes neurais chamado de Transformers (deep learning) e é composto por duas subcamadas no bloco Encoder (codificador): um mecanismo de atenção (self-attention) multi-cabeça e uma Rede feedforward Network (FFN).

A camada de atenção (self-attention) facilita a comunicação entre tokens para coletar informações contextuais, através do percentual de relações de relevância entre cada token (palavra resultante da quebra de uma frase) com as demais tokens (demais palavras da frase). 

Ele usa a função matemática Softmax para transformar o vetor de similaridade em um vetor de distribuição de probabilidade através de inserções dos números que varia de 0% a 100% (ou 0,0 a 1,0), indicando o peso contextual que um token dá a outro.

O resultado é que cada palavra começa a entender a frase inteira e o seu papel no contexto. O modelo aprendeu baseado em uma distribuição de probabilidade.

E como última cetapa do ENCODER tem o Feed Forward Network (FFN) que tem o papel de desempenhar a computação por token e refinar a representação individual de cada token.

Esse vetor final vai para próxima etapa Decoder no próxima artigo!

Se repararem eu ando com hiper foco em IA, mas como não poderia é fascinante!!