Onde hospedar um Projeto de IA

Pensando que toda solução de IA generativa precisa de uma camada de dados, infraestrutura, serviços, segurança robusta, rede, hospedagem, dimensionamento e recursos de IA, eu fui atrás da informação de qual seria a forma mais prática para fazer isso. 

Eu fiz o treinamento on-line da Microsoft e trago aqui o que eu aprendi nesse artigo.

Acesse e crie uma assinatura na Microsoft

Uma pessoa ou uma empresa se inscreve no Microsoft 365 ou no Azure, e é realizada uma assinatura do Azure com a cobrança do uso dos recursos de nuvem da Microsoft, que da suporte ao desenvolvimento de IA e que pode ser compartilhado por vários projetos de IA.

Depois vá no portal do Azure, acessível em https://portal.azure.com, que é uma interface do usuário de gerenciamento centralizada para todos os serviços/recursos. Usado para:

  • Criar e gerenciar recursos de nuvem
  • Implantar e configurar serviços
  • Monitorar o uso, o desempenho e a integridade
  • Gerenciar identidades, funções e políticas de acesso
  • Exibir padrões de faturamento, custos e gastos
  • Acessar serviços especializados como o Microsoft Foundry (Projetos de IA)

Crie o Projeto no Foundry e implante um modelo de chat

Os projetos ficam em um workspace dentro do Recurso Microsoft Foundry que é uma PaaS, plataforma como serviço, unificada e corporativa para criar, personalizar, gerenciar e governar aplicativos e agentes de inteligência artificial em larga escala. Ele é a visão dos recursos Azure que estão associados aos projetos e que fornecem as capacidades que os agentes irão utilizar.

  1. Entre no Portal do Foundry usando a sua assinatura do Azure e crie um projeto do Foundry.

1.1 Va a página inicial do seu projeto. Na barra de ferramentas no canto superior esquerdo, selecione o nome do seu projeto. Depois, no menu resultante, selecione: Ver todos os recursos para ver todos os projetos aos quais você tem acesso (talvez você tenha apenas um!)

1.2 Veja a página Descobrir, selecione a aba Modelos para visualizar o catálogo de modelos.

  1. No Catálogo de Modelos analise os resultados de Benchmarking de cada um.
  2. Escolhido o modelo implante-o (Deploy). Lembre-se do nome da implantação do modelo pois você vai precisar depois. Garanta que a implantação do seu modelo seja selecionada no Playground. Quando você implanta um modelo na Foundry, várias coisas ocorrem:
    • Os recursos de computação são alocados: a Foundry atribui o hardware necessário para executar o modelo — CPUs, GPUs, memória, rede e regras de dimensionamento.
    • Um endpoint de API é criado: você pode invocar com segurança o modelo por meio da API de Respostas OpenAI, validada por meio de verificações de API de gerenciamento.
    • A configuração (como versão do modelo, estilo de resposta, configurações de segurança) está bloqueada
    • Monitoramento e log são ativados: as métricas de uso, o desempenho, a latência, os erros e os custos são acompanhados.]
  3. Configure o seu Modelo no Playground: ele é o ambiente para  configurações, você pode definir parâmetros como:
    • Temperatura: controla a criatividade versus o determinismo.
    • Máximo de tokens de saída – limita o comprimento da resposta; afeta o consumo de token e o comportamento de limitação.

    Limitação, em um contexto de computação, significa intencionalmente reduzir ou limitar a quantidade de trabalho de computação que pode ocorrer simultaneamente. É um mecanismo de proteção usado quando um sistema está perto de atingir seus limites de processamento. A limitação restringe temporariamente o uso de recursos para que o sistema possa permanecer estável e responsivo. As cotas de nível de implantação definem quantos tokens ou solicitações podem ser processados antes da limitação ocorrer. Prompts maiores e configurações de token de saída máxima mais altas consomem mais TPM, levando a erros de limite de taxa se excedidos. Caso você veja uma limitação de velocidade, diminua o máximo de tokens ou reduza as solicitações simultâneas no código.

    • Instruções do sistema – Prompt do Sistema define o comportamento e a função do modelo.

  4. Teste o seu modelo no Playground: ele é o ambiente de testes para poder experimentar o modelo, lá gere e grave prompts, teste respostas. È maneira mais fácil de interagir com um modelo implantado no portal do Foundry. Escolha métricas assistidas por IA para pontuação qualitativa além das métricas tradicionais.  
    • Exemplos de métricas clássicas de qualidade NLP são: acurácia, precisão, revocação e F1.
    • Exemplos de métricas assistidas por IA incluem aterramento, relevância, coerência e fluência e similaridade de GPT

Depois de testar prompts representativos, você pode usar os mesmos prompts de sistema e de usuário e valores de parâmetro quando for a hora de criar o aplicativo chat cliente (protótipo) mais a frente. O playground fornece a representação disso em código que você pode copiar e colar na sua aplicação Python como ponto de partida.

1.3 Veja a página de Build. Esta página é onde você desenvolve soluções de IA. Você pode salvar seu modelo, instruções e ferramentas como um agente.

Crie um agente definindo um comportamento consistente, semelhante ao fluxo de trabalho, que pode ser reutilizado entre aplicativos, experiências e serviços. O importante é a adição de ferramentas, que permitem que o modelo atue fundamentado com informações.

Ferramentas = ações.
Conhecimento = contexto.

Os agentes podem:

    • Chamar ferramentas externas: APIs, funções, recuperação automaticamente,
    • Chamar sistemas externos através do modelo: pesquisar na Web, consultar um banco de dados ou usar um servidor MCP (aplicativos como Jira, .
    • Dividir metas em etapas estruturadas
    • Manter a memória de trabalho durante uma conversa
    • Processar entrada do usuário, decidir ações e gerar saídas estruturadas

Já tem modelo definido e agente criado, revise as configurações:

  • Visualize e gerencie as implantações de modelos no seu projeto.
  • Ajuste os modelos base para responder a consultas baseadas nas necessidades específicas da sua aplicação.
  • Defina e gerencie limites de proteção para garantir a conformidade com políticas responsáveis de IA para conteúdo e comportamento de IA generativa.
  • Configure o armazenamento de memória para que os modelos possam manter o contexto da conversa entre as sessões.
  • Crie avaliações para comparar o desempenho dos modelos.
  • Ajuste os modelos para otimizar o desempenho.

Garanta um modelo configurado. Personalizar o desempenho, o custo e a governança. Disponibilizar para uso em produção escalonável e seguro transforma o modelo em um serviço que os aplicativos podem chamar. Garanta a confiabilidade, ele permite que os desenvolvedores impeçam o uso não autorizado ou não seguro.

  • Visualize e gerencie os agentes e fluxos de trabalho do seu projeto.
  • Adicione e configure ferramentas que os agentes possam usar para realizar tarefas.
  • Gerencie o conhecimento dos seus agentes com base nas fontes de dados do Foundry IQ em sua empresa.
  • Conecte-se e gerencie índices de dados para agentes de IA e aplicativos de IA generativa.

1.4. Veja a página Operar. Nesta página, você pode operar sua solução de IA ao:

  • Gerenciar a conformidade com as políticas de segurança.
  • Visualizar e gerencie configurações de cotas que definem limites para o uso de modelos e outros ativos no seu projeto. Ao implantar um modelo, você pode atribuir a ele uma alocação de Tokens por Minuto (TPM). O TPM determina a velocidade e a escala com que o modelo pode processar entradas e os limites de taxa, como requisições por minuto (RPM)
  • Realize tarefas administrativas para gerenciar seus projetos.

Crie um aplicativo simples

Chegou a hora de fazer um aplicativo cliente de chat leve, pequeno e mínimo cujo trabalho principal é coletar a entrada do usuário (texto, voz, imagens)chamar um serviço/API remoto e exibir resultados, sem estruturas de interface do usuário pesadas, lógica de back-end complexa ou grandes dependências locais.

ATENÇÃO, é agora que você cola o código que você copiou do Playground em um ambiente Python para não precisar escrever do zero. Dai precisa instalar a biblioteca SDK/openai. Você precisa saber que esse código funciona porque usa um SDK/cliente e precisa entender disso para adaptar o código que vc colou.

Com esse pequeno volume de código e uma configuração mínima (geralmente apenas variáveis de ambiente + um script curto), será fácil prototipar, fácil de executar localmente e fácil de estender mais tarde.

SDK que significa Software Development Kit (Kit de Desenvolvimento de Software), ele esconde boa parte da complexidade, pois ele usa componentes já criados para se conectar a um serviço. O que normalmente existe em um SDK: Bibliotecas prontas, Classes e funções, Exemplos de código, Documentação, Ferramentas de autenticação e Modelos de integração.

Primeiro você precisará achar o endpoint e a chave do modelo que podem ser encontrados na página de detalhes do Foundry Playground.

  1. Seu aplicativo (Cliente) chama o endpoint (ponto de extremidade) da API do Modelo que vc implantou e que e se encontra dentro do openAI, através de um endereço HTTP exclusivo protegido.

Uma API é um conjunto de regras (contrato) que permite que um aplicativo específico fale com outro aplicativo ou serviço específico.

O endpoint da API segue as regras REST (Representational State Transfer) que é um estilo de arquitetura que define boas práticas para criar APIs. REST é o padrão usado nessa comunicação, diz coisas mais genéricas, ex: Use recursos (clientes, produtos, pedidos), Identifique recursos por URL, Use HTTP, Utilize os verbos HTTP (GET, POST, PUT, DELETE) e As requisições devem ser stateless.

Ex: GET/ clientes/123   ->    GET (REST ) / clientes/123 (API)

Resumindo: Endpoint é o endereço HTTP para acesso de sistema. API é o serviço. REST é a forma organizada de conversar com esse serviço.

2. Sua solicitação inclui uma chave para autenticar a chamada, um token confirmando que suas credenciais de ID do Microsoft. A chave é armazenada no Azure Key Vault como um segredo.

Exemplos de Python

Se você esta testando, estudando, experimentando prompts ou ajustando parâmetros o Playground do Foundry é suficiente. Mas se você quer colocar o modelo dentro de um sistema de verdade como site, aplicativo, chatbot da empresa ou automação, ai você precisa do Python +SDKAPI, ou seja, complementar o código que você copiou, conforme exemplo abaixo.

Ex: O aplicativo cliente usa a autenticação para se conectar ao ponto de extremidade do modelo, enviar um prompt e exibir a resposta.

Repare que no Playground você configurou tudo visualmente, como modelo, prompt do sistema, temperatura e tokens, mas quando você copiou o código Python de lá ele simplesmente transformou aquelas escolhas em chamadas de SDK, conforme os trechos aqui do código de exemplo. Você não começou do zero apenas acrescentou o necessário.

Use o Kubernetes para hospedar e dimensionar seu aplicativo

Dimensionar seus aplicativos significa ajustar a quantidade de energia de computação que seu aplicativo usa. Plataformas de nuvem como o Azure tornam o dimensionamento automático com base no uso da CPU, no número de solicitações ou nas métricas personalizadas.

Mapa mental

imagem gerada por IA

Imagem do perfil

Informações sobre a autora: Jacqueline é Agile por experiência e entusiasta de IA. Sempre evoluindo! https://www.linkedin.com/in/jacqueline-mba-e-pmp