ANÁLISE DO IMPACTO DE MODELOS DE LINGUAGEM E INFRAESTRUTURA COMO CÓDIGO NA RECUPERAÇÃO
ARQUITETURAL DE SISTEMAS BASEADOS EM MICROSSERVIÇOS
Recuperação arquitetural. Reconstrução arquitetural. Microserviços. Infraestrutura como código. Modelos de linguagem de grande porte.
Sistemas distribuídos, especialmente os baseados em microserviços, evoluem de forma contínua e descentralizada. Serviços, relações arquiteturais e artefatos de infraestrutura podem ser modificados em ritmos distintos, muitas vezes por equipes diferentes. Esse cenário dificulta a manutenção da documentação arquitetural, que tende a se tornar incompleta, desatualizada ou dispersa ao longo da evolução do sistema. Como consequência, torna-se desafiador manter uma documentação que reflita, de forma atualizada, a arquitetura efetivamente implementada.
Este trabalho apresenta uma proposta de pesquisa voltada à comparação entre fluxos de recuperação arquitetural em sistemas baseados em microserviços, considerando o momento de integração de modelos de linguagem de grande porte no processo e o impacto da incorporação de evidências extraídas de artefatos de infraestrutura como código. A pesquisa parte da premissa de que, em sistemas baseados em microserviços, a informação arquitetural não está concentrada apenas no código-fonte. Parte dessa informação também pode estar distribuída em artefatos como Docker Compose e Terraform, que descrevem serviços, elementos de infraestrutura, recursos de implantação e relações arquiteturalmente relevantes. Assim, abordagens baseadas apenas no código-fonte podem produzir visões parciais da arquitetura implementada.
A proposta compara dois fluxos principais. O primeiro será baseado no Semarc, representando uma estratégia em que a LLM participa durante a recuperação arquitetural. O segundo será baseado no Retriever, representando uma estratégia estruturada de engenharia reversa e reconstrução arquitetural sem uso de LLM no núcleo da recuperação inicial, com refinamento semântico posterior por LLM desenvolvido no âmbito desta pesquisa. Em ambos os fluxos, evidências extraídas de Docker Compose e Terraform serão incorporadas por meio de parsers próprios.
Os modelos arquiteturais recuperados serão materializados em um metamodelo intermediário serializado em JSON e comparados com a arquitetura conhecida e documentada dos projetos analisados. A avaliação utilizará métricas como precisão, revocação (recall) e F1-score, além de indicadores operacionais como tempo de execução, consumo de tokens, necessidade de engenharia de prompt e variação dos resultados entre execuções. Espera-se que a pesquisa contribua para compreender como o momento de uso da LLM e a incorporação de evidências de infraestrutura como código influenciam a qualidade, a eficiência e a reprodutibilidade dos modelos arquiteturais recuperados. Como contribuição adicional, pretende-se propor um metamodelo intermediário para normalização e comparação dos resultados, bem como um protocolo avaliativo reprodutível para comparar os cenários experimentais definidos.