|
Abstract:
|
Com o avanço da inteligência artificial, ferramentas baseadas em Large Language Models
(LLMs) vêm transformando diversas etapas do desenvolvimento de software, especial-
mente por meio da automação de tarefas repetitivas. No entanto, algumas áreas ainda
são pouco exploradas por essas tecnologias, como é o caso da geração automatizada de
testes de integração. Considerando a importância desse tipo de teste na garantia da quali-
dade de sistemas complexos, este trabalho propõe a realização de um estudo comparativo
sobre o uso de LLMs na geração de testes de integração de software. A pesquisa é con-
duzida com base em um estudo de caso real, o sistema Jornada do Estudante, no qual
diferentes modelos de LLM são avaliados por meio de técnicas de prompt engineering e
métricas consolidadas na literatura. A metodologia adotada inclui a seleção das ferramen-
tas mais indicadas, o planejamento e aplicação dos prompts e a análise dos testes gerados,
buscando identificar os principais desafios, limitações e potencialidades dos LLMs nesse
contexto. Os resultados obtidos revelaram que, com a aplicação de one-shot prompting,
os modelos avaliados alcançaram alta conformidade aos padrões arquiteturais do projeto.
O modelo GPT-5.4 destacou-se por apresentar o melhor equilíbrio e maior capacidade
de propor novos cenários úteis. O DeepSeek-V4-Flash obteve a maior eficiência compu-
tacional, sacrificando a eficácia funcional, enquanto o Gemini 2.5 Pro apresentou maior
instabilidade na geração de código compilável. |