| dc.description.abstract |
O uso de técnicas de inteligência artificial tem se mostrado relevante para apoiar tarefas de análise documental na área jurídica, especialmente em contextos que envolvem documentos extensos, heterogêneos e com baixa padronização textual. Nesse cenário, este trabalho tem como objetivo desenvolver e avaliar uma abordagem baseada em grandes modelos de linguagem, do inglês Large Language Models (LLMs), e geração aumentada por recuperação, do inglês Retrieval-Augmented Generation (RAG), para a extração literal da seção denominada “Objeto” em documentos em formato PDF relacionados a Acordos de Não Persecução Civil.
Em etapa complementar, a abordagem também é utilizada para decompor o conteúdo extraído em duas variáveis de interesse jurídico: o enquadramento legal do fato e a descrição do fato concreto, quando presentes. Para isso, foi organizada uma base documental oriunda do Ministério Público de Santa Catarina e construído um dataset de referência, manualmente curado e normalizado, utilizado para a avaliação dos experimentos.
A solução foi implementada em Python e organizada como uma pipeline que combina extração do conteúdo textual dos arquivos PDF, recuperação semântica, uso de prompts especializados e execução de LLMs. Os resultados da extração da seção “Objeto” e da sua decomposição em variáveis de interesse foram comparados com o dataset de referência por meio de métricas de igualdade e de similaridade textual, complementadas por análise qualitativa de erros e casos divergentes.
Os resultados indicaram elevada similaridade textual nas melhores configurações avaliadas, demonstrando a viabilidade da abordagem nas condições experimentais e no conjunto documental analisados. Ao todo, foram avaliados 530 documentos, dos quais 470 continham a seção “Objeto” no dataset de referência. Considerando apenas os documentos com conteúdo de referência para essa seção, a melhor configuração alcançou 99,11% de similaridade média na extração da seção “Objeto”, com 96,17% dos registros apresentando similaridade igual ou superior a 95%.
Em uma avaliação binária complementar da melhor configuração sobre os 530 documentos, foram obtidos 96,23% de acurácia, 95,92% de precisão, 100% de sensibilidade e 66,67% de especificidade na identificação da presença ou ausência da seção. Os resultados devem ser interpretados como evidência exploratória restrita ao conjunto documental analisado, uma vez que não houve conjunto independente de teste. |
pt_BR |