Extração e decomposição da seção "Objeto" em acordos de não persecução civil por meio de LLMs e RAG

DSpace Repository

A- A A+

Extração e decomposição da seção "Objeto" em acordos de não persecução civil por meio de LLMs e RAG

Show simple item record

dc.contributor Universidade Federal de Santa Catarina. pt_BR
dc.contributor.advisor Dorneles, Carina Friedrich
dc.contributor.author Domenegato, Fernando Carlos Pereira
dc.date.accessioned 2026-07-17T21:28:57Z
dc.date.available 2026-07-17T21:28:57Z
dc.date.issued 2026-07-09
dc.identifier.uri https://repositorio.ufsc.br/handle/123456789/274473
dc.description TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Sistemas de Informação. pt_BR
dc.description.abstract O uso de técnicas de inteligência artificial tem se mostrado relevante para apoiar tarefas de análise documental na área jurídica, especialmente em contextos que envolvem documentos extensos, heterogêneos e com baixa padronização textual. Nesse cenário, este trabalho tem como objetivo desenvolver e avaliar uma abordagem baseada em grandes modelos de linguagem, do inglês Large Language Models (LLMs), e geração aumentada por recuperação, do inglês Retrieval-Augmented Generation (RAG), para a extração literal da seção denominada “Objeto” em documentos em formato PDF relacionados a Acordos de Não Persecução Civil. Em etapa complementar, a abordagem também é utilizada para decompor o conteúdo extraído em duas variáveis de interesse jurídico: o enquadramento legal do fato e a descrição do fato concreto, quando presentes. Para isso, foi organizada uma base documental oriunda do Ministério Público de Santa Catarina e construído um dataset de referência, manualmente curado e normalizado, utilizado para a avaliação dos experimentos. A solução foi implementada em Python e organizada como uma pipeline que combina extração do conteúdo textual dos arquivos PDF, recuperação semântica, uso de prompts especializados e execução de LLMs. Os resultados da extração da seção “Objeto” e da sua decomposição em variáveis de interesse foram comparados com o dataset de referência por meio de métricas de igualdade e de similaridade textual, complementadas por análise qualitativa de erros e casos divergentes. Os resultados indicaram elevada similaridade textual nas melhores configurações avaliadas, demonstrando a viabilidade da abordagem nas condições experimentais e no conjunto documental analisados. Ao todo, foram avaliados 530 documentos, dos quais 470 continham a seção “Objeto” no dataset de referência. Considerando apenas os documentos com conteúdo de referência para essa seção, a melhor configuração alcançou 99,11% de similaridade média na extração da seção “Objeto”, com 96,17% dos registros apresentando similaridade igual ou superior a 95%. Em uma avaliação binária complementar da melhor configuração sobre os 530 documentos, foram obtidos 96,23% de acurácia, 95,92% de precisão, 100% de sensibilidade e 66,67% de especificidade na identificação da presença ou ausência da seção. Os resultados devem ser interpretados como evidência exploratória restrita ao conjunto documental analisado, uma vez que não houve conjunto independente de teste. pt_BR
dc.language.iso por pt_BR
dc.publisher Florianópolis, SC. pt_BR
dc.rights Open Access. en
dc.subject Inteligência artificial pt_BR
dc.subject Grandes modelos de linguagem pt_BR
dc.subject Geração aumentada por recuperação pt_BR
dc.subject Extração de informações em documentos jurídicos pt_BR
dc.title Extração e decomposição da seção "Objeto" em acordos de não persecução civil por meio de LLMs e RAG pt_BR
dc.type TCCgrad pt_BR


Files in this item

Files Size Format View Description
TCC.pdf 1.267Mb PDF View/Open TCC

This item appears in the following Collection(s)

Show simple item record

Search DSpace


Advanced Search

Browse

My Account

Statistics

Compartilhar