| Title: | Advanced RAG com query expansion para extração e cruzamento de entidades em documentos jurídicos |
| Author: | Schmitz, Manuela |
| Abstract: |
O combate à corrupção em licitações públicas depende da capacidade de analisar rapidamente processos judiciais, que servem, muitas vezes, como fontes primárias de indícios de fraudes e desvios de conduta empresarial. No entanto, o expressivo volume de documentos jurídicos eletrônicos gerado pelo setor público brasileiro, em sua maioria não estruturado, dificulta a identificação manual de empresas rés e seus sócios em processos judiciais. Este trabalho propõe um pipeline de extração de informação baseado em Advanced RAG com Query Expansion, que combina expressões regulares para identificação de CNPJs, indexação semântica com embeddings BGE-M3 e ChromaDB, e Grandes Modelos de Linguagem orquestrados pela biblioteca LangChain, no intuito de extrair empresas rés e seus respectivos sócios a partir de documentos jurídicos fornecidos pelo Ministério Público de Santa Catarina. Foram avaliadas três famílias de modelos de código aberto, Gemma, Llama e Qwen, em diferentes tamanhos, com e sem o Advanced RAG, utilizando um framework de avaliação próprio baseado em correspondência por similaridade em cascata dos sócios extraídos, considerando nome, CPF e RG dos sócios. Os resultados do baseline sem RAG mostraram que o modelo Llama 70b obteve o melhor desempenho geral, com F1-Score de 85.5% na extração de sócios, enquanto a aplicação do Advanced RAG com Query Expansion nos modelos Gemma aumentou a cobertura de CNPJs processados, ao custo de uma queda de precisão e, no caso do modelo Gemma 27b, de um aumento de até quase 10 vezes no tempo de execução. A avaliação em datasets sintéticos demonstrou que, em documentos com relações espacialmente dispersas entre empresa e sócio, a arquitetura sem RAG falha completamente na extração de sócios, com F1 de 0,0%, enquanto o Advanced RAG manteve F1 acima de 91% no mesmo cenário, evidenciando o RAG como componente necessário para a robustez do pipeline. O sistema final integra o pipeline de extração a um módulo de cruzamento construído no Projeto CÉOS, a fim de verificar aquelas empresas investigadas em processo que continuam participando de licitações públicas no Estado. Combating corruption in public procurement depends on the ability to quickly analyze judicial proceedings, which often serve as primary sources of evidence of fraud and corporate misconduct. However, the significant volume of electronic legal documents generated by the Brazilian public sector, mostly unstructured, hinders the manual identification of defendant companies and their partners in judicial proceedings. This work proposes an information extraction pipeline based on Advanced RAG with Query Expansion, combining regular expressions for CNPJ identification, semantic indexing with BGE-M3 embeddings and ChromaDB, and Large Language Models orchestrated through the LangChain library, in order to extract defendant companies and their respective partners from legal documents provided by the Public Prosecutor's Office of Santa Catarina. Three open source model families, Gemma, Llama and Qwen, were evaluated across different sizes, with and without the proposed architecture, using a custom evaluation framework based on cascading similarity matching of extracted partners, considering name, CPF and RG. Baseline results without RAG showed that the Llama 70b model achieved the best overall performance, with an 85.5% F1 Score in partner extraction, while applying Advanced RAG with Query Expansion to the Gemma models increased the coverage of processed CNPJs at the cost of reduced precision and, in the case of the Gemma 27b model, a significant increase in execution time. Validation on synthetic datasets demonstrated that, in documents with spatially dispersed relationships between company and partner, the architecture without RAG fails completely in partner extraction, with an F1 Score of 0.0%, while Advanced RAG maintained F1 above 91% in the same scenario, establishing RAG as a necessary component for pipeline robustness. The final system integrates the extraction pipeline with a cross referencing module against the public procurement database of Santa Catarina state and a web interface, delivering a support tool for auditing irregularities in the public sector. |
| Description: | TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Sistemas de Informação. |
| URI: | https://repositorio.ufsc.br/handle/123456789/274094 |
| Date: | 2026-07-09 |
| Files | Size | Format | View |
|---|---|---|---|
| TCC_Manuela_Schmitz.pdf | 1.783Mb |
View/ |