| dc.contributor |
Universidade Federal de Santa Catarina |
|
| dc.contributor.advisor |
Dorneles, Carina Friedrich |
|
| dc.contributor.author |
Correia, José Silvestre |
|
| dc.date.accessioned |
2026-09-19T23:27:25Z |
|
| dc.date.available |
2026-09-19T23:27:25Z |
|
| dc.date.issued |
2026 |
|
| dc.identifier.other |
398726 |
|
| dc.identifier.uri |
https://repositorio.ufsc.br/handle/123456789/276649 |
|
| dc.description |
Dissertação (mestrado) - Universidade Federal de Santa Catarina, Centro Tecnológico, Programa de Pós-Graduação em Ciência da Computação, Florianópolis, 2026. |
|
| dc.description.abstract |
A transparência nos processos de contratação pública constitui um elemento central para a promoção da integridade governamental e o uso eficiente dos recursos do Estado. No Brasil, a promulgação da Lei n.º 14.133/2021 Nova Lei de Licitações e Contratos estabeleceu um conjunto de cláusulas obrigatórias que devem estar presentes em todos os contratos públicos, impondo novos desafios de conformidade à administração pública. Contudo, a verificação sistemática do cumprimento dessas exigências jurídicas enfrenta obstáculos significativos: o volume crescente de documentos contratuais, a ausência de padronização estrutural entre órgãos públicos e o caráter não estruturado dos arquivos em formato PDF tornam a análise manual morosa, custosa e propensa a erros.Diante desse cenário, a presente dissertação propõe uma abordagem computacional para a detecção automatizada de cláusulas obrigatórias e a análise de conformidade em contratos públicos de licitação. A solução desenvolvida integra técnicas de Processamento de Linguagem Natural (PLN),regras heurísticas estruturadas por meio de Expressões Regulares (REGEX), com o modelo de linguagempré-treinadoBERTimbau(Souza et al., 2020),versão adaptada ao português brasileiro do modelo BERT,O pipeline de processamento de dados foi segmentado em duas etapas consecutivas e complementares. Inicialmente, aplicaram-se regras heurísticas fundamentadas em Expressões Regulares (REGEX) para a triagem e filtragem preliminar do corpus, visando isolar estruturas textuais padronizadas com baixo custo computacional. Em seguida, os segmentos refinados foram submetidos aoBERTimbau, modelo de linguagem estado da artepré-treinado para o português.Ametodologia adotada seguiu as etapas de uma Revisão Sistemática de Literatura (RSL), adaptada deKitchenham(2004),para fundamentar teoricamente a pesquisa em estudos correlatos sobre segmentação e extração de informações em documentos jurídicos. Em seguida, procedeu-se à coleta de contratos reais provenientes de portais de transparência governamental, os quais foram submetidos a um processo de pré-processamento que envolverama conversão dePDFspara texto, tokenização, lematização e o Reconhecimento de Entidades Nomeadas (NER) com foco em valores monetários, prazos e cláusulas específicas. Para garantir a avaliação rigorosa do sistema, foi construído umDatasetOuro (Gold Standard), anotado manualmente, que serviu como referência para o treinamento e a validação dosmodelos.Osresultados demonstraram que a abordagemproposta supera métodos tradicionais como o REGEX puro e modelosSVMnaidentificação de cláusulas com alta variabilidade semântica. O modeloBERTimbau, ao capturar a semântica contextual do texto jurídico em português, mostrou-se particularmente eficaz na detecção de padrões linguísticos complexos, que escapam às regras rígidas de expressões regulares. A avaliação por métricas de Precisão, Revocação e F1-Score evidenciou ganhos expressivos de desempenho, validando a viabilidade da inteligência artificial como ferramenta de auditoria e controle da conformidade contratual.Este trabalho contribui para o avanço da pesquisaem PLN aplicado ao domínio jurídico em língua portuguesa e oferece uma solução tecnológica concreta para o fortalecimento da transparência e do combate à corrupção nas contratações públicas brasileiras. Como perspectivas futuras, destacam-se o aprimoramento do pipeline de extração, a ampliação do corpus de treinamento e o desenvolvimento de uma interface de auditoria acessível a gestores públicos e órgãos de controle. |
|
| dc.description.abstract |
Abstract: Transparency in public procurement processes is a central element for promoting governmental integrity and the efficient use of state resources. In Brazil, the enactment of Law No. 14,133/2021, the New Law on Bidding and Contracts, established a set of mandatory clauses that must be present in all public contracts, imposing new compliance challenges on public administration. However, the systematic verification of compliance with these legal requirements faces significant obstacles: the growing volume of contractual documents, the lack of structural standardization among public bodies, and the unstructured nature of PDF files make manual analysis slow, costly, and prone to errors. In this context, this dissertation proposes a computational approach for the automated detection of mandatory clauses and compliance analysis in public procurement contracts. The developed solution integrates Natural Language Processing (NLP) techniques, heuristic rules structured through Regular Expressions (REGEX), with the pre-trained BERTimbau language model (Souza et al., 2020), a Brazilian Portuguese-adapted version of the BERT model. The data processing pipeline was segmented into two consecutive and complementary stages. Initially, heuristic rules based on Regular Expressions(REGEX) were applied for preliminary screening and filtering of the corpus, aiming to isolate standardized textual structures with low computational cost. Subsequently, the refined segments were submitted to BERTimbau, a state-of-the-art language model pre-trained for Portuguese. The methodology adopted followed the steps of a Systematic Literature Review (SLR), adapted from Kitchenham (2004), to theoretically ground the research in related studies on segmentation and information extraction in legal documents. Next, real contracts from government transparency portals were collected and subjected to a pre-processing process involving PDF conversion to text, tokenization, lemmatization, and Named Entity Recognition (NER) focusing on monetary values, deadlines, and specific clauses. To ensure a rigorous system evaluation, a manually annotated Gold Standard dataset was constructed, serving as a reference for training and validating the models. The results demonstrated that the proposed approach outperforms traditional methods such as pure REGEX and SVM models in identifying clauses with high semantic variability. The BERTimbau model, by capturing the contextual semantics of legal text in Portuguese, proved particularly effective in detecting complex linguistic patterns that escape the rigid rules of regular expressions. Evaluation using Precision, Recall, and F1-Score metrics showed significant performance gains, validating the viability of artificial intelligence as a tool for auditing and controlling contractualcompliance. This work contributes to the advancement of NLP research applied to the legal domain in the Portuguese language and offers a concrete technological solution for strengthening transparency and combating corruption in Brazilian public procurement. Future perspectives include improving the extraction pipeline, expanding the training corpus, and developing an audit interface accessible to public managers and oversight bodies. |
en |
| dc.format.extent |
71 p.| il., tabs. |
|
| dc.language.iso |
por |
|
| dc.subject.classification |
Computação |
|
| dc.subject.classification |
Processamento de linguagem natural (Computação) |
|
| dc.subject.classification |
Licitação pública |
|
| dc.title |
Uma abordagem automatizada para a análise de conformidade contratual em contratos de licitação pública |
|
| dc.type |
Dissertação (Mestrado) |
|