| Title: | Engenharia de prompt para o direito: validação de uma arquitetura agêntica para extração de informações de sentenças judiciais utilizando modelos de linguagem de grande escala |
| Author: | Pereira, Lucas de Castro Rodrigues |
| Abstract: |
O expressivo volume de dados textuais não estruturados gerado pelo Poder Judiciário brasileiro impõe um desafio significativo à extração de informações para análises em larga escala. Métodos tradicionais, como a busca por palavras-chave e a anotação manual, mostram-se limitados, sendo esta última caracterizada pela baixa escalabilidade e pela inconsistência inerente ao processo. Nesse contexto, o presente estudo teve como objetivo central o desenvolvimento e a validação de uma metodologia de engenharia de prompt para a extração de informações concretas e abstratas de sentenças judiciais com modelos de linguagem de grande escala (LLMs). Para alcançar tal objetivo, a pesquisa foi conduzida por meio de um estudo de caso experimental com um corpus de 1.163 sentenças sobre responsabilidade civil no transporte aéreo. A investigação metodológica progrediu de uma \"Abordagem de Extração Direta\" para uma arquitetura mais complexa, denominada \"Pipeline Multi-Agente\", com o desempenho de extração quantificado pela métrica F1-Score em comparação a um gabarito de referência. Os resultados da primeira fase indicam que a \"Abordagem de Extração Direta\" atingiu um desempenho de F1-Score 0,59, valor considerado moderado e marcado por falhas significativas na identificação de classes minoritárias. A análise da arquitetura \"Pipeline Multi-Agente\", por sua vez, revelou um desafio distinto: um desalinhamento de critérios entre as extrações do modelo e o gabarito original. Essa constatação motivou a implementação de um processo de adjudicação por especialista para resolver as divergências, no qual se verificou que 91,2\% das classificações do modelo nos casos de discordância foram validadas. Diante do exposto, e após o refinamento do gabarito, o desempenho final do pipeline atingiu um F1-Score de 0,97, o que permite concluir que a performance na extração de informação jurídica por LLMs é substancialmente determinada pela arquitetura de processamento. Dessa forma, a pesquisa consolida uma metodologia validada para a extração de dados e, de modo complementar, propõe um processo de adjudicação essencial para o gerenciamento da subjetividade na análise jurídica e para o refinamento da própria linha de base de avaliação. Abstract: The massive volume of unstructured textual data generated by the Brazilian Judiciary poses a significant challenge to information extraction for large-scale analysis. Traditional methods, such as keyword search and manual annotation, prove limited; specifically, manual annotation is hindered by low scalability and the inconsistency inherent to the process. In this context, this study aims to develop and validate a prompt engineering methodology for extracting both concrete and abstract information from court judgments using Large Language Models (LLMs). To achieve this, the research employed an experimental case study utilizing a corpus of 1,163 judgments concerning civil liability in air transportation. The methodological investigation progressed from a \"Direct Extraction Approach\" to a more complex architecture, designated \"Multi-Agent Pipeline,\" with extraction performance quantified via the F1-Score metric against a reference ground truth. Initial results indicated that the \"Direct Extraction Approach\" achieved an F1-Score of 0.59?a moderate value characterized by significant failures in identifying minority classes. In contrast, analysis of the \"Multi-Agent Pipeline\" architecture revealed a distinct challenge: a misalignment of criteria between the model?s extractions and the original ground truth. This finding motivated the implementation of an expert adjudication process to resolve discrepancies, revealing that 91.2\% of the model?s classifications in contested cases were valid. Consequently, following the refinement of the ground truth, the pipeline?s final performance reached an F1-Score of 0.97. This supports the conclusion that the performance of legal information extraction by LLMs is substantially determined by the processing architecture. Thus, this research establishes a validated methodology for data extraction and, complementarily, proposes an adjudication process essential for managing subjectivity in legal analysis and refining the evaluation baseline itself. |
| Description: | Dissertação (mestrado) ? Universidade Federal de Santa Catarina, Centro de Ciências Jurídicas, Programa de Pós-Graduação em Direito, Florianópolis, 2026. |
| URI: | https://repositorio.ufsc.br/handle/123456789/275044 |
| Date: | 2026 |
| Files | Size | Format | View |
|---|---|---|---|
| PDPC1884-D.pdf | 640.7Kb |
View/ |