| Title: | PARAMETER-EFFICIENT FINE-TUNING AND ALIGNMENT OF QUANTIZED LLMS FOR STRICT SCHEMA LEGAL EXTRACTION |
| Author: | Resmer, João Pedro Perez |
| Abstract: |
Large Language Models (LLMs) have emerged as very powerful tools for multiple tasks over the past years. Their ability to approximate human performance in a variety of fields through next-token prediction has attracted much attention inside and outside the academic community. Given their ability to represent semantics in high-dimensional vector spaces using embedding models and process them using self-attention, this work proposes two fine-tuning approaches using Low-Rank Adaptation (LoRA) and quantization to leverage the great capabilities of LLMs for a labor-intensive task, data extraction from legal documents, while minimizing the hardware requirements for training a 4-billion-parameter model. The chosen model was fine-tuned on training sets of different sizes (100, 200, 300, 400, and 470 examples) under two different regimes, a pure Supervised Fine-Tuning (SFT) approach and a second approach combining Supervised Fine-Tuning with a reinforcement learning step, and under different sets of hyperparameters, in order to find the optimal setup and improve the results. Through validation we found that the best model was produced by the pure SFT approach with 470 examples, producing simililar or better results than the SFT and RL combination across all metrics. While testing on the held-out test set against our baseline models revealed that our model was able to outperform all models of similar size, and even achieve performance comparable to larger models, demonstrating the effectiveness of our approach in leveraging LLMs for structured legal extraction tasks Grandes Modelos de Linguagem (Large Language Models ou LLMS) emergiram como poderosas ferramentas em múltiplas tarefas nos últimos anos. A habilidade desses modelos de aproximar-se da performance humana em uma variedade de áreas a partir de predição do próximo token tem atraído muito interesse dentro e fora da comunidade acadêmica. Dada a capacidade desses modelos de representar relações semânticas em espaços vetoriais de alta dimensionalidade e processar essas informações por meio de camadas de atenção, o presente trabalho propõe dois métodos de ajuste fino usando Low-Rank Adaptation (LoRA) e quantização para fazer uso das incríveis capacidades desses modelos para auxiliar uma tarefa que demanda grande esforço, extração de dados em documentos legais, enquanto, ao mesmo tempo, minimiza os requerimentos de hardware necessários para treinar um modelo de 4 bilhões de parâmetros. O modelo escolhido foi ajustado em conjuntos de treino de diferentes tamanhos (100, 200, 300, 400 e 470 exemplos) sob dois regimes diferentes. O primeiro regime consiste no uso apenas de Ajuste Fino Supervisionado, enquanto o segundo método combina o Ajute Fino Supervisionado com o Treinamento por Reforço. Os modelos foram treinados sob diferentes ambientes e combinações de hiperparâmetros com o objetivo de encontrar um configuração ótima e aprimorar os resultados. Por meio da validação, descobrimos que o melhor modelo foi produzido pelo regime de Ajuste Fino Supervisionado com 470 exemplos, produzindo resultados similares ou melhores do que a combinação de Ajuste Fino Supervisionado e Treinamento por Reforço em todas as métricas. Testes realizados no conjunto de teste revelaram que nosso modelo foi capaz de superar todos os modelos de tamanho similar, e até mesmo alcançar performance comparável a modelos maiores, demonstrando a eficácia da nossa abordagem em aproveitar os LLMs para tarefas de extração legal estruturada. |
| Description: | TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Ciências da Computação. |
| URI: | https://repositorio.ufsc.br/handle/123456789/274086 |
| Date: | 2026-07-09 |
| Files | Size | Format | View |
|---|---|---|---|
| TCC.pdf | 2.509Mb |
View/ |