| Title: | Aplicação de blockchain como fonte descentralizada de dados para LLMs |
| Author: | Delazzari, Ana Regina |
| Abstract: |
O crescente reconhecimento dos dados como um fator estratégico, especialmente no contexto de modelos de linguagem de grande escala (LLMs), tem trazido novos desafios relacionados à segurança, privacidade e transparência no uso dessas informações. Paralelamente, a tecnologia blockchain vem sendo explorada como uma alternativa para garantir descentralização, imutabilidade e auditabilidade de registros digitais. Trabalhos recentes têm investigado a integração entre LLMs, aprendizado federado e blockchains, empregando mecanismos de coordenação descentralizada e técnicas de agregação de parâmetros. Neste contexto, este trabalho propôs e implementou uma arquitetura de aprendizado federado descentralizado para o fine-tuning de LLMs com base em dados armazenados em uma rede blockchain permissionada. A solução se apoia em elementos já consolidados na literatura, como a utilização da blockchain para coordenação do aprendizado federado, o algoritmo FedAvg para agregação dos parâmetros e o algoritmo QLoRA para ajuste eficiente dos modelos. Como diferencial, a arquitetura introduz mecanismos parametrizáveis definidos por consenso entre os participantes e parte de dados originalmente armazenados em uma blockchain existente, preservando suas propriedades de descentralização, integridade e confiabilidade ao longo de todo o ciclo de atualização do modelo. A arquitetura foi aplicada ao contexto do projeto Rede de Rastreabilidade de Dados da Educação Superior (RRDES), utilizando documentos acadêmicos em formato XML do padrão Diploma Digital como fonte de dados. Os experimentos realizados em um ambiente controlado permitiram comparar o treinamento descentralizado com uma abordagem centralizada por meio de métricas de tempo de treinamento, uso de memória de vídeo (VRAM) e perda de validação (evaluation loss). Adicionalmente, foram avaliados cenários de ataques de envenenamento do modelo e de inferência de associação, mostrando que a incorporação de privacidade diferencial reduziu significativamente a eficácia deste último ataque. Os experimentos realizados demonstraram a aplicabilidade da arquitetura proposta para o treinamento colaborativo de LLMs em ambientes blockchain permissionados. The growing recognition of data as a strategic asset, especially in the context of Large Language Models (LLMs), has introduced new challenges related to security, privacy and transparency in the use of such information. At the same time, blockchain technology has been explored as a means of providing decentralization, immutability and auditability for digital records. Recent studies have investigated the integration of LLMs, federated learning and blockchain technologies, employing decentralized coordination mechanisms and parameter aggregation techniques. In this context, this work proposed and implemented a decentralized federated learning architecture for fine-tuning LLMs using data stored in a permissioned blockchain network. The solution builds upon concepts already established in the literature, including the use of blockchain to coordinate federated learning, the FedAvg algorithm for parameter aggregation and the QLoRA algorithm for efficient model adaptation. As its main distinguishing feature, the architecture introduces parameterizable mechanisms defined through consensus among participating nodes and leverages data originally stored in an existing blockchain, preserving its decentralization, integrity, and trustworthiness throughout the model update cycle. The architecture was applied to the context of the project Rede de Rastreabilidade de Dados da Educação Superior (RRDES), using academic documents encoded in the Digital Diploma XML standard as the data source. Experiments conducted in a controlled environment compared decentralized and centralized training approaches in terms of training time, video memory (VRAM) consumption, and evaluation loss. In addition, scenarios involving model poisoning and membership inference attacks were evaluated, showing that the incorporation of differential privacy significantly reduced the effectiveness of the latter attack. The experiments demonstrated the applicability of the proposed architecture for collaborative training of LLMs in permissioned blockchain environments. |
| Description: | TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Ciências da Computação. |
| URI: | https://repositorio.ufsc.br/handle/123456789/274053 |
| Date: | 2026-07-03 |
| Files | Size | Format | View | Description |
|---|---|---|---|---|
| TCC II - Ana Regina Delazzari - Versão Final.pdf | 3.781Mb |
View/ |
TCC |