Análise e Exploração de Recursos Educacionais do Moodle utilizando Processamento de Linguagem Natural e RAG

DSpace Repository

A- A A+

Análise e Exploração de Recursos Educacionais do Moodle utilizando Processamento de Linguagem Natural e RAG

Show full item record

Title: Análise e Exploração de Recursos Educacionais do Moodle utilizando Processamento de Linguagem Natural e RAG
Author: dos Santos, Bruna Leticia Matos
Abstract: O crescimento dos recursos educacionais digitais amplia as possibilidades de acesso, compartilhamento e reutilização de materiais voltados ao ensino e à aprendizagem. Entretanto, a existência de um acervo numeroso não garante que seus conteúdos possam ser localizados e explorados de forma adequada. Esse problema se torna mais evidente em backups de ambientes virtuais de aprendizagem, cuja estrutura é voltada à restauração da plataforma e não à consulta direta dos documentos. Este trabalho teve como objetivo desenvolver um método para organizar, recuperar e explorar recursos educacionais extraídos de backups do Moodle relacionados à plataforma IntecEdu e ao Laboratório de Experimentação Remota da Universidade Federal de Santa Catarina. A pesquisa foi conduzida com base na Design Science Research Methodology e resultou em um artefato composto por um pipeline documental e uma aplicação web. O método realizou a reconstrução dos arquivos a partir dos metadados do Moodle, a filtragem de conteúdos sem finalidade educacional, a deduplicação por conteúdo e a preservação das diferentes origens dos recursos. Os documentos PDF, DOCX e PPTX foram submetidos à extração e à fragmentação textual. Os fragmentos foram convertidos em representações vetoriais com o modelo gemini-embedding-001 e armazenados em uma base persistente do ChromaDB. Sobre essa estrutura, foram implementadas busca semântica e Geração Aumentada por Recuperação. O mecanismo RAG recupera fragmentos relacionados à pergunta, organiza o contexto e utiliza o modelo gemini-2.5-flash para gerar respostas acompanhadas dos documentos e trechos utilizados como fonte. O mesmo modelo também foi empregado para produzir automaticamente a organização temática do corpus. A LLM analisou identificadores, títulos, nomes de arquivos e resumos textuais, gerando uma estrutura hierárquica formada por macroáreas, subtópicos e documentos associados. Em uma segunda etapa, a taxonomia foi refinada automaticamente e os títulos dos documentos foram normalizados para apresentação na interface. A aplicação oferece listagem de documentos, navegação temática e visualizações interativas do acervo. Foram identificadas aproximadamente 4.440 ocorrências de arquivos. Após a filtragem e a deduplicação, o corpus resultou em cerca de 713 documentos canônicos, dos quais 672 foram indexados, originando 6.046 fragmentos textuais. O artefato foi avaliado por indicadores quantitativos descritivos e por verificação funcional exploratória, sem comparação com sistemas de referência ou avaliação formal com usuários. Os resultados demonstram viabilidade técnica no corpus analisado, permanecendo como trabalhos futuros a avaliação da qualidade da recuperação, da fidelidade das respostas e da usabilidade da aplicação. Como contribuição, o trabalho apresenta um método aplicado a uma coleção educacional real, preservando a rastreabilidade entre consultas, respostas e documentos de origem.The growth of digital educational resources expands the possibilities for accessing, sharing, and reusing teaching and learning materials. However, the existence of a large collection does not ensure that its contents can be properly located and explored. This problem becomes more evident in backups of virtual learning environments, whose internal structure is designed to restore the platform rather than to support direct document retrieval. This work aimed to develop a method for organizing, retrieving, and exploring educational resources extracted from Moodle backups associated with the IntecEdu platform and the Remote Experimentation Laboratory of the Federal University of Santa Catarina. The research was conducted according to the Design Science Research Methodology and resulted in an artifact composed of a document-processing pipeline and a web application. The method reconstructed the files using Moodle metadata, filtered content without an educational purpose, removed content-based duplicates, and preserved the different origins of each resource. PDF, DOCX, and PPTX documents were submitted to text extraction and segmentation. The resulting chunks were converted into vector representations using the gemini-embedding-001 model and stored in a persistent ChromaDB vector database. Semantic search and Retrieval-Augmented Generation were implemented on top of this structure. The RAG mechanism retrieves chunks related to the user query, organizes the context, and uses the gemini-2.5-flash model to generate responses accompanied by the documents and excerpts used as sources. The same model was also used to automatically produce the thematic organization of the corpus. The LLM analyzed document identifiers, titles, filenames, and textual summaries to generate a hierarchical structure composed of broad subject areas, subtopics, and associated documents. In a second stage, the taxonomy was automatically refined and document titles were normalized for presentation in the interface. The application provides document listing, thematic navigation, and interactive visualizations of the collection. Approximately 4,440 file occurrences were identified. After filtering and deduplication, the corpus contained approximately 713 canonical documents, of which 672 were indexed, producing 6,046 textual chunks. The artifact was evaluated through descriptive quantitative indicators and exploratory functional verification, without comparison with reference systems or formal user evaluation. The results demonstrate technical feasibility in the analyzed corpus, while future work should evaluate retrieval quality, answer faithfulness, and application usability. As its main contribution, the study presents a method applied to a real educational collection while preserving traceability between queries, generated responses, and source documents.
Description: TCC (graduação) - Universidade Federal de Santa Catarina, Campus Araranguá, Tecnologias da Informação e Comunicação.
URI: https://repositorio.ufsc.br/handle/123456789/274509
Date: 2026-07-10


Files in this item

Files Size Format View
Análise e Explo ... inguagem Natural e RAG.pdf 7.411Mb PDF View/Open

This item appears in the following Collection(s)

Show full item record

Search DSpace


Advanced Search

Browse

My Account

Statistics

Compartilhar