| dc.contributor |
Universidade Federal de Santa Catarina. |
pt_BR |
| dc.contributor.advisor |
Sérgio, Marina Carradore |
|
| dc.contributor.author |
dos Santos, Bruna Leticia Matos |
|
| dc.date.accessioned |
2026-07-20T17:55:19Z |
|
| dc.date.available |
2026-07-20T17:55:19Z |
|
| dc.date.issued |
2026-07-10 |
|
| dc.identifier.uri |
https://repositorio.ufsc.br/handle/123456789/274509 |
|
| dc.description |
TCC (graduação) - Universidade Federal de Santa Catarina, Campus Araranguá, Tecnologias da Informação e Comunicação. |
pt_BR |
| dc.description.abstract |
O crescimento dos recursos educacionais digitais amplia as possibilidades de
acesso, compartilhamento e reutilização de materiais voltados ao ensino e à
aprendizagem. Entretanto, a existência de um acervo numeroso não garante que
seus conteúdos possam ser localizados e explorados de forma adequada. Esse
problema se torna mais evidente em backups de ambientes virtuais de
aprendizagem, cuja estrutura é voltada à restauração da plataforma e não à consulta
direta dos documentos. Este trabalho teve como objetivo desenvolver um método
para organizar, recuperar e explorar recursos educacionais extraídos de backups do
Moodle relacionados à plataforma IntecEdu e ao Laboratório de Experimentação
Remota da Universidade Federal de Santa Catarina. A pesquisa foi conduzida com
base na Design Science Research Methodology e resultou em um artefato composto
por um pipeline documental e uma aplicação web. O método realizou a reconstrução
dos arquivos a partir dos metadados do Moodle, a filtragem de conteúdos sem
finalidade educacional, a deduplicação por conteúdo e a preservação das diferentes
origens dos recursos. Os documentos PDF, DOCX e PPTX foram submetidos à
extração e à fragmentação textual. Os fragmentos foram convertidos em
representações vetoriais com o modelo gemini-embedding-001 e armazenados em
uma base persistente do ChromaDB. Sobre essa estrutura, foram implementadas
busca semântica e Geração Aumentada por Recuperação. O mecanismo RAG
recupera fragmentos relacionados à pergunta, organiza o contexto e utiliza o modelo
gemini-2.5-flash para gerar respostas acompanhadas dos documentos e trechos
utilizados como fonte. O mesmo modelo também foi empregado para produzir
automaticamente a organização temática do corpus. A LLM analisou identificadores,
títulos, nomes de arquivos e resumos textuais, gerando uma estrutura hierárquica
formada por macroáreas, subtópicos e documentos associados. Em uma segunda
etapa, a taxonomia foi refinada automaticamente e os títulos dos documentos foram
normalizados para apresentação na interface. A aplicação oferece listagem de
documentos, navegação temática e visualizações interativas do acervo. Foram
identificadas aproximadamente 4.440 ocorrências de arquivos. Após a filtragem e a
deduplicação, o corpus resultou em cerca de 713 documentos canônicos, dos quais
672 foram indexados, originando 6.046 fragmentos textuais. O artefato foi avaliado
por indicadores quantitativos descritivos e por verificação funcional exploratória, sem
comparação com sistemas de referência ou avaliação formal com usuários. Os
resultados demonstram viabilidade técnica no corpus analisado, permanecendo
como trabalhos futuros a avaliação da qualidade da recuperação, da fidelidade das
respostas e da usabilidade da aplicação. Como contribuição, o trabalho apresenta
um método aplicado a uma coleção educacional real, preservando a rastreabilidade
entre consultas, respostas e documentos de origem. |
pt_BR |
| dc.description.abstract |
The growth of digital educational resources expands the possibilities for accessing,
sharing, and reusing teaching and learning materials. However, the existence of a
large collection does not ensure that its contents can be properly located and
explored. This problem becomes more evident in backups of virtual learning
environments, whose internal structure is designed to restore the platform rather than
to support direct document retrieval. This work aimed to develop a method for
organizing, retrieving, and exploring educational resources extracted from Moodle
backups associated with the IntecEdu platform and the Remote Experimentation
Laboratory of the Federal University of Santa Catarina. The research was conducted
according to the Design Science Research Methodology and resulted in an artifact
composed of a document-processing pipeline and a web application. The method
reconstructed the files using Moodle metadata, filtered content without an
educational purpose, removed content-based duplicates, and preserved the different
origins of each resource. PDF, DOCX, and PPTX documents were submitted to text
extraction and segmentation. The resulting chunks were converted into vector
representations using the gemini-embedding-001 model and stored in a persistent
ChromaDB vector database. Semantic search and Retrieval-Augmented Generation
were implemented on top of this structure. The RAG mechanism retrieves chunks
related to the user query, organizes the context, and uses the gemini-2.5-flash model
to generate responses accompanied by the documents and excerpts used as
sources. The same model was also used to automatically produce the thematic
organization of the corpus. The LLM analyzed document identifiers, titles, filenames,
and textual summaries to generate a hierarchical structure composed of broad
subject areas, subtopics, and associated documents. In a second stage, the
taxonomy was automatically refined and document titles were normalized for
presentation in the interface. The application provides document listing, thematic
navigation, and interactive visualizations of the collection. Approximately 4,440 file
occurrences were identified. After filtering and deduplication, the corpus contained
approximately 713 canonical documents, of which 672 were indexed, producing
6,046 textual chunks. The artifact was evaluated through descriptive quantitative
indicators and exploratory functional verification, without comparison with reference
systems or formal user evaluation. The results demonstrate technical feasibility in the
analyzed corpus, while future work should evaluate retrieval quality, answer
faithfulness, and application usability. As its main contribution, the study presents a
method applied to a real educational collection while preserving traceability between
queries, generated responses, and source documents. |
pt_BR |
| dc.format.extent |
118 páginas |
pt_BR |
| dc.language.iso |
por |
pt_BR |
| dc.publisher |
Araranguá, SC. |
pt_BR |
| dc.rights |
Open Access. |
en |
| dc.subject |
Recursos educacionais digitais |
pt_BR |
| dc.subject |
Moodle |
pt_BR |
| dc.subject |
Processamento de Linguagem Natural |
pt_BR |
| dc.subject |
Busca semântica |
pt_BR |
| dc.subject |
Geração Aumentada por Recuperação |
pt_BR |
| dc.title |
Análise e Exploração de Recursos Educacionais do Moodle utilizando Processamento de Linguagem Natural e RAG |
pt_BR |
| dc.type |
TCCgrad |
pt_BR |