Extração de informação de textos literários em língua portuguesa usando modelos de linguagem visando integração em grafo de conhecimento

DSpace Repository

A- A A+

Extração de informação de textos literários em língua portuguesa usando modelos de linguagem visando integração em grafo de conhecimento

Show full item record

Title: Extração de informação de textos literários em língua portuguesa usando modelos de linguagem visando integração em grafo de conhecimento
Author: Costa, Arthur de Sousa
Abstract: Atualmente, uma grande quantidade de informações está disponível na forma de textos em documentos digitais, como livros, reportagens de jornais e revistas, páginas da Internet e publicações em redes sociais. O volume crescente desses dados torna inviável o processamento manual e demanda soluções de Processamento de Linguagem Natural (PLN). No domínio literário, a interpretação automatizada ainda representa um desafio relevante, especialmente quando envolve a identificação de personagens, suas características e as relações estabelecidas entre eles ao longo da narrativa. Este trabalho investiga a extração de informação (IE) em obras literárias em português do Brasil, com foco na estruturação de elementos narrativos por meio de Modelos de Linguagem de Grande Escala (LLMs) open-source, usando prompts que orientam a geração de dados estruturados em formato adequado para a integração em um grafo de conhecimento (KG). A metodologia proposta utiliza LangChain para orquestrar um pipeline composto por três cadeias principais de processamento: simplificação de sentenças, resolução de correferência e extração estruturada de personagens, características e relações. Para lidar com obras extensas, o texto é segmentado em sentenças e organizado em chunks, preservando metadados e evidências textuais associadas às extrações. Embora seja utilizado um único modelo de linguagem, são conduzidos três experimentos distintos, variando a estratégia de prompting: um experimento com prompt básico, um experimento com chain-of-thought prompting e um experimento com in-context learning. Essa configuração permite comparar o impacto de diferentes formas de instrução sobre o mesmo modelo. As informações extraídas são organizadas em formatos estruturados e posteriormente integradas em um KG, no qual personagens são modelados como nós e suas relações como arestas. Os resultados indicam que a abordagem contribui para automatizar a análise de elementos narrativos, oferecendo um recurso para pesquisadores e leitores explorarem personagens, atributos e interações de modo mais sistemático, auditável e reprodutível.Currently, a large amount of information is available as text in digital documents, such as books, newspaper and magazine articles, web pages, and social media posts. The growing volume of these data makes manual processing impractical and demands Natural Language Processing (PLN) solutions. In the literary domain, automated semantic interpretation remains a relevant challenge, especially when it involves identifying characters, their characteristics, and the relationships established among them throughout the narrative. This work investigates information extraction (IE) in literary works written in Brazilian Portuguese, focusing on the structuring of narrative elements through open-source Large Language Models (LLMs), using prompts that guide the generation of structured data in a format suitable for integration into a knowledge graph (KG). The proposed methodology uses LangChain to orchestrate a pipeline composed of three main processing chains: sentence simplification, coreference resolution, and structured extraction of characters, characteristics, and relationships. To handle long literary works, the text is segmented into sentences and organized into chunks, preserving metadata and textual evidence associated with the extractions. Although a single language model is used, three distinct experiments are conducted by varying the prompting strategy: one experiment with a basic prompt, one experiment with chain-of-thought prompting, and one experiment with in-context learning. This configuration makes it possible to compare the impact of different instruction strategies on the same model. The extracted information is organized into structured formats and integrated in a KG, in which characters are modeled as nodes and their relationships as edges. The results indicate that the approach contributes to automating the analysis of narrative elements, offering a resource for researchers and readers to explore characters, attributes, and interactions in a more systematic, auditable, and reproducible way.
Description: TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Ciências da Computação.
URI: https://repositorio.ufsc.br/handle/123456789/274097
Date: 2026-07-07


Files in this item

Files Size Format View Description
TCC.pdf 1.629Mb PDF View/Open TCC

This item appears in the following Collection(s)

Show full item record

Search DSpace


Browse

My Account

Statistics

Compartilhar