Coleta e Integração de Informações sobre Medicamentos aprovados no Brasil

DSpace Repository

A- A A+

Coleta e Integração de Informações sobre Medicamentos aprovados no Brasil

Show simple item record

dc.contributor Universidade Federal de Santa Catarina. pt_BR
dc.contributor.advisor Fileto, Renato
dc.contributor.author Schuler, Marcelo Gassen
dc.date.accessioned 2026-07-13T00:07:56Z
dc.date.available 2026-07-13T00:07:56Z
dc.date.issued 2026-06-24
dc.identifier.uri https://repositorio.ufsc.br/handle/123456789/274091
dc.description TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Sistemas de Informação. pt_BR
dc.description.abstract Este trabalho apresenta o desenvolvimento de um processo automatizado para coleta, integração e disponibilização de informações sobre medicamentos aprovados para uso no Brasil. A proposta consiste na criação de uma base de dados unificada a partir das fontes oficiais da Agência Nacional de Vigilância Sanitária (Anvisa) e da Câmara de Regulação do Mercado de Medicamentos (CMED), utilizando técnicas de Extra- ção, Transformação e Carga (ETL) para a coleta periódica de dados atualizados. O processo com tarefas de ETL codificadas em Python é orquestrado pela ferramenta Apache Airflow. O MongoDB é utilizado para carga inicial dos dados coletados de APIs da Anvisa (JSON) e da CMED (convertidos para JSON a partir do original em planilha Excel). Posteriormente, os dados são transformados e carregados em um banco de dados PostgreSQL com estruturas (tabelas normalizadas, índices, etc.) apropriadas para o seu uso eficiente em aplicações. A solução proposta visa facilitar o acesso a informações como número de registro ou código de notificação, nome comercial, princípio(s) ativo(s), dosagem de cada princípio ativo, forma farmacêutica, fabricante e preço máximo ao longo do tempo, viabilizando estudos e aplicações que dependam de dados consolidados sobre medicamentos. Diferentemente de iniciativas relacionadas voltadas principalmente à busca em terminologias da saúde suplementar, à extração semântica de informações de bulas ou à análise epidemiológica de conjuntos específi- cos de dispensação, este TCC concentra-se na integração operacional e reutilizável de dados cadastrais, composicionais e de preços de medicamentos registrados no Brasil. Além de apresentar a modelagem da base relacional final, este trabalho descreve a metodologia empregada no processo de ETL, faz uma análise exploratória dos dados coletados, relata os desafios encontrados e discute as possibilidades de utilização futura da base construída em projetos de pesquisa e inovação. Os dados coletados têm se mostrado muito úteis em tarefas como extração de informações de descrições textuais de medicamentos em itens de notas fiscais eletrônicas. Além disso, podem ter várias outras aplicações, incluindo extração de informação de textos clínicos e re- ceitas médicas, além de contribuir para a qualidade das trocas de informações sobre medicamentos entre instituições e empresas dos setores de saúde e farmacêutico. pt_BR
dc.description.abstract This work presents the development of an automated process for collecting, integrat- ing, and providing information about medications registered in Brazil. The proposal consists of creating a unified database from the official sources of the Brazilian Health Regulatory Agency (Anvisa) and the Drug Market Regulation Chamber (CMED), using Extraction, Transformation, and Loading (ETL) techniques for the periodic collection of updated data. The process, with ETL tasks coded in Python, is orchestrated by the Apache Airflow tool. MongoDB is used for the initial loading of data collected from the Anvisa APIs (JSON) and CMED (converted to JSON from the original Excel spread- sheet). Subsequently, the data is transformed and loaded into a PostgreSQL database with structures (normalized tables, indexes, etc.) appropriate for its efficient use in applications. The proposed solution aims to facilitate access to information such as registration number or notification code, commercial name, active ingredient(s), dosage of each active ingredient, pharmaceutical form, manufacturer, and maximum price over time, enabling studies and applications that depend on consolidated data about med- ications. Unlike related initiatives mainly focused on searching supplementary-health terminologies, semantically extracting information from drug leaflets, or epidemiologi- cally analyzing specific dispensing datasets, this work focuses on the operational and reusable integration of registration, composition, and pricing data for medications reg- istered in Brazil. In addition to presenting the modeling of the final relational database, this work describes the methodology employed, performs an exploratory analysis of the collected data, reports the challenges encountered, and discusses the possibilities for future use of the database in research and innovation projects. The collected data has proven useful in tasks such as extracting information from textual descriptions of medications in electronic invoice items. Furthermore, it may have various other applica- tions, including information extraction from clinical texts and medical prescriptions, as well as contributing to the quality of information exchanges about medications between institutions and companies in the healthcare and pharmaceutical sectors. pt_BR
dc.format.extent 81 pt_BR
dc.language.iso por pt_BR
dc.publisher Florianópolis, SC. pt_BR
dc.rights Open Access. en
dc.subject Integração de dados pt_BR
dc.subject Medicamentos pt_BR
dc.subject Anvisa pt_BR
dc.subject ETL pt_BR
dc.title Coleta e Integração de Informações sobre Medicamentos aprovados no Brasil pt_BR
dc.type TCCgrad pt_BR


Files in this item

Files Size Format View
tcc-marcelo-gassen.pdf 1.665Mb PDF View/Open

This item appears in the following Collection(s)

Show simple item record

Search DSpace


Advanced Search

Browse

My Account

Statistics

Compartilhar