| dc.contributor |
Universidade Federal de Santa Catarina. |
pt_BR |
| dc.contributor.advisor |
Fileto, Renato |
|
| dc.contributor.author |
Schuler, Marcelo Gassen |
|
| dc.date.accessioned |
2026-07-13T00:07:56Z |
|
| dc.date.available |
2026-07-13T00:07:56Z |
|
| dc.date.issued |
2026-06-24 |
|
| dc.identifier.uri |
https://repositorio.ufsc.br/handle/123456789/274091 |
|
| dc.description |
TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Sistemas de Informação. |
pt_BR |
| dc.description.abstract |
Este trabalho apresenta o desenvolvimento de um processo automatizado para coleta,
integração e disponibilização de informações sobre medicamentos aprovados para uso
no Brasil. A proposta consiste na criação de uma base de dados unificada a partir
das fontes oficiais da Agência Nacional de Vigilância Sanitária (Anvisa) e da Câmara
de Regulação do Mercado de Medicamentos (CMED), utilizando técnicas de Extra-
ção, Transformação e Carga (ETL) para a coleta periódica de dados atualizados. O
processo com tarefas de ETL codificadas em Python é orquestrado pela ferramenta
Apache Airflow. O MongoDB é utilizado para carga inicial dos dados coletados de APIs
da Anvisa (JSON) e da CMED (convertidos para JSON a partir do original em planilha
Excel). Posteriormente, os dados são transformados e carregados em um banco de
dados PostgreSQL com estruturas (tabelas normalizadas, índices, etc.) apropriadas
para o seu uso eficiente em aplicações. A solução proposta visa facilitar o acesso
a informações como número de registro ou código de notificação, nome comercial,
princípio(s) ativo(s), dosagem de cada princípio ativo, forma farmacêutica, fabricante e
preço máximo ao longo do tempo, viabilizando estudos e aplicações que dependam de
dados consolidados sobre medicamentos. Diferentemente de iniciativas relacionadas
voltadas principalmente à busca em terminologias da saúde suplementar, à extração
semântica de informações de bulas ou à análise epidemiológica de conjuntos específi-
cos de dispensação, este TCC concentra-se na integração operacional e reutilizável de
dados cadastrais, composicionais e de preços de medicamentos registrados no Brasil.
Além de apresentar a modelagem da base relacional final, este trabalho descreve a
metodologia empregada no processo de ETL, faz uma análise exploratória dos dados
coletados, relata os desafios encontrados e discute as possibilidades de utilização
futura da base construída em projetos de pesquisa e inovação. Os dados coletados
têm se mostrado muito úteis em tarefas como extração de informações de descrições
textuais de medicamentos em itens de notas fiscais eletrônicas. Além disso, podem
ter várias outras aplicações, incluindo extração de informação de textos clínicos e re-
ceitas médicas, além de contribuir para a qualidade das trocas de informações sobre
medicamentos entre instituições e empresas dos setores de saúde e farmacêutico. |
pt_BR |
| dc.description.abstract |
This work presents the development of an automated process for collecting, integrat-
ing, and providing information about medications registered in Brazil. The proposal
consists of creating a unified database from the official sources of the Brazilian Health
Regulatory Agency (Anvisa) and the Drug Market Regulation Chamber (CMED), using
Extraction, Transformation, and Loading (ETL) techniques for the periodic collection
of updated data. The process, with ETL tasks coded in Python, is orchestrated by the
Apache Airflow tool. MongoDB is used for the initial loading of data collected from the
Anvisa APIs (JSON) and CMED (converted to JSON from the original Excel spread-
sheet). Subsequently, the data is transformed and loaded into a PostgreSQL database
with structures (normalized tables, indexes, etc.) appropriate for its efficient use in
applications. The proposed solution aims to facilitate access to information such as
registration number or notification code, commercial name, active ingredient(s), dosage
of each active ingredient, pharmaceutical form, manufacturer, and maximum price over
time, enabling studies and applications that depend on consolidated data about med-
ications. Unlike related initiatives mainly focused on searching supplementary-health
terminologies, semantically extracting information from drug leaflets, or epidemiologi-
cally analyzing specific dispensing datasets, this work focuses on the operational and
reusable integration of registration, composition, and pricing data for medications reg-
istered in Brazil. In addition to presenting the modeling of the final relational database,
this work describes the methodology employed, performs an exploratory analysis of
the collected data, reports the challenges encountered, and discusses the possibilities
for future use of the database in research and innovation projects. The collected data
has proven useful in tasks such as extracting information from textual descriptions of
medications in electronic invoice items. Furthermore, it may have various other applica-
tions, including information extraction from clinical texts and medical prescriptions, as
well as contributing to the quality of information exchanges about medications between
institutions and companies in the healthcare and pharmaceutical sectors. |
pt_BR |
| dc.format.extent |
81 |
pt_BR |
| dc.language.iso |
por |
pt_BR |
| dc.publisher |
Florianópolis, SC. |
pt_BR |
| dc.rights |
Open Access. |
en |
| dc.subject |
Integração de dados |
pt_BR |
| dc.subject |
Medicamentos |
pt_BR |
| dc.subject |
Anvisa |
pt_BR |
| dc.subject |
ETL |
pt_BR |
| dc.title |
Coleta e Integração de Informações sobre Medicamentos aprovados no Brasil |
pt_BR |
| dc.type |
TCCgrad |
pt_BR |