Coleta e Integração de Informações sobre Medicamentos aprovados no Brasil

DSpace Repository

A- A A+

Coleta e Integração de Informações sobre Medicamentos aprovados no Brasil

Show full item record

Title: Coleta e Integração de Informações sobre Medicamentos aprovados no Brasil
Author: Schuler, Marcelo Gassen
Abstract: Este trabalho apresenta o desenvolvimento de um processo automatizado para coleta, integração e disponibilização de informações sobre medicamentos aprovados para uso no Brasil. A proposta consiste na criação de uma base de dados unificada a partir das fontes oficiais da Agência Nacional de Vigilância Sanitária (Anvisa) e da Câmara de Regulação do Mercado de Medicamentos (CMED), utilizando técnicas de Extra- ção, Transformação e Carga (ETL) para a coleta periódica de dados atualizados. O processo com tarefas de ETL codificadas em Python é orquestrado pela ferramenta Apache Airflow. O MongoDB é utilizado para carga inicial dos dados coletados de APIs da Anvisa (JSON) e da CMED (convertidos para JSON a partir do original em planilha Excel). Posteriormente, os dados são transformados e carregados em um banco de dados PostgreSQL com estruturas (tabelas normalizadas, índices, etc.) apropriadas para o seu uso eficiente em aplicações. A solução proposta visa facilitar o acesso a informações como número de registro ou código de notificação, nome comercial, princípio(s) ativo(s), dosagem de cada princípio ativo, forma farmacêutica, fabricante e preço máximo ao longo do tempo, viabilizando estudos e aplicações que dependam de dados consolidados sobre medicamentos. Diferentemente de iniciativas relacionadas voltadas principalmente à busca em terminologias da saúde suplementar, à extração semântica de informações de bulas ou à análise epidemiológica de conjuntos específi- cos de dispensação, este TCC concentra-se na integração operacional e reutilizável de dados cadastrais, composicionais e de preços de medicamentos registrados no Brasil. Além de apresentar a modelagem da base relacional final, este trabalho descreve a metodologia empregada no processo de ETL, faz uma análise exploratória dos dados coletados, relata os desafios encontrados e discute as possibilidades de utilização futura da base construída em projetos de pesquisa e inovação. Os dados coletados têm se mostrado muito úteis em tarefas como extração de informações de descrições textuais de medicamentos em itens de notas fiscais eletrônicas. Além disso, podem ter várias outras aplicações, incluindo extração de informação de textos clínicos e re- ceitas médicas, além de contribuir para a qualidade das trocas de informações sobre medicamentos entre instituições e empresas dos setores de saúde e farmacêutico.This work presents the development of an automated process for collecting, integrat- ing, and providing information about medications registered in Brazil. The proposal consists of creating a unified database from the official sources of the Brazilian Health Regulatory Agency (Anvisa) and the Drug Market Regulation Chamber (CMED), using Extraction, Transformation, and Loading (ETL) techniques for the periodic collection of updated data. The process, with ETL tasks coded in Python, is orchestrated by the Apache Airflow tool. MongoDB is used for the initial loading of data collected from the Anvisa APIs (JSON) and CMED (converted to JSON from the original Excel spread- sheet). Subsequently, the data is transformed and loaded into a PostgreSQL database with structures (normalized tables, indexes, etc.) appropriate for its efficient use in applications. The proposed solution aims to facilitate access to information such as registration number or notification code, commercial name, active ingredient(s), dosage of each active ingredient, pharmaceutical form, manufacturer, and maximum price over time, enabling studies and applications that depend on consolidated data about med- ications. Unlike related initiatives mainly focused on searching supplementary-health terminologies, semantically extracting information from drug leaflets, or epidemiologi- cally analyzing specific dispensing datasets, this work focuses on the operational and reusable integration of registration, composition, and pricing data for medications reg- istered in Brazil. In addition to presenting the modeling of the final relational database, this work describes the methodology employed, performs an exploratory analysis of the collected data, reports the challenges encountered, and discusses the possibilities for future use of the database in research and innovation projects. The collected data has proven useful in tasks such as extracting information from textual descriptions of medications in electronic invoice items. Furthermore, it may have various other applica- tions, including information extraction from clinical texts and medical prescriptions, as well as contributing to the quality of information exchanges about medications between institutions and companies in the healthcare and pharmaceutical sectors.
Description: TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Sistemas de Informação.
URI: https://repositorio.ufsc.br/handle/123456789/274091
Date: 2026-06-24


Files in this item

Files Size Format View
tcc-marcelo-gassen.pdf 1.665Mb PDF View/Open

This item appears in the following Collection(s)

Show full item record

Search DSpace


Advanced Search

Browse

My Account

Statistics

Compartilhar