Análise dos efeitos de diferentes métodos de imputação de dados na reconstrução de populações e no desempenho de modelos preditivos

DSpace Repository

A- A A+

Análise dos efeitos de diferentes métodos de imputação de dados na reconstrução de populações e no desempenho de modelos preditivos

Show full item record

Title: Análise dos efeitos de diferentes métodos de imputação de dados na reconstrução de populações e no desempenho de modelos preditivos
Author: Masso, Gabriela Ramire Bueno
Abstract: A ocorrência de dados faltantes é um desafio recorrente em pesquisas, análises estatísticas e aplicações de aprendizado de máquina, podendo comprometer a qualidade e a confi- abilidade dos resultados obtidos. Este trabalho realizou uma análise comparativa entre diferentes estratégias de tratamento de dados faltantes, com foco em avaliar seus efeitos na reconstrução das distribuições originais dos dados e no desempenho de modelos preditivos de classificação. Para isso, foram utilizadas duas bases de dados reais, Heart Disease e Instituto Nacional de Meteorologia (INMET) Florianópolis 2025, nas quais valores foram removidos aleatoriamente em diferentes proporções, sob a categoria de ausência Missing Completely At Random (MCAR). Os métodos avaliados incluíram estratégias simples, como imputação pela média e pela mediana, além de métodos mais elaborados, como K-Nearest Neighbors (KNN) e Multiple Imputation by Chained Equations (MICE). Es- ses métodos foram comparados entre si em conjunto com a alternativa de não imputar os dados. A avaliação foi realizada por meio da análise das distribuições reconstruídas, da comparação de métricas preditivas, como acurácia, precisão, revocação e F1-score, e da aplicação de testes estatísticos pareados. Os resultados indicaram que não houve um único método de imputação superior em todos os cenários. O desempenho das técnicas variou conforme a base de dados, a variável analisada, o percentual de dados faltantes e o modelo preditivo utilizado. Métodos simples tenderam a reduzir a variabilidade das distribuições, enquanto KNN e MICE apresentaram bom desempenho em determinados contextos, mas também limitações em variáveis assimétricas ou com relações fracas entre atributos. Conclui-se que a escolha do método de imputação deve ser realizada de forma criteriosa, considerando as características dos dados e o objetivo da análise.The occurrence of missing data is a recurring challenge in research, statistical analyses, and machine learning applications, as it may compromise the quality and reliability of the results obtained. This study carried out a comparative analysis of different strategies for handling missing data, focusing on evaluating their effects on the reconstruction of the original data distributions and on the performance of predictive classification models. For this purpose, two real datasets were used, Heart Disease and Instituto Nacional de Meteorologia (INMET) Florianópolis 2025, in which values were randomly removed at different proportions under the Missing Completely At Random (MCAR) mechanism. The evaluated methods included simple strategies, such as mean and median imputation, as well as more elaborate methods, such as K-Nearest Neighbors (KNN) and Multiple Imputation by Chained Equations (MICE). These methods were compared with each other, as well as with the alternative of not imputing the data. The evaluation was conducted through the analysis of the reconstructed distributions, the comparison of predictive metrics such as accuracy, precision, recall, and F1-score, and the application of paired statistical tests. The results indicated that there was no single imputation method that was superior in all scenarios. The performance of the techniques varied according to the dataset, the analyzed variable, the percentage of missing data, and the predictive model used. Simple methods tended to reduce the variability of the distributions, while KNN and MICE showed good performance in certain contexts, but also limitations in asymmetric variables or in datasets with weak relationships among attributes. It is concluded that the choice of an imputation method should be made carefully, considering the characteristics of the data and the objective of the analysis.
Description: TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Ciências da Computação.
URI: https://repositorio.ufsc.br/handle/123456789/274107
Date: 2026-06-23


Files in this item

Files Size Format View Description
TCC_Gabriela_VersaoFinal (1).pdf 1.548Mb PDF View/Open TCC

This item appears in the following Collection(s)

Show full item record

Search DSpace


Advanced Search

Browse

My Account

Statistics

Compartilhar