| dc.contributor |
Universidade Federal de Santa Catarina. |
pt_BR |
| dc.contributor.advisor |
Inacio, Eduardo Camilo |
|
| dc.contributor.author |
Masso, Gabriela Ramire Bueno |
|
| dc.date.accessioned |
2026-07-13T07:36:18Z |
|
| dc.date.available |
2026-07-13T07:36:18Z |
|
| dc.date.issued |
2026-06-23 |
|
| dc.identifier.uri |
https://repositorio.ufsc.br/handle/123456789/274107 |
|
| dc.description |
TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Ciências da Computação. |
pt_BR |
| dc.description.abstract |
A ocorrência de dados faltantes é um desafio recorrente em pesquisas, análises estatísticas
e aplicações de aprendizado de máquina, podendo comprometer a qualidade e a confi-
abilidade dos resultados obtidos. Este trabalho realizou uma análise comparativa entre
diferentes estratégias de tratamento de dados faltantes, com foco em avaliar seus efeitos na
reconstrução das distribuições originais dos dados e no desempenho de modelos preditivos
de classificação. Para isso, foram utilizadas duas bases de dados reais, Heart Disease e
Instituto Nacional de Meteorologia (INMET) Florianópolis 2025, nas quais valores foram
removidos aleatoriamente em diferentes proporções, sob a categoria de ausência Missing
Completely At Random (MCAR). Os métodos avaliados incluíram estratégias simples,
como imputação pela média e pela mediana, além de métodos mais elaborados, como
K-Nearest Neighbors (KNN) e Multiple Imputation by Chained Equations (MICE). Es-
ses métodos foram comparados entre si em conjunto com a alternativa de não imputar
os dados. A avaliação foi realizada por meio da análise das distribuições reconstruídas,
da comparação de métricas preditivas, como acurácia, precisão, revocação e F1-score, e
da aplicação de testes estatísticos pareados. Os resultados indicaram que não houve um
único método de imputação superior em todos os cenários. O desempenho das técnicas
variou conforme a base de dados, a variável analisada, o percentual de dados faltantes
e o modelo preditivo utilizado. Métodos simples tenderam a reduzir a variabilidade das
distribuições, enquanto KNN e MICE apresentaram bom desempenho em determinados
contextos, mas também limitações em variáveis assimétricas ou com relações fracas entre
atributos. Conclui-se que a escolha do método de imputação deve ser realizada de forma
criteriosa, considerando as características dos dados e o objetivo da análise. |
pt_BR |
| dc.description.abstract |
The occurrence of missing data is a recurring challenge in research, statistical analyses,
and machine learning applications, as it may compromise the quality and reliability of
the results obtained. This study carried out a comparative analysis of different strategies
for handling missing data, focusing on evaluating their effects on the reconstruction of
the original data distributions and on the performance of predictive classification models.
For this purpose, two real datasets were used, Heart Disease and Instituto Nacional de
Meteorologia (INMET) Florianópolis 2025, in which values were randomly removed at
different proportions under the Missing Completely At Random (MCAR) mechanism. The
evaluated methods included simple strategies, such as mean and median imputation, as well
as more elaborate methods, such as K-Nearest Neighbors (KNN) and Multiple Imputation
by Chained Equations (MICE). These methods were compared with each other, as well
as with the alternative of not imputing the data. The evaluation was conducted through
the analysis of the reconstructed distributions, the comparison of predictive metrics such
as accuracy, precision, recall, and F1-score, and the application of paired statistical tests.
The results indicated that there was no single imputation method that was superior in all
scenarios. The performance of the techniques varied according to the dataset, the analyzed
variable, the percentage of missing data, and the predictive model used. Simple methods
tended to reduce the variability of the distributions, while KNN and MICE showed good
performance in certain contexts, but also limitations in asymmetric variables or in datasets
with weak relationships among attributes. It is concluded that the choice of an imputation
method should be made carefully, considering the characteristics of the data and the
objective of the analysis. |
pt_BR |
| dc.format.extent |
60f. |
pt_BR |
| dc.language.iso |
por |
pt_BR |
| dc.publisher |
Florianópolis, SC. |
pt_BR |
| dc.rights |
Open Access. |
|
| dc.subject |
dados faltantes |
pt_BR |
| dc.subject |
aprendizado de máquina |
pt_BR |
| dc.subject |
imputação de dados |
pt_BR |
| dc.title |
Análise dos efeitos de diferentes métodos de imputação de dados na reconstrução de populações e no desempenho de modelos preditivos |
pt_BR |
| dc.type |
TCCgrad |
pt_BR |