|
Abstract:
|
O absenteísmo é uma das principais métricas que impactam o custo em instituições nos mais diversos setores. Na saúde em específico, onde há uma alta taxa de não comparecimento de pacientes, existem grandes filas para realização de consultas, exames e procedimentos. Nesse contexto, esse trabalho propõe uma comparação entre modelos de aprendizado de máquina, com foco em regressão logística e árvore de decisão, visando prever o absenteísmo e, assim, fornecer subsídios para desenvolvedores de modelos preditivos que visam resolver problemas do setor de saúde com aprendizado de máquina. Para isso, foram geradas 243 versões do conjunto de dados a partir de diferentes decisões de pré-processamento, combinadas com as configurações de cada modelo, totalizando mais de onze mil experimentos, avaliados por métricas apropriadas a dados desbalanceados, como AUC, precisão, recall e F1, além da comparação com estratégias simples de referência e da análise do limiar de decisão, de modo a identificar o que cada abordagem efetivamente oferece para mitigar o problema do absenteísmo. Os resultados mostraram que a regressão logística superou a árvore de decisão, alcançando um desempenho modesto, porém estável, com AUC em torno de 0,60 em dados nunca vistos, enquanto a árvore de decisão apresentou forte sobreajuste e desempenho próximo ao acaso fora do conjunto de treino. Mais do que um modelo pronto para uso, o trabalho entrega uma avaliação controlada e reprodutível do que esses modelos conseguem, e do que não conseguem, oferecer como apoio à gestão do absenteísmo. |