|
Abstract:
|
A detecção de fraudes em cartões de crédito tem se tornado uma preocupação cada vez mais relevante, à medida que o número de transações digitais cresce e movimenta bilhões de dólares anualmente. Entre os principais desafios, encontram-se o desequilíbrio dos dados e as consequências econômicas da classificação incorreta. Na literatura, é frequente a suposição de que uma classificação incorreta possui o mesmo custo para todas as classes, o que não reflete com precisão os custos reais envolvidos. Nesse contexto, este trabalho apresenta uma arquitetura de processamento para detecção de fraudes em cartões de crédito, enfatizando a sensibilidade aos custos e a limitação da capacidade computacional. O estudo envolveu a preparação e a análise dos dados, seleção de atributos relevantes e a implementação de um modelo probabilístico integrado a um classificador. Os resultados obtidos indicaram um retorno financeiro correspondente a 77,28% do máximo possível, equivalente a um retorno absoluto de US$ 61.596,28, considerando as restrições estabelecidas de baixo custo computacional e rapidez de inferência. Adicionalmente, contrariamente à literatura, verificou-se que técnicas de aumento de dados, especificamente o SMOTE (Synthetic Minority Over-sampling Technique), não resultaram em aumentos significativos para este contexto específico. Destaca-se a importância de utilizar métricas adequadas, como precisão e recall ponderados pelos custos econômicos associados aos erros, uma vez que métricas tradicionais como acurácia e AUC-ROC não refletem plenamente o desempenho econômico e operacional em situações de fraudes raras e dados altamente desbalanceados. |