| Title: | Análise do impacto da proporção entre dados reais e sintéticos no treinamento de modelos de aprendizado profundo para classificação de imagens |
| Author: | Vieira, Leticia Mello |
| Abstract: |
Este trabalho investiga o impacto da proporção entre dados reais e dados sintéticos no desempenho de modelos de classificação de imagens, considerando um problema multiclasse com sete classes. O objetivo principal é analisar em que medida os dados sintéticos podem complementar ou substituir dados reais no treinamento de modelos de visão computacional. A metodologia adotada baseia-se na realização de experimentos controlados utilizando duas arquiteturas amplamente empregadas na literatura: a ResNet50, baseada em redes convolucionais profundas, e o ViT-B/16, baseado em Vision Transformers. Foram avaliadas diferentes combinações de dados reais e sintéticos no conjunto de treinamento, variando de 100% de dados reais até 100% de dados sintéticos. A avaliação foi conduzida segundo o paradigma Train on Synthetic, Test on Real (TSTR), utilizando exclusivamente imagens reais no conjunto de teste. O desempenho dos modelos foi analisado por meio das métricas de acurácia, precisão macro, recall macro e F1-score macro, além da análise qualitativa das matrizes de confusão. Os resultados indicam que o desempenho dos modelos está fortemente associado à presença de dados reais no treinamento. Observou-se uma degradação progressiva das métricas à medida que a proporção de dados sintéticos aumenta, evidenciando a existência de uma lacuna de domínio entre os dados reais e sintéticos. No entanto, verificou-se que a inclusão de uma pequena fração de dados sintéticos, especificamente 10% do conjunto de treinamento, resultou em ganho de desempenho para a ResNet50 quando comparada ao treinamento exclusivamente com dados reais. Em contrapartida, proporções mais elevadas de dados sintéticos levaram a um aumento significativo dos padrões de confusão entre classes visualmente semelhantes, especialmente nos cenários com predominância ou exclusividade de dados sintéticos. Conclui-se que os dados sintéticos, embora não sejam suficientes para substituir dados reais no treinamento de modelos de classificação de imagens, podem atuar de forma complementar quando utilizados em proporções reduzidas. Além disso, os resultados indicam que modelos baseados em redes convolucionais apresentam maior robustez à introdução de dados sintéticos quando comparados a arquiteturas baseadas em Transformers. Esses resultados reforçam a importância de estratégias que visem reduzir a lacuna de domínio entre dados reais e sintéticos para ampliar a aplicabilidade desses dados em cenários reais. Abstract: This work investigates the impact of the ratio between real and synthetic data on the performance of image classification models, considering a multiclass problem with seven classes. The main objective is to analyze the extent to which synthetic data can complement or replace real data in the training of computer vision models. The methodology adopted is based on controlled experiments using two architectures widely employed in the literature: ResNet50, based on deep convolutional networks, and ViT-B/16, based on Vision Transformers. Different combinations of real and synthetic data were evaluated in the training set, ranging from 100% real data to 100% synthetic data. The evaluation was conducted according to the Train on Synthetic, Test on Real (TSTR) paradigm, using only real images in the test set. The performance of the models was analyzed using accuracy, macro precision, macro recall, and macro F1-score metrics, in addition to qualitative analysis of confusion matrices. The results indicate that model performance is strongly associated with the presence of real data in training. A progressive degradation of the metrics was observed as the proportion of synthetic data increased, highlighting the existence of a domain gap between real and synthetic data. However, it was found that the inclusion of a small fraction of synthetic data, specifically 10% of the training set, resulted in performance gains for ResNet50 when compared to training exclusively with real data. In contrast, higher proportions of synthetic data led to a significant increase in confusion patterns between visually similar classes, especially in scenarios with a predominance or exclusivity of synthetic data. It can be concluded that synthetic data, although not sufficient to replace real data in training image classification models, can act as a complement when used in small proportions. In addition, the results indicate that models based on convolutional networks are more robust to the introduction of synthetic data when compared to architectures based on Transformers. These results reinforce the importance of strategies that aim to reduce the domain gap between real and synthetic data to expand the applicability of this data in real scenarios. |
| Description: | Dissertação (mestrado) - Universidade Federal de Santa Catarina, Centro Tecnológico, Programa de Pós-Graduação em Engenharia de Automação e Sistemas, Florianópolis, 2026. |
| URI: | https://repositorio.ufsc.br/handle/123456789/275300 |
| Date: | 2026 |
| Files | Size | Format | View |
|---|---|---|---|
| PEAS0489-D.pdf | 1.647Mb |
View/ |