|
Abstract:
|
A irrigação agrícola representa um dos processos mais críticos da produção rural, sendo
responsável por aproximadamente 70% do consumo hídrico mundial. A adoção de
sistemas inteligentes baseados em aprendizado de máquina oferece uma alternativa
concreta aos métodos convencionais, porém sua eficácia depende diretamente da
disponibilidade de dados de qualidade para treinamento, um recurso escasso no contexto
agrícola brasileiro. Este trabalho investiga o uso de dados sintéticos como estratégia
para viabilizar o treinamento de modelos de classificação aplicados à decisão de irrigação,
comparando três técnicas de geração (CTGAN, TVAE e Cópula Gaussiana) e quatro
algoritmos de classificação (Regressão Logística, Random Forest, k-NN e SVM com
kernel RBF) utilizando, dados reais, dados sintéticos puros e conjuntos aumentados.
Um experimento de frações progressivas foi conduzido para identificar o limiar de
volume de dados reais a partir do qual a aumentação sintética produz ganho mensurável.
Os resultados indicam que o TVAE foi o único método capaz de superar o baseline
real de forma consistente, com ganho de acurácia de até 9,4 pontos percentuais em
regimes de baixa disponibilidade de dados, e que o SVM com kernel RBF mostrou-se
o classificador mais robusto em todos os cenários avaliados. O ponto de saturação da
aumentação de dados foi identificado em aproximadamente 50% do conjunto original,
fornecendo um critério prático para o uso eficiente de dados sintéticos em sistemas de
irrigação inteligente. |