|
Abstract:
|
Propõe o desenvolvimento e a validação de um protótipo de sistema, denominado
SelectorWatch, capaz de detectar automaticamente falhas em seletores de web scrapers e
sugerir correções com o apoio de modelos de linguagem de grande escala (LLMs). Web
scrapers são programas amplamente utilizados para coleta automatizada de dados na Web,
porém enfrentam o problema recorrente da fragilidade de seletores, que deixam de funcionar quando os sites alvo alteram suas estruturas HTML. A manutenção manual desses seletores é um processo lento, custoso e repetitivo. O sistema proposto é composto por três módulos de negócio integrados (monitoramento contínuo, diagnóstico e comparação de snapshots HTML, e sugestão de novos seletores via LLM) e dois componentes de infraestrutura (dashboard web e scheduler), combinando técnicas de recuperação de informação com inteligência artificial generativa. A pesquisa se insere no campo da Ciência da Informação ao abordar processos de coleta, organização e recuperação de dados na Web, e emprega metodologia de pesquisa aplicada, de natureza descritiva, com abordagem quantitativa. A avaliação do protótipo é
conduzida por meio de quatro métricas: taxa de detecção de falhas, precisão das sugestões
geradas pelo LLM, taxa de auto-recuperação e tempo médio de recuperação. Espera-se que o protótipo contribua para a automação da manutenção de pipelines de coleta de dados e para o avanço do conhecimento sobre a aplicação de LLMs na recuperação de informação. |