|
Abstract:
|
A Lei de Acesso à Informação (Lei nº 12.527/2011) e a Lei de Responsabilidade Fiscal (LC nº 101/2000) exigem que prefeituras e câmaras municipais divulguem ativamente, em seus portais da transparência, um conjunto extenso de informações orçamentárias, fiscais e administrativas. Em municípios de pequeno e médio porte, a verificação manual da conformidade desses portais é lenta e sujeita a erros, dado o grande número de itens a checar frente à heterogeneidade técnica dos sites. Este trabalho tem como objetivo o desenvolvimento de um sistema automatizado para verificação da conformidade dos portais de transparência de municípios de Santa Catarina, combinando web scraping, um banco de dados relacional estruturado e um pipeline de Retrieval-Augmented Generation (RAG) apoiado em modelos de linguagem (LLMs), com foco no desenvolvimento do back-end da solução.
Metodologicamente, foi projetado um banco de dados em PostgreSQL para armazenar municípios, URLs de coleta, conteúdo extraído e o checklist de conformidade, com 100 perguntas para prefeituras e 89 para câmaras, cada uma vinculada ao respectivo embasamento jurídico. Um coletor automatizado, implementado com a biblioteca crawl4ai, navega pelos portais por busca em largura, extraindo o conteúdo textual e armazenando-o no banco. O módulo verificador segmenta esse conteúdo em trechos, gera embeddings com o modelo bge-m3 via Ollama, recupera os trechos mais relevantes para cada pergunta do checklist e os submete a um modelo de linguagem (Qwen), instruído a classificar cada item como Sim, Não ou Inconclusivo com base exclusivamente no conteúdo recuperado. Um módulo de comparação cruza essas respostas com avaliações manuais previamente registradas.
Os resultados obtidos até o momento, para quatro municípios (Blumenau, Joinville, São José e Ouro), totalizam 286 perguntas comparáveis, das quais 57 (19,9%) tiveram resposta coincidente entre a avaliação automatizada e a manual. Observou-se alta precisão quando o sistema classifica um item como conforme (cerca de 82,6%), porém baixo recall (cerca de 27,8%), já que o modelo tende a responder Inconclusivo sem evidência suficientemente clara, nunca classificando um item como não conforme nos casos analisados.
Conclui-se que a abordagem é promissora como ferramenta de triagem inicial para priorizar a revisão manual de portais e itens, embora ainda não substitua integralmente a avaliação humana. Como próximos passos, pretende-se refinar a segmentação do conteúdo coletado, avaliar bases vetoriais dedicadas para a recuperação e ajustar os parâmetros do modelo para reduzir a taxa de respostas inconclusivas. |