|
Abstract:
|
O controle e a transparência nos gastos públicos exigem mecanismos eficazes para
a identificação de sobrepreços em licitações. Para viabilizar essa análise em larga
escala, é necessário um meio de agrupar registros de compras. O código GTIN (Global Trade Item Number), emitido pela organização GS1 e presente nas Notas Fiscais
Eletrônicas (NF-e) de licitações, cumpriria esse papel, no entanto, o campo está frequentemente ausente ou incorretamente preenchido. Este trabalho, desenvolvido no
âmbito do Projeto Céos, iniciativa de pesquisa entre a Universidade Federal de Santa
Catarina (UFSC) e o Ministério Público de Santa Catarina (MPSC), propõe um método
computacional para a validação e alocação automática desse código, estruturado em
três etapas. Na primeira etapa, avaliaram-se diferentes abordagens de Processamento
de Linguagem Natural (PLN) para classificar se um par de descrições textuais com
mesmo GTIN, uma proveniente da NF-e e outra da base oficial da GS1, refere-se ao
mesmo produto. Na segunda etapa, implementou-se um pipeline de busca com o Apache Solr para o preenchimento do código usando a abordagem escolhida na primeira
etapa . Por fim, na terceira etapa, desenvolveu-se um método de agrupamento de produtos equivalentes na base da GS1, expandindo a classificação de pares equivalentes
para formar grupos de produtos, com o objetivo de encontrar GTINs equivalentes. Para
isso, fez-se uso do algorítmo Locality-Sensitive Hashing (LSH) junto do MinHash para
validação dos pares e a formação dos grupos finais se dá por componentes conexas
dos pares equivalentes encontrados. Para a tarefa de validação o método baseado
na similaridade de Jaccard sobre trigramas teve o melhor resultado, alcançando F0.5
score de 0.916. Já a solução de preenchimento foi avaliada sobre 1104 notas fiscais
sem GTIN, tendo uma taxa de acerto de 95.97%. Os resultados demonstram a viabilidade do método proposto em automatizar a identificação e agrupamento de produtos
em compras públicas. |