Benchmarking de modelos de linguagem na classificação de código humano versus gerado por inteligência artificial

DSpace Repository

A- A A+

Benchmarking de modelos de linguagem na classificação de código humano versus gerado por inteligência artificial

Show full item record

Title: Benchmarking de modelos de linguagem na classificação de código humano versus gerado por inteligência artificial
Author: Scheffel, Maria Clara Seixa
Abstract: O uso crescente de ferramentas de IA generativa no ensino de programação levanta questões sobre a autoria de código produzido por estudantes e o impacto des- sas ferramentas no desenvolvimento do pensamento lógico. Nesse contexto, surge o problema de identificar automaticamente se um trecho de código foi escrito por um humano ou gerado por IA. A detecção precisa dessa autoria é relevante para professores que precisam avaliar o aprendizado genuíno dos alunos. Neste artigo apresenta-se uma avaliação do desempenho de LLMs na tarefa de classificação de autoria de código-fonte, comparando código humano e AIGC. A metodologia adotada envolve conjuntos de dados rotulados, estratégias de engenharia de prompt zero-shot e Chain-of-Thought, e avaliação por métricas de acurácia, precisão, recall e F1-score, com estratificação por linguagem, tamanho e complexidade do código.The growing use of generative AI tools in programming education raises questions about the authorship of student-produced code and the impact of these to- ols on the development of logical thinking. In this context, the problem of automatically identifying whether a code snippet was written by a human or generated by AI be- comes relevant. Accurate authorship detection is important for instructors who need to assess genuine student learning. This work presents an evaluation of the perfor- mance of Large Language Models in the source code authorship classification task, comparing human-written code and AI-Generated Code. The methodology involves labeled datasets, zero-shot and Chain-of-Thought prompt engineering strategies, and evaluation using accuracy, precision, recall, and F1-score metrics, with stratification by programming language, snippet size, and code complexity.
Description: TCC (graduação) - Universidade Federal de Santa Catarina, Campus Joinville, Ciência e Tecnologia.
URI: https://repositorio.ufsc.br/handle/123456789/273845
Date: 2026-06-18


Files in this item

Files Size Format View Description
tcc_maria_clara_seixa_scheffel.pdf 1.187Mb PDF View/Open TCC

This item appears in the following Collection(s)

Show full item record

Search DSpace


Browse

My Account

Statistics

Compartilhar