Estudantes de medicina vs chatbots na resolução de um teste médico: um estudo comparativo

DSpace Repository

A- A A+

Estudantes de medicina vs chatbots na resolução de um teste médico: um estudo comparativo

Show full item record

Title: Estudantes de medicina vs chatbots na resolução de um teste médico: um estudo comparativo
Author: La Maison, Douglas Augusto Pasqual
Abstract: INTRODUÇÃO: A educação médica é avaliada globalmente por Exames Nacionais de Licenciamento Médico e Testes de Progresso. Recentemente, a inteligência artificial generativa (GAI), incluindo Large Language Models (LLMs) e chatbots, mostrou potencial como ferramenta de suporte na educação médica, ao passo que estudos indicaram que seu desempenho é comparável ao de estudantes de medicina em exames. OBJETIVO: Avaliar a efetividade de diferentes chatbots de LLM na resolução de questões do Teste de Progresso NAPISUL-II, comparando seu desempenho com o de estudantes do último semestre de medicina, com vista à aplicabilidade pedagógica de LLMs no ensino médico. MÉTODO: Foram utilizados dados do Teste de Progresso NAPISUL-II de 2023, aplicados em estudantes de medicina do Sul do Brasil. Quatro chatbots (ChatGPT 3.5, ChatGPT 4.0, Bing AI e Bard) responderam três vezes ao teste. As respostas foram comparadas com as dos estudantes do último semestre do curso, de acordo com as áreas médicas inerentes ao TP e categorias de raciocínio definidas pelos autores. A análise dos dados foi descritiva, utilizando taxas de acerto para comparar os grupos. RESULTADO: Os chatbots tiveram uma média de 80,81% de acertos em 116 questões, enquanto os estudantes de medicina obtiveram uma média de 62%. O Bing AI teve a melhor performance, com 87,35% de acertos, seguido pelo ChatGPT 4.0 com 85,86%. Em áreas específicas, o ChatGPT 4.0 destacou-se em clínica cirúrgica (88,33%) e clínica médica (86,67%), enquanto o Bing AI teve o melhor desempenho entre os chatbots em ciências básicas (94,44%), ginecologia e obstetrícia (94,74%), saúde coletiva (83,33%) e pediatria (82,46%). O Bard, apesar de apresentar a maior amplitude de variação entre as áreas, e o ChatGPT 3.5, inferior aos outros chatbots, também superaram os estudantes em todas as categorias. CONCLUSÃO: Todos os chatbots estudados tiveram um desempenho superior aos estudantes de medicina do décimo segundo semestre do bloco NAPISUL-II no Teste de Progresso. O Bing destacou-se com o melhor desempenho entre os chatbots, seguido pelo Chat GPT-4. Isso indica que os chatbots tem potencial de ser uma ferramenta auxiliar na educação médica, embora sejam necessários mais estudos para avaliar as possibilidades dessa ferramenta nesse contexto.
Description: TCC (graduação) - Universidade Federal de Santa Catarina, Centro de Ciências da Saúde, Medicina.
URI: https://repositorio.ufsc.br/handle/123456789/269551
Date: 2025-07-02


Files in this item

Files Size Format View Description
TCC.pdf 995.1Kb PDF View/Open TCC

This item appears in the following Collection(s)

Show full item record

Search DSpace


Browse

My Account

Statistics

Compartilhar