|
Abstract:
|
INTRODUÇÃO: A educação médica é avaliada globalmente por Exames Nacionais de
Licenciamento Médico e Testes de Progresso. Recentemente, a inteligência artificial generativa
(GAI), incluindo Large Language Models (LLMs) e chatbots, mostrou potencial como ferramenta de
suporte na educação médica, ao passo que estudos indicaram que seu desempenho é comparável
ao de estudantes de medicina em exames. OBJETIVO: Avaliar a efetividade de diferentes chatbots
de LLM na resolução de questões do Teste de Progresso NAPISUL-II, comparando seu
desempenho com o de estudantes do último semestre de medicina, com vista à aplicabilidade
pedagógica de LLMs no ensino médico. MÉTODO: Foram utilizados dados do Teste de Progresso
NAPISUL-II de 2023, aplicados em estudantes de medicina do Sul do Brasil. Quatro chatbots
(ChatGPT 3.5, ChatGPT 4.0, Bing AI e Bard) responderam três vezes ao teste. As respostas foram
comparadas com as dos estudantes do último semestre do curso, de acordo com as áreas médicas
inerentes ao TP e categorias de raciocínio definidas pelos autores. A análise dos dados foi
descritiva, utilizando taxas de acerto para comparar os grupos. RESULTADO: Os chatbots tiveram
uma média de 80,81% de acertos em 116 questões, enquanto os estudantes de medicina obtiveram
uma média de 62%. O Bing AI teve a melhor performance, com 87,35% de acertos, seguido pelo
ChatGPT 4.0 com 85,86%. Em áreas específicas, o ChatGPT 4.0 destacou-se em clínica cirúrgica
(88,33%) e clínica médica (86,67%), enquanto o Bing AI teve o melhor desempenho entre os
chatbots em ciências básicas (94,44%), ginecologia e obstetrícia (94,74%), saúde coletiva (83,33%)
e pediatria (82,46%). O Bard, apesar de apresentar a maior amplitude de variação entre as áreas,
e o ChatGPT 3.5, inferior aos outros chatbots, também superaram os estudantes em todas as
categorias. CONCLUSÃO: Todos os chatbots estudados tiveram um desempenho superior aos
estudantes de medicina do décimo segundo semestre do bloco NAPISUL-II no Teste de Progresso.
O Bing destacou-se com o melhor desempenho entre os chatbots, seguido pelo Chat GPT-4. Isso
indica que os chatbots tem potencial de ser uma ferramenta auxiliar na educação médica, embora
sejam necessários mais estudos para avaliar as possibilidades dessa ferramenta nesse contexto. |