Cadernos de Saúde Pública (CSP)
O acesso a dados estruturados de prontuários eletrônicos de saúde (PES) continua sendo um grande desafio, particularmente em sistemas de saúde com recursos limitados e em idiomas diferentes do inglês. Este estudo realiza benchmarking de múltiplos grandes modelos de linguagem (LLMs) para a extração automatizada de variáveis clínicas estruturadas a partir de anotações médicas em português brasileiro em um ambiente com recursos computacionais limitados. Avaliamos cinco LLMs (GPT-4o mini, DeepSeek-V3, Mixtral-8x7B, LLaMA 8B e Qwen-32B) em relação a um conjunto de dados anotado e validado manualmente, composto por prontuários de pacientes ambulatoriais de cardiologia e infectologia. Os modelos foram implementados em versões quantizadas para otimizar a eficiência computacional. As respostas (outputs) dos modelos foram comparadas com anotações humanas utilizando F1-score, acurácia balanceada e sensibilidade (recall). Entre os modelos testados, o Qwen-32B alcançou o melhor desempenho tanto no domínio clínico da infectologia (acurácia balanceada = 0,91 [0,07]) quanto no domínio clínico da cardiologia (acurácia balanceada = 0,89 [0,07]). O desempenho dos modelos variou de acordo com a variável clínica, com melhores resultados para condições frequentemente e consistentemente documentadas (p.ex.: diabetes) e menor acurácia para variáveis complexas ou infrequentes (p.ex.: tumores). O tempo de extração variou de 0,9 a 24,2 minutos por paciente, dependendo do domínio clínico e do modelo de LLM. Esses achados indicam a viabilidade da implementação de ferramentas de processamento de linguagem natural baseadas em LLMs em cenários de saúde com recursos limitados e em idiomas diferentes do inglês. Pesquisas futuras devem avaliar modelos emergentes de grande porte e explorar domínios clínicos adicionais.
DOI
10.1590/0102-311XEN145025
Identificação
Página da publicação
Publicado por (Instituto)