La IA no alcanza a los médicos y enfermeras en la clasificación de pacientes, según una investigación

La Universidad de Vilnius (Lituania) ha realizado esta investigación para evaluar el nivel de la IA en clasificación de pacientes comparada con médicos y enfermeras

Lilly-Nvidia- superordenador-IA

Redacción
Los médicos y enfermeras son mejores que la inteligencia artificial (IA) en la clasificación de pacientes
en los departamentos de emergencia, según una investigación de la Universidad de Vilnius (Lituania) y presentada en el Congreso Europeo de Medicina de Emergencia, celebrado en Viena (Austria).

Sin embargo, Renata Jukneviciene, doctora e investigadora postdoctoral de la Universidad de Vilnius, no descarta la utilidad de la inteligencia artificial como ayuda para el personal clínico. No obstante, considera que no debería utilizarse como una herramienta de clasificación independiente.

«Realizamos este estudio para abordar el creciente problema de la saturación en los servicios de urgencias y la creciente carga de trabajo del personal de enfermería. Dado el rápido desarrollo de herramientas de IA como ChatGPT, nuestro objetivo era explorar si la IA podría facilitar la toma de decisiones de triaje, mejorar la eficiencia y reducir la carga del personal en urgencias«, explica la doctora Jukneviciene.

«Nuestro objetivo era explorar si la IA podría facilitar la toma de decisiones de triaje, mejorar la eficiencia y reducir la carga del personal en urgencias»

Para la investigación, se contó con seis médicos y 51 enfermeras del servicio de urgencias del Hospital Universitario Santaros Klinikos de Vilna. Su labor consistió en la clasificación de casos clínicos seleccionados de manera aleatoria de 110 informes citados en la base de datos PubMed en internet.

Los médicos y enfermeras tuvieron que clasificar a los pacientes según la urgencia, colocándolos en una de cinco categorías, de mayor a menor urgencia, utilizando el Sistema de Triaje de Manchester. Los mismos casos se analizaron con ChatGPT, en su versión 3.5. Un total de 44 enfermeras (86,3%) y seis médicos (100%) completaron el cuestionario.

En cuanto a los resultados de la investigación, la doctora destaca que «en general, la IA tuvo un rendimiento inferior al de las enfermeras y los médicos en la mayoría de las métricas que medimos. Por ejemplo, la precisión general de la IA fue del 50,4%, en comparación con el 65,5% de las enfermeras y el 70,6% de los médicos».

«La IA tuvo un rendimiento inferior al de las enfermeras y los médicos en la mayoría de las métricas que medimos, pero superó al personal de enfermería en la primera categoría de triaje»

Además, en cuanto a la precisión con la que identificó los casos verdaderamente urgentes, «la sensibilidad de la IA también fue menor, con un 58,3%, en comparación con la de las enfermeras, que obtuvieron un 73,8% y los médicos, que obtuvieron un 83%«, desarrolla Jukneviciene. Por su parte, los médicos obtuvieron puntuaciones más altas en todas las áreas y categorías de urgencia analizadas por los investigadores.

Sin embargo, la inteligencia artificial superó al personal de enfermería en la primera categoría de triaje, que se corresponde con los casos más urgentes. En este aspecto, mostró mostró mayor precisión y especificidad, lo que significa que identificó los casos verdaderamente mortales.

En cuanto a precisión, la IA obtuvo un 27,3% en comparación con el 9,3% del personal de enfermería, y en cuanto a especificidad, la IA obtuvo un 27,8% frente al 8,3%. Por ello, la doctora Jukneviciene argumenta que «estos resultados sugieren que, si bien la IA generalmente tiende a sobreclasificar, puede ser algo más cautelosa al señalar casos críticos, lo que puede ser tanto una fortaleza como una desventaja«.

Los médicos obtuvieron mejores resultados que la IA al considerar casos que requirieron cirugía, así como en casos que exigen tratamientos con medicamentos u otras terapias no invasivas. En los casos quirúrgicos, los médicos alcanzaron una fiabilidad del 68,4%, por encima de las enfermeras con un 63% y de la inteligencia artificial con un 39,5%. En los casos terapéuticos, los médicos obtuvieron una puntuación del 65,9%, las enfermeras del 44,5% y la IA obtuvo un mejor resultado, con una puntuación del 51,9% en fiabilidad.

«La IA no debería reemplazar el juicio clínico, sino que podría servir como herramienta de apoyo a la toma de decisiones en contextos clínicos específicos y en servicios de urgencias saturados»

La doctora se mostró sorprendida porque la inteligencia artificial alcanzó un rendimiento «bastante bueno» en algunas áreas. De hecho, en la categoría de triaje más urgente, demostró una mayor precisión que el personal de enfermería. «Esto indica que la IA no debería reemplazar el juicio clínico, sino que podría servir como herramienta de apoyo a la toma de decisiones en contextos clínicos específicos y en servicios de urgencias saturados», declaró Jukneviciene.

Por ello, la investigadora cree que esta herramienta puede servir para «priorizar los casos más urgentes de forma más consistente y a apoyar al personal nuevo o con menos experiencia«. Pero, por el lado contrario, «un triaje excesivo podría generar ineficiencias, por lo que una integración cuidadosa y la supervisión humana son cruciales.

Así, considera que «los hospitales deben abordar la implementación de la IA con cautela y centrarse en capacitar al personal para que interprete críticamente las sugerencias de la IA«, añade Jukneviciene.

La inteligencia artificial puede servir para «priorizar los casos más urgentes de forma más consistente y a apoyar al personal nuevo o con menos experiencia»

Tras este primer paso, los investigadores planean estudios de seguimiento con versiones más recientes de IA y modelos de IA optimizados para fines médicos. Buscarán, además, probarlos en grupos más amplios de participantes, incluir la interpretación de ECG y explorar cómo esta herramienta puede integrarse en la formación de enfermeras, especialmente para el triaje y los incidentes con gran número de víctimas.

Respecto a las limitaciones del estudio, se incluyen varios aspectos: el reducido número de participantes, la realización de un solo estudio en un solo centro y que el análisis de IA se realizó fuera de un entorno hospitalario en tiempo real, por lo que no fue posible evaluar su uso en el flujo de trabajo diario. Tampoco fue posible interactuar con los pacientes, evaluar las constantes vitales ni obtener datos de seguimiento. Además, ChatGPT 3.5 no fue entrenado específicamente para uso médico.

Por el contrario, los puntos fuertes del estudio fueron que utilizó casos clínicos reales para la comparación por parte de un grupo multidisciplinario de médicos y enfermeras, así como IA; su accesibilidad y flexibilidad se incrementaron al distribuir el cuestionario digitalmente y en papel; fue clínicamente relevante para los desafíos actuales de la atención médica, como el hacinamiento y la escasez de personal en el departamento de emergencias; y el estudio identificó que la IA sobreclasifica a muchos pacientes, asignándoles una mayor urgencia, lo que es un conocimiento crucial para la implementación segura de la IA en los departamentos de emergencias.

Podcast

Podcast

Especiales

Atención primaria

Sanidad privada

iSanidadental

Anuario

Accede a iSanidad

Buscar
Síguenos en