14 enero 2024

Hacia una inteligencia artificial de diagnóstico conversacional

Por Julio Bonis Sanz. Médico de familia + MBA + Ingeniero de IA PLN

En el repositorio arXiv investigadores de Google han publicado hace tres días un articulo titulado: «Hacia una IA de diagnóstico conversacional» (Towards Conversational Diagnostic AI)

Diseño del estudio: en un estudio aleatorizado, doble ciego cruzado de consultas basadas en texto. Se elaboraron 149 escenarios clínicos que fueron representados por actores entrenados, al estilo de un Examen Clínico Objetivo Estructurado (ECOE). Los actores interaccionaban exclusivamente via chat de texto bien con 20 médicos de atencion primaria (10 canadienses y 10 indios) con amplio rango de experiencia (entre 3 y 30 años) bien con un modelo de lenguaje (estilo chatGPT) denominado AMIE (Articulate Medical Intelligence Explorer).

Se pidió a los médicos y a la IA elaborar un listado de los 10 diagnósticos más probables ordenados de más a menos probables. Además se evaluaron multitud de dimensiones de la entrevista clínica; desde aspectos relacionados con la empatía, presencia del diagnóstico correcto entre el listado de diagnóstico, si el tratamiento recomendado era apropiado, si las pruebas complementarias solicitadas eran apropiadas, si las derivaciones al especialista eran adecuadas, etc.

Esta evaluación se realizó mediante dos tipos de cuestionarios: unos de satisfacción validados, rellenados por los actores (para las dimensiones de empatía) y otros cuestionarios rellenados POR MEDICOS ESPECIALISTAS seleccionando la especialidad según el caso a juicio de los investigadores (ingenieros informáticos de Google) para evaluar la calidad clínica. Se media por tanto esta ultima y , pero también la calidad empática del encuentro.

Resultados: La IA obtuvo mejores resultados en todas las dimensiones (clínicas y empáticas) que los médicos de atención primaria… a juicio de médicos especialistas.

AMIE supera a los médicos de familia en varios ejes de evaluación para el diálogo diagnóstico

Conclusión: La IA puede cambiar ciertas cosas, pero hay otras que no van a cambiar. Ninguno de los investigadores (ingenieros de Silicon Valley) ni ninguno de los médicos y expertos que andan estos días discutiendo las limitaciones del estudio (que las tiene) ha caído en la cuenta de que a lo mejor el criterio de un médico especialista no es lo mejor para valorar lo que ocurre en una consulta de atención primaria. Se considera una obviedad que el juicio clínico del médico especialista es el gold standard que por pura epistemología se asume nunca se podrá superar (como mucho igualar).

Interpretación alternativa: Los resultados del estudio sugieren que la IA se comporta, en cuanto a sus decisiones clínicas, más como un especialista que como un médico de atención primaria. Esto tiene sentido pues los modelos de lenguaje están entrenados con el contenido encontrado en internet (incluido PubMed) y eso es lo que replican al generar textos.

Por tanto no sería descabellado pensar que los primeros susceptibles de ser sustituidos deberían ser los médicos especialistas y no los generalistas. Sin embargo eso tampoco lo veremos.

PD: como dato curioso se pidió a los especialistas indicasen si el «medico de familia/IA» habia producido una «alucinación» (se define como un contenido sin sentido, erróneo o inventado por un modelo de lenguaje).Según se puede ver en el artículo publicado los especialistas (que evaluaban los chats sin saber si eran generados por humanos o una IA) encontraron alucinaciones en un 10% de los casos en la IA… y en un 15% de los médicos de familia. Corolario: Conviene no ir puestos de LSD al centro de salud.

Towards Conversational Diagnostic AI

Resumen canónico : En el corazón de la medicina se encuentra el diálogo médico-paciente, en el que una hábil anamnesis allana el camino para un diagnóstico preciso, un tratamiento eficaz y una confianza duradera. Los sistemas de Inteligencia Artificial (IA) capaces de dialogo diagnóstico podrían aumentar la accesibilidad, la coherencia y la calidad de la atención. Sin embargo, aproximarse a la experiencia de los médicos es un gran reto pendiente. Presentamos AMIE (Articulate Medical Intelligence Explorer), un sistema de IA basado en un modelo de lenguaje amplio (LLM) optimizado para el diálogo diagnóstico.

AMIE utiliza un novedoso entorno simulado basado en el juego automático con mecanismos de retroalimentación automatizados para escalar el aprendizaje a través de diversas enfermedades, especialidades y contextos. Diseñamos un marco para evaluar ejes de rendimiento clínicamente significativos, como la elaboración de la historia clínica, la precisión diagnóstica, el razonamiento de gestión, las habilidades de comunicación y la empatía. Comparamos el rendimiento de los AMIE con el de los médicos de atención primaria (MAP) en un estudio aleatorizado, doble ciego cruzado de consultas basadas en texto con actores pacientes validados al estilo de un Examen Clínico Objetivo Estructurado (ECOE). El estudio incluyó 149 escenarios de casos clínicos de profesionales de Canadá, el Reino Unido y la India, 20 MAPs para comparar con AMIE y evaluaciones por parte de médicos especialistas y los actores que actuaban como pacientes.

AMIE demostró una mayor precisión diagnóstica y un rendimiento superior en 28 de 32 ejes según los médicos especialistas y en 24 de 26 ejes según los pacientes actores. Nuestra investigación tiene varias limitaciones y debe interpretarse con la debida cautela. Los médicos se limitaron a un chat de texto sincrónico poco familiar que permite interacciones a gran escala entre el AMIE y el paciente, pero que no es representativo de la práctica clínica habitual. Aunque es necesario seguir investigando antes de que AMIE pueda trasladarse a entornos reales, los resultados representan un hito hacia la IA de diagnóstico conversacional.