García Fernández te pone al día

'Deep learning' en el diagnóstico con ecocardiografía de prolapso mitral

'Deep learning' en el diagnóstico con ecocardiografía de prolapso mitral
  • Título original: A Deep Learning Model to Identify Mitral Valve Prolapse From the Echocardiogram
  • Revista: JACC: cardiovascular imaging
  • Fecha publicación: Octubre 2025
  • Enlace al trabajo: Visitar sitio
  • Calificación: Cultura de imagen


👨🏻‍🎓 La opinión de García Fernández

Idea-faro

Diagnosticar automáticamente el prolapso mitral a partir de análisis vídeos de ecocardiografía con un modelo de IA.

Parece que la IA diagnostica con alta precisión y además obtiene un score que se relaciona con mayor probabilidad con la presencia insuficiencia mitral (IM) moderada-severa y mayor riesgo de intervención mitral futura… bufff, surgen muchas preguntas.

🤨


📒 Resumen del trabajo

Contexto clínico

El prolapso es frecuente (≈2–3%) y, aunque muchas veces es benigno, en subgrupos se asocia a insuficiencia cardiaca y muerte súbita. La ecocardiografía transtorácica es la herramienta estándar, pero su lectura requiere tiempo y experiencia (según dicen los autores y yo añado... ¡como todo!), con variabilidad entre observadores.

En este marco, un sistema automatizado podría aportar rapidez y estandarización, y funcionar como cribado a gran escala, especialmente útil fuera del laboratorio experto... según sugieren los autores.


Métodos y población

El modelo se entrena y valida con una base grandísima del Massachusetts General Hospital (MGH): 1.043.893 vídeos, 48.829 estudios y 16.902 pacientes de cardiología. Luego se valida externamente en atención primaria del MGH (8.888 pacientes) y del Brigham and Women’s Hospital (BWH, 257 pacientes). Además del rendimiento diagnóstico, se estudia si el “score” del modelo se asocia con la severidad de la IM y con la necesidad futura de reparación o recambio valvular mitral.


Resultados e interpretación

En la cohorte de derivación (61 ± 16 años; 38% mujeres), la prevalencia fue 4,6%. El rendimiento fue excelente y consistente: AUROC 0,947 en validación interna de cardiología del MGH, 0,964 en atención primaria del MGH y 0,968 en atención primaria del BWH; la precisión media (AP) también fue adecuada pese a prevalencias bajas. Más allá de detectar prolapso, la presencia de un score alto (>0,67) frente a bajo (<0,33) se asoció a IM moderada/severa (OR ajustada 2,0) y a mayor riesgo de MVR futura (HR ajustada 3,7), sugiriendo que el modelo capta un fenotipo de MVP con mayor relevancia clínica.

Mi crítica “potente” a este trabajo os la resumo:

  • El modelo parece muy bueno detectando un patrón visual, pero el estudio deja abiertas varias dudas clave sobre qué está aprendiendo realmente, cuánto de ese rendimiento es generalizable y, sobre todo, si aporta un valor clínico incremental.
  • El talón de Aquiles es el “gold standard” (etiquetado). En el prolapso “la etiqueta” no es trivial, depende de criterios (desplazamiento, plano de referencia, calidad del corte, fenotipos (Barlow, fibroelástico) y coexistencia de IM. Si el “diagnóstico” usado para entrenar proviene de informes clínicos rutinarios o de codificación, existe un riesgo alto de ruido y heterogeneidad. El modelo puede estar aprendiendo “lo que el sistema llama prolapso” más que un verdadero prolapso anatómico estrictamente definido.
  • Hoy por hoy, no es oro todo lo que reluce en la IA… Puede ser excelente detectando “prolapsos claros con ecos de libro” que es justo lo que ya detectamos con facilidad, pero podria ser menos fiable en lo difícil: prolapsos ligeros, criterios limítes, mala ventanas, fenotipos atípicos.
  • La asociación del score con IM moderada-severa y con cirugía mitral suena lógica… pero también es sospechosa. Es muy probable que el modelo utilice signos de IM (jet, dilatación auricular, cambios hemodinámicos secundarios) como proxy del MVP. Si ocurre, el algoritmo no estaría detectando MVP “per se”, sino un fenotipo de IM que, en la práctica, suele acompañar a MVP significativo. Esto explicaría también por qué el score predice intervención. La cirugía la decide la IM y su impacto, no el hecho de “tener MVP” aislado.
  • Necesitaríamos un ensayo prospectivo en laboratorios diversos, con criterios de prolapso adjudicados de forma central y evaluación de impacto clínico.

Concluyendo: despacio, despacio con la aplicación directa de la IA... el diagnóstico de prolapso es sencillo cuando es claro (al contrario de lo que se dice para justificar la idea) y, cuando no es claro, veremos que aporta la IA… Cosa que no explica este trabajo.