Cada día, miles de pacientes describen sus síntomas a un chatbot antes de llamar a su médico. La pregunta ya no es si lo hacen, sino qué fiabilidad tienen esas respuestas. Hemos revisado los estudios comparativos publicados —con casos clínicos estandarizados y escalas de triaje validadas— para responder con datos a la pregunta técnica: ¿cuál es la precisión de triaje de los distintos modelos de IA conversacional, y dónde fallan exactamente? La conclusión adelantada incomoda a los dos bandos: son mucho mejores de lo que muchos clínicos creen, y mucho menos fiables de lo que sugieren los titulares.
iMetodología y transparencia: este análisis no ejecuta pruebas propias: sintetiza estudios comparativos ya publicados y revisados por pares (JMIR, PubMed/PMC, American Journal of Emergency Medicine) que evaluaron modelos comerciales sobre casos clínicos estandarizados y conversaciones reales de urgencias, usando escalas validadas (MTS, ESI, KTAS) y el criterio de profesionales como patrón oro. Citamos cada cifra con su fuente al final. Las versiones de los modelos cambian rápido: los datos son válidos para la versión evaluada en cada estudio, no para "la IA" en abstracto.
- Con casos clínicos estandarizados (viñetas limpias), los modelos frontera aciertan el triaje en torno al 92–94 %: al nivel de médicos de atención primaria (91,3 %) y muy por encima de un lego con internet (74,1 %).
- Con conversaciones reales de urgencias, la precisión se desploma al 66–74 %. Ese hueco —la "ilusión de la viñeta"— es el hallazgo más importante de toda la literatura.
- El error dominante es el sobretriaje (mandar a urgencias lo que no lo necesita) y, más grave, el infratriaje de casos críticos: un modelo llegó a clasificar mal el 78 % de los casos de máxima urgencia.
- Las diferencias entre versiones del mismo fabricante son a veces mayores que entre fabricantes distintos: "usar IA" no significa nada; la versión concreta lo es todo.
- Conclusión práctica: hoy la IA conversacional sirve como apoyo y orientación, nunca como sustituto del triaje clínico. Y por eso el profesional verificado vale más que nunca.
¿Cómo se mide la precisión de triaje de una IA?
Se compara la clasificación de urgencia que asigna el modelo con la de profesionales entrenados, usada como patrón oro, sobre escalas validadas (Manchester, ESI o KTAS). Se miden la concordancia (kappa de Cohen), la sensibilidad y la especificidad, y sobre todo dos errores asimétricos: el sobretriaje y el infratriaje.
Entender la metodología es lo que separa este análisis de un titular. Cuatro conceptos que conviene tener claros antes de mirar cualquier cifra:
-
La escala y el patrón oro
Los estudios serios no preguntan "¿acertó?", sino "¿coincidió con el nivel que asignó el profesional?". El patrón oro es la clasificación de enfermeras o médicos de triaje sobre una escala validada: Manchester (MTS), Emergency Severity Index (ESI) o la coreana KTAS.
-
Viñeta clínica vs. conversación real
Una viñeta estandarizada es un caso escrito, ordenado y completo. Una conversación real de triaje es ambigua, incompleta y desordenada. Como veremos, el mismo modelo rinde radicalmente distinto en cada escenario — y ahí está la trampa de muchos titulares.
-
Sobretriaje e infratriaje no son el mismo error
Sobretriar (marcar como urgente lo que no lo es) satura el sistema. Infratriar (marcar como leve lo grave) puede costar una vida. Un modelo con buena precisión media pero que falla en los críticos es peor que uno mediocre pero prudente.
-
Sensibilidad, especificidad y kappa
La sensibilidad mide cuántos casos urgentes detecta; la especificidad, cuántos no urgentes descarta bien; la kappa de Cohen, cuánto concuerda con el humano más allá del azar. Un modelo puede tener sensibilidad del 90 % y especificidad del 23 %: detecta casi todo lo urgente… porque marca casi todo como urgente.
1Resultados con casos clínicos estandarizados: los modelos ya rinden como un médico
En viñetas clínicas estandarizadas, la comparativa publicada en JMIR (2024) sobre 48 casos encontró una precisión de triaje del 94 % para Claude 3.5 Sonnet, y del 92 % para GPT-4o y Gemini 1.5 Pro. En conjunto, los modelos frontera acertaron el 92,4 %: por encima de los legos con internet (74,1 %) y a la par de los médicos de primaria (91,3 %).
El salto generacional es la otra noticia: GPT-3 acertaba el 71 % del triaje —al nivel de un lego con Google— y los modelos frontera actuales rondan el 92 %. En diagnóstico, el acierto en el "top 3" de hipótesis alcanzó el 98,6 %, comparable al de los médicos (95,6 %). Y cuando los modelos "colaboraban" entre sí, la concordancia subía aún más.
2Y entonces llega el mundo real: la caída de 20 puntos
Cuando se evalúan conversaciones reales de triaje en urgencias, la precisión cae drásticamente. En un estudio con 1.057 casos reales de tres hospitales terciarios, la mejor precisión fue del 73,8 % (Gemini 2.5 Flash) y GPT-4.1 alcanzó el 70,6 %. En otro estudio prospectivo, ChatGPT logró un 66,5 % — casi igual que las enfermeras de triaje (65,2 %).
Aquí está la lección técnica que casi nadie titula: la viñeta clínica es un examen; la consulta real es la vida. El paciente que dice "me duele aquí, bueno, más bien me molesta, desde el jueves… o el miércoles" no se parece a un caso de manual. Y ahí los modelos pierden veinte puntos largos.
| Escenario | Modelo / evaluado | Precisión | Detalle relevante |
|---|---|---|---|
| Viñetas estandarizadas | Claude 3.5 Sonnet | 94 % | Mejor resultado individual del estudio JMIR (45/48 casos). |
| Viñetas estandarizadas | GPT-4o / Gemini 1.5 Pro | 92 % | 44 de 48 casos correctos cada uno. |
| Conversaciones reales (1.057 casos) | Gemini 2.5 Flash | 73,8 % | La mejor precisión del estudio; especificidad 88,9 %, VPP 94 %. |
| Conversaciones reales (1.057 casos) | GPT-4.1 | 70,6 % | Sensibilidad 81,3 % con respuesta en 1,79 s (viable en tiempo real). |
| Conversaciones reales (1.057 casos) | Gemini 2.5 Pro | Sens. 90,9 % | Alta sensibilidad… con especificidad del 23,3 %: sobretriaje masivo. |
| Urgencias, estudio prospectivo | ChatGPT Plus | 66,5 % | Enfermeras de triaje: 65,2 %. Copilot Pro: 61,8 %. |
El dato que hay que leer dos veces: en el estudio con conversaciones reales, el rendimiento varió tanto entre versiones del mismo fabricante como entre fabricantes distintos. Decir "uso IA para orientar a mis pacientes" no significa nada clínicamente: la versión concreta, el prompt y el contexto cambian el resultado por completo. Añadir unos pocos ejemplos al prompt (few-shot) mejoró la precisión de casi todos los modelos.
3Dónde fallan exactamente: el error que puede matar
El patrón de error es consistente y asimétrico: los modelos tienden al sobretriaje (marcar como urgente lo que no lo es) y, simultáneamente, subestiman los casos de máxima gravedad. Una auditoría reciente encontró que un modelo asignó el nivel de reanimación a solo el 1,6 % de los casos, cuando en la realidad eran el 16,8 %.
Los estudios sobre la escala Manchester mostraron que los modelos asignaban con demasiada frecuencia la categoría roja (máxima urgencia) — un sesgo conservador que, aunque parezca "seguro", satura el sistema y erosiona la confianza. Pero el hallazgo más inquietante es el contrario: el colapso en la clasificación de los verdaderamente críticos. En una auditoría de 2026 sobre sesgo en triaje con IA, el mejor modelo desplazó el 78 % de los casos de nivel 1 (reanimación) a nivel 2. Dicho de otro modo: acertaba "casi", y en el paciente que se está muriendo, "casi" no vale.
A esto se suman dos limitaciones estructurales. La primera, la inconsistencia: por su naturaleza probabilística, un mismo caso preguntado cuatro veces puede recibir cuatro clasificaciones distintas (por eso los estudios rigurosos repiten cada consulta varias veces). La segunda, el sesgo: hay auditorías en curso sobre cómo cambia la clasificación al alterar solo el género u otras características del paciente. Ningún sistema de triaje humano es perfecto tampoco — pero el humano responde de sus decisiones, y un modelo no.
4¿Qué significa esto para ti como profesional sanitario?
Que la IA conversacional es hoy una excelente herramienta de orientación y apoyo, y una mala sustituta del juicio clínico. Sirve para informar, ordenar dudas, redactar y acompañar; no para decidir la urgencia de un paciente. Y sirve, sobre todo, para recordarte algo: cuando todos los pacientes preguntan a una IA, el diferencial es tener detrás a alguien verificado.
Tres consecuencias prácticas, ordenadas de la más urgente a la más estratégica:
-
Tus pacientes ya lo están usando
Llegan a consulta con una hipótesis de ChatGPT bajo el brazo. Prohibirlo no funciona; educar, sí. Explícales lo que muestran estos datos: es un buen orientador general y un pésimo evaluador de gravedad, y ante un síntoma de alarma no se pregunta a un chatbot, se llama al 112.
-
Usa la IA donde su precisión sí es suficiente
Redactar, estructurar contenido, preparar material divulgativo, responder dudas administrativas o de orientación general, ahorrarte horas de escritura. Ahí el margen de error no es clínico. Reservar el juicio de gravedad para ti no es tecnofobia: es leer los datos.
-
Tu firma verificada es ahora el activo escaso
Cuanto más contenido genérico produce la IA, más valen las fuentes con un profesional identificable detrás. Los propios buscadores generativos priorizan cada vez más contenidos con autoría verificable. La respuesta al ruido de la IA no es esconderse: es firmar.
En Murisana la IA está donde debe estar: al servicio del profesional, no en su lugar. Los agentes te ayudan a escribir y publicar con tu tono y tus fuentes, y el Asistente 24/7 orienta a quien visita tu página y le agenda una cita — es un asistente de orientación y agenda, no un sistema de triaje clínico: la valoración de gravedad la haces tú. Además, cada artículo que publicas en tu perfil verificado lleva tu credencial como dato legible por máquinas: así, cuando las IAs respondan sobre tu especialidad, la fuente citada puede ser un profesional real. Tú.
Preguntas frecuentes
Fiabilidad de los chatbots médicos: dudas frecuentes
¿Qué modelo de IA es más preciso en triaje de síntomas?
Depende del escenario, y ahí está la clave. En viñetas clínicas estandarizadas, Claude 3.5 Sonnet lideró con un 94 %, seguido de GPT-4o y Gemini 1.5 Pro (92 %). En conversaciones reales de urgencias, Gemini 2.5 Flash obtuvo la mejor precisión (73,8 %) y GPT-4.1 un 70,6 %. Ningún modelo es "el mejor" en abstracto: las diferencias entre versiones del mismo fabricante llegan a ser enormes.
¿Puede una IA sustituir a la enfermera de triaje?
Hoy, no. Aunque un estudio prospectivo encontró precisiones similares (ChatGPT 66,5 % frente a 65,2 % de las enfermeras), los modelos infratrian precisamente a los pacientes más críticos y son inconsistentes entre repeticiones. La literatura los plantea como apoyo a la decisión en pacientes no críticos, siempre con supervisión profesional y responsabilidad humana.
Si un paciente me dice que ChatGPT le dijo X, ¿cómo lo manejo?
Sin ridiculizarlo: la evidencia dice que estos modelos aciertan bastante en hipótesis diagnósticas generales (hasta el 98,6 % de acierto en el "top 3" en casos estandarizados). Escucha su hipótesis, corrige lo que proceda y aprovecha para explicarle el límite real: la IA es razonable orientando y mala midiendo gravedad. Ese matiz es exactamente lo que tú aportas.
¿Estos datos seguirán siendo válidos dentro de un año?
Las cifras concretas, probablemente no: los modelos se actualizan cada pocos meses y la propia literatura advierte que un estudio puede quedar desfasado antes de publicarse. Lo que sí es estable es el patrón: gran rendimiento en casos limpios, caída en el mundo real, y fallos peligrosos en los casos críticos. Esa es la lectura que conviene retener.
Cuando la IA responde por todos, la firma verificada marca la diferencia
Ponte en la vanguardia: publica con tu credencial verificada, deja que los buscadores con IA citen a un profesional real y usa los agentes para producir más sin ceder tu criterio.
Crear mi perfil gratisComienza gratisSin tarjeta de créditoVerificación real en 24h
Fuentes: Journal of Medical Internet Research (2024), "The Triage and Diagnostic Accuracy of Frontier Large Language Models: Updated Comparison to Physician Performance" — triaje sobre 48 viñetas: Claude 3.5 Sonnet 94 % (45/48), GPT-4o 92 % (44/48), Gemini 1.5 Pro 92 % (44/48); conjunto 92,4 % (133/144) frente a legos con internet 74,1 % (3.706/5.000), médicos de primaria 91,3 % (608/666) y GPT-3 71 % (34/48); diagnóstico top-3 98,6 %. · Estudio en PMC/PubMed (2025), "Performance of ChatGPT, Gemini and DeepSeek for non-critical triage support using real-world conversations in emergency department" — 1.057 casos reales de tres hospitales terciarios, patrón oro KTAS asignado por enfermeras: Gemini 2.5 Flash 73,8 % de precisión (especificidad 88,9 %, VPP 94 %), Gemini 2.5 Pro sensibilidad 90,9 % con especificidad 23,3 %, GPT-4.1 70,6 % y 1,79 s de respuesta; mejora con few-shot; hallazgos aplicables a pacientes no críticos (KTAS 3-5). · American Journal of Emergency Medicine (2025), estudio prospectivo en urgencias: enfermeras 65,2 %, ChatGPT Plus 66,5 %, Copilot Pro 61,8 %. · JMIR (2024), "Triage Performance Across Large Language Models, ChatGPT, and Untrained Doctors in Emergency Medicine" — 124 viñetas con Manchester Triage System: GPT-4 κ=0,67 frente a médicos no entrenados κ=0,68 y GPT-3.5 κ=0,54; tendencia a asignar en exceso la categoría roja. · EQUITRIAGE (2026), auditoría de sesgo en triaje con LLM (preprint, arXiv): subrepresentación del nivel ESI-1 (1,6 % predicho frente al 16,8 % real) y desplazamiento del 78 % de los casos ESI-1 a ESI-2. Las versiones de los modelos evolucionan con rapidez; los resultados corresponden a las versiones evaluadas en cada estudio.
Aviso importante: este artículo es un análisis técnico con fines informativos y divulgativos dirigido a profesionales sanitarios. Ningún modelo de IA conversacional es un dispositivo médico ni sustituye el triaje clínico, el juicio profesional ni la atención sanitaria presencial. Si tú o alguien de tu entorno presenta síntomas de alarma, contacta con los servicios de emergencia (112 en España) o acude a un centro sanitario. Murisana no ofrece servicios de triaje clínico automatizado: sus agentes son herramientas de creación de contenido, orientación general y gestión de agenda, siempre bajo la supervisión y la responsabilidad del profesional verificado.

