Desde diciembre de 2025 construyo, con ayuda de agentes de inteligencia artificial, dos aplicaciones de salud para el embarazo y la paternidad, Eira y Tyr, y una consola para profesionales que las acompaña. El criterio lo conté en la primera pieza de este blog: fuente actualizada, oficial y cruzable, y si no hay fuente, no entra. Lo que no conté entonces, porque todavía no me había pasado, es lo que ocurre cuando la fuente sí está, es la correcta, aparece bien escrita al pie, y aun así el dato que la acompaña no es suyo.

Esto es la crónica de ese incidente, con las cifras reales del repositorio, y de lo que he aprendido después buscando cuánto de esto es culpa de la IA y cuánto es un vicio viejo de la literatura científica que la IA solo ha acelerado. Adelanto la respuesta: casi todo es viejo. Lo nuevo es la velocidad y el acabado.

Una tabla que parecía perfecta

El encargo era pequeño. La consola profesional necesitaba una tarjeta de referencia rápida de eficacia anticonceptiva: el Índice de Pearl, la cifra que le dice a una matrona cuántos embarazos por cada cien mujeres-año cabe esperar con cada método, en uso típico y en uso perfecto. La fuente estándar es conocida: la revisión de James Trussell de 2011 en Contraception, que actualiza las probabilidades de fallo en el primer año para todos los métodos disponibles en Estados Unidos y distingue entre uso típico (incluye el uso incorrecto e inconstante) y uso perfecto (correcto y constante)1. Es la tabla que reproducen, entre otros, los CDC en el apéndice de eficacia de sus recomendaciones de planificación familiar2.

El agente que hizo el trabajo entregó la tarjeta con quince métodos, cada uno con sus dos cifras, y al pie la cita completa: «Trussell J. Contraceptive failure in the United States. Contraception. 2011;83(5):397-404». Formato Vancouver impecable, volumen, número y páginas correctos, PMID correcto. Nada que objetar a simple vista.

Y ahí está el problema con «a simple vista»: una cita correcta no dice nada sobre si los números que la acompañan son los que esa cita respalda. Puede ser la referencia exacta, en el formato exacto, y estar pegada a datos que vienen de otro sitio.

La regla que la paró antes de producción

En este proyecto no se publica nada que toque una decisión clínica sin que un segundo proceso, independiente del primero, intente refutarlo. No es un trámite de calidad ni una frase bonita de la documentación: es una regla operativa fija, con su gate y su acta. Antes de que cualquier tabla, fórmula o umbral se dé por bueno, alguien, o algo con instrucciones explícitas, tiene que ir a la fuente primaria y comparar, número por número, lo que dice el código contra lo que dice el documento.

Ese segundo proceso hizo justo eso. Abrió el artículo de Trussell, extrajo la Tabla 1 (la de verdad, no un resumen de segunda mano) y la puso al lado de la tarjeta que se iba a publicar. La revisión la suspendió: le puso un 6 sobre 10, y en este proyecto nada llega a producción por debajo de un 7. La tarjeta no salió.

Preservativo masculino, uso típico: la tarjeta decía 13 %. El artículo de Trussell dice 18 %.

Siete números, una cita, dos tablas

El resultado de la comparación fue más incómodo de lo que esperaba. De los quince métodos, ocho coincidían exactamente: el DIU de cobre, el DIU hormonal, el implante, las dos esterilizaciones, el preservativo femenino, los métodos de conciencia de la fertilidad y el grupo «ningún método». Pero siete no. La píldora y el parche o anillo decían 7 % en uso típico donde Trussell dice 9 %1. El preservativo masculino, 13 % donde dice 18 %. La inyección de medroxiprogesterona, 4 % donde dice 6 %. La marcha atrás, 20 % donde dice 22 %. Los espermicidas, 21 % y 16 % donde dice 28 % y 18 %. Y el diafragma, que era el caso serio: 17 % y 16 % donde el artículo dice 12 % y 6 %.

Gráfica 01 · Misma cita, dos tablas

Embarazos por cada 100 mujeres en el primer año de uso típico: lo que decía la tarjeta frente a lo que dice Trussell 2011

Píldora · parche · anillo 9 7 Preservativo masculino 18 13 Diafragma 12 17 Inyección (DMPA) 6 4 Marcha atrás 22 20 Espermicidas 28 21
Trussell 2011, Tabla 1 (la fuente citada) La tarjeta = Trussell y Aiken 2018

Uso típico, primer año. Valores de 2011 leídos en la Tabla 1 del artículo1; valores de la tarjeta según el acta del incidente del proyecto, que coinciden uno a uno con la edición de 2018 de Contraceptive Technology3 tal como la reproduce el manual de la OMS4. Píldora, parche y anillo comparten cifra en ambas tablas.

El diafragma en uso perfecto es el que me quitó el sueño: la tarjeta decía un 16 % de fallo; el artículo citado dice un 6 %. Una profesional que usara esa tarjeta para explicarle a una paciente la eficacia real del método le habría dado una cifra 2,7 veces peor de la que dice la fuente que tenía impresa debajo, y lo habría hecho de buena fe, porque la referencia era la buena.

De dónde salieron: el mismo autor, siete años después

Cuando redacté el acta del incidente, en julio, escribí que los siete números «no salían de la nada» y apunté una hipótesis: que el 13 % del preservativo coincidía con la estimación de Sundaram y colaboradores de 2017 sobre la Encuesta Nacional de Crecimiento Familiar de 2006-2010, que da un 12,6 % para el preservativo, un 7,2 % para la píldora, un 4 % para la inyección y un 19,9 % para la marcha atrás5. Encajaba con cuatro de los siete. Pero Sundaram no publica cifra alguna para el diafragma ni para los espermicidas, así que dejé la hipótesis como lo que era: razonable y no verificada.

Al preparar esta versión he ido a cerrarla, y el origen resulta ser más limpio y más incómodo a la vez. Los siete valores de la tarjeta, incluidos el 17 y el 16 del diafragma y el 21 y el 16 de los espermicidas, son exactamente los de la tabla de Trussell y Aiken en la 21.ª edición de Contraceptive Technology, de 20183, que es la que hoy reproduce, con esa misma atribución al pie, el apéndice de eficacia del manual de planificación familiar de la OMS y la Universidad Johns Hopkins4. No eran números equivocados. Eran los números actualizados del mismo autor, con la cita antigua debajo.

Ni siquiera eso del todo. Porque los otros ocho valores de la tarjeta sí eran de 2011, y en al menos dos de ellos las tablas difieren: el implante pasa de 0,05 % a 0,1 % y el DIU hormonal, en uso típico, de 0,2 % a 0,7 %14. La tarjeta era una mezcla de dos ediciones con una sola cita. Y las dos ediciones circulan a la vez con la firma de Trussell: los CDC mantienen en línea su tabla con los datos de 2011 (píldora 9 %, preservativo 18 %)2 mientras la OMS distribuye la de 2018 (7 % y 13 %)4. Turner ha documentado, para los métodos de conciencia de la fertilidad, cómo esa convivencia de cifras heredadas de estudios históricos acaba perpetuando valores inexactos en guías, literatura y dominio público6.

Las dos tablas son verdad. La tarjeta no lo era.

Esto tiene nombre y es más viejo que la IA

A esto lo llamamos, dentro del proyecto, deriva de cita: el número cambia de fuente en algún paso intermedio de la redacción, pero la referencia no se actualiza con él. Es un fallo traicionero porque no se parece a un error. Se parece a una tabla bien hecha. La cita es real, el formato es correcto, el artículo existe y dice lo que promete su título. Lo único que falla es la casilla en la que se cruzan la fila y la columna.

Es tentador pensar que esto es cosa de la inteligencia artificial generativa. No lo es. Jergas y Baethge metaanalizaron en 2015 veintiocho estudios sobre la exactitud de las citas en revistas médicas y estimaron que el 25,4 % de las citas contienen algún error, un 11,9 % de ellos graves: la fuente no dice lo que se le atribuye7. Mogull recalculó la tasa en 2017 con un método más conservador, sobre quince estudios, y bajó al 14,5 %; pero de esos errores de contenido el 64,8 % eran mayores, es decir, la fuente citada no respalda la afirmación, no tiene relación con ella o la contradice8. En enfermería no estamos mejor: Oermann y Ziolkowski revisaron 244 referencias de tres revistas de cuidados críticos y encontraron errores en el 22,9 %, y eso solo mirando la forma de la cita, sin entrar en si el dato era el suyo9.

25,4 %
Citas con algún error en revistas médicas (metaanálisis de 28 estudios)7
64,8 %
De los errores de contenido, los que la fuente no respalda o contradice8
22,9 %
Referencias con errores en tres revistas de enfermería de cuidados críticos9
≈ 20 %
Citantes que, según el modelo de Simkin y Roychowdhury, leyeron el original10

Hay un dato que explica el mecanismo mejor que cualquier porcentaje. Simkin y Roychowdhury, dos físicos de la UCLA, estudiaron en 2003 cómo se propagan las erratas dentro de las citas (el mismo error tipográfico repetido de artículo en artículo) y construyeron un modelo estocástico del proceso de citar. Su estimación: solo alrededor del 20 % de quienes citan un artículo lo han leído; el resto copia la referencia de otro que la citaba10. Greenberg demostró en el BMJ lo que pasa cuando esa cadena de copias se convierte en red: analizó 242 artículos y 675 citas sobre una única afirmación biomédica y encontró 220.553 rutas de cita que la sostenían, con sesgo contra los trabajos que la refutaban, amplificación por artículos sin datos propios e «invención», la conversión de una hipótesis en hecho por el mero acto de citarla11. Lo llamó autoridad infundada. Es un buen nombre para una tarjeta con quince métodos y una cita al pie.

Por eso las recomendaciones del ICMJE, las que siguen las revistas médicas serias, piden a los autores citar directamente las fuentes originales siempre que sea posible, evitar citar resúmenes y comprobar que ninguna referencia apunta a un artículo retractado12. Nada de eso es nuevo. Lo nuevo es quién redacta.

Lo que la IA cambia: la velocidad y la buena pinta

Cuando los modelos de lenguaje empezaron a usarse para redactar textos médicos, la primera alarma fue la invención de referencias. Bhattacharyya y colaboradores pidieron a ChatGPT-3.5, en 2023, treinta artículos médicos breves con sus referencias: de 115 citas, el 47 % eran fabricadas y solo el 7 % eran auténticas y exactas; el PMID era incorrecto en el 93 % de los textos13. Walters y Wilder compararon en el mismo año 636 citas generadas por dos versiones del modelo: el 55 % de las de GPT-3.5 no existían, frente al 18 % de las de GPT-414. Chelli y colaboradores midieron en 2024 la «alucinación» de referencias al pedir revisiones sistemáticas: 39,6 % en GPT-3.5, 28,6 % en GPT-4 y 91,4 % en Bard15.

Gráfica 02 · Referencias que no existen

Porcentaje de referencias fabricadas o «alucinadas» por modelos de lenguaje en tres estudios (2023-2024)

47 % 55 % 18 % 39,6 % 28,6 % 91,4 % GPT-3.5 GPT-3.5 GPT-4 GPT-3.5 GPT-4 BARD Bhattacharyya 2023 115 citas Walters y Wilder 2023 636 citas Chelli et al. 2024 471 citas · revisiones sistemáticas
Modelos de 2022-2023 (GPT-3.5) GPT-4 Bard

Bhattacharyya: referencias fabricadas13. Walters y Wilder: citas inexistentes14. Chelli: «alucinadas», definidas como dos o más datos erróneos entre título, primer autor y año15. Las definiciones no son idénticas entre estudios; el gráfico muestra la magnitud, no una comparación directa.

Esas cifras describen modelos de 2023 y han mejorado mucho desde entonces; en una auditoría interna de 126 citas de Tyr, este verano, ninguna era inventada, aunque una de cada siete llevaba el autor equivocado (lo contaré con detalle en otra pieza). Pero el número que a mí me interesa de esos estudios no es el de las fabricadas. Es el otro: en el trabajo de Bhattacharyya, el 46 % de las referencias eran auténticas pero inexactas13, y en el de Walters y Wilder, entre las citas reales, el 43 % de las de GPT-3.5 y el 24 % de las de GPT-4 contenían errores sustantivos14. Ese es exactamente mi caso. La referencia inventada se caza con una búsqueda en PubMed. La referencia real con el dato de otra edición solo se caza abriendo el artículo y mirando la casilla.

Lo que sí cambia con la IA es la velocidad y el acabado. Un agente genera quince filas de una tabla en segundos, con la misma seguridad tipográfica tenga razón o no. La confianza visual del resultado, bien formateado, con su cita, con su PMID, no dice nada sobre si es correcto. Por eso la verificación no puede ser «¿tiene buena pinta?». Tiene que ser «¿coincide con el documento original, número por número?».

Otros dos casos del mismo cajón

Desde julio he ido guardando los incidentes de la misma familia, porque una vez que sabes lo que buscas los encuentras. Dos ejemplos, ya corregidos, que muestran la variedad del fallo.

El primero es un umbral. En la pantalla del GAD-7 de Eira, el cuestionario breve de ansiedad, aparecía la frase «con una puntuación ≥7 en embarazo, coméntalo con tu profesional», y el comentario del test que la protegía atribuía ese corte a Spitzer 2006. Spitzer y colaboradores validaron el GAD-7 en 2.740 pacientes de atención primaria y el corte que optimiza sensibilidad (89 %) y especificidad (82 %) es ≥10; ese artículo no contiene ningún ≥7 ni menciona el embarazo16. El ≥7 existe y es defendible, pero es de Zhong y colaboradores, que en 2015 validaron la versión en español del GAD-7 en 946 gestantes peruanas con entrevista diagnóstica y obtuvieron, maximizando el índice de Youden, ese corte con una sensibilidad del 73,3 % y una especificidad del 67,3 %17. La cifra era buena. La firma, no. Y la firma importa, porque quien lea «Spitzer» esperará el 89/82 de la población general y no el 73/67 de un cribado en gestantes.

El segundo es un identificador. Durante meses, decenas de fichas de ejercicio en el embarazo citaron el Committee Opinion 804 del Colegio Americano de Obstetras y Ginecólogos, que es la referencia correcta18, con el PMID 34623087. Ese PMID existe, se titula igual, y es la fe de erratas del documento: una página de octubre de 2021 sin autores19. Un verificador anterior había puesto la marca de «comprobado» porque el título empezaba igual. La cita era, otra vez, perfecta a simple vista.

Tabla 01 · Tres formas de la misma deriva

Lo que decía la cita, lo que decía el dato y dónde estaba la casilla que fallaba

CasoLa cita decíaEl dato era deQué fallaba
Índice de PearlTrussell 20111Trussell y Aiken 2018 en 7 de 15 métodos34El número: mismo autor, otra edición, mezcla de dos tablas
GAD-7 ≥7 en embarazoSpitzer 200616Zhong 2015, 946 gestantes17La firma: el corte existe, pero en otro estudio y otra población
ACOG CO 804PMID 34623087Es la fe de erratas del artículo19; el artículo es el PMID 3221798018El identificador: título idéntico, documento distinto

Tres incidentes reales del mismo proyecto, corregidos contra el documento primario y registrados en las actas de auditoría del repositorio. En ninguno la referencia era inventada.

Cinco reglas de producto, ninguna abstracta

De este episodio, y de los que vinieron después, salen reglas concretas que ya están escritas en el proyecto y que aplico también a lo que publico aquí:

  1. Ninguna cifra clínica se publica con una sola pasada. Necesita una segunda revisión hecha por un proceso distinto del que la generó, cuyo único trabajo sea intentar tumbarla.
  2. La segunda revisión va a la fuente primaria, no a un resumen ni a una cita de segunda mano. «Parece razonable» no es un criterio cuando hablamos de eficacia anticonceptiva o de cualquier dato que una paciente vaya a usar para decidir.
  3. Cita correcta y dato correcto son dos verificaciones distintas, y hay que hacer las dos. ¿Existe esta fuente y dice lo que dice el título? Y, por separado: ¿el número que le hemos puesto al lado es el que esa fuente respalda, exactamente ese, no uno parecido de otra edición?
  4. Se verifica por afirmación, no por referencia. Una lista de referencias «comprobadas» no protege nada si lo comprobado fue que el título coincidía. La marca de verificado la lleva la frase, no la cita.
  5. El error se corrige contra el primario y se dice en voz alta. Hoy la calculadora de la consola usa la tabla de 2018, la que reproduce la OMS en su manual de 20224, cotejada método a método contra la imagen original del apéndice y con su cita completa al pie. De paso dejó de llamarse Índice de Pearl: lo que da Trussell es la proporción de mujeres que se quedan embarazadas en el primer año de uso, y así lo dice ahora. Donde la fuente no da cifra, la calculadora escribe «sin dato en la fuente» en vez de inventarla. El dato y la cita se cambiaron a la vez, que es lo único que no se hizo la primera vez.
La velocidad de generación de un asistente de IA no es la velocidad de publicación. Puede haber minutos entre generar y verificar. Nunca cero.

Cómo valido: a mano, dato a dato

Hay algo que este caso no cuenta y que conviene decir claro. Toda la validación de Eira y de Tyr la hago yo, a mano, comprobando dato a dato. Los agentes de inteligencia artificial me ayudan a otra cosa: los lanzo para fabricar cientos de supuestos —usuarias con ciclos irregulares, embarazos de riesgo, datos que faltan, datos que se contradicen— y ver cómo responde la app antes de que nada llegue a producción. Después leo lo que sale, lo cotejo contra la guía o el artículo original y decido. Eso son muchas horas. Pruebas, y pruebas, y más pruebas.

No concibo un lanzamiento sin revisión personal y sin múltiples rondas de testeo. Es en esas miles de pruebas y en las cientos de veces que vuelvo a cotejar la misma tabla donde aparecen los fallos. El de esta pieza y todos los pequeños que no salen en ningún artículo —una cifra mal redondeada, un umbral de otra guía, una cita con el autor cambiado— los he cazado así: lanzando yo las pruebas, leyendo yo los resultados y comprobando yo cada dato contra su fuente. Y cada uno ha quedado escrito en la memoria del proyecto: qué estaba mal, de dónde salía y qué se cambió.

La IA agiliza los testeos. La visión, la supervisión humana y el cotejo constante de los datos no los sustituye nada.

Somos personas y tratamos con personas. La inteligencia artificial es una herramienta que acelera el trabajo, pero siempre tiene que estar probada y supervisada, igual que cualquier otra herramienta que entra en una consulta. Por eso ninguna de las dos apps ha salido todavía al mundo.

Estado actual · septiembre de 2026 Eira y Tyr están en fase alfa técnica cerrada: se distribuyen solo por la pista de pruebas internas de Google Play y todavía no están abiertas a betatesters. Ahora mismo se están probando la sincronización por Bluetooth entre las dos apps y el buzón cifrado de extremo a extremo con AES-256. Antes de abrirlas, espero poder someterlas a la valoración del comité de bioética del Colegio Oficial de Enfermería de Valencia.

Una cita correcta es media promesa

No cuento esto para presumir de que «funcionó el sistema», aunque en este caso funcionó. Lo cuento porque es la prueba más honesta que tengo de por qué la verificación adversarial no es un lujo de proyectos grandes ni un capricho de perfeccionista. Es la diferencia entre una herramienta que ayuda a una matrona a explicar bien la eficacia de un método y una que la desinforma con la fuente correcta impresa al pie, como si eso bastara. Y es la misma diferencia que hay, en una planta, entre la compañera que comprueba la dosis contra la prescripción y la que la comprueba contra lo que pone en la etiqueta que escribió otra.

Tampoco lo cuento como un fallo de la inteligencia artificial. Los estudios de arriba llevan dos décadas midiendo el mismo vicio en textos escritos por personas con prisa, y el 20 % de Simkin es anterior a cualquier modelo de lenguaje. La IA no ha inventado la deriva de cita. La ha hecho más rápida, más barata y mucho mejor maquetada.

Una cita correcta no es una promesa. Es, como mucho, media promesa: dice que el documento existe y que alguien lo miró en algún momento. La otra mitad, que el número que ves es el número que ese documento respalda, solo la garantiza comprobarlo, casilla a casilla, contra el original. En salud digital esa segunda mitad no es opcional. En este blog, tampoco: cada superíndice de esta pieza se ha abierto hoy. Si encuentras uno que no cuadra, dímelo.