¿Puede la inteligencia artificial sustituir las búsquedas de una revisión sistemática?

¿Puede la inteligencia artificial sustituir las búsquedas de una revisión sistemática?

Las plataformas basadas en inteligencia artificial permiten formular una pregunta de investigación en lenguaje natural y obtener, en pocos segundos, una selección de artículos aparentemente relevantes. Herramientas como Elicit, SciSpace o Scite pueden resultar atractivas para quienes realizan revisiones sistemáticas: son sencillas, rápidas y no requieren construir estrategias de búsqueda complejas. Pero ¿recuperan realmente toda la evidencia necesaria?

Un estudio publicado en Clinical and Translational Allergy ha evaluado hasta qué punto estas plataformas pueden utilizarse para localizar los estudios primarios de una síntesis de evidencia. Sus resultados muestran que pueden ser útiles como apoyo, pero también que todavía no deberían sustituir las búsquedas en bases de datos bibliográficas, registros de ensayos y otras fuentes de literatura gris.

 

¿Cómo se evaluaron las plataformas?

Los autores estudiaron tres plataformas especializadas en la identificación de publicaciones científicas: Elicit, SciSpace y Scite. En noviembre de 2024 formularon distintas consultas para localizar ensayos clínicos y revisiones sistemáticas sobre tratamientos para la rinitis alérgica.

El principal caso de estudio partió de una revisión sistemática previamente finalizada, utilizada para elaborar las recomendaciones ARIA-EAACI. Esta revisión había incluido 32 ensayos clínicos sobre mometasona frente a placebo:

  • 21 artículos completos con DOI;
  • un artículo sin DOI;
  • un resumen de congreso;
  • nueve ensayos no publicados como artículos, pero con resultados disponibles en registros de ensayos clínicos.

Esta colección previa permitió comprobar cuántos de los estudios ya conocidos podían ser recuperados mediante las plataformas de inteligencia artificial.

Los autores no se limitaron a preguntar directamente por ensayos clínicos. También buscaron revisiones sistemáticas sobre la misma pregunta y examinaron sus referencias mediante CitationChaser. Además, compararon diferentes formulaciones de las consultas, repitieron las búsquedas un mes después y aplicaron el procedimiento a otros tres casos de estudio.

 

Un resultado aparentemente bueno, pero incompleto

La estrategia que combinó las tres plataformas y la búsqueda tanto de ensayos como de revisiones sistemáticas recuperó 18 de los 32 ensayos elegibles. Esto representa solamente el 56,3 % de toda la evidencia incluida en la revisión original.

Sin embargo, si se consideran exclusivamente los artículos completos con DOI, la recuperación alcanzó el 85,7 %. Esta diferencia es fundamental para interpretar el estudio.

Las plataformas localizaron una proporción elevada de los estudios publicados como artículos convencionales, pero no encontraron ninguno de los ensayos que solo estaban disponibles en registros, resúmenes de congresos u otros formatos sin DOI. Por tanto, su buen rendimiento aparente dependía en gran medida de qué se consideraba el conjunto de referencia.

Este resultado recuerda que una búsqueda sistemática no pretende localizar únicamente los artículos más accesibles. También debe intentar identificar estudios no publicados o difíciles de encontrar, precisamente porque su exclusión puede introducir sesgo de publicación o de difusión.

 

¿Importa perder tantos estudios?

En este caso concreto, los metaanálisis realizados únicamente con los ensayos encontrados por las plataformas produjeron estimaciones puntuales parecidas a las de la revisión original. No obstante, incluyeron menos estudios, presentaron mayor imprecisión y, para algún desenlace, una heterogeneidad considerablemente superior.

La similitud entre las estimaciones no demuestra que las búsquedas incompletas sean seguras. Es posible perder estudios sin que cambie sustancialmente un resultado determinado, pero también que la omisión de uno o dos estudios modifique de forma importante la estimación, especialmente cuando la evidencia disponible es escasa.

Tampoco puede asumirse que los estudios no publicados sean intercambiables con los publicados. Si la probabilidad de publicación está relacionada con la dirección o la magnitud de los resultados, su ausencia puede producir una visión distorsionada de los efectos.

El rendimiento también dependió del diseño estudiado. En otro caso de estudio, las plataformas solo identificaron 17 de los 48 estudios observacionales elegibles. Los trabajos recuperados tendían a ser más antiguos y a expresar de manera más explícita en el título o el resumen la asociación investigada. Esto sugiere que determinadas características de redacción e indexación pueden influir en qué evidencia resulta visible para estas herramientas.

 

¿Para qué pueden ser útiles?

El estudio identifica varias funciones razonables para estas plataformas:

  • localizar artículos clave con los que comprobar una estrategia bibliográfica;
  • complementar, pero no reemplazar, las búsquedas convencionales;
  • identificar revisiones sistemáticas relevantes y explorar sus referencias;
  • realizar comprobaciones rápidas en revisiones vivas para valorar si podría ser necesario actualizar una búsqueda.

Los autores proponen, además, un marco metodológico y una lista de comprobación para documentar su uso. Recomiendan especificar las plataformas consultadas, las fechas, las preguntas o prompts, el número de resultados examinados, los criterios de parada y las estrategias complementarias empleadas. Estas decisiones deberían establecerse en el protocolo, no improvisarse después de observar los resultados.

 

Una fotografía que envejece rápidamente

El estudio tiene una limitación inevitable: las plataformas fueron evaluadas principalmente en noviembre de 2024. Sus algoritmos, fuentes documentales y funcionalidades pueden haber cambiado desde entonces. Por ello, los resultados no deberían interpretarse como una clasificación actual de Elicit, SciSpace y Scite.

Lo más duradero del trabajo no es qué herramienta obtuvo mejor rendimiento, sino cómo deben evaluarse estas tecnologías. No basta con comprobar si recuperan algunos artículos importantes o si el metaanálisis resultante se parece al original. Es necesario estudiar su sensibilidad frente a un conjunto de referencia adecuado, su capacidad para recuperar literatura gris, la reproducibilidad de sus resultados y las consecuencias de los estudios omitidos.

La conclusión, por ahora, es clara: la inteligencia artificial puede convertirse en una ayuda valiosa para buscar evidencia, pero rapidez no equivale a exhaustividad. En una revisión sistemática, estas plataformas pueden ampliar y facilitar el proceso; todavía no pueden sustituirlo.

 

Referencia: Sousa-Pinto B, Bognanni A, Jemioło P, et al. Use of Artificial Intelligence-Based Platforms to Support Searches in Evidence Synthesis Studies: A Study of the EAACI Methodology Committee. Clinical and Translational Allergy. 2026;16. https://doi.org/10.1002/clt2.70202