Regístrate

El impacto de los datos y la IA en la producción científica

Una perspectiva política sobre cómo los datos FAIR y la gobernanza de la IA pueden mantener la fiabilidad de la producción científica.

Autores:

Retrato de Barend Mons

monseñor barendProfesor emérito de la Universidad de Leiden, miembro del consejo de administración de la fundación GO FAIR y director de LIFES, la Iniciativa de Leiden para la Ciencia Justa y Equitativa.

Retrato de Arie Baak

Arie BaakMiembro de la junta directiva de LIFES Association for FAIR and Equitable science

Retrato de Koen Jonkers

Koen JonkersComisión Europea, Centro Común de Investigación (JRC), Bruselas, Bélgica

La inteligencia artificial está transformando la forma en que se lleva a cabo, se comunica y se valida la ciencia. Ofrece un gran potencial, permitiendo el reconocimiento de patrones a escalas inalcanzables para cualquier investigador humano, acelerando los flujos de trabajo y abriendo nuevas vías de descubrimiento. Sin embargo, la IA también es rápida, no está exenta de errores y es indiscriminada, mientras que la ciencia, por naturaleza, requiere mucho tiempo y es meticulosa. La tensión entre estas dos realidades ya está generando graves disfunciones: una avalancha de publicaciones y datos generados por IA, una revisión por pares degradada, hallazgos ilusorios y una pérdida de confianza en el registro científico. Las habilidades que se exigen a los científicos del futuro están cambiando radicalmente y la política científica no se ha adaptado a este ritmo. Abordar esta brecha es urgente.

La IA está transformando la forma en que se hace ciencia.

La ciencia ha pasado de un entorno con escasez de datos a uno con abundancia de ellos a una velocidad asombrosa. Donde antes los investigadores generaban conjuntos de datos modestos y comunicaban sus hallazgos principalmente a través de artículos legibles por humanos, ahora operan en una era de generación exponencial de datos. Gran parte de ellos son de alta dimensionalidad, distribuidos y solo procesables por máquinas. Sin embargo, esta tendencia no se refleja en la reutilización real de los datos. Para cambiar esto, los datos en sí mismos deben ser tratados como un resultado científico de primer orden, no como un subproducto de los artículos.

Las máquinas sobresalen en la detección de patrones en conjuntos de datos grandes y complejos. Sin embargo, carecen de un modelo conceptual inherente de la realidad humana. El resultado es una fuente casi ilimitada de patrones, muchos de ellos espurios y algunos engañosos. Un desafío fundamental para la próxima generación de científicos será desenvolverse en esta maraña de patrones: distinguir la información relevante del ruido estadístico. La supervisión humana no es opcional; es estructuralmente necesaria.

Los responsables políticos también deben tener en cuenta que la IA en la ciencia va mucho más allá de los grandes modelos lingüísticos, que actualmente dominan el debate público. El panorama general incluye el aprendizaje automático para la generación de hipótesis, los flujos de trabajo experimentales automatizados y el razonamiento basado en grafos de conocimiento, cada uno con sus propios riesgos y oportunidades que requieren respuestas de gobernanza adaptadas.

La calidad de los datos y la infraestructura son el cuello de botella.

La calidad de los resultados de la IA en la ciencia está directamente determinada por la calidad de los datos. Las opciones de entradaLos datos FAIR (Localizables, Accesibles, Interoperables y Reutilizables, y cada vez más conocidos como Totalmente Preparados para la IA) son el requisito fundamental para una ciencia responsable basada en IA. Sin ellos, los modelos de IA se entrenan con contenido bruto, sin procesar, potencialmente sesgado o incluso fabricado, lo que produce alucinaciones que pueden ser potencialmente mortales en contextos clínicos y que socavan sistemáticamente la confianza en la ciencia. Especialmente cuando la reutilización de datos fácilmente localizables la realizan principalmente actores ajenos al ámbito científico, como las empresas LLM actuales.

Igualmente importante es el uso de modelos conceptuales FAIR para limitar la IA. salidasAl proporcionar marcos semánticos estructurados, donde cada concepto está bien definido, se explica cómo se relacionan y qué se considera una inferencia válida, estos modelos reducen significativamente el riesgo de alucinaciones y ayudan a garantizar que los hallazgos generados por la IA sigan siendo explicables, interpretables y verificables por los humanos.

La crisis de integridad en la publicación científica agrava estos riesgos. Los sistemas de IA ahora pueden generar artículos, datos y revisiones de apariencia plausible casi instantáneamente. Una importante conferencia sobre IA recibió más de 20 000 propuestas solo en 2025. Esta respuesta (científicos que utilizan IA para revisar artículos generados por IA) corre el riesgo de crear un círculo vicioso en el que sistemas defectuosos se evalúan entre sí sin una verificación externa significativa. Los datos FAIR publicados en la fuente, donde se puede verificar su procedencia, se encuentran entre las herramientas más sólidas disponibles para contrarrestar esta tendencia.

Detrás de todo esto subyace una falla estructural en los incentivos. Los investigadores aún son recompensados ​​principalmente por la cantidad de artículos y las tasas de citación, una métrica diseñada para una era de escasez de datos. Publicar datos FAIR de alta calidad conlleva poco reconocimiento profesional y no garantiza financiación. Esto debe cambiar.

Las deficiencias en la gobernanza son graves.

El panorama de la gobernanza técnica de datos en la ciencia se encuentra en crisis. Décadas de dependencia de un pequeño número de grandes proveedores de servicios en la nube, sumadas a instrumentos legales como la Ley de la Nube de EE. UU., han generado un problema de soberanía de datos que ahora es acuciante, especialmente a la luz de la reciente inestabilidad política de EE. UU. y sus efectos en la infraestructura de investigación compartida internacionalmente. Muchos de los recursos de datos científicos fundamentales del mundo se encuentran, en la práctica, fuera del control jurisdiccional de las instituciones y comunidades que los generaron.

Los Principios FAIR, complementados por los Principios CARE (que abordan los derechos e intereses de los pueblos indígenas en la gobernanza de datos), proporcionan un marco coherente para una gestión responsable. Juntos, definen las condiciones bajo las cuales los datos deben ser abiertos o restringidos, reutilizables y soberanos. El concepto de una Internet de Datos y Servicios FAIR (IFDS), en la que los datos permanecen en su origen y son consultados por algoritmos autorizados en lugar de ser copiados y centralizados, ofrece una respuesta arquitectónica práctica. En este modelo, las consultas computacionales se dirigen a nodos de datos distribuidos; los datos no se envían a repositorios centralizados a menos que sea inevitable.

La participación equitativa en la ciencia impulsada por la IA también requiere que esta infraestructura sea verdaderamente accesible. Las instituciones y comunidades del Sur Global no pueden ser sujetos pasivos de la reutilización de datos. En el otro extremo del espectro de conectividad, la industria intensiva en datos no debe quedar excluida. La infraestructura FAIR distribuida, diseñada para evitar la dependencia de un único proveedor y los puntos únicos de fallo, es el mecanismo que posibilita una participación significativa.

Qué deberían hacer los responsables políticos

Una respuesta política coherente requiere acciones en varios frentes:

  • Exigir el cumplimiento de los estándares de datos FAIR en la investigación financiada con fondos públicos. Los organismos financiadores deberían exigir que la publicación de datos FAIR sea una condición para la concesión de subvenciones, no una recomendación.
  • Financiar la publicación de datos y la aplicación de los principios FAIR como gastos subvencionables. Es necesario reconocer y cubrir la inversión requerida para generar datos de alta calidad que puedan ser procesados ​​por máquinas.
  • Incluir la reutilización de datos generados previamente y la infraestructura de apoyo como costos de investigación elegibles en las propuestas de subvención.Es necesario reconocer y cubrir la inversión requerida para almacenar y proporcionar datos de alta calidad que puedan ser procesados ​​por máquinas.
  • Apoye los estándares basados ​​en la comunidad en lugar de las soluciones impulsadas por los proveedores. Una infraestructura abierta e interoperable, basada en estándares compartidos mínimos, evita la dependencia de un único proveedor y garantiza la igualdad de condiciones.
  • Invierta en alfabetización científica. Además de los científicos, los ciudadanos, los periodistas y los responsables políticos también necesitan comprender las capacidades y limitaciones de la IA. La brecha entre la percepción pública y la realidad técnica representa un riesgo para la gobernanza.
  • Exigir requisitos de procedencia y transparencia para la IA utilizada en la investigación. Cualquier sistema de IA que contribuya a la publicación de hallazgos científicos debería estar obligado a revelar la procedencia de los datos de entrenamiento, así como las restricciones y limitaciones del modelo.

La ciencia es un bien público global. Su integridad, equidad y transparencia no pueden darse por sentadas; requieren decisiones políticas activas. La oportunidad para establecer una gobernanza sólida de la IA en la producción científica está abierta, pero no lo estará indefinidamente. Las decisiones que se tomen ahora sobre estándares de datos, infraestructura, incentivos y supervisión determinarán si la IA acelera la ciencia confiable o la socava sistemáticamente.


Foto de Getty Images para Desaparecer+

Este blog, alojado en colaboración entre el Consejo Internacional de la Ciencia (ISC) y Frontiers Policy Labs, forma parte de un proyecto conjunto. 'Una nueva gobernanza para la ciencia en el siglo XXI'" Esta serie sirve como un foro de debate dinámico para el liderazgo intelectual sobre el futuro de la gobernanza científica. Alejándose de los estudios académicos rígidos, la iniciativa reúne a destacadas voces globales para ofrecer artículos de opinión incisivos, provocadores, basados ​​en evidencia y con visión de futuro. De este modo, busca contribuir a definir un modelo de gobernanza resiliente, inclusivo y transparente, preparado para los desafíos del mañana.

Ver la publicación original aquí.

Renuncia de responsabilidad:
La información, las opiniones y las recomendaciones presentadas en nuestros blogs de invitados son responsabilidad de los colaboradores individuales y no reflejan necesariamente los valores y creencias del Consejo Internacional de la Ciencia.

Manténgase al día con nuestros boletines