Auteurs:
Barend MonsProfesseur émérite de l'Université de Leiden, membre du conseil d'administration de la fondation GO FAIR et directeur de LIFES, l'Initiative de Leiden pour une science juste et équitable
Arie BaakMembre du conseil d'administration de LIFES Association for FAIR and Equitable Science
Koen JonkersCommission européenne, Centre commun de recherche (CCR), Bruxelles, Belgique
L'intelligence artificielle transforme la manière dont la science est menée, communiquée et validée. Elle est porteuse de véritables promesses : elle permet la reconnaissance de formes à une échelle qu'aucun chercheur humain ne peut égaler, accélère les flux de travail et ouvre de nouvelles perspectives de découverte. Cependant, l'IA est aussi rapide, non infaillible et non sélective, tandis que la science est par nature longue et méticuleuse. La tension entre ces deux réalités engendre déjà de graves dysfonctionnements : un déluge de publications et de données générées par l'IA, une dégradation de l'évaluation par les pairs, des résultats erronés et une érosion de la confiance dans les données scientifiques. Les compétences requises des futurs scientifiques évoluent fondamentalement et les politiques scientifiques n'ont pas suivi le rythme. Il est urgent de combler ce fossé.
La science est passée, à une vitesse remarquable, d'un environnement où les données étaient rares à un environnement où elles abondaient. Alors qu'autrefois les chercheurs produisaient des ensembles de données modestes et communiquaient leurs résultats principalement par le biais d'articles destinés à un public humain, ils évoluent désormais dans une ère de production exponentielle de données. Une grande partie de ces données est multidimensionnelle, distribuée et ne peut être traitée que par des machines. Or, cette tendance ne se traduit pas par une réutilisation effective des données. Pour y remédier, les données elles-mêmes doivent désormais être considérées comme un résultat scientifique à part entière, et non comme un simple sous-produit des articles.
Les machines excellent dans la détection de tendances au sein d'ensembles de données vastes et complexes. Cependant, elles ne possèdent aucun modèle conceptuel intrinsèque de la réalité pertinente pour l'humain. Il en résulte une quantité quasi illimitée de tendances, dont beaucoup sont fallacieuses, voire trompeuses. Un défi majeur pour la prochaine génération de scientifiques sera de s'orienter dans cette jungle de tendances : distinguer le signal significatif du bruit statistique. La supervision humaine n'est pas optionnelle ; elle est structurellement nécessaire.
Les décideurs politiques doivent également être conscients que l'IA en science dépasse largement le cadre des grands modèles de langage, qui dominent actuellement le débat public. Ce domaine plus vaste inclut l'apprentissage automatique pour la génération d'hypothèses, les flux de travail expérimentaux automatisés et le raisonnement basé sur les graphes de connaissances, chacun présentant des risques et des opportunités spécifiques qui nécessitent des réponses de gouvernance adaptées.
La qualité des résultats de l'IA en science est directement déterminée par la qualité des données. contributionLes données FAIR (faciles à trouver, accessibles, interopérables et réutilisables, et de plus en plus souvent comprises comme étant pleinement compatibles avec l'IA) constituent le prérequis fondamental d'une science responsable pilotée par l'IA. Sans elles, les modèles d'IA sont entraînés sur des données brutes, non validées, potentiellement biaisées, voire fabriquées, produisant des résultats erronés qui peuvent mettre des vies en danger dans des contextes cliniques et qui sapent systématiquement la confiance dans la science. C'est particulièrement vrai lorsque la réutilisation de données facilement accessibles est principalement le fait d'acteurs non scientifiques, comme les entreprises actuelles de masters en sciences.
L'utilisation de modèles conceptuels FAIR pour encadrer l'IA est tout aussi importante. sortiesEn fournissant des cadres sémantiques structurés, où chaque concept est bien défini, ainsi que leurs relations et ce qui constitue une inférence valide, ces modèles réduisent considérablement le risque d'hallucination et contribuent à garantir que les résultats générés par l'IA restent explicables, interprétables et vérifiables par les humains.
La crise d'intégrité qui frappe les publications scientifiques aggrave ces risques. Les systèmes d'IA peuvent désormais générer des articles, des données et des revues d'apparence plausible presque instantanément. Une conférence majeure sur l'IA a reçu plus de 20 000 soumissions rien qu'en 2025. La réponse adoptée (des scientifiques utilisant l'IA pour évaluer des articles générés par l'IA) risque de créer un cercle vicieux où des systèmes défectueux s'évaluent mutuellement sans contrôle externe significatif. La publication de données conformes aux principes FAIR à la source, où leur provenance peut être vérifiée, figure parmi les outils les plus efficaces pour contrer cette tendance.
Ce problème sous-tend tout cela par une défaillance structurelle du système d'incitations. Les chercheurs sont encore majoritairement récompensés en fonction du nombre de publications et du taux de citations, un indicateur conçu pour une époque où les données sont rares. La publication de données FAIR de haute qualité n'apporte que peu de reconnaissance professionnelle et n'offre aucune garantie de financement. Cela doit changer.
Le paysage de la gouvernance technique des données scientifiques est en crise. Des décennies de dépendance à l'égard d'un petit nombre de grands fournisseurs de services cloud, conjuguées à des instruments juridiques tels que le Cloud Act américain, ont engendré un problème de souveraineté des données aujourd'hui aigu, notamment au vu de l'instabilité politique récente aux États-Unis et de ses répercussions sur les infrastructures de recherche partagées à l'échelle internationale. De nombreuses ressources de données scientifiques essentielles au monde échappent de fait au contrôle juridictionnel des institutions et des communautés qui les ont produites.
Les principes FAIR, complétés par les principes CARE (qui prennent en compte les droits et intérêts des peuples autochtones en matière de gouvernance des données), offrent un cadre cohérent pour une gestion responsable. Ensemble, ils définissent les conditions d'ouverture ou de restriction des données, de leur réutilisabilité et de leur souveraineté. Le concept d'Internet des données et services FAIR (IFDS), où les données restent à leur source et sont consultées par des algorithmes autorisés plutôt que copiées et centralisées, propose une solution architecturale concrète. Dans ce modèle, les requêtes informatiques sont acheminées vers des nœuds de données distribués ; les données ne sont transférées vers des référentiels centralisés qu'en cas de nécessité absolue.
Une participation équitable à la science pilotée par l'IA exige également que cette infrastructure soit véritablement accessible. Les institutions et les communautés des pays du Sud ne peuvent être de simples victimes passives de la réutilisation des données. À l'autre extrémité du spectre de la connectivité, les industries à forte intensité de données ne doivent pas être exclues. Une infrastructure FAIR distribuée, conçue pour éviter la dépendance vis-à-vis d'un fournisseur unique et les points de défaillance uniques, est le mécanisme qui rend possible une participation significative.
Une réponse politique cohérente exige une action sur plusieurs fronts :
La science est un bien public mondial. Son intégrité, son équité et son ouverture ne vont pas de soi ; elles exigent des choix politiques délibérés. L’occasion d’instaurer une gouvernance saine de l’IA dans la production scientifique est encore possible, mais elle ne le restera pas indéfiniment. Les décisions prises aujourd’hui concernant les normes de données, les infrastructures, les incitations et le contrôle détermineront si l’IA favorise une science fiable ou si elle la compromet systématiquement.
Photo par Getty Images pour Unsplash+
Hébergé en partenariat par le Conseil international des sciences (ISC) et Frontiers Policy Labs, ce blog fait partie d'un « Une nouvelle gouvernance pour la science au XXIe siècle »» Cette série se veut un forum de discussion dynamique pour les experts en matière d'avenir de la gouvernance scientifique. S'éloignant des études académiques rigides, cette initiative rassemble des personnalités internationales de premier plan afin de proposer des articles d'opinion incisifs, stimulants, étayés par des données probantes et tournés vers l'avenir. Ce faisant, elle souhaite contribuer à définir un modèle de gouvernance résilient, inclusif et transparent, capable de relever les défis de demain.
Voir le message original ici.
Clause de non-responsabilité
Les informations, opinions et recommandations présentées dans nos blogs invités sont celles des contributeurs individuels et ne reflètent pas nécessairement les valeurs et les convictions du Conseil international des sciences.