著者:
バーレント・モンズライデン大学名誉教授、GO FAIR財団理事、ライデン大学の公正かつ公平な科学のためのイニシアチブであるLIFESのディレクター
アリー・バークLIFES(公正かつ公平な科学のための協会)の理事
コーエン・ヨンカース欧州委員会共同研究センター(JRC)、ベルギー、ブリュッセル
人工知能(AI)は、科学の実施方法、情報伝達方法、検証方法を根本的に変革しつつあります。AIは、人間の研究者には到底及ばない規模のパターン認識を可能にし、ワークフローを加速させ、新たな発見の道を開くなど、真に大きな可能性を秘めています。しかし、AIは高速である反面、エラーがなく、無差別である一方、科学は本来、時間と労力を要する綿密な研究です。この二つの現実の間の緊張関係は、すでに深刻な機能不全を引き起こしています。AIが生成した論文やデータの氾濫、査読の質の低下、誤った発見、そして科学的記録に対する信頼の失墜などがその例です。未来の科学者に求められるスキルセットは根本的に変化しており、科学政策はそれに追いついていません。このギャップへの対応は喫緊の課題です。
科学は、データが乏しい環境からデータが豊富な環境へと、驚くべき速さで移行してきた。かつて研究者は、小規模なデータセットを作成し、主に人間が読める論文を通して研究成果を伝えていたが、今や指数関数的にデータが生成される時代に生きている。その多くは高次元で分散しており、機械でしか処理できない。しかし、この傾向は実際のデータ再利用には反映されていない。この状況を変えるには、データ自体を論文の副産物ではなく、第一級の科学的成果物として扱う必要がある。
機械は大規模で複雑なデータセットからパターンを見つけることに長けている。しかし、機械には人間にとって意味のある現実の概念モデルが本質的に備わっていない。その結果、多くの偽りのパターンや誤解を招くパターンを含む、ほぼ無限のパターンが生み出される。次世代の科学者にとっての中心的な課題は、このパターンのジャングルをどう切り抜けるか、つまり、統計的なノイズから意味のあるシグナルを区別することである。人間の監視は選択肢ではなく、構造的に不可欠なものとなる。
政策立案者は、科学分野におけるAIは、現在世論を席巻している大規模言語モデルにとどまらないことを認識しておくべきである。より広範な領域には、仮説生成のための機械学習、自動化された実験ワークフロー、知識グラフに基づく推論などが含まれ、それぞれに特有のリスクと機会が存在するため、個別のガバナンス対応が必要となる。
科学におけるAIの出力の質は、データの質によって直接的に左右される。 FAIRデータ(検索可能、アクセス可能、相互運用可能、再利用可能であり、ますます完全なAI対応として理解されている)は、責任あるAI主導型科学の基礎となる前提条件です。これがなければ、AIモデルは未加工でキュレーションされていない、潜在的に偏りのある、あるいは捏造されたコンテンツでトレーニングされ、臨床現場では生命を脅かす可能性のある幻覚を生み出し、科学への信頼を体系的に損なうことになります。特に、容易に検索可能なデータの再利用が、現在のLLM企業のような非科学系の主体によって行われている場合はなおさらです。
同様に重要なのは、FAIR概念モデルを使用してAIを制約することである。 outputs各概念が明確に定義され、それらの関係性や妥当な推論が何であるかが明確に示された構造化された意味論的フレームワークを提供することで、これらのモデルは幻覚のリスクを大幅に軽減し、AIが生成した結果が人間によって説明可能、解釈可能、検証可能であることを保証するのに役立ちます。
科学出版における信頼性の危機は、これらのリスクをさらに悪化させています。AIシステムは、もっともらしい論文、データ、レビューをほぼ瞬時に生成できるようになりました。ある主要なAI学会では、2025年だけで2万件を超える投稿が寄せられました。これに対する対応策(科学者がAIを使ってAI生成論文をレビューする)は、欠陥のあるシステムが意味のある外部チェックなしに互いを評価する、閉じたノイズフィードバックループを生み出すリスクがあります。出所が検証可能なソースで公開されるFAIRデータは、この傾向に対抗するための最も強力なツールの1つです。
こうした状況の根底には、インセンティブ制度の構造的な欠陥がある。研究者は依然として論文数と引用率で主に評価されているが、これはデータが不足している時代のために設計された指標だ。質の高いFAIRデータを公開しても、専門家からの評価はほとんど得られず、研究資金の確保も保証されない。この状況は変えなければならない。
科学分野におけるデータの技術的ガバナンスの状況は危機に瀕している。数十年にわたる少数の大手クラウドプロバイダーへの依存と、米国クラウド法などの法的手段が相まって、データ主権の問題が生じており、特に近年の米国の政策の不安定さと、それが国際的に共有される研究インフラに及ぼす影響を考慮すると、この問題は深刻化している。世界の多くの主要な科学データ資源は、事実上、それらを生成した機関やコミュニティの管轄権の及ばないところにある。
FAIR原則は、CARE原則(データガバナンスにおける先住民の権利と利益を扱う原則)によって補完され、責任あるデータ管理のための首尾一貫した枠組みを提供する。これら2つの原則は、データがオープンであるべきか制限されるべきか、再利用可能であるべきか、主権を持つべきかといった条件を定義する。データがコピーされて中央集権化されるのではなく、ソースに留まり、承認されたアルゴリズムによってアクセスされるという、FAIRデータとサービスのインターネット(IFDS)の概念は、実用的なアーキテクチャ上の解決策を提供する。このモデルでは、計算クエリは分散データノードに渡され、データはやむを得ない場合を除き、中央集権型リポジトリには送られない。
AIを活用した科学への公平な参加には、このインフラが真にアクセス可能であることが不可欠です。グローバル・サウスの機関やコミュニティは、データ再利用の受動的な対象であってはなりません。接続性のもう一方の極にあるデータ集約型産業も排除されるべきではありません。ベンダーロックインや単一障害点を回避するように設計された分散型FAIRインフラは、有意義な参加を可能にするメカニズムです。
一貫性のある政策対応には、複数の側面での行動が必要となる。
科学は世界的な公共財である。その健全性、公平性、そして透明性は当然のこととして期待できるものではなく、積極的な政策選択によって確保される。科学研究におけるAIの健全なガバナンスを確立するための機会は今まさに開かれているが、それは永遠に続くものではない。データ標準、インフラ、インセンティブ、そして監視体制に関して今下される決定が、AIが信頼できる科学を加速させるのか、それとも体系的に損なうのかを決定づけるだろう。
写真提供:ゲッティイメージズ アンスプラッシュ+
国際科学会議(ISC)とフロンティアーズ・ポリシー・ラボの提携により運営されているこのブログは、 21世紀における科学のための新たなガバナンス' 本シリーズは、科学ガバナンスの未来に関する思想的リーダーシップのための活発な議論の場として機能します。硬直的な学術研究から脱却し、本イニシアチブは世界をリードする専門家を集め、鋭く刺激的でありながらも証拠に基づいた、未来を見据えた意見記事を提供します。そうすることで、明日の課題に対応できる、強靭で包括的かつ透明性の高いガバナンスモデルの構築に貢献することを目指しています。
元の投稿を見る こちら.
免責事項
ゲストブログに掲載されている情報、意見、提言は、個々の寄稿者のものであり、必ずしも国際科学会議の価値観や信念を反映するものではありません。