英国、医療AIの適合性とバイアス評価プラットフォームを開発
英国の研究者たちは、NHS(国民保健サービス)向けに開発されたAIアルゴリズムが目的に適合しているか、またバイアスがないかをテストできるプラットフォームを開発しました。このプラットフォームは、企業がAIをNHSで使用させる際にデータにバイアスを導入するリスクを克服することを目的としています。
糖尿病性眼疾患検出AIの評価
初期段階として、このプラットフォームは8種類のAIが「公平、衡平、透明、信頼できる方法」で糖尿病性眼疾患を検出できるかを評価するために使用されました。評価には、北東ロンドン糖尿病眼スクリーニングプログラムから得られた、20万人以上のスクリーニング訪問による120万枚の網膜画像が活用されました。評価されたAIの性能は、独立した研究者からなる信頼できる研究環境で、NHSの標準プロトコルに従って最大3人の人間が分析した画像と比較されました。
評価結果と精度
その結果、8つのAIアルゴリズムすべてがテストに合格しました。臨床的介入が必要な可能性のある糖尿病性眼疾患を特定する際の精度は、AIアルゴリズム全体で83.7%から98.7%の間でした。これは、人間の手動評価による過去の研究で示された精度(75%から98%)と同等かそれ以上の水準です。
研究の意義と今後の展望
研究チームは、このアプローチが「視力に影響を及ぼす糖尿病性眼疾患を検出するAIシステムの、世界初となる公平、衡平、透明な評価」を提供すると述べています。彼らは、大規模なデータセットを使用し、異なる民族や年齢層にわたってAIが良好に機能することを示すことで、これらのAIシステムがNHSでの使用に安全であることを証明しました。本研究は、英国で400万人以上の糖尿病患者が定期的な眼科検診を必要とする中で、AIシステムの大量展開前にベンチマークを行う方法を示しています。このアプローチは、がんや心臓病といった他の慢性疾患に対するAI評価にも応用できると提案されています。
元記事:Platform tests commercial algorithms for NHS use for bias