全体平均では、見えない差がある
AI研究者でAlgorithmic Justice League創設者のJoy Buolamwini氏は、AIシステムは予期せぬ形で失敗することがあるため、 継続的に確認し続ける必要があると指摘しています。
彼女が行ったGender Shades研究では、商用の顔分析システムを属性別に検証すると、 明るい肌の男性ではほぼ誤りがない一方、暗い肌の女性では最悪の場合3割を超える失敗が確認されました。 全体平均だけを見ていては気づけない差が、集団を分けて評価することで初めて表面化したのです。
野球のAIも、平均値だけでは選手を守れない
これは野球でAIを使う場面でも同じことが言えます。投手と野手、右投げと左投げ、 高校生と社会人、故障歴のある選手とない選手、測定回数の多い選手と少ない選手で、予測の精度は本当に同じでしょうか。
球数や疲労から故障リスクを算出するモデルが、もし復帰直後の投手だけを外し続けているとしたら、 全体の的中率がどれだけ高くても、現場では危険な状態です。
全体の正解率が高いことと、
誰も見落とさないことは、別の話。
確かめる順番
この順番で確かめることで、AIの答えを「評価」としてそのまま受け取るのではなく、 「対話の材料」として扱うことができます。AIリテラシーとは、使い方の上手さだけでなく、 モデルがどの集団を見落としやすいかを疑い続ける姿勢のことでもあります。
スポーツ界でも、同様の指摘がある
スポーツ分野のパフォーマンス予測モデルでも、似た課題が指摘されています。 たとえば、成長期の選手を対象にした故障予測モデルは、体格の成長速度が個人によって大きく異なるため、 同じ年代でも「早熟型」と「晩熟型」で予測精度に差が出やすいことが知られています。
また、ポジションによってプレーの負荷パターンが根本的に異なるため、 投手向けに作られたモデルを野手にそのまま適用すると、精度が落ちるケースも報告されています。 属性ごとに異なるモデルを使うか、少なくとも属性別の精度を確認する。 この一手間が、AIを安全に使うための最低条件になります。


