OpenAI研究:生命科学AIの判断力を測るGeneBench-Pro、GPT-5.6 Solでも最高31.5%にとどまる
OpenAIは6月30日、計算生物学の難しい判断をAIエージェントに解かせる研究ベンチマークGeneBench-Proを発表しました。129問を用意し、最強モデルでもPro設定で31.5%と、人間専門家の仕事にはまだ届かない結果です。
科学研究のAI活用は進んでいますが、専門判断はまだ人間の確認が必要です。研究補助としての使い方が現実的です。
ニュースをやさしく解説
結論から言うと、生命科学の研究をAIに任せるには、まだ大きな壁があります。OpenAIは2026年6月30日、計算生物学のAIエージェント評価「GeneBench-Pro」を発表しました。これは、きれいに整ったクイズではなく、ゲノム解析、がん、薬の反応、集団遺伝など10領域・129問で、データのノイズを見抜き、分析方針を選び、結果を判断する力を測るベンチマークです。
問題は合成データで作られ、正解の因果構造が分かるため、もっともらしい説明だけでは通りません。外部の大学院生、研究者、教授らが82問を確認し、現実の研究らしさも点検しています。結果は厳しく、OpenAIのGPT-5.6 Solでも最高推論設定で28.7%、Proモードで31.5%でした。
人間の専門家なら1問に20〜40時間かかる難度だとされ、数ドルの推論費で一部を助けられる可能性はあります。私たちに関係するのは、AIが論文やデータを扱えるようになっても、専門家の確認なしに医療・研究判断を任せるのは危険だという点です。出典はOpenAIの研究発表と公開論文です。OpenAIは代表的な10問を公開し、今後は50問のサブセットを第三者評価にも提供する予定です。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。