Tag

#Benchmark

ニュース

重要度: 高 OpenAI 研究 / ベンチマーク・生命科学AI

Introducing GeneBench-Pro

2026-06-30 / 掲載更新: 2026/07/01 07:05 JST / 関連製品: GeneBench-Pro, OpenAI models

短い要約
OpenAIは、ゲノミクス、生物学、科学研究でのAI性能を測る新ベンチマークGeneBench-Proを発表しました。 複雑な実世界データセットを使い、生命科学研究タスクでのモデル能力を評価する内容です。
詳細
GeneBench-Proは、ゲノミクス、生物学、科学研究におけるAI性能を検証するための新しいベンチマークです。 公式RSSでは、複雑な実世界データセットを用いて、AIが科学研究タスクにどこまで対応できるかを評価すると説明されています。 対象は生命科学研究者、AI評価担当者、科学系AIエージェントやモデルを評価する開発者です。 製品APIの新エンドポイントではなく、モデル評価・研究発表であり、料金、提供プラン、移行期限、破壊的変更は示されていません。 実務上は、汎用ベンチマークだけでは見えにくい生命科学領域でのモデル能力を比較・検証する材料になります。
公式ソースを読む
重要度: 中 OpenAI 研究 / ベンチマーク事例

Inside Genebench-Pro

2026-06-30 / 掲載更新: 2026/07/01 07:05 JST / 関連製品: GeneBench-Pro, OpenAI models

短い要約
OpenAIはGeneBench-Proの関連ページとして、ケーススタディ集「Inside Genebench-Pro」を公開しました。 GeneBench-Proで扱う科学研究タスクや評価観点を補足する公式ページです。
詳細
公式RSSではタイトルとURLのみが示されており、GeneBench-Proのケーススタディページとして公開されています。 同日に発表されたGeneBench-Pro本体の補足資料と見られ、生命科学・ゲノミクス領域でのAI評価を具体例で示す位置づけです。 対象は、ベンチマークの中身や評価事例を確認したい研究者・開発者です。 API仕様、モデル提供条件、料金、移行期限、破壊的変更は示されていません。 実務上は、GeneBench-Proを単なるスコアではなく、どのような研究タスクで評価しているかを確認するための補助資料になります。
公式ソースを読む
重要度: 高 OpenAI 研究 / ベンチマーク / 生命科学

Introducing LifeSciBench

2026-06-17 / 掲載更新: 2026/06/18 10:57 JST / 関連製品: LifeSciBench, OpenAI models, Agentic AI systems

短い要約
OpenAIは、実際の生命科学研究ワークフローに近いAI評価ベンチマーク「LifeSciBench」を発表しました。 750件の専門家作成タスク、1,062件の添付アーティファクト、19,020件のルーブリック基準で、研究支援能力を細かく評価します。
詳細
LifeSciBenchは、AIが単なる生物学知識の回答ではなく、実際の生命科学研究タスクを支援できるかを測るベンチマークです。 タスクはPh.D.レベルの訓練とバイオテック/製薬業界経験を持つ173人の専門家が作成し、453人の専門レビュー担当者が評価しました。 750件のタスクは、エビデンス処理、分析、設計・最適化、科学的推論、検証・運用、トランスレーション、科学コミュニケーションの7ワークフローと7生物領域をカバーします。 タスクの79%は複数ステップの推論や意思決定を必要とし、53%は図、PDF、表、配列ファイル、構造/化学ファイル、Web参照など少なくとも1つの添付アーティファクトの解釈・統合を要求します。 評価は最終答えだけでなく、科学的に妥当な理由づけ、重要な caveat、運用上有用な形式まで、19,020件の詳細ルーブリックで採点します。 開発者向けAPI変更、モデル移行期限、破壊的変更はありません。生命科学向けAIエージェントや研究支援モデルの評価に関わる研究者・開発者に重要です。
公式ソースを読む