Tag

#Scientific AI

ニュース

重要度: 高 OpenAI 研究 / ベンチマーク・生命科学AI

Introducing GeneBench-Pro

2026-06-30 / 掲載更新: 2026/07/01 07:05 JST / 関連製品: GeneBench-Pro, OpenAI models

短い要約
OpenAIは、ゲノミクス、生物学、科学研究でのAI性能を測る新ベンチマークGeneBench-Proを発表しました。 複雑な実世界データセットを使い、生命科学研究タスクでのモデル能力を評価する内容です。
詳細
GeneBench-Proは、ゲノミクス、生物学、科学研究におけるAI性能を検証するための新しいベンチマークです。 公式RSSでは、複雑な実世界データセットを用いて、AIが科学研究タスクにどこまで対応できるかを評価すると説明されています。 対象は生命科学研究者、AI評価担当者、科学系AIエージェントやモデルを評価する開発者です。 製品APIの新エンドポイントではなく、モデル評価・研究発表であり、料金、提供プラン、移行期限、破壊的変更は示されていません。 実務上は、汎用ベンチマークだけでは見えにくい生命科学領域でのモデル能力を比較・検証する材料になります。
公式ソースを読む
重要度: 高 OpenAI 研究 / 科学AI / 医薬化学

A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry

2026-06-17 / 掲載更新: 2026/06/18 10:57 JST / 関連製品: GPT-5.4, Maria AI and Lab, Molecule.one

短い要約
OpenAIは、GPT-5.4をMolecule.oneのMaria AI/Labに接続し、医薬化学で使われるChan-Lam coupling反応の改善を示しました。 GPT-5.4が提案したTEMPO系添加剤により、テストした基質の多くで収率が改善し、人間の化学者がベンチスケールで代表例を再現しました。
詳細
OpenAIは、GPT-5.4をMolecule.oneのMariaというエージェント型化学AIと高スループット実験ラボに接続し、反応改善というオープンエンドな研究目標を与えました。 システムは研究提案、実験設計、実験データ分析、追試提案を行い、人間の化学者はプロンプト設計、候補選定、実験計画の限定的修正、ラボ操作、最終結果の独立検証を担当しました。 対象は一次スルホンアミドのChan-Lam couplingで、GPT-5.4はTEMPOなどの穏やかな酸化剤が改善に効く可能性を提案しました。 Maria Labで合計10,080反応を実行し、最適条件ではホウ酸側で88%、スルホンアミド側で83%のテスト基質で収率が改善しました。平均収率は16.6%から25.2%へ上がり、30%超の反応割合も15.6%から37.5%へ増えています。 人間の化学者による代表14組のベンチスケール再現では11組で収率改善が確認され、多くで2倍超の改善が見られました。 これはAPIや製品提供の変更ではなく研究発表です。化学・生物領域の悪用リスクを踏まえ、OpenAIはPreparedness Framework、専門家監督、有害用途を避けたスコープ設定を明記しています。
公式ソースを読む
重要度: 高 OpenAI 研究 / ベンチマーク / 生命科学

Introducing LifeSciBench

2026-06-17 / 掲載更新: 2026/06/18 10:57 JST / 関連製品: LifeSciBench, OpenAI models, Agentic AI systems

短い要約
OpenAIは、実際の生命科学研究ワークフローに近いAI評価ベンチマーク「LifeSciBench」を発表しました。 750件の専門家作成タスク、1,062件の添付アーティファクト、19,020件のルーブリック基準で、研究支援能力を細かく評価します。
詳細
LifeSciBenchは、AIが単なる生物学知識の回答ではなく、実際の生命科学研究タスクを支援できるかを測るベンチマークです。 タスクはPh.D.レベルの訓練とバイオテック/製薬業界経験を持つ173人の専門家が作成し、453人の専門レビュー担当者が評価しました。 750件のタスクは、エビデンス処理、分析、設計・最適化、科学的推論、検証・運用、トランスレーション、科学コミュニケーションの7ワークフローと7生物領域をカバーします。 タスクの79%は複数ステップの推論や意思決定を必要とし、53%は図、PDF、表、配列ファイル、構造/化学ファイル、Web参照など少なくとも1つの添付アーティファクトの解釈・統合を要求します。 評価は最終答えだけでなく、科学的に妥当な理由づけ、重要な caveat、運用上有用な形式まで、19,020件の詳細ルーブリックで採点します。 開発者向けAPI変更、モデル移行期限、破壊的変更はありません。生命科学向けAIエージェントや研究支援モデルの評価に関わる研究者・開発者に重要です。
公式ソースを読む