Tag

#Biology

ニュース

重要度: 高 OpenAI 研究 / ベンチマーク・生命科学AI

Introducing GeneBench-Pro

2026-06-30 / 掲載更新: 2026/07/01 07:05 JST / 関連製品: GeneBench-Pro, OpenAI models

短い要約
OpenAIは、ゲノミクス、生物学、科学研究でのAI性能を測る新ベンチマークGeneBench-Proを発表しました。 複雑な実世界データセットを使い、生命科学研究タスクでのモデル能力を評価する内容です。
詳細
GeneBench-Proは、ゲノミクス、生物学、科学研究におけるAI性能を検証するための新しいベンチマークです。 公式RSSでは、複雑な実世界データセットを用いて、AIが科学研究タスクにどこまで対応できるかを評価すると説明されています。 対象は生命科学研究者、AI評価担当者、科学系AIエージェントやモデルを評価する開発者です。 製品APIの新エンドポイントではなく、モデル評価・研究発表であり、料金、提供プラン、移行期限、破壊的変更は示されていません。 実務上は、汎用ベンチマークだけでは見えにくい生命科学領域でのモデル能力を比較・検証する材料になります。
公式ソースを読む
重要度: 中 OpenAI 研究 / ベンチマーク事例

Inside Genebench-Pro

2026-06-30 / 掲載更新: 2026/07/01 07:05 JST / 関連製品: GeneBench-Pro, OpenAI models

短い要約
OpenAIはGeneBench-Proの関連ページとして、ケーススタディ集「Inside Genebench-Pro」を公開しました。 GeneBench-Proで扱う科学研究タスクや評価観点を補足する公式ページです。
詳細
公式RSSではタイトルとURLのみが示されており、GeneBench-Proのケーススタディページとして公開されています。 同日に発表されたGeneBench-Pro本体の補足資料と見られ、生命科学・ゲノミクス領域でのAI評価を具体例で示す位置づけです。 対象は、ベンチマークの中身や評価事例を確認したい研究者・開発者です。 API仕様、モデル提供条件、料金、移行期限、破壊的変更は示されていません。 実務上は、GeneBench-Proを単なるスコアではなく、どのような研究タスクで評価しているかを確認するための補助資料になります。
公式ソースを読む
重要度: 高 Anthropic Research / Science / Agents

Paving the way for agents in biology

2026-06-08 / 関連製品: Claude, Claude Sonnet 4, scientific agents, gget virus

短い要約
Anthropicが、生物学領域でAIエージェントを信頼して使うには、決定論的なデータ取得レイヤーが重要だとする研究記事を公開しました。Claudeなどの科学エージェントをNCBI Virusの配列取得タスクで評価しています。
詳細
研究では、Claude、Biomni、Edison Analysis、GPTなどの科学エージェントに、NCBI Virusからウイルス配列データを取得させるタスクを与えました。モデル単体では、最先端モデルでも再現性と正確性が十分でないケースがあり、同じ問い合わせでも結果が大きく変わることが示されています。一方、gget virusのような決定論的な取得ツールを与えると、精度と再現性が大幅に改善しました。実務上は、科学AIではモデルの推論能力だけでなく、API、識別子、メタデータ、検証可能なログを備えたエージェント向け基盤が必要だという示唆です。Claudeの新機能提供というより、バイオ・科学研究でエージェントを安全に使うための重要な研究発表です。
公式ソースを読む