Tag

#Research

ニュース

重要度: 低 Anthropic Research / Grants

Apply for Anthropic’s AI for Science rare disease research grants

2026-07-20 / 掲載更新: 2026/07/22 07:08 JST / 関連製品: Claude, Anthropic AI for Science

短い要約
Anthropicは希少疾患研究を対象とするAI for Science助成金の募集を発表しました。Claudeなどを研究用途で活用する外部研究者・組織を支援する取り組みです。
詳細
製品の機能追加やAPIの仕様変更ではなく、AIを用いた希少疾患研究を促進する助成プログラムです。 研究用途でのClaude活用や、ライフサイエンス分野での外部研究支援の方向性を示します。 一般利用者のプラン、料金、日本での提供条件の変更はこの発表では示されていません。
公式ソースを読む
重要度: 中 Anthropic 企業発表 / 研究支援 / Claude API

Anthropic commits $10 million to Canadian AI research

2026-07-14 / 掲載更新: 2026/07/15 17:28 JST / 関連製品: Claude, Claude API, Claude for Startups

短い要約
Anthropicはカナダの責任あるAI研究へ1,000万カナダドルを拠出し、主要研究機関や医療機関へClaude利用支援を行うと発表しました。 関連スタートアップにはClaude APIクレジットも提供されます。
詳細
Amii、Mila、Vector Instituteのほか、大学・小児医療・精神医療の研究機関と提携し、AI安全性、健康、科学、ロボティクスなどの研究にClaudeクレジットを提供します。 University of Toronto Data Sciences Instituteでは、科学レビューを通じて研究プロジェクトへClaude APIクレジットを配分するとしています。 Anthropic for Startupsには3研究機関を追加し、関連する数百のカナダ企業へ各5,000米ドル以上のAPIクレジットを提供する計画です。 これは研究・導入支援の発表で、Claude APIの価格、モデル仕様、移行期限、破壊的変更はありません。日本での提供条件変更も記載されていません。
公式ソースを読む
重要度: 中 Anthropic 研究 / AI利用動向 / Claude

How Canada uses Claude: Findings from the Anthropic Economic Index

2026-07-14 / 掲載更新: 2026/07/15 17:28 JST / 関連製品: Claude.ai, Anthropic Economic Index

短い要約
AnthropicはEconomic Indexのカナダ分析を公開し、カナダのClaude.ai利用が世界トラフィックの2.6%、人口比では想定の4倍超と報告しました。 専門・科学・技術職の比率が高い地域ほど利用が強く、翻訳、学習、コーディング支援が特徴的です。
詳細
分析対象は2026年2月のClaude.ai会話サンプルで、カナダは総利用量で世界8位、人口調整後の利用指数では上位10カ国中米国に次ぐ2位とされています。 オンタリオ、ケベック、ブリティッシュコロンビア、アルバータの4州で国内会話の約94%を占め、人口比ではブリティッシュコロンビアが最も高い利用率でした。 地域の所得よりも、専門・科学・技術サービスの雇用構成が採用度に強く関係するという分析です。 カナダでは文書翻訳、学業、コーディング支援、履歴書作成が英語圏の比較対象より多く、仕事利用は各州で会話の34%から40%とされています。 製品更新や価格変更ではなく、匿名化した利用傾向の研究です。日本の利用状況や新たな提供条件は記載されていません。
公式ソースを読む
重要度: 中 Anthropic 研究 / AI安全性 / Claude

Claude's values across models and languages

2026-07-13 / 掲載更新: 2026/07/18 07:06 JST / 関連製品: Claude.ai, Claude Sonnet 4.6, Claude Opus 4.6, Claude Opus 4.7

短い要約
Anthropicは、Claudeが示す価値観を4軸に圧縮して、モデル間と20言語間の違いを分析しました。 +Opus 4.7は慎重さ・深さ・率直さ、Sonnet 4.6は温かさ・ユーザーへの同調・簡潔さに比較的寄るという結果です。
詳細
Anthropicは、匿名化したClaude.ai会話309,815件を分析し、3,307の価値を4軸へ圧縮しました。4軸は、同調性対慎重さ、温かさ対厳密さ、深さ対簡潔さ、率直さ対実行性です。 +モデル比較では、Opus 4.7は慎重さ、厳密さ、深さ、率直さを、Sonnet 4.6は同調性、温かさ、簡潔さを相対的に多く示す傾向が確認されました。 +言語比較では、英語とロシア語では厳密さ寄り、アラビア語とヒンディー語では温かさ寄りの表現が比較的強く、言語間でも差が確認されました。 +これはモデルの振る舞いと安全性評価の研究であり、Claudeの新モデル、API、料金、プラン、移行期限、破壊的変更の発表ではありません。日本語での個別結果や日本での提供条件は記事に記載されていません。
公式ソースを読む
重要度: 高 Anthropic 研究 / 安全性・二重用途リスク

An off switch for dual-use knowledge in AI models

2026-07-08 / 掲載更新: 2026/07/11 10:49 JST / 関連製品: Claude, GRAM, Anthropic Research

短い要約
AnthropicはAE Studioとの共同研究として、AIモデル内の二重用途知識をモジュール化して取り外す手法GRAMを公開しました。 バイオ、サイバー、核物理、専門コードなどの危険にも有用にもなり得る知識を、一般能力を保ちながら制御するための研究です。
詳細
GRAMはTransformer層に追加ニューロンを置き、二重用途カテゴリごとの知識を補助モジュールに学習させる手法です。 モデル本体の一般重みは固定し、必要に応じて特定領域のモジュールを取り外すことで、その領域の能力を下げることを狙います。 実験では合成トピック、Web/コード/科学を含む現実的な混合データ、50M〜5Bパラメータのモデルで検証されています。 モジュール除去はデータフィルタリングに近い能力抑制を示し、一般性能は大きく損なわなかったと報告されています。 対象領域はウイルス学、サイバーセキュリティ、核物理、専門コードなどで、Claudeの本番機能として提供されたものではありません。 Anthropicは、フロンティア規模や下流タスクでは未検証で、知識がモデル内に強く絡み合う場合の限界も残ると説明しています。 実務上は、危険能力をモデル全体の再学習なしで制御する安全性研究として重要ですが、現時点でAPI利用者の移行や設定変更はありません。
公式ソースを読む
重要度: 高 OpenAI 研究発表

Separating signal from noise in coding evaluations

2026-07-08 / 掲載更新: 2026/07/09 09:18 JST / 関連製品: Codex, coding evaluations, SWE-Bench Pro, AI coding agents

短い要約
OpenAIは、コーディングAIの評価で使われるSWE-Bench Proに関する分析を公開し、ベンチマークの信頼性と正確性に問題があると指摘しました。 AIモデルやコーディングエージェントを比較する際、単一スコアだけでは実務性能を見誤る可能性があるという研究発表です。
詳細
OpenAIの分析は、コーディングモデルやAIコーディングエージェントの評価に使われるSWE-Bench Proを対象にしています。 公式概要では、評価データや採点方法に起因する問題が、モデル比較の信頼性や正確性に影響し得るとされています。 対象は、Codexのようなコーディングエージェント、社内開発支援AI、ベンチマークでモデル選定を行う開発組織です。 実務上は、公開ベンチマークの順位だけで導入判断せず、自社コードベース、レビュー品質、テスト通過後の保守性、セキュリティ影響を含む評価が必要になります。 製品提供条件やAPIの変更ではなく、評価手法に関する研究発表です。破壊的変更や移行期限は確認されていません。
公式ソースを読む
重要度: 高 Anthropic Research / Interpretability / Safety

A global workspace in language models

2026-07-06 / 掲載更新: 2026/07/07 09:16 JST / 関連製品: Claude, J-space, Language Models

短い要約
Anthropicが、Claude内部に「J-space」と呼ぶ小さな内部表現群が自然に生じているという解釈可能性研究を公開しました。出力に現れない内部思考や、多段推論で使われる作業領域に近い機能を調べた研究です。
詳細
Anthropicの新しい解釈可能性研究は、Claudeの内部にJ-spaceと呼ぶ小さな神経パターン群があり、通常の内部処理とは異なる特別な役割を持つと報告しています。J-spaceはモデルが言葉として出力していない概念を内部的に保持し、いわば沈黙した作業領域として機能する可能性があります。 研究では、J-space内の表現はClaudeが報告しやすく、ユーザーが「何を考えているか」を尋ねたときに反映されやすいと説明されています。また、ユーザーが何かを考えるよう指示した場合に、対応するJ-space表現が活性化しやすいとも述べています。 多段推論では、中間ステップが出力されない場合でもJ-space内に現れ、こうした表現がタスク性能に因果的に関係する実験結果が示されています。一方、J-spaceを使えなくしても流暢な会話や単純な事実想起などは残るが、高次の認知機能が失われると説明しています。 Anthropicは、これはClaudeが人間のように意識を持つことを示すものではないと明記しています。実務上は、モデル内部で何が推論・保持されているかを理解し、安全性、監査、解釈可能性の研究を進めるための基礎的な発表です。APIや製品提供条件の変更、移行期限、破壊的変更はありません。
公式ソースを読む
重要度: 高 Anthropic Product Update / Research

Claude Science, an AI workbench for scientists, is now available

2026-06-30 / 掲載更新: 2026/07/02 07:05 JST / 関連製品: Claude Science, Claude, Claude Pro, Claude Max, Claude Team, Claude Enterprise

短い要約
Anthropicは、科学研究向けのAIワークベンチ「Claude Science」をベータ提供開始しました。文献調査、データ解析、図表・原稿作成、計算資源管理、監査可能な成果物生成を1つの研究環境に統合します。
詳細
Claude ScienceはmacOSまたはLinux、SSH経由のリモートマシン、HPCログインノードで利用できる研究向けアプリです。Pro、Max、Team、Enterpriseユーザー向けにベータ提供されます。ゲノミクス、single-cell、プロテオミクス、構造生物学、ケモインフォマティクスなどに向けた60以上のスキル/コネクタを事前構成しています。生成した図表や原稿には、作成に使ったコード、環境、メッセージ履歴が付与され、後から検証・再現しやすくなります。計算はローカルPC、研究室のLinux/HPC、ModalのオンデマンドGPUなどに接続して実行でき、大規模または機微なデータを既存インフラに置いたまま作業できます。レビューエージェントが引用、数値、図表とコードの整合性を確認し、科学用途での監査性を重視しています。
公式ソースを読む
重要度: 高 OpenAI 研究 / ベンチマーク・生命科学AI

Introducing GeneBench-Pro

2026-06-30 / 掲載更新: 2026/07/01 07:05 JST / 関連製品: GeneBench-Pro, OpenAI models

短い要約
OpenAIは、ゲノミクス、生物学、科学研究でのAI性能を測る新ベンチマークGeneBench-Proを発表しました。 複雑な実世界データセットを使い、生命科学研究タスクでのモデル能力を評価する内容です。
詳細
GeneBench-Proは、ゲノミクス、生物学、科学研究におけるAI性能を検証するための新しいベンチマークです。 公式RSSでは、複雑な実世界データセットを用いて、AIが科学研究タスクにどこまで対応できるかを評価すると説明されています。 対象は生命科学研究者、AI評価担当者、科学系AIエージェントやモデルを評価する開発者です。 製品APIの新エンドポイントではなく、モデル評価・研究発表であり、料金、提供プラン、移行期限、破壊的変更は示されていません。 実務上は、汎用ベンチマークだけでは見えにくい生命科学領域でのモデル能力を比較・検証する材料になります。
公式ソースを読む
重要度: 中 OpenAI 研究 / ベンチマーク事例

Inside Genebench-Pro

2026-06-30 / 掲載更新: 2026/07/01 07:05 JST / 関連製品: GeneBench-Pro, OpenAI models

短い要約
OpenAIはGeneBench-Proの関連ページとして、ケーススタディ集「Inside Genebench-Pro」を公開しました。 GeneBench-Proで扱う科学研究タスクや評価観点を補足する公式ページです。
詳細
公式RSSではタイトルとURLのみが示されており、GeneBench-Proのケーススタディページとして公開されています。 同日に発表されたGeneBench-Pro本体の補足資料と見られ、生命科学・ゲノミクス領域でのAI評価を具体例で示す位置づけです。 対象は、ベンチマークの中身や評価事例を確認したい研究者・開発者です。 API仕様、モデル提供条件、料金、移行期限、破壊的変更は示されていません。 実務上は、GeneBench-Proを単なるスコアではなく、どのような研究タスクで評価しているかを確認するための補助資料になります。
公式ソースを読む
重要度: 高 Anthropic 研究 / 経済影響・利用分析

Anthropic Economic Index report: Cadences

2026-06-26 / 掲載更新: 2026/06/27 07:07 JST / 関連製品: Claude, Claude Code, Claude Cowork, Claude API, Anthropic Economic Index

短い要約
AnthropicはEconomic Indexの新レポート「Cadences」を公開しました。 Claudeの利用が会話中心からClaude Code/Coworkの長時間エージェントタスクへ広がる中、時間帯、成果物、仕事への認識を分析しています。
詳細
新レポートでは、Economic Indexのデータパイプラインを更新し、より高頻度のサンプリング、出力分類器、Claude会話・Cowork・1P APIの月次集計を導入したと説明されています。 週末は個人利用が増え、平日は業務連絡、マーケティング文案、スライドなどの仕事関連が多い一方、朝のニュース、夕方のレシピ、早朝の睡眠相談など時間帯ごとの傾向も分析されています。 Claudeの出力物は説明、文書・レポート、ガイダンスなどに分類され、93%のClaude会話が何らかの成果物を生んでいるとされています。 高賃金職種に対応する会話ほどトークン消費が多く、より複雑で価値の高い成果物ほど計算量が増える傾向が示されています。 Claude Codeでは同じ種類の作業でもチャット/CoworkよりAIの自律性が高く、製品面の違いが委任度を押し上げている可能性が示されています。 研究発表であり、Claude APIの仕様変更、モデル提供条件、移行期限、破壊的変更ではありません。 実務上は、Claude CodeやCoworkを単なる対話ではなく、仕事の成果物生成・委任の実態として評価するためのデータとして使えます。
公式ソースを読む
重要度: 中 OpenAI 研究 / 医療・生命科学AI

How GPT-5 helped immunologist Derya Unutmaz solve a 3-year-old mystery

2026-06-23 / 掲載更新: 2026/06/24 08:55 JST / 関連製品: GPT-5 Pro

短い要約
OpenAIは、GPT-5 Proが免疫学者Derya Unutmaz氏の3年来の研究課題解決を支援した事例を公開しました。 T細胞の挙動に関する洞察が得られ、がんや自己免疫疾患研究への応用可能性が示されています。
詳細
GPT-5 Proが、免疫学の研究課題に対して仮説整理や洞察提示を支援した公式事例です。 対象はT細胞の挙動に関する3年来の謎で、がん研究や自己免疫疾患研究への示唆があると説明されています。 製品更新というより、科学研究における高度推論モデルの利用例として重要です。 研究者やライフサイエンス領域の実務者にとって、AIを文献理解、仮説生成、研究判断の補助に使う流れを示す事例になります。 臨床利用、医療診断、治療提供としての発表ではありません。料金、対象プラン、日本での利用可否、APIの破壊的変更は記事では示されていません。
公式ソースを読む
重要度: 中 Google 研究・開発者向け / AIコーディングエージェント評価

Measuring What Matters with Jules

2026-06-22 / 掲載更新: 2026/06/23 07:06 JST / 関連製品: Jules, Google Labs, AI coding agents

短い要約
Google Developers Blogは、Julesを含むプロアクティブなAIコーディングエージェントを評価するための研究的取り組みを紹介しました。 SWE-Benchのようなタスク完了評価ではなく、目標に対して何を重要と判断して通知するかを測る「insight policy」が焦点です。
詳細
記事では、AIコーディングエージェントが単発タスクを解くだけでなく、コードベースを探索し、リスクや診断的洞察を能動的に提示する段階へ移っていると説明されています。 Google Labsの研究では、実際のバグ修正履歴を使い、時間的近接性と意味的類似性から、複数のバグが示す上位目標を推定する評価セットを作っています。 初期評価では、705件のバグと1,178件のCLを使い、修正前の状態に戻したコードベースをエージェントに探索させ、予測した洞察をLLMで1〜5点評価しました。 1回の探索では平均4.5/5の関連性が出た一方、複雑な問題では探索予算を2回から3回へ増やすことでHit@5が33%から57%へ改善したとされています。 Julesや将来のプロアクティブな開発エージェントでは、いつ通知し、いつ黙るべきかを評価することが重要になります。 製品の一般提供条件、無料/有料、日本での利用可否、APIの破壊的変更はこの記事では示されていません。
公式ソースを読む
重要度: 高 Anthropic 研究 / Claude Code / エージェント型コーディング

Agentic coding and persistent returns to expertise

2026-06-16 / 掲載更新: 2026/06/19 09:07 JST / 関連製品: Claude Code, Claude, Anthropic Economic Index

短い要約
Anthropicは、Claude Codeの実利用セッションを分析し、エージェント型コーディングでは利用者の専門性が成功率に強く効くと発表しました。 人間は何を作るかを主に決め、Claudeはどのように実装するかを担う分業が多いと説明されています。
詳細
Claude Codeのセッション分析では、利用者が計画判断の約70%を担い、実装・実行判断の多くをClaudeが担う構図が示されています。 利用目的は、新規開発、修正、テスト/オーケストレーション、運用、既存システム理解、変更計画、データ分析、文章作成などに分類されています。 専門性が高いユーザーほど成功率が上がり、失敗や誤解が起きた場合にも立て直しやすい傾向があるとされています。 一方で、専門家と中級者の差は限定的で、深いコーディング経験よりも対象ドメインを正確に理解していることが重要だと位置づけられています。 実務上は、Claude Codeを「実装を丸投げする道具」ではなく、業務知識を持つ人が目的・制約・検証観点を与えて動かすツールとして設計する重要性が高いです。 製品の新機能提供ではなく研究分析です。無料/有料、個人/法人、日本での利用可能性に関する新しい条件は記載されていません。
公式ソースを読む
重要度: 高 OpenAI 研究 / 安全性評価

Predicting model behavior before release by simulating deployment

2026-06-16 / 掲載更新: 2026/06/17 08:14 JST / 関連製品: OpenAI models, GPT-5 series Thinking, Codex agents, Deployment Simulation

短い要約
OpenAIは、新モデル公開前に実運用に近い会話文脈を再現して望ましくない挙動を予測する「Deployment Simulation」を紹介しました。 GPT-5系Thinkingモデルやエージェント的なツール利用環境で、従来評価より実運用時のリスク推定を改善できたと説明しています。
詳細
従来の安全性評価は、合成プロンプトや高リスクケースに偏りやすく、実際の利用分布でどの程度問題が起きるかを推定しにくい課題がありました。 Deployment Simulationは、過去の会話から元のアシスタント応答を取り除き、公開候補モデルで応答を再生成して、実運用に近い分布で望ましくない挙動を測ります。 OpenAIは、GPT-5系Thinkingモデルの複数デプロイで、望ましくない挙動の発生率推定、未知のミスアラインメント検出、モデルが評価中だと認識するリスクの低減に役立ったとしています。 約130万件の匿名化済み会話を分析し、GPT-5.4 Thinkingでは20種類の望ましくない挙動について事前登録した予測も行っています。 エージェント的なコーディング環境では、ライブ環境に実ツールを実行せず、リポジトリ状態や過去のツール応答を使ってツール呼び出しをシミュレーションする方法も示されています。 開発者向けのAPI変更や移行期限はありませんが、モデル公開前評価、レッドチーム、システムカード、エージェント安全性評価に関わるチームには重要な研究更新です。
公式ソースを読む
重要度: 中 Anthropic 調査 / AI政策 / 社会影響

Results from the first Anthropic Public Record

2026-06-12 / 関連製品: Anthropic Public Record, Claude

短い要約
Anthropicが約5万2,000人の米国人を対象に行った初のAI意識調査を公開しました。 AIへの期待は疾病治療が最多で、最大の懸念は雇用喪失、政府のAI関与を支持する回答は71%でした。
詳細
2025年11月から12月に、YouGovを通じて米国の16歳以上51,993人を調査し、国勢調査基準に合わせて重み付けしています。 AIへの期待では疾病治療が48%、障害者支援が36%で上位でした。一方、雇用喪失を懸念する回答は64%、認知的依存は56%、偽情報は52%でした。 政府がAI開発・規制へ関与すべきとの回答は71%で、特にプライバシー、児童安全、被害への法的責任が重視されています。 AI企業を信頼して開発・利用方針を任せられるとの回答は15%にとどまり、調査対象の機関中で最低でした。 仕事でAIを毎日使う人は、使わない人より雇用喪失への不安が低い傾向も報告されています。 今後も定期的に調査し、将来は米国外へ拡大する計画です。製品機能、Claudeの料金、API、モデル、提供地域には変更ありません。
公式ソースを読む
重要度: 中 Google 研究発表 / 教育 / 責任あるAI

Measuring the impact of learning with AI in Sierra Leone and beyond

2026-06-09 / 関連製品: Gemini, Guided Learning, LearnLM

短い要約
Google DeepMindが、シエラレオネでGeminiのGuided Learningを使った教育効果のランダム化比較試験結果を公開しました。 1,763人の中学生を対象に8週間評価し、数学スコアで対照群比+0.258標準偏差の改善が見られたとしています。
詳細
試験はFab AIおよびシエラレオネ教育省の支援で、12校・1,763人の中学生を対象に実施されました。 Guided Learningは単に答えを出すのではなく、理解を促す足場かけ質問を重視する設計で、GoogleのLearnLMの取り組みに基づいています。 分析対象の11.3万件以上のやり取りでは、91.4%の会話が概念理解の構築に使われ、Geminiの応答の76%が足場かけ質問だったと説明されています。 数学スコアの改善は8週間で通常の1.2〜1.7年分、授業の約半分で活用した教室では1.8〜2.5年分に相当するとしています。 製品の一般提供や料金変更ではなく、教育現場におけるAI活用の研究・実証結果としての意味が大きい更新です。
公式ソースを読む
重要度: 高 Anthropic Research / Science / Agents

Paving the way for agents in biology

2026-06-08 / 関連製品: Claude, Claude Sonnet 4, scientific agents, gget virus

短い要約
Anthropicが、生物学領域でAIエージェントを信頼して使うには、決定論的なデータ取得レイヤーが重要だとする研究記事を公開しました。Claudeなどの科学エージェントをNCBI Virusの配列取得タスクで評価しています。
詳細
研究では、Claude、Biomni、Edison Analysis、GPTなどの科学エージェントに、NCBI Virusからウイルス配列データを取得させるタスクを与えました。モデル単体では、最先端モデルでも再現性と正確性が十分でないケースがあり、同じ問い合わせでも結果が大きく変わることが示されています。一方、gget virusのような決定論的な取得ツールを与えると、精度と再現性が大幅に改善しました。実務上は、科学AIではモデルの推論能力だけでなく、API、識別子、メタデータ、検証可能なログを備えたエージェント向け基盤が必要だという示唆です。Claudeの新機能提供というより、バイオ・科学研究でエージェントを安全に使うための重要な研究発表です。
公式ソースを読む
重要度: 中 Anthropic Research / Science

Making Claude a chemist

2026-06-05 / 関連製品: Claude, Claude for Science

短い要約
Anthropicは、Claudeを化学研究に応用する取り組みを紹介しました。自然言語での実験計画、化学知識の活用、研究支援に関する研究発表です。
詳細
この研究発表は、Claudeを化学領域の専門タスクに使う可能性を示すものです。対象は研究者、製薬・材料・化学分野のR&D担当者、科学AIに関心がある開発者です。製品機能の即時提供というより、Claudeが専門知識、推論、ツール利用を組み合わせて科学研究を支援する方向性を示しています。無料/有料プランや日本提供条件の変更は明記されていません。実務上は、Claudeを研究補助、仮説生成、文献理解、実験設計の補助に使う流れが強まっていると見てよい更新です。
公式ソースを読む
重要度: 高 OpenAI Science / Research / Agentic Workflows

Introducing new capabilities to GPT-Rosalind

2026-06-03 / 関連製品: GPT-Rosalind, OpenAI frontier models

短い要約
OpenAIが、科学研究向けAIエージェントGPT-Rosalindの新機能を発表しました。研究者が、文献調査、仮説生成、実験設計、データ解析、研究計画の整理をより一貫して進められるようにする更新です。
詳細
GPT-Rosalindは、一般的なチャット用途ではなく、科学研究の実務に寄せたAIシステムです。今回の更新では、研究プロジェクト全体を扱うための文脈管理、複数ステップの分析、研究者との反復的なやり取りが強化されています。実験条件の検討、論文・既存知見の整理、データからの洞察抽出、次に試すべき実験案の提案などに関係します。OpenAIはこの領域を、Rosalindやバイオディフェンス関連の取り組みと合わせて進めており、科学研究の加速と安全性管理を両立させる方向です。一般ユーザー向けの無料機能ではなく、研究機関・科学者・高度なR&D用途向けの重要更新と見てよいです。
公式ソースを読む
重要度: 高 OpenAI Science / Research / Biosecurity

Rosalind: advancing AI-powered scientific research

2026-05-29 / 関連製品: OpenAI models

短い要約
OpenAIが科学研究支援の取り組み「Rosalind」を紹介しました。研究者がAIを使って仮説形成、実験計画、文献理解などを進める方向性に関係します。
詳細
科学研究では、AIが大量の文献・データ・実験条件を扱えることが価値になります。一方で、生物・化学領域は悪用リスクもあるため、安全性評価やアクセス制御が重要です。今回の発表は、OpenAIが研究支援と安全対策を両立させながら、高度な科学タスクへモデルを使う流れを示しています。研究者・バイオ/化学系企業・AI安全性に関心がある人には重要です。
公式ソースを読む
重要度: 高 Anthropic Research / Safety / Evaluation

Anthropic’s Frontier Red Teaming Protocol

2026-05-26 / 関連製品: Claude, Anthropic frontier models

短い要約
Anthropicが、フロンティアAIモデルの危険能力を評価するための **Frontier Red Teaming Protocol** を公開しました。モデルがサイバー、生物、化学、核、AI研究開発などの高リスク領域でどの程度危険な支援能力を持つかを測る枠組みです。
詳細
これはClaudeなどの高性能モデルを安全に展開するための評価手順で、AnthropicのResponsible Scaling Policyと接続する重要な研究更新です。評価対象には、悪用可能な専門知識、実行可能な手順の生成、攻撃・開発支援能力などが含まれます。単なるベンチマークではなく、専門家によるレッドチーミングと実践的なタスク評価を組み合わせる設計です。開発者や企業ユーザーに直接新機能を提供する発表ではありませんが、今後のClaudeモデルの提供条件、安全制限、公開タイミングに影響する可能性があります。AI安全性・ガバナンス観点では重要度が高いです。
公式ソースを読む