Tag

#agentic-coding

ニュース

重要度: 中 Anthropic 公式特集

The Making of Claude Code

2026-07-06 / 掲載更新: 2026/07/08 07:23 JST / 関連製品: Claude Code, Claude, coding agent

短い要約
Anthropicは、Claude Codeが社内CLIから公式のコーディングエージェントへ発展した経緯を紹介する公式特集を公開しました。 研究者、エンジニア、初期ユーザーの視点から、コード実行環境、永続シェル、ハーネス設計など、エージェント型コーディングに必要な基盤が語られています。
詳細
この記事は新機能リリースではなく、Claude Codeの設計背景と開発史を説明する公式特集です。 Anthropicは、Claude Codeを単なるチャット型補助ではなく、コード実行、入出力ストリーミング、タイムアウト管理、作業環境の安全な制御を含むエージェント型開発基盤として位置づけています。 記事内では、2022年ごろの社内CLIや外部ユーザーによる初期利用、永続シェルをコンテナ内で動かすハーネス設計など、現在のエージェント開発課題につながる要素が説明されています。 実務上は、Claude Codeや類似のコーディングエージェントを評価する際に、モデル性能だけでなく実行環境、権限、安全なツール利用、開発ワークフロー統合を見る必要があることを示す内容です。 提供条件、API、モデル、料金、破壊的変更に関する新しい発表は確認されていません。
公式ソースを読む
重要度: 中 Google 研究・開発者向け / AIコーディングエージェント評価

Measuring What Matters with Jules

2026-06-22 / 掲載更新: 2026/06/23 07:06 JST / 関連製品: Jules, Google Labs, AI coding agents

短い要約
Google Developers Blogは、Julesを含むプロアクティブなAIコーディングエージェントを評価するための研究的取り組みを紹介しました。 SWE-Benchのようなタスク完了評価ではなく、目標に対して何を重要と判断して通知するかを測る「insight policy」が焦点です。
詳細
記事では、AIコーディングエージェントが単発タスクを解くだけでなく、コードベースを探索し、リスクや診断的洞察を能動的に提示する段階へ移っていると説明されています。 Google Labsの研究では、実際のバグ修正履歴を使い、時間的近接性と意味的類似性から、複数のバグが示す上位目標を推定する評価セットを作っています。 初期評価では、705件のバグと1,178件のCLを使い、修正前の状態に戻したコードベースをエージェントに探索させ、予測した洞察をLLMで1〜5点評価しました。 1回の探索では平均4.5/5の関連性が出た一方、複雑な問題では探索予算を2回から3回へ増やすことでHit@5が33%から57%へ改善したとされています。 Julesや将来のプロアクティブな開発エージェントでは、いつ通知し、いつ黙るべきかを評価することが重要になります。 製品の一般提供条件、無料/有料、日本での利用可否、APIの破壊的変更はこの記事では示されていません。
公式ソースを読む
重要度: 高 Anthropic 研究 / Claude Code / エージェント型コーディング

Agentic coding and persistent returns to expertise

2026-06-16 / 掲載更新: 2026/06/19 09:07 JST / 関連製品: Claude Code, Claude, Anthropic Economic Index

短い要約
Anthropicは、Claude Codeの実利用セッションを分析し、エージェント型コーディングでは利用者の専門性が成功率に強く効くと発表しました。 人間は何を作るかを主に決め、Claudeはどのように実装するかを担う分業が多いと説明されています。
詳細
Claude Codeのセッション分析では、利用者が計画判断の約70%を担い、実装・実行判断の多くをClaudeが担う構図が示されています。 利用目的は、新規開発、修正、テスト/オーケストレーション、運用、既存システム理解、変更計画、データ分析、文章作成などに分類されています。 専門性が高いユーザーほど成功率が上がり、失敗や誤解が起きた場合にも立て直しやすい傾向があるとされています。 一方で、専門家と中級者の差は限定的で、深いコーディング経験よりも対象ドメインを正確に理解していることが重要だと位置づけられています。 実務上は、Claude Codeを「実装を丸投げする道具」ではなく、業務知識を持つ人が目的・制約・検証観点を与えて動かすツールとして設計する重要性が高いです。 製品の新機能提供ではなく研究分析です。無料/有料、個人/法人、日本での利用可能性に関する新しい条件は記載されていません。
公式ソースを読む
重要度: 高 OpenAI Codex / 科学研究 / 導入事例

How an astrophysicist uses Codex to help simulate black holes

2026-06-11 / 関連製品: Codex, ChatGPT

短い要約
ブラックホール衝突を研究する理論物理学者Vijay Varma氏が、Codexを数値相対論のコード開発・検証に使う事例が公開されました。 複数の独立したCodexエージェントに理論導出、実装、テスト、査読を分担させ、人間が統合・検証する研究ワークフローです。
詳細
対象は、アインシュタイン方程式をスーパーコンピューターで解くSpECTREコードベースで、1回のシミュレーションが数か月かかる高コストな研究です。 Codexは文献調査、数式の整理、C++実装、数値テスト、コードレビュー、可視化まで支援します。 Varma氏は単一の回答を信用するのではなく、独立した複数エージェントに別々の解法や批判的レビューをさせ、結果を比較しています。 AIの主張は既存の物理法則、独立実装、回帰テスト、保存則などで検証され、最終判断は研究者が行います。 記事では、特殊なGauge変換の導出が従来数週間かかる作業から約1日に短縮された例が紹介されています。 Codexの新機能や料金変更ではありませんが、長時間・高精度の科学計算でエージェントを使う具体的な実務例です。 無料/有料プラン、日本での提供条件、API変更は示されていません。
公式ソースを読む
重要度: 高 Anthropic Model / Developer / Agentic Coding

Introducing Claude Opus 4.8

2026-05-28 / 関連製品: Claude Opus 4.8, Claude Code, Claude API, MCP

短い要約
AnthropicがClaude Opus 4.8を発表しました。コーディング、長時間エージェント作業、ツール利用、複雑な推論に重点を置いた上位モデル更新です。
詳細
開発者・AIコーディング用途ではかなり重要です。Claude Code、API、MCP連携、長い作業の計画・実行・修正のようなエージェント型タスクが主な対象です。Anthropicは、複雑なコードベース理解、変更計画、テスト、レビュー、ツール利用の改善を強調しています。Claudeを開発支援や業務エージェントに使っている場合、既存のOpus系ワークフローの品質向上が期待できます。提供条件や料金は利用チャネルごとに確認が必要ですが、少なくとも個人向けClaudeと開発者向けAPIの両方で注目すべき更新です。
公式ソースを読む
重要度: 高 OpenAI Engineering / Codex / Agentic Workflow

Building self-improving tax agents with Codex

2026-05-27 / 関連製品: Codex, GPT-5.5, agentic coding

短い要約
OpenAIとThrive Holdingsが、税務エージェントをCodexで継続改善する実例を公開しました。実務者の修正、プロダクトトレース、評価セットをCodexに渡し、エージェント自身の性能改善ループを作る内容です。
詳細
Tax AIはCreteの30以上の会計事務所向けに、1040/1041などの税務申告準備を支援しました。7,000件の申告を処理し、税務準備時間を約3分の1削減、最大97%の精度、スループット約50%向上とされています。重要なのは、単にCodexがコードを書く話ではなく、実務者の修正ログを「評価可能な失敗」として構造化し、Codexが対象コード・プロダクトトレース・評価コマンドを使って改善する点です。エージェントを本番投入した後、失敗を集めてeval化し、Codexに改善タスクとして渡すパターンは、税務以外の業務エージェントにも応用できます。
公式ソースを読む