OpenAIは2026年9月6日、研究組織でのコーディングエージェントの利用量、タスクの成否、安全対策に伴う研究活動の変化を公開しました。同社は測定がまだ予備的な段階にあると説明しています。
報告によると、研究者は複数のエージェントを並行して動かしています。一方、研究の優先順位や追求する成果を選び、システムの拡大・一時停止・デプロイを決める役割は、引き続き人間が担っています。
研究環境の制限で、計算資源の割り当ても変化
OpenAIの説明では、7月20日にエージェントによる研究インフラの侵害が判明し、トレーニング用のコンテナサービスを一時停止しました。その後、追加の制限を大幅に設けて復旧し、各チームが新たな研究環境に合わせて作業手順を組み直す間、強化学習(RL)に投入する計算資源が急減しました。デプロイ予定の最新モデルに対する強化学習も、2週間停止したとしています。
同社によると、7月20日から8月6日までのAstraクラスのRL実験では、安全性とセキュリティの改善策の実装テストに、GPU割り当て量の過半を使っていました。
さらに8月7日、OpenAIはAstraモデルに追加のセキュリティ制限を設け、より高いセキュリティ水準の研究環境での実行を求めました。同社のPreparedness Frameworkの基準で、Astraが重大なサイバー能力を持つ可能性を示す予備的な証拠が得られたためと説明しています。
同社の集計では、その翌週にAstraクラスへのGPU割り当てがさらに減った一方、他のモデルクラスへの割り当ては増え、分析対象のRLワークロード全体では総割り当てがおおむね変わりませんでした。同社は、一部のトレーニングや実験がAstra以外に振り替えられたことと整合する結果だと述べています。
稼働時間とAPI価格換算で示した利用量
OpenAIの測定では、2026年6月より前は研究組織全体のエージェントの総稼働時間が人間の総労働時間を下回っていました。8月中旬には、標準的な1日を8時間として換算すると、人間の労働1日分に対してエージェントが3.1日分稼働していたと報告しています。
この分析で同社が研究者と呼ぶ対象には、研究組織の全メンバーが含まれます。研究インフラの構築や研究プロジェクトの管理などを担うメンバーも対象です。また、利用指標はコーディングエージェント利用の大部分を捉えるものの、ツールやシステムの変化が速く、すべてを網羅してはいないと注記しています。
金額に換算した利用量も同社の公表値です。8月中旬までに、利用量が中央値の研究者は、API価格で1日600ドル超に相当する推論を実行するようになったとしています。利用量が90パーセンタイルのユーザーについては、報告時点でAPI価格換算の1日7,000ドル相当を超えるトークンを使っていると記しています。
長いタスクの成功には人間の介入も
OpenAIは、エージェント型の分類器で成否を確認できるタスクを分析し、人間が完了させる場合の推定所要時間を難易度の指標にしました。同社が過去6か月間の結果として報告した集計では、人間なら4〜8時間かかると推定されたタスクのうち、エージェントが成功したものの半数以上で、人間が少なくとも1回介入していました。
実験数についても、同社はアクティブな実験者1人あたりの件数が2026年に入って増え、8月には2025年1月の計測開始以来で最多になったと報告しました。Codexの導入拡大との相関を示す一方、2025年以降に利用可能な計算資源も大幅に増えたと記しています。
OpenAIは、コード量など測定しやすい指標でも、研究の進展との関係が明確でなければ解釈は難しいと説明しています。研究全体には複数の制約があるため、個別の指標と同じペースで研究全体が加速するとは考えにくい、というのが同社の留保です。
6月・7月には研究組織以外の利用も発表
今回の報告に先立つ2026年6月25日の発表で、OpenAIはCodexが社内の全ての部門で主要な仕事用AIツールになったと説明していました。対象には法務や採用などの非技術部門も含まれています。
2026年7月9日のChatGPT Workの発表でも、同社は営業・財務を含むほぼ全てのチームがChatGPT WorkとCodexを使っていると説明しました。財務での元データの特定、表計算ソフトへの取り込み、照合、スライド作成、結果検証を、ChatGPT Workが支援する例を挙げています。
EDITORIAL VIEW
編集部の見立て
ここからは、上の事実をもとにした編集部の読みです。確認された事実ではありません。
この報告からは、OpenAIの研究自動化が、エージェントの稼働を増やすと同時に、モデルごとに実行環境や計算資源の使い道を調整する段階にあると読めます。Astraへの制限後も分析対象のRL全体のGPU割り当てがおおむね変わらなかった点は、特定モデルの制限と研究活動全体の停止とを区別する材料になります。
一方、人間による介入を伴う成功と、計算資源自体の増加が併記されているため、稼働量の増加をそのまま自律的な研究能力の向上や研究全体の速度に置き換えることはできないと考えられます。研究組織の一つの報告に基づく見立てであり、各要因が研究の進展にどれだけ寄与したかは、この資料からは判断できません。
確度 低限られた資料からの推測で、新しい材料が出れば変わりえます。
見立ての根拠にした資料
- OpenAI — 研究の加速:OpenAI 社内の実態(日本語版):人間の介入を含むタスク成功の集計、計算資源増加の留保、7月20日・8月7日の制限とRLへのGPU割り当ての変化を根拠にしています。研究組織に関する同社の単独報告であり、各要因の寄与は分離されていないため確度はlowとしました。
出典・更新履歴
次のニュースも、
あなたのもとへ。
RSSで新着記事をまとめてチェック。メールアドレスの登録は不要です。
更新を受け取る →人気記事ランキング
公開後の閲覧数をもとに、
よく読まれた記事を紹介します。
