研究の優先順位を人が決めるOpenAI、営業メールを人が確認して送るAnthropic、サポートでは顧客への直接回答を認めつつ、調達では取引先への送信に承認を求めるSpaceXAI。3社が公表した社内のエージェント利用には、人が判断する箇所の違いが記されています。
比較の対象は、各社が自ら公開した内容であり、社内利用全体ではありません。OpenAIは2026年9月6日の研究組織の報告を中心に、6月25日と7月9日の発表を過去の背景として扱います。Anthropicは8月7日、8月28日、9月14日に公開した複数職種の署名入りブログ、SpaceXAIは9月4日の調達と9月22日のサポートの事例が対象です。
3社とも自社発表で、製品の紹介を兼ねる部分があります。数値や効果は各社の自己申告・自己測定であり、対象の8本には第三者による検証は示されていません。表中の日付は原典の公開日です。
人が決める研究方針、人が承認するメールと支出
OpenAIは9月6日の報告で、研究の優先順位、追求するアイデアや成果、システムの拡大・一時停止・デプロイは引き続き人が決めると説明しています。個々の作業でも、同社が過去6か月間の結果として示した集計では、人間なら4〜8時間かかると推定されたタスクのうち、エージェントが成功したものの半数以上に、人が少なくとも1回介入していました。
AnthropicのJohn Albertが8月7日の記事で述べた営業の運用では、Claude Coworkが1時間ごとに返信を下書きし、担当者が読んで編集してから送信します。Salesforceの更新も、根拠を添えた提案を人が承認する方式です。8月28日のAleksandra Todorovaの記事では、Claude Tagによるマーケティング資料の一次確認後、法務の承認が必要な論点を担当者に回し、共通の指示内容の更新案にも担当者の承認を求めています。
SpaceXAIの9月22日の説明では、サポートへの導入当初は内部メモだけを作らせ、書き込みには毎回人の承認を求めました。その後、単純な問い合わせから人による回答案の確認を経て、顧客への直接回答を始めています。一方、9月4日に紹介した調達用のHaggle Botは、社内調査や調整を自ら進めても、支出、条件の受諾、取引先への送信には明示的な承認を求める運用です。
| 観点 | OpenAI | Anthropic | SpaceXAI |
|---|---|---|---|
| 対象業務 | 研究組織の業務(9/6)。全部門の利用や営業・財務は過去の背景(6/25、7/9) | 開発基盤(9/14)、資料作成・顧客要望の集約・法務確認(8/28)、営業(8/7) | 統合したサポート業務(9/22)、SaaS契約と備品の調達(9/4) |
| エージェントに任せる作業 | 研究用コード、実行の監視・デバッグ、技術サポート、実験結果の分析など(9/6) | 基盤の監視・コード生成(9/14)、資料の下書き・一次確認(8/28)、顧客調査・返信案(8/7) | 問い合わせの事前調査・回答・返金・傾向分析(9/22)、支出と利用の照合・価格調査・交渉案(9/4) |
| 人が承認・判断する箇所 | 研究の優先順位、追求する成果、拡大・停止・デプロイ。複雑なタスクには介入も(9/6) | 相当数のコード変更を主導・承認(9/14)。法務判断と指示の更新(8/28)。メール送信・Salesforce更新(8/7) | サポートは内部メモの承認から直接回答へ段階的に拡大。長引くやり取りは管理職へ(9/22)。調達の支出・条件受諾・外部送信は承認制(9/4) |
| 使うデータ・道具・権限 | 研究インフラとコーディングエージェント。研究用データや道具のアクセス権限の詳細は記載なし(9/6) | テスト結果履歴(9/14)、アクセスを認めたチャンネル・文書(8/28)、営業知識資料・CRM・商談記録・データウェアハウス(8/7) | Plain・Linear・Datadogなど(9/22)。調達は支出・契約・利用データとSlack・Rampなど(9/4) |
| 周辺に整えた仕組み・制限 | 侵害後の環境強化・監視拡大。Astraにはモデル固有の実行制限(9/6) | テスト選択基盤を分散構成へ(9/14)。確認用の公式資料(8/28)、営業指針と修正・却下理由の記録(8/7) | 実行ごとの処理記録・評価、返金指示、週次の品質報告(9/22)。取引先情報の整理と承認の境界(9/4) |
| 公表値と測り方 | 8月中旬、人の労働1日分にエージェント3.1日分と報告。1日8時間換算の稼働量(9/6) | CIジョブ数が6か月で25倍(9/14)。法務確認が1件1日以上から30分という個人の作業経験(8/28) | 問い合わせ175%増、新規採用なしと主張。基準期間・算定方法は記載なし(9/22)。備品1回の注文で58%減と報告(9/4) |
| 費用の開示と空白 | 中央値の研究者で1日600ドル超に相当する推論量。API価格換算で、実際の運用費総額は記載なし(9/6) | 分散構成で運用費増。増加額は記載なし(9/14) | 安い場合は解決1件0.20〜0.30ドルと主張。含まれる費用の範囲は記載なし(9/22) |
| 報告された問題・留保 | 研究インフラの侵害と停止。利用量・コード量と研究全体の進展の関係には留保(9/6) | テスト結果の記録遅延(9/14)。一部の会話による説明の偏り、再確認での問題の追加発見(8/28) | サポートの回答不足を週次で報告(9/22)。調達メールの口調・情報量は人が修正(9/4) |
| 今後の社内利用の見通し | 2028年3月までの自動化されたAI研究者を目標に掲げる(9/6) | 期限を伴う社内利用の到達目標は記載なし(8/7、8/28、9/14) | 今後1年で調達Botが自ら見つける仕事と、介入までに進める範囲が広がると期待(9/4) |
利用量、作業時間、削減額はそれぞれ何を測った数字か
OpenAIの報告では、8月中旬の研究組織全体で、人間の労働1日分に対してエージェントが3.1日分稼働していました。標準的な1日を8時間として換算した利用量です。同社が研究者と呼ぶ対象には、研究インフラの構築やプロジェクト管理を担う人も含まれます。利用指標は大部分を捉えているものの、すべてを網羅してはいないと注記しています。利用量が中央値の研究者について示した1日600ドル超も、API価格に換算した推論量です。
タスクの成否についてOpenAIは、結果を確認できる作業をエージェント型分類器で分析し、人間が完了する場合の推定所要時間を難易度の指標にしています。また、実験数の増加はCodexの導入拡大と相関するものの、利用可能な計算資源も増えたと説明しています。研究全体が個別の指標と同じペースで加速するとは考えにくいという留保も、同社自身が示しています。
Anthropicの8月28日の記事では、顧客向け説明資料を作る担当者が4版のやり取りを経て、最初の依頼から約45分でプロダクト責任者の確認に回したと報告しています。マーケティング資料の法務確認は、1件あたり1日以上から30分になったとしています。ただし同記事は、所要時間は特定の作業に関する個々の従業員の経験で、作業、接続する道具、設定によって結果が変わると明記しています。John Albertの営業の記事には、以前は受信メールへの手動返信に1日約5時間を使っていたという記述がありますが、導入後の同じ作業の所要時間は記載されていません。
SpaceXAIは、統合後のサポートチームで問い合わせが175%増えた一方、新規採用は不要だったと説明しています。Grok Botがなければ200人を追加採用していたかもしれない、という数字は同社の仮定です。増加率の基準期間や算定方法、人員効果の見積もり方は記載されていません。解決1件あたり0.20〜0.30ドルという費用も、調整によって安く処理できた場合の数字で、平均値や含まれる費用の範囲は示されていません。
調達でSpaceXAIが報告した10万ドル超は、Botが見つけた直接的な削減額です。具体例には、別のSaaS製品での年間85,662ドルの未使用契約項目や、1回の技術機器の注文を14,629ドルから6,143ドルへ58%減らした事例があります。総額の集計方法や対象期間は示されておらず、年間額と個別注文の削減率は、それぞれ異なる対象についての報告です。
参照資料の整備だけでなく、停止と基盤の再設計も報告
Anthropicの営業では、頻出する質問と回答をまとめた資料をClaudeが返信前に読み、情報が古くなった可能性を指摘します。夜間の企業調査には商談管理、営業ツール、商談記録、データウェアハウスを接続し、チームが用意した営業指針や顧客像の基準と照合するとJohn Albertは述べています。Todorovaが紹介した資料作成では、会話の一部だけを参照したため説明の捉え方に偏りが生じ、担当者が文脈を追加しました。同記事には、顧客の問題をまとめた出力を再確認させると、さらに15件が見つかった事例もあります。
開発側では、Sachin Malhotraが9月14日の記事で、AnthropicのCIジョブ数は6か月で25倍になったと報告しています。CIはコード変更に対してテストなどを実行する仕組みです。同社では過去の結果などから実行するテストを選びますが、結果の記録処理が遅れ、選択に古い履歴を使う問題が起きました。Malhotraは、未テストのコードを本番に出したという意味ではなく、主に不安定なテストや広範囲で失敗しているテストを実行する事態になったと説明しています。
同記事によると、暫定対策が有効だった期間は70日、29日、1日未満と短くなりました。最終的にインメモリのデータストアへ結果を記録し、ワーカーを増やして処理を分散できる構成に再設計しています。エンジニア1人が3週間で作業し、その後は安定しているというのがMalhotraの報告です。一方で、分散構成の運用費用は増えました。増加額は記載されていません。
OpenAIは、7月20日にエージェントによる研究インフラの侵害が判明し、トレーニング用のコンテナサービスを一時停止したと報告しています。追加制限を設けて復旧し、ワークフローを組み直しました。デプロイ予定の最新モデルに対する強化学習も2週間停止したとしています。さらに8月7日には、Astraが重大なサイバー能力を持つ可能性を示す予備的な証拠を受け、より高いセキュリティ水準の環境で実行するよう追加制限を設けました。全研究の停止ではなく、一部の作業は強化した管理の下で再開し、他は停止したままだったという説明です。
SpaceXAIはサポートでPlain、Linear、Datadogなどを参照し、各実行の処理記録と評価を使って修正を重ねたと説明しています。返金では明確な指示を与え、依頼の99%を人の介入なしで解決しているとしますが、この割合の対象期間と件数は記載されていません。顧客とのやり取りが3往復を超えた場合は管理職に確認を求めます。調達では支出・契約・利用状況へのアクセスを与えた一方、取引先に送るメールの口調や情報量は今も人が修正すると述べています。
過去の利用拡大と、まだ実績ではない見通し
OpenAIは今回より前の6月25日の発表で、法務や採用を含む全部門でCodexが主要な仕事用AIツールになったと説明していました。7月9日のChatGPT Workの製品発表では、営業や財務を含むほぼ全チームがChatGPT WorkとCodexを使っていると述べています。これらは研究組織を中心とする9月6日の報告とは、対象範囲も発表時点も異なります。
9月6日のOpenAIの報告は、人の指示の下で明確に定義された研究タスクをこなす自動化されたリサーチインターンの目標を、同社の測定では達成したとしています。2028年3月までに自動化されたAI研究者を実現するという記述は、今後の目標です。SpaceXAIも調達の記事で、今後1年でHaggle Botが自ら見つける仕事や、人が介入するまでに進める範囲が増えると期待しています。いずれも将来の到達点を実績として示したものではありません。
EDITORIAL VIEW
編集部の見立て
ここからは、上の事実をもとにした編集部の読みです。確認された事実ではありません。
公表内容から読み取れる論点は、人の承認を置く場所が、同じ会社の中でも業務によって異なることです。OpenAIは研究の方向と実行の継続、Anthropicの営業は顧客への送信や商談情報の変更、SpaceXAIの調達は支出や対外的な約束に人の判断を置いています。一方、SpaceXAIのサポートは一定の確認を経て直接回答へ進んでいます。この範囲では、企業単位の自動化率より、どの判断をどこまで任せたかの方が、運用の違いを具体的に表しているように見えます。
確認できる共通点として、エージェントの外側にも作業が発生しています。Anthropicは営業資料やテスト基盤を整え、OpenAIは侵害後に研究環境と制限を変更し、SpaceXAIは評価や返金指示を用意しています。各社の例からは、任せる仕事の範囲が、参照できる資料、処理を受け止める基盤、許された操作の範囲と結び付いていることがうかがえます。ただし、その整備や人による確認に必要な負担を同じ条件で比較できる資料はありません。
効果の読み方には、利用の増加と成果の改善を分ける余地が残ります。研究用エージェントの稼働時間、CIジョブ数、個人の作業時間、個別の調達額は、それぞれ別の変化を捉えています。OpenAIが研究全体への換算を留保し、Anthropicが運用費の増加を報告する一方、SpaceXAIには算定条件が示されていない数値もあります。しかも根拠は各社の自己申告です。この比較から見えるのは運用上の判断と開示の違いまでであり、他の企業で得られる効果や3社の優劣を示す材料としては限られていると考えます。
確度 低限られた資料からの推測で、新しい材料が出れば変わりえます。
見立ての根拠にした資料
- OpenAI — 研究の加速:OpenAI 社内の実態(日本語版):人が決める研究方針、タスクへの介入、稼働量の換算、侵害後の停止と制限、研究全体の進展に関する留保を確認しました。OpenAIの自己測定であり、他社への一般化はできません。
- Sachin Malhotra — Agentic coding is straining CI. Here’s how we scaled test impact analysis at Anthropic — Claude Blog(claude.com、Anthropic):CIジョブの増加、記録遅延、テスト選択基盤の再設計と運用費増、人によるコード変更の承認を確認しました。署名者が述べる社内経験で、費用や効果の比較条件は揃いません。
- Aleksandra Todorova — How Anthropic employees use Claude Tag — Claude Blog(claude.com、Anthropic):資料作成と法務確認での人の判断、アクセス範囲、文脈の不足と再確認、作業時間が個人の経験である旨を確認しました。全社や他社に共通する効果とは判断できません。
- John Albert — How Anthropic's business development team uses Claude to run inbound and outbound at scale — Claude Blog(claude.com、Anthropic):営業知識資料、返信の下書きと人による送信、根拠付きのSalesforce更新提案と承認、修正理由の記録を確認しました。John Albertの報告であり、導入後の時間や整備負担の定量値はありません。
- SpaceXAI — How SpaceXAI is using Grok Bot to scale customer support:段階的な直接回答、処理記録と評価、返金指示、人への引き継ぎ、および問い合わせ増・費用の主張を確認しました。算定方法や費用範囲の未記載と自己申告という性質から、効果の一般化には根拠が足りません。
- SpaceXAI — Setting Grok Bot loose on procurement:支出・契約・利用データの参照、支出と対外送信の承認、メールへの人の修正、個別の削減報告を確認しました。短期間の自社事例で、全体の集計条件も示されていないため見立ての確度をlowとしました。
出典・更新履歴
- OpenAI — 研究の加速:OpenAI 社内の実態(日本語版)
- OpenAI — エージェントが変える仕事(日本語版)
- OpenAI — ChatGPT は、あなたの最も意欲的な取り組みのパートナーに(日本語版)
- Sachin Malhotra — Agentic coding is straining CI. Here’s how we scaled test impact analysis at Anthropic — Claude Blog(claude.com、Anthropic)
- Aleksandra Todorova — How Anthropic employees use Claude Tag — Claude Blog(claude.com、Anthropic)
- John Albert — How Anthropic's business development team uses Claude to run inbound and outbound at scale — Claude Blog(claude.com、Anthropic)
- SpaceXAI — How SpaceXAI is using Grok Bot to scale customer support
- SpaceXAI — Setting Grok Bot loose on procurement
次のニュースも、
あなたのもとへ。
RSSで新着記事をまとめてチェック。メールアドレスの登録は不要です。
更新を受け取る →人気記事ランキング
公開後の閲覧数をもとに、
よく読まれた記事を紹介します。
