AIが人の3.1倍の時間働く研究室。OpenAIの実測から考える「任せ方」と「測り方」

複数のAI作業から生まれた成果を研究者が確認し、完成した仕事を選び取るイメージ

AIに仕事を頼み、別の作業を進めている間にも処理が続く。そんな使い方が増えると、「人が何時間働いたか」だけでは職場の動きが見えなくなります。

OpenAIが9月6日に公開した研究現場の報告には、その変化を示す数字があります。8月半ば時点で、人の1労働日に対して、コーディングエージェントが3.1労働日分動いていたというのです。ただし、これは研究成果が3.1倍になったという意味ではありません。

ドライブレコーダーもAIにお任せ

この報告を、AIの稼働量と仕事の進み具合を分けて考える材料として読んでみます。

何を数えた「3.1」なのか

元の報告は、OpenAI内部の利用状況を観察したものです。エージェントの活動時間を8時間で1労働日に換算し、人側の基準と比較しています。人側も実測した作業時間ではなく、研究組織の従業員数をもとにした換算値です。複数のエージェントが並行して動けば、その時間は積み上がります。

これは、処理をどれだけ投入したかを示す数字です。同じ時間でも、正しい変更を仕上げた場合と、間違った方向を何度も試した場合では価値が違います。機械が忙しそうだからといって、仕事が片づいているとは限らない。人間の会議と少し似ています。

もう一つの重要な結果は、人なら4〜8時間かかると推定された仕事で、成功例の半数超に人の介入があったことです。「成功した」と「最後まで任せきれた」は別の指標になります。出典:OpenAIの報告、利用量とタスク成功の節

AIの稼働、内容の確認、合格した成果を分け、必要なら手直しへ戻す流れ
稼働量と成果を分けて考えるための概念図。AICompanyが独自に作成したもので、実測値やOpenAIの図表を再現したものではありません。

任せる仕事に、確認の出口をつくる

ここからは、この報告を踏まえたAICompanyの応用案です。

たとえば「このツールを使いやすくして」と頼むと、どこまで変えるかも、何をもって成功とするかも広がります。完成物を受け取った人は、意図の確認からやり直すことになります。

代わりに「読み込み中に同じボタンを押せないようにする。成功時も失敗時も操作可能に戻る。再試行できることまで確認する」と切り分けてみます。これなら、変更箇所と、結果を見るための操作が結びつきます。

着手前に用意したいのは、長い仕様書よりも、次の三つです。

  • 成功したと判断できる、具体的な操作や出力。
  • 今回の変更で壊れてほしくない、既存の動作。
  • 途中で判断を返してほしい、条件や予算の境界。

調査なら、成果物を「候補の一覧」だけにせず、採用理由と原文の該当箇所まで含める。文章なら、読みやすさに加えて、重要な数値の出典まで確認できるようにする。こうすると、人の確認を仕事の最後に押し込まず、任せる単位の中へ組み込めます。

「速くなった」を小さく試す

次の例は実験結果ではなく、評価方法を考えるための仮の数字です。

似た難しさの修正が10件あるとします。これまで1件につき自分の作業が40分なら、合計400分です。AIを使うと、自分の指示と確認が1件15分に減った。ただし、差し戻しが4件あり、それぞれ追加で30分かかったとします。

この場合、人の時間は150分と120分を足した270分です。最初の確認だけなら250分減ったように見えますが、差し戻し込みでは130分の削減です。さらに、完成した修正が同じ品質かも確かめる必要があります。

この例で記録するものは、同じ単位に無理やりまとめなくて構いません。

  • 合格件数と合格条件:仕事が本当に終わったか。
  • 指示、確認、手直しに使った人の時間:自分の負担が減ったか。
  • 依頼から合格までの経過時間:待ち時間も含めて早くなったか。
  • AIの利用費と試行回数:同じ方法を続けられるか。
  • 後から発見した不具合:完了判定が甘くなっていないか。

まず数件でこの記録を取り、うまくいかなかった依頼も残します。簡単な仕事だけをAIに渡した比較なら、その偏りも書いておく。同じ課題を解き直す場合には、二度目は答えを知っている影響があるため、厳密な優劣の証明とは扱いません。

並行処理を増やす前に、確認待ちを見る

もう一つ試したいのは、確認待ちの件数を数えることです。

AIが毎回五つの成果物を出しても、人が一つしか確認できなければ、未確認の仕事がたまります。そこへ追加の依頼を流すと、どの版を見たのか、何を保留したのかまで曖昧になります。

そんなときは、同時に動かす数を増やす前に、提出物を小さくします。一つの変更、一つの検証記録、一つの判断事項に区切り、確認が終わってから次へ進む。並行処理そのものが悪いのではなく、受け取れる量と合わせるための工夫です。

自分が確認に使える時間を先に決めて、その中で受け取れる仕事を任せる。小さな開発や記事づくりなら、この順番のほうが試しやすいはずです。

この報告から、まだ言えないこと

OpenAIの結果は内部の観察であり、AIだけの効果を切り出した比較実験ではありません。計算資源の増加や仕事の変化が重なります。成功判定にもAIが使われ、人の判定との照合は25件です。不確かな結果を除いた集計にも注意が必要です。AICompanyは内部データの再分析を行っていません。出典:OpenAIの報告末尾の方法説明

だから、3.1という数字を自分の職場の目標にする必要はありません。先に測りたいのは、合格した仕事が増えたか、自分の確認と手直しが減ったかです。AIに長く働いてもらうことより、受け取った仕事を安心して次へ渡せること。その変化を、小さな記録から確かめていきましょう。

ドライブレコーダーもAIにお任せ

投稿者 AICompany

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です

CAPTCHA