← パースペクティブに戻る
/Intellicon FDE Team

企業は AI Agent が1,000ステップ近く実行しても失敗する事態をどう防ぐべきか?

336組のモデルとタスクの組み合わせのうち、106組では同じテストタスクの実行コストがかえって高くなりました。本記事では、自社のタスクを用いた反復テスト、失敗時の支出を含むコスト計算、予算上限と停止条件の設定方法について解説します。

AIEgentWrX人機協作導入
企業は AI Agent が1,000ステップ近く実行しても失敗する事態をどう防ぐべきか?

AI モデルを調達する際、まず料金表が比較基準になりがちです。しかし、営業見積もりでは過去の注文履歴や原価データの参照、契約条項の確認が必要となり、カスタマーサポートでもナレッジベースや社内システムを繰り返し検索する場合があります。モデルが推論を重ね、ツールを呼び出すたびに費用は増え続けます。最終的に利用可能な成果が得られなかったとしても、それまでに発生した費用は支払わなければなりません。

そのため、企業がモデルを選定する際は、業務を完了するためのコストを評価する必要があります。まずは自社で頻繁に発生するタスクを抽出し、成功条件とテスト方法を統一したうえで、成功・失敗の両方にかかった支出をすべて計上します。モデルの単価は参考になりますが、どのモデルがどの業務に適しているかを単価だけで判断することはできません。

単価が安いのに、同じテストを実行するとかえって高くなるのはなぜか?

TechOrange は、スタンフォード大学、カーネギーメロン大学、カリフォルニア大学バークレー校、Microsoft Research の研究者が共同で実施した研究を紹介しています。この研究では、8つの最先端推論モデルと、数学、科学分野の質疑応答、プログラミング、外部環境との複数回のやり取りを必要とする AI Agent タスクを含む12種類のテストが対象となりました。336組のモデルとタスクの組み合わせのうち、106組で価格の逆転が発生しました。つまり、API 単価が低いモデルのほうが、同じテストタスクを実行する際のコストが高くなったのです。

研究者は、その主な要因を過剰推論(overthinking)と過剰実行(overacting)の2つに分類しています。前者は推論 token を過剰に消費し、後者は AI Agent がタスクの分解、ツールの呼び出し、結果の読み取り、次のステップの判断を繰り返すことで発生します。AI Agent は外部環境とやり取りするたびに、それまでに蓄積されたタスク情報を再処理する可能性があるため、実行回数が増えるほど支出も膨らみます。

研究に含まれる AI Agent のテスト事例は、この問題をより明確に示しています。あるモデルは1,000ステップ近く実行したにもかかわらず、最終的にタスクを完了できませんでした。また、同じモデルに同一の問題を与えた場合でも、実行ごとの推論 token 消費量には最大9.7倍の差が生じました。これらの結果は、高価格のモデルが必ずしも割安であることを意味しません。しかし、1回当たりの呼び出し料金だけでは、業務全体のコストを判断できないことを、調達部門や IT 部門に十分示しています。調達部門と IT 部門が最初に行うべきことは、複数回のツール呼び出しが必要なプロセス、再試行が起こりやすいプロセス、明確な停止条件がないプロセスを特定し、優先的に実地テストの対象とすることです。

モデルを選ぶ前に、成功条件とテスト方法を明確にする

企業はまず、営業見積もり、調達価格の比較、品質異常の要約、カスタマーサポート回答案の作成、部門横断の承認資料整理など、頻度の高いタスクを3~5件選ぶことを推奨します。各タスクでは、実際の業務で使用する入力形式とツールを採用し、どのような結果を成功とみなすかをあらかじめ定義します。営業見積もりであれば、必須項目がすべて記載されているか、参照した注文や条項を追跡できるかを確認します。調達価格の比較では、仕様が正しく対応付けられているか、差異が明確に示されているかを確認できます。成功条件を「妥当な回答」のように曖昧に定義すると、評価者によって結論が異なる可能性があります。

テストでは、各モデルを同じ条件で繰り返し実行し、成否、token 消費量、ツールの呼び出し回数、実行ステップ数、費用、失敗理由を記録します。同じモデルを繰り返し実行しても結果に大きな差が生じることが研究で確認されているため、1回の成功や失敗だけを調達判断の根拠にすることは適切ではありません。タスク指示、利用可能なツール、成功条件など、テストのバージョンも保存する必要があります。保存していなければ、再テスト時に生じた差がモデルやプロセスによるものなのか、それともテスト内容の変更によるものなのかを判断できません。

結果を比較する際は、「成功タスク1件当たりのコスト」を指標として利用できます。成功した実行と失敗した実行にかかった費用をすべて合計し、成功回数で割って算出します。この指標を用いることで、失敗や再試行に伴う支出も同じ計算に含められ、レポートで単発の実行費用が最も低かった結果だけを選ぶことも防げます。タスクごとに異なるモデルを採用しても構いません。複雑な条項を解釈する業務では能力の高いモデルを優先的にテストし、形式が固定された定型的な整理業務では高速で低コストなモデルをテストできます。その後、チームは同じテスト記録を用いてタスクごとに適切なモデルを選定します。先に1つのモデルを指定し、すべてのプロセスをそのモデルに合わせるべきではありません。

モデル選定後、支出の増加をどう防ぐか?

モデルを選定した後も、実行時間とタスク1件当たりの費用上限に加え、ツール呼び出しと再試行の停止条件を設定する必要があります。AI Agent がデータ不足、外部システムの無応答、結果の連続不合格といった状況に直面した場合、プロセスを停止して担当者による確認に切り替えます。担当者は、どのステップで失敗したのか、支出がどこまで累積しているのかを確認したうえで、モデルの変更、タスク指示の修正、プロセスの分割、再起動のいずれを行うか判断します。スケジュールが解除されていないという理由だけで、システムを繰り返し実行させてはなりません。

EgentWrX では、企業が同一プラットフォーム上で Anthropic、OpenAI、オンプレミスモデルから選択できます。各プロバイダーには「最も高性能」「バランス型」「最速・最安」の3つの選択肢があり、企業は前述の実地テストの結果に基づいて、タスクごとに異なるモデルを設定できます。また、テナント、部門、メンバー、AI Agent の4階層で予算を設定できます。しきい値到達時の動作を「ブロック」に設定した場合、いずれかの階層で予算を使い切ると、タスクは停止します。長時間の実行を許可している場合、プラットフォームは60分経過時に実行を継続するか確認し、継続後も最長90分で終了します。タスク1件当たりの費用上限は3米ドルです。

定期実行タスクについては、EgentWrX がスケジュールの5回連続失敗後に自動で一時停止し、担当者による対応と再起動を待ちます。ただし、一時停止は費用の増加を防ぐだけで、失敗原因を判断する担当者の役割を代替するものではないため、企業は各スケジュールに担当者を指定する必要があります。どの予算階層でタスクが頻繁にブロックされているか、どのタスクで失敗が多いかを毎月確認し、モデルとプロセスを調整することを推奨します。モデルの性能や価格が変わった場合にも、元のテストセットを使って再度比較することで、検証可能な選定根拠を構築し、失敗したタスクによる費用の累積を抑えられます。

よくある質問

モデルの単価が最も安ければ、大量の定型業務に適していますか?

必ずしも適しているとは限りません。定型業務でも、データの反復検索、ツールの呼び出し、再試行が必要であれば、総支出は増加する可能性があります。実際の入力を使って繰り返しテストし、成功率、実行ステップ数、成功タスク1件当たりのコストを比較してから、利用を拡大するか判断してください。

成功タスク1件当たりのコストはどのように計算しますか?

同じテスト期間中に発生した、成功した実行と失敗した実行の費用をすべて合計し、成功回数で割ります。企業は成功条件とテストバージョンも固定する必要があります。そうでなければ、各モデルのコストを共通の基準で比較できず、調達判断にも活用できません。

モデルのテストは何回実施すれば参考になりますか?

同じモデルとタスクを繰り返し実行し、1回の結果だけで判断することは避けるべきです。テスト回数はタスクのリスクと予算に応じて設定できますが、消費量と成功率が安定しているかを確認するため、各回で同じ入力、ツール、成功条件、上限を使用する必要があります。

モデルの本番導入後、どのくらいの頻度で再評価する必要がありますか?

企業は定期的な確認サイクルを設定し、モデルの性能、価格、タスク指示、ツールに大きな変更があった場合にも再テストを実施する必要があります。元のタスクセットと成功条件を継続して使用することで、コストの差がモデルの変化によるものか、それともプロセスの変更によるものかを判断できます。

参考資料

30 分で、AI に先に任せられる業務を一緒に洗い出します

社員一人ひとりに AI の分身を持たせませんか。

コンサルタントより速やかにご連絡いたします。