プログラムの作成や修正をAIに任せるとき、単価の安いAIモデルを選べば費用も抑えられると思いがちです。ところが、AIの動作監視や評価を手がけるFiddlerの研究チームが複数のAIモデルに不具合を修正させて比べたところ、単価が安くても、正しく修正するための費用はかえって高くなる場合があることが分かりました。

Why Cheaper Models Cost More to Complete Coding Tasks

https://www.fiddler.ai/blog/cheaper-ai-models-coding-agent-cost



プログラムからAIモデルを利用するためのAPIでは、入力・出力する文章やコードを細かく区切った「トークン」の数に応じて料金がかかります。このトークン単価と実際の修正費用の関係を調べるため、Fiddlerの研究チームは、Anthropicの「Claude Haiku 4.5」と「Claude Sonnet 5」を比較しました。実験で使った料金体系では、入力・出力ともにHaikuのトークン単価はSonnetの半額です。

研究チームは、Pythonで書かれたプログラムの不具合を直す課題5件を用意しました。AIモデルが1つの課題に取り組み始めてから終了するまでを1回の試行とし、5課題に各3回取り組む計15回を1セットとして、各AIモデルで3セット実施しました。試行回数は1つのAIモデル当たり45回で、合計90回です。

各試行では、AIモデルが「ファイルの中身を調べる」「コードを書き換える」「テストを実行する」といった作業を、命令(コマンド)として実験用プログラムに指示しました。プログラムはAIモデルの応答1回につき命令を1つ実行してその結果をAIモデルに返し、AIモデルは結果を確認してから次の作業を指示する想定です。こうして作業を1つずつ進め、AIモデルが修正完了を報告したら試行を終了しました。なお、完了の報告がなくても、AIモデルが8回応答した時点で打ち切るルールになっていました。

ただし、AIモデルが完了を報告しても不具合が直っているとは限らないため、研究チームはAIモデルに見せるテストとは別に、内容を伏せたテストも用意しました。修正後のコードがこのテストを通過した場合だけ成功と判定し、失敗分も含めた総費用を成功した試行の数で割った「成功1件当たりのコスト」で比較しています。

その結果、各AIモデルの45回分の総費用は、Sonnetが0.45ドル(約71円)、Haikuが4ドル(約630円)でした。また、成功1件当たりのコストをセットごとに比べると、HaikuはSonnetの8.4倍~14.1倍となり、3セットすべてで高くつきました。以下のグラフは横軸が実験の各セット、縦軸が成功1件当たりのコスト(ドル)で、オレンジ色の棒がSonnet、赤茶色の棒がHaikuを示しています。



この費用差を生んだ主な原因は、Haikuが1回の応答で大量の文章を生成していたことでした。実際、出力トークン数の中央値はSonnetが16だったのに対し、Haikuは361で、最長の応答にも大きな差がありました。以下のグラフの上段は中央値と「90%の応答がその長さ以下に収まる値」、下段は最大値を示しています。横軸は出力トークン数、オレンジ色はSonnet、赤茶色はHaikuを示しており、上下では横軸の目盛りが異なります。



そこで研究チームが長い応答の中身を調べると、Haikuが実行していないコマンドの結果まで生成していることが分かりました。Haikuは実際の結果を待たずに予想した結果を文章に書き、その予想を前提に次のコマンドと結果まで書き続けていたとのこと。例えば、ある応答には60個のコマンドと架空の実行結果が並び、修正完了と報告するまでに2万1492トークンを使っていました。しかし、実験用プログラムは1回の応答に含まれる先頭のコマンド1個しか実行しない仕組みのため、残り59個は文章に書かれただけで、実行されていなかったそうです。

こうした長い応答は文章を生成する際の出力料金に加え、その後の入力料金も増やします。この実験では過去の応答を会話履歴として毎回AIモデルに渡すため、同じ文章を繰り返し読み込む分にも料金がかかっていました。以下のグラフは5回やりとりした試行の一例で、5回目の入力トークン数はHaikuが9930、Sonnetが1220でした。横軸はやりとりの回数、縦軸は各回に読み込んだトークン数で、赤茶色がHaiku、オレンジ色がSonnetです。



応答の長さと費用の関係を確かめるため、研究チームはHaikuの試行を実際の応答が短かったものと長かったものに分け、1回のやりとり当たりの費用も比べました。その結果、短かったグループは0.00235ドル(約0.37円)で、Sonnetの全試行から求めた1回当たりの費用0.00244ドル(約0.39円)をわずかに下回りました。一方、長かったグループでは0.01693ドル(約2.7円)となり、短かったグループの7.2倍でした。以下のグラフは上から「応答が短かったHaiku」「Sonnetの全試行」「応答が長かったHaiku」で、横軸は1回のやりとり当たりの費用(ドル)です。



なお、同じ条件で繰り返した追加実験でも成功1件当たりのコストはHaikuの方が高くつきました。ただし、極端に長い応答が1回あるだけでも全体の費用が大きく変わるため、費用差の大きさは一定ではなかったとのことです。

Fiddlerの研究チームは、課題や実行方法によって結果は変わるため、今回の費用差がすべてのコーディング作業に当てはまるわけではないと説明しています。そのため、AIモデルを選ぶ際は実際の業務に近い課題で試し、失敗した試行の分も含めて正しく修正できた1件当たりの費用を比べる必要があると指摘しています。