本文へスキップ

【実測検証】AIモデルは単価表で選ぶな――5モデル25試行で判明した「請求額逆転」の真実

公開日 最終更新日 解説
share
5つのAIモデルについてカタログ単価と実務タスク単位コストの順位逆転を比較する技術解説

100万トークン当たりの単価が最安でも、1件の仕事を最安で終えられるとは限りません。同じ業務タスクを5モデルで各5回、計25回実行したところ、カタログ単価2位のGPT-5.6 Lunaが実コスト1位となり、単価1位のGLM 5.3 Flashを3.2倍上回るコスト効率を示しました。

1. 結論:単価表と請求額の順位は逆転する

モデルカタログ単価単価順位実コスト実コスト順位
GLM 5.3 Flash$0.251位0.52円2位
GPT-5.6 Luna$0.602位0.16円1位
DeepSeek V4 Flash 0731$0.663位1.36円4位
Gemini 3.7 Flash$1.8754位0.98円3位
Gemini 3.8 Flash$1.8754位1.65円5位

入力単価だけならGLM 5.3 Flashが最安ですが、実際のタスクではGPT-5.6 Lunaが0.16円で最安でした。GLMの0.52円に対して約3.2分の1です。一方、同じ$1.875のGemini 3.7 Flashと3.8 Flashにも、実コストで約1.7倍の差が生じました。

2. なぜ単価表だけでは実務コストを読めないのか

API料金は通常、入力・キャッシュ入力・出力などのトークン単価として表示されます。しかし請求額を決めるのは、単価だけではありません。モデルが内部推論に何トークン使うか、再試行が何回発生するか、成果物を人間が修正する必要があるか、処理待ちが業務全体へどれだけ影響するかが加わります。

3. 請求額を左右したのは「見えない推論トークン」

モデル応答本文推論出力計推論比率
GPT-5.6 Luna5137571,27059.6%
Gemini 3.7 Flash5322,4382,97082.1%
Gemini 3.8 Flash4724,8675,33891.2%
DeepSeek V4 Flash 073151712,30112,81896.0%
GLM 5.3 Flash68612,38313,06994.7%

ユーザーが受け取る本文は472〜686トークンの範囲に収まりましたが、内部推論を含む出力総量は1,270〜13,069トークンまで広がりました。最大は最小の約10.3倍です。低い出力単価でも、同じ答えを作るために10倍のトークンを消費すれば、請求額の優位性は消えます。

4. 同一単価でもGemini 3.7と3.8は別の経済性を持つ

指標Gemini 3.7 FlashGemini 3.8 Flash
カタログ単価$1.875$1.875
実コスト0.98円1.65円
処理時間中央値14.8秒26.2秒
推論トークン2,4384,867
無修正成果物0/5回2/5回

Gemini 3.7 Flashは速度と請求額で優位でしたが、今回の品質基準では無修正成果物がありませんでした。3.8 Flashは約1.7倍の実コストと長い処理時間を要した一方、5回中2回は無修正で利用できました。同じ単価表の行に並ぶモデルでも、速度・推論量・修正率を含めると用途は異なります。

5. 処理時間には最大18倍近い開き

モデル中央値最短〜最長
Gemini 3.7 Flash14.8秒13.1〜17.8秒
Gemini 3.8 Flash26.2秒17.5〜30.6秒
GPT-5.6 Luna32.8秒21.5〜42.2秒
DeepSeek V4 Flash 0731111.6秒61.5〜196.1秒
GLM 5.3 Flash263.0秒136.4〜509.9秒

最速のGemini 3.7 Flashと最遅のGLM 5.3 Flashを中央値で比べると約17.8倍です。夜間バッチなら許容できる待ち時間でも、対話UIや有人オペレーションでは離脱や作業停止につながります。コスト最適化では、円だけでなくサービスレベル目標も同じルーティング条件に含める必要があります。

6. 品質を入れると「安い成果物」の順位が再び変わる

モデル無修正成果物無修正成果物単価
GPT-5.6 Luna5/5回0.16円
GLM 5.3 Flash3/5回0.86円
DeepSeek V4 Flash 07314/5回1.70円
Gemini 3.8 Flash2/5回4.11円
Gemini 3.7 Flash0/5回算出不能

品質監査を通過した成果物だけを分母にすると、失敗した試行の費用も成功分へ配賦されます。GPT-5.6 Lunaは5回すべてが無修正だったため0.16円を維持しました。Gemini 3.7 Flashは高速でしたが合格が0件だったため、今回の条件では無修正成果物単価を算出できません。

7. 5モデルを用途別にルーティングする

用途推奨モデル判断理由
全社標準GPT-5.6 Luna最安の実コストと5/5回の無修正品質
即応対話Gemini 3.7 Flash中央値14.8秒。品質ゲート併用が前提
短文正確性Gemini 3.8 Flash3.7より無修正率が高い
夜間バッチGLM 5.3 Flash低単価。長い待ち時間を許容できる処理向け
事実網羅草案DeepSeek V4 Flash 0731推論量を使った草案生成。後段監査を前提

単一モデルへ全処理を固定するより、タスクの品質基準、待ち時間上限、予算、機密区分に応じて経路を選ぶ方が合理的です。重要なのはモデル名を固定することではなく、同じ評価セットを定期実行し、結果に応じてルーティング規則を更新できることです。

8. 実装すべきルーティング指標

  • タスク完了コスト:入力、キャッシュ、応答、推論、再試行を同じタスクIDへ集約する
  • 品質合格率:形式、事実性、禁止事項、修正要否を自動評価と人手監査で記録する
  • 遅延分布:平均だけでなく中央値、上位95%、タイムアウト率を用途別に監視する
  • モデル・経路情報:モデルバージョン、API提供者、リージョン、処理モードを残す
  • フォールバック:品質不合格、予算超過、遅延超過時の再実行先と最大回数を定義する

これらを共通化するのがAIゲートウェイの役割です。RiN Gatewayのような制御層では、名目単価ではなく実測されたタスク単位コストをポリシー判断へ取り込み、品質・速度・データ境界を満たす経路だけを選択できる設計が重要です。

9. 自社ベンチマークを作る際の注意点

  • 実際の業務入力を匿名化し、短文・長文・検索・コードなどタスク群を分ける
  • 温度、最大出力、推論強度、ツール利用条件を固定し、モデルごとの差を記録する
  • 料金表ではなくAPIレスポンスと請求データから入力・応答・推論トークンを採取する
  • 正答率だけでなく、無修正率、修正時間、処理時間、エラー率を測る
  • モデル更新や料金改定後に同じ評価セットを再実行し、過去結果と比較する

10. 結論:買うべきなのは安いトークンではなく、安く完了する仕事

今回の25試行では、カタログ単価2位のGPT-5.6 Lunaが実コストと無修正成果物単価の双方で1位になりました。反対に、カタログ単価が最安のGLM 5.3 Flashは大量の推論トークンと長い処理時間により、請求額では2位でした。

モデル選定の調達単位を「100万トークン」から「品質基準を満たした1タスク」へ変えるべきです。モデルは更新され、順位も変わります。だからこそ、単一の勝者を決めるのではなく、自社データで測定し、用途別に経路を切り替える運用能力が長期的なコスト優位になります。

よくある質問

入力・出力単価が安いモデルほど、実務でも安くなりますか?

必ずしも安くなりません。内部推論トークン、再試行、品質不合格、人手修正、待ち時間を含めると順位が逆転します。今回の検証では、単価2位のGPT-5.6 Lunaがタスク実コスト1位でした。

推論トークンが多いモデルほど品質も高いのですか?

比例するとは限りません。推論量は難しい問題で品質向上に寄与する場合がありますが、今回の同一タスクでは総出力トークンに最大約10.3倍の差があり、推論量の多さだけでは無修正率を説明できませんでした。タスク別の実測が必要です。

企業はどのAIモデルを標準採用すべきですか?

今回の条件では全社標準にGPT-5.6 Lunaを推奨しますが、即応対話、夜間バッチ、草案生成など用途によって最適モデルは異なります。品質、遅延、コスト、データ境界を条件にしたマルチモデルルーティングが有効です。

参照した一次情報

モデル提供各社

記事情報

執筆吉田 拓馬(株式会社Metelix CEO Office)
技術監修株式会社Metelix エンジニアリングチーム
公開日
最終更新日
分類解説(LLM実効コスト・推論トークン構造・マルチモデルルーティング)
利害関係本記事は、AIゲートウェイ製品であるRiN Gatewayを提供する株式会社Metelixが、自社実測結果に基づいて執筆しています。
評価時点2026年9月5日。料金、モデル仕様、提供条件、為替は変動するため、導入時には最新情報と自社タスクで再検証してください。

関連記事

改訂履歴

初版公開
share

Free Whitepaper

ホワイトペーパー
無料ダウンロード

5モデル25試行の検証結果を8ページに凝縮。タスク単位コスト、推論トークン、速度、品質をまとめて確認できます。

ご入力いただいた情報は、資料提供および当社サービスのご案内に利用します。 詳細は当社プライバシーポリシーをご確認ください。

RiN Gateway

このコラムの内容を自社に適用する方法をご相談ください

RiN Gatewayは、企業のAI活用における統制・ガバナンス・コスト最適化を支援するプラットフォームです。トライアルや導入相談はお気軽にどうぞ。