ChatGPT APIの料金を計算するとき、100万トークン単価だけを見ても月額予算は出せません。実際の請求はモデル、入力、キャッシュ入力、出力、画像・音声・ツール、再試行、月間回数で変わります。本記事では、公式料金表から単価を転記して終わるのではなく、自社の1リクエストと月間件数から予算を作り、上限超過を防ぐ手順を説明します。
1回あたりの入力・出力・追加機能を分け、成功時と再試行時の両方を測ることが基本です。単価は更新されるため公式料金を参照し、月額にはログ、評価、監視、開発・保守費も加えます。
公開:2026年6月6日 最終リライト:2026年9月10日
- ChatGPT API料金の基本構造
- API料金の計算式
- 1リクエストから月額を見積もる手順
- 見積もり例:問い合わせ分類
- RAG利用で入力料金が増える理由
- 料金を抑える7つの方法
- 法人利用で必要な予算管理
- API料金以外にかかる費用
- モデルを切り替えるときの再計算
- 見積もりで起きやすい失敗
- 月額予算を作る計算シート
- 魚見の実務視点:安いモデルへ替える前に測ること
- ChatGPT API料金の結論:入力・キャッシュ・出力・ツールを分ける
- 主要モデルのAPI料金比較【2026年9月10日時点】
- API料金を日本円で計算する手順
- Standard・Batch・Fast modeを使い分ける
- Prompt Cachingで安くなる条件
- RAGのAPI料金を抑える設計
- モデルルーティングで費用と品質を両立する
- API料金以外の隠れたコスト
- 予算超過を防ぐ実装チェックリスト
- API導入前の30日検証プラン
- 日本語の文字数からAPI料金を決め打ちしない
- 失敗・再試行・タイムアウトを原価へ含める
- 経理・開発・事業部で見るダッシュボードを分ける
- まとめ
- よくある質問
- 参照した一次情報
ChatGPT API料金の基本構造
一般にテキストAPIは入力トークンと出力トークンで課金され、モデルごとに単価が異なります。同じプロンプトの前半を繰り返す場合はキャッシュ入力が適用されることがあり、非同期の大量処理ではBatch APIの条件を使える場合があります。画像、音声、検索、コンテナなどを組み合わせると別の料金要素が加わります。
| 料金要素 | 増える場面 | 確認するログ |
|---|---|---|
| 入力トークン | 長い指示、会話履歴、RAG文書 | prompt / input tokens |
| キャッシュ入力 | 共通の長い前提を再利用 | cached tokens |
| 出力トークン | 長文、JSON、詳細な推論結果 | completion / output tokens |
| ツール・メディア | 検索、画像、音声、実行環境 | 機能別利用回数 |
| 再試行 | 失敗、タイムアウト、品質再生成 | リクエスト数とエラー |
API料金の計算式
月額の概算は、入力・キャッシュ入力・出力を100万トークン単価へ合わせて計算します。モデル単価を固定値でコードへ埋め込むと価格改定時にずれるため、見積書には確認日と公式URLを残します。
テキスト利用の概算
月額 =(月間入力トークン ÷ 1,000,000 × 入力単価)+(月間キャッシュ入力 ÷ 1,000,000 × キャッシュ単価)+(月間出力トークン ÷ 1,000,000 × 出力単価)+追加機能。
1リクエストから月額を見積もる手順
- 本番に近い入力を20〜50件用意する
- 候補モデルごとに同じ完了条件で実行する
- 入力・キャッシュ・出力・ツール利用を記録する
- 成功率と平均再試行回数を出す
- 1回あたり平均費用を公式単価で計算する
- 平日・休日・繁忙期の月間件数を掛ける
- 上振れ分と監視・保守費を加えて予算にする
見積もり例:問い合わせ分類
たとえば月10万件の問い合わせ分類を想定しても、本文の長さ、カテゴリ定義、返却JSON、再試行率で費用は変わります。短い分類なら出力をカテゴリIDと確信度に限定し、長い回答文を生成しない方が安定します。単価は公式ページの対象モデル欄を使ってください。
| 仮定 | 測る値 | 改善案 |
|---|---|---|
| 長い分類ルールを毎回送る | 入力・キャッシュ比率 | 共通前提を固定しキャッシュ適用を確認 |
| 説明文も毎回返す | 出力トークン | 本番はカテゴリID中心にする |
| 曖昧な入力を再生成 | 再試行率 | 人へ戻す閾値を設ける |
| 全件を高性能モデルで処理 | 件数別精度と費用 | 軽量モデルと高性能モデルを振り分ける |
RAG利用で入力料金が増える理由
RAGでは検索結果の文書を毎回モデルへ渡すため、参照件数と1件の長さが入力費へ影響します。検索精度が低いまま多くの文書を詰め込むと、料金だけでなく回答品質も下がり得ます。チャンクの長さ、取得件数、重複除去、メタデータ絞り込みを調整し、正答率と入力量を同時に測ります。
料金を抑える7つの方法
- 用途に必要な最小モデルを比較する
- 出力形式と最大長を限定する
- 会話履歴を無制限に送らない
- RAGの取得件数と重複を減らす
- 共通プロンプトのキャッシュを確認する
- 即時性が不要な大量処理はBatch APIを検討する
- 失敗を無制限に再試行しない
安いモデルへ変えるだけで精度が下がり、人の確認が増えると総費用は高くなります。モデル費と確認工数を一つの表で比較します。
法人利用で必要な予算管理
| 管理項目 | 設定・運用 |
|---|---|
| プロジェクト分離 | 部署・用途・環境ごとに利用を分ける |
| 上限・通知 | 日次・月次の閾値と異常増加を通知 |
| キー管理 | 個人PCへ直書きせず、定期的に更新 |
| ログ | 個人情報を避け、利用量・モデル・エラーを記録 |
| 評価 | 価格改定やモデル変更時に同じデータで再比較 |
| 停止 | 予算超過や異常時に機能を縮退できる設計 |
API料金以外にかかる費用
本番では、プロンプトと評価データの整備、アプリ開発、データベース、検索基盤、監視、障害対応、セキュリティレビュー、人の確認が必要です。API利用料が小さくても、運用者が毎日手作業で確認すれば総費用は大きくなります。見積もりには初期費用と月次費用を分けて載せます。
モデルを切り替えるときの再計算
新しいモデルが安くても、出力形式や指示追従が変われば再試行と確認工数が増えることがあります。価格だけで即時に切り替えず、固定した評価データで正答率、重大誤り、平均入力・出力、処理時間を比較します。移行後は一部トラフィックで並行運用し、費用と品質の両方が合格した段階で比率を広げます。
用途が複数ある場合は、分類、要約、文章生成、複雑な判断を同じモデルへ統一しない方法もあります。軽い処理を低コストモデルへ、判断が難しい処理を高性能モデルまたは人へ振り分けることで、平均費用を下げながら重大誤りを抑えます。
見積もりで起きやすい失敗
サンプル1件だけで平均を出す、再試行を無視する、開発環境と本番を合算できない、価格の確認日を残さない、全リクエストを同じモデルで処理する、といった見積もりは外れやすくなります。平均値だけでなく、95パーセンタイルの入力長や繁忙日の件数も確認します。
月額予算を作る計算シート
競合記事の料金表だけでは、自社の請求額は決まりません。1回の処理量、月間回数、再試行率、キャッシュ利用率、追加機能を分けて入力します。単価は変更されるため、計算時点のOpenAI公式料金を参照してください。
| 入力項目 | 計算に使う値 | 確認元 |
|---|---|---|
| 入力トークン | 固定指示、会話履歴、検索結果、添付文書 | APIレスポンスのusage |
| キャッシュ入力 | 同じ先頭部分を再利用できた量 | cached tokens |
| 出力トークン | 回答本文と構造化出力 | output tokens |
| 月間成功回数 | 利用者数×1人当たり回数 | アプリログ |
| 再試行率 | タイムアウト、形式不正、品質不足による再実行 | エラーログ・評価ログ |
| 追加機能 | Web検索、画像、音声、保存、外部ツール等 | 利用機能ごとの公式料金 |
| 為替・税 | 請求通貨を社内予算へ換算 | 請求書と社内レート |
月額概算
= 1回当たりの入力費 + キャッシュ入力費 + 出力費 + 追加機能費
× 月間成功回数
×(1 + 再試行率)
+ ログ・監視・評価・保守費
魚見の実務視点:安いモデルへ替える前に測ること
マーケティング業務では、API単価を下げても分類ミスや不自然な文章が増え、担当者の修正時間や広告・LPの損失が増えることがあります。モデル比較は同じ評価データで行い、1回答の料金ではなく、採用できた回答1件当たりの費用で判断します。
| 用途 | 品質指標 | 費用と一緒に見る指標 |
|---|---|---|
| 問い合わせ分類 | 誤分類率、重要案件の見逃し | 人の再確認時間 |
| 広告文生成 | 審査否認、訴求の重複、採用率 | 採用案1件当たり費用 |
| 記事要約 | 重要条件の欠落、出典一致 | 公開可能な要約1件当たり費用 |
| RAG回答 | 根拠一致率、回答不能の適切さ | 解決1件当たり費用 |
予算超過を防ぐアラート設計
日次費用だけでは異常の発見が遅れます。1リクエスト当たりトークン、利用者別回数、再試行率、エラー率、モデル別費用を記録し、通常値から急増したときに通知します。月予算の50%、75%、90%で段階通知し、上限到達時は重要業務だけ継続できる運用にします。
当サイトのように記事制作や分析へAPIを使う場合も、長文を毎回すべて送り直すより、固定指示をキャッシュし、対象H2だけを処理し、公開前監査を別工程に分けた方が費用と確認範囲を抑えられます。
ChatGPT API料金の結論:入力・キャッシュ・出力・ツールを分ける
ChatGPT APIと呼ばれることが多いOpenAI APIは、基本的に使った量に応じた従量課金です。ChatGPT PlusやProの月額料金へAPI利用料が自動的に含まれるわけではありません。API原価を正しく見積もるには、入力token、キャッシュ入力token、出力token、Web検索などのツール、処理速度のサービス階層を別々に計算します。
| 費用 | 何が対象か | 増えやすい状況 |
|---|---|---|
| 入力 | 指示、会話履歴、添付・検索文書 | 履歴と全文を毎回送る |
| キャッシュ入力 | 再利用できた共通の先頭部分 | 共通部分が不安定でキャッシュが効かない |
| 出力 | 回答、構造化データ、推論に伴う出力 | 冗長な回答や再生成が多い |
| ツール | 検索、画像、音声等の該当機能 | 条件なしで毎回ツールを呼ぶ |
| 処理階層 | Standard、Batch、Fast等 | 低遅延を全処理へ適用 |
主要モデルのAPI料金比較【2026年9月10日時点】
以下はOpenAI公式モデル一覧に掲載された標準処理のテキストtoken単価です。1MTokは100万tokenを意味します。料金改定、長文コンテキスト、地域処理、追加機能で変わる場合があるため、実装時は必ず公式料金ページを再確認してください。
| モデル | 入力/1MTok | キャッシュ入力 | 出力/1MTok | 用途の考え方 |
|---|---|---|---|---|
| GPT-6 Astra | 10ドル | 1ドル | 50ドル | 難しい判断、複雑な複数工程 |
| GPT-5.6 Sol | 4ドル | 0.40ドル | 20ドル | 高品質な実務、分析、実装 |
| GPT-5.6 Terra | 2ドル | 0.20ドル | 12ドル | 品質と費用のバランス |
| GPT-5.6 Luna | 0.20ドル | 0.02ドル | 1.20ドル | 大量分類、定型抽出、軽量処理 |
重要:モデル単価が高くても、少ない再試行や短い出力で完了すれば1成功あたりの費用が低い場合があります。単価だけでなく、同じ評価セットを合格した処理の総費用で比較します。
API料金を日本円で計算する手順
- APIレスポンスのusageから入力・キャッシュ・出力tokenを取得する
- 1回の成功処理と失敗・再試行を分けて記録する
- 各tokenを100万で割り、モデル単価を掛ける
- 検索・画像・音声・Fast mode等の追加費用を足す
- 月間予定回数と利用者増加率を掛ける
- 請求時の為替、税、予備費を社内ルールで反映する
GPT-5.6 Terraで問い合わせ分類する例
1回あたり入力5,000token、キャッシュ入力3,000token、出力500tokenなら、入力0.01ドル、キャッシュ0.0006ドル、出力0.006ドルで、モデル部分は約0.0166ドルです。月10万回なら単純計算で約1,660ドルです。再試行率が5%なら、その分を追加して見積もります。
GPT-6 Astraで複雑な調査をする例
入力20万token、キャッシュ入力10万token、出力3万tokenの場合、入力2ドル、キャッシュ0.1ドル、出力1.5ドルで約3.6ドルです。Web検索などを使う場合は別料金を加えます。出力を10万tokenに伸ばすと出力だけで5ドルになるため、必要な形式と上限を先に決めます。
Standard・Batch・Fast modeを使い分ける
| 方式 | 向く処理 | 注意点 |
|---|---|---|
| Standard | 通常のリアルタイムAPI | 標準単価とレート制限を確認 |
| Batch | 即時性が不要な大量分類・評価 | 完了期限、対応モデル、結果取得を確認 |
| Fast mode | 低遅延が売上や体験へ直結する処理 | 標準より高い単価、長文条件、SLAを確認 |
すべてをFast modeへ統一すると費用が増えます。顧客が待つ対話は低遅延、夜間集計はBatch、管理画面の下書きはStandardというように、業務の待ち時間許容度で分けます。
Prompt Cachingで安くなる条件
Prompt Cachingは、同じシステム指示、長い規程、出力形式など共通の先頭部分を再利用できる処理に向きます。毎回異なる部分を先頭へ置く、順序を変える、タイムスタンプを共通部分へ入れると、キャッシュが効きにくくなります。
- 固定指示と可変入力を分離している
- 共通文書の順序と表記が安定している
- usageでcached tokensを実測している
- 機密情報を無理に共通化していない
- キャッシュ前提が崩れた場合の予算も計算している
RAGのAPI料金を抑える設計
RAGは関連文書を取得して入力へ追加するため、検索結果が多いほど入力tokenが増えます。文書を短く切ればよいわけではなく、回答に必要な意味のまとまり、更新単位、権限単位で分割します。
| 改善箇所 | 費用への効果 | 品質リスク |
|---|---|---|
| 検索件数を絞る | 入力token減 | 必要な根拠を落とす |
| 重複チャンクを除く | 同じ内容の再送を防ぐ | 文脈不足 |
| メタデータで絞る | 部署・日付・製品の範囲を限定 | タグ誤りで検索漏れ |
| 要約を保存 | 長文の再入力を抑える | 原文更新とのずれ |
料金削減後は、根拠一致率、回答不能の適切さ、重要情報の欠落を再評価します。安くなっても誤回答が増えれば、問い合わせ再対応や事故対応の費用が上回ります。
モデルルーティングで費用と品質を両立する
すべての依頼へ同じモデルを使わず、分類・抽出はLuna、一般的な生成はTerra、複雑な例外はSolまたはAstraというように段階化できます。ただし、入力内容を判断するルーター自体の誤分類も評価対象です。
- 同じ評価データを全候補モデルで実行する
- 重大誤り、採用率、再試行率を記録する
- 軽量モデルで合格したケースを固定する
- 低信頼・高リスクだけ上位モデルへ送る
- 月次でルーティング結果と総費用を見直す
API料金以外の隠れたコスト
| 項目 | 具体例 | 予算化の単位 |
|---|---|---|
| 開発 | 認証、UI、API連携、構造化出力 | 初期+改修 |
| 評価 | 正解データ、回帰テスト、人の採点 | モデル変更ごと |
| 運用 | ログ、監視、障害対応、問い合わせ | 月額 |
| データ | 整備、更新、権限、保持 | 月額・四半期 |
| セキュリティ | 秘密情報、アクセス、監査、事故対応 | 導入+継続 |
| 人の確認 | レビュー、差し戻し、公開承認 | 1件あたり時間 |
予算超過を防ぐ実装チェックリスト
- 本番・検証・部署でAPIプロジェクトを分ける
- モデル、利用者、機能別のtokenを記録する
- 1回の最大入力・最大出力を設定する
- タイムアウトと再試行回数に上限を置く
- 月予算50%、75%、90%で通知する
- 急増時に高コスト機能を止める縮退運転を用意する
- APIキーをコードや公開ログへ残さない
- 料金確認日と試算前提を文書化する
API導入前の30日検証プラン
| 期間 | 実施内容 | 確認する数字 |
|---|---|---|
| 1週目 | 1業務、100件程度の評価セットを用意 | 現行時間、ミス、処理量 |
| 2週目 | 複数モデルとプロンプトを比較 | 品質、token、再試行 |
| 3週目 | 限定利用者で実業務テスト | 採用率、確認時間、1成功単価 |
| 4週目 | 月間量へ換算し予算・上限を設定 | 通常月、繁忙月、障害時 |
魚見の実務では、文章生成や分類の単価だけでなく、公開・送信・反映まで完了した件数で見ます。APIが安くても人が全面的に書き直すなら、成功単価は高くなります。反対に上位モデルで手戻りが減り、CVや問い合わせにつながるなら、1tokenの単価が高くても投資効率は上がります。
日本語の文字数からAPI料金を決め打ちしない
日本語の1文字と1tokenは同じではありません。漢字、かな、英数字、URL、コード、空白、使用モデルのtokenizerで変わります。「1,000文字なら必ず○token」という換算だけで年間予算を作ると誤差が積み上がります。実際の代表入力をAPIへ送り、レスポンスのusageを取得してください。
代表サンプルは3種類で測る
短い問い合わせ、標準的な資料、最長クラスの添付文書を用意します。それぞれ10〜30件を実行し、中央値と上位10%のtoken量を記録します。平均値だけでは、長文資料が集中した日の費用とレート制限を見落とします。
| サンプル | 測る値 | 予算への使い方 |
|---|---|---|
| 短文 | 分類・短い回答のtoken | 日常の大量処理 |
| 標準 | 通常資料と会話履歴 | 月次予算の中心 |
| 長文 | 最大添付、長い履歴 | 繁忙月と上限設計 |
失敗・再試行・タイムアウトを原価へ含める
APIがエラーを返した処理だけでなく、形式不正、品質不足、外部ツールの失敗でやり直した処理にもtokenが発生する場合があります。成功リクエストの単価に、再試行率と失敗時の平均tokenを加えます。再試行回数は無制限にせず、同じ原因が続いたら人へ戻します。
(成功処理の総費用+失敗・再試行の総費用+人の確認費)÷採用・完了できた件数
構造化出力を利用しても、必須項目の欠落、型の不一致、業務ルール違反は別に検証します。JSONとして正しいことと、業務上正しいことは同じではありません。
経理・開発・事業部で見るダッシュボードを分ける
経理は月額と予算消化率、開発はtoken・エラー・遅延、事業部は完了件数・品質・CVを見ます。一つの請求額だけでは、費用が増えた理由が利用増なのか、再試行なのか、高価格モデルへの切替なのか分かりません。
| 閲覧者 | 主要指標 | 判断 |
|---|---|---|
| 経理・管理 | 月予算、消化率、部署別費用 | 追加予算・停止 |
| 開発・運用 | モデル別token、失敗、遅延 | 最適化・障害対応 |
| 事業責任者 | 成功単価、採用率、売上・CV | 継続・拡大・撤退 |
日次の急増アラートには、対象プロジェクト、利用者、モデル、機能、直前の変更を含めます。通知だけで止めず、優先度の低い処理を一時停止し、重要業務だけ軽量モデルへ切り替える手順を用意します。
月次レビューでは、費用が増えた処理を上位から並べ、利用増による正常な増加と、無駄な履歴・再試行による増加を分けます。品質が維持できる範囲だけ最適化し、変更後は同じ評価セットで採用率と重大誤りを再確認します。削減額だけでなく、確認時間と事業成果も同じ表へ残し、必ず次月の予算へ反映します。
まとめ
ChatGPT API料金は、入力・キャッシュ入力・出力・追加機能を分け、実測値と月間件数から計算します。公式料金を確認し、再試行、RAG、監視、人の確認まで加えてください。少数の本番相当データでモデル別の品質と総費用を比べ、上限と縮退運転を決めてから拡大すると予算超過を防ぎやすくなります。
よくある質問
ChatGPTの月額契約にAPI料金は含まれますか
通常は別の課金体系です。ChatGPT契約とAPI利用の請求画面を分けて確認してください。
トークン数はどう確認しますか
APIレスポンスのusage情報や利用ダッシュボード、ログで入力・出力を記録します。
日本語は料金が高くなりますか
文字数とトークン数は同じではありません。実際の日本語入力で測定してください。
Prompt Cachingは必ず使えますか
対象モデルや条件があります。共通の前提が繰り返されるか、公式仕様とusageで確認します。
Batch APIはいつ向きますか
即時応答が不要な大量の分類・要約・評価などです。対象モデルと処理期限を公式仕様で確認します。
最安モデルを選べばよいですか
品質低下で再試行や人の確認が増える場合があります。総費用で比較します。
予算超過を防ぐには
プロジェクト分離、上限通知、再試行制限、異常監視、縮退運転を用意します。
参照した一次情報
月間件数、品質要件、データ、確認工程から、本番費用と上限管理を設計します。

監修者プロフィール
魚見幸司
生まれ(32歳)
監修:魚見幸司
SEO、Web広告、SNS・LINE運用、LP制作・改善、アクセス解析、コンテンツマーケティング、生成AI導入を横断するデジタルマーケティングの専門家。広告代理店で最年少マーケティング事業部長を務め、グローバルマーケティング会社のCMOを経験しています。
成果指標から施策を逆算し、小規模検証から標準化へ進める方法と、人の確認を残した半自動化を重視。SEO・広告・SNS・LP・問い合わせを分断せず、事業成果までつなげる実務検証を行っています。
この記事の監修:AI活用マーケティング総合研究所|AIマーケティング・Web広告の専門家 SEO、GEO・LLMO、ChatGPT活用、広告運用、LP改善、アクセス解析を横断し、生成AIを集客と問い合わせにつなげる実務設計を支援しています。
監修方針:実務で再現できる条件、数値、リスク、確認手順を重視して内容を確認しています。 監修者・専門家情報を見る

