AI Gateway では、リクエスト単位でカスタムコストを設定できます。カスタムコストには、交渉済みの入力、出力、キャッシュ読み取り、キャッシュ書き込みの単価を反映できます。デフォルトまたは公開のモデルコストより優先されます。
API リクエストにカスタムコストを追加するには、cf-aig-custom-cost ヘッダーを使います。このヘッダーは次のプロパティをサポートします。
per_token_in: 入力トークンあたりのコスト。per_token_out: 出力トークンあたりのコスト。per_cache_read_token: キャッシュ読み取りトークンあたりのコスト。per_cache_write_token: キャッシュ書き込みトークンあたりのコスト。
小数点以下の桁数に制限はありません。値が小さくても、正確にコストを計算できます。
キャッシュトークンの価格設定は任意です。有効にするには、キャッシュ単価を少なくとも 1 つ指定します。一方だけ指定した場合、もう一方のデフォルトは per_token_in です。両方を省略すると、AI Gateway はキャッシュトークン数を無視し、既存の入力・出力の計算を使います。
プロバイダーによって、キャッシュ使用量の報告方法は異なります。キャッシュ読み取り・書き込みトークンを入力トークン数に含める場合と、入力とキャッシュを別カウントで報告する場合があります。
AI Gateway は、各プロバイダーとモデルのキャッシュ報告方法を自動で考慮します。キャッシュトークンが入力数に含まれる場合は、per_token_in を適用する前に差し引きます。別カウントの場合は、入力コストに加えてキャッシュコストを適用します。これにより、キャッシュトークンの二重計上を防ぎます。
たとえば、包括的なレスポンスが次の使用量を報告したとします。
- 入力トークン 1,000
- キャッシュ読み取りトークン 600
- キャッシュ書き込みトークン 200
- 出力トークン 100
AI Gateway は新規入力トークンを 200 と計算します(1,000 - 600 - 200)。その後、各カスタム単価を対応するトークン数に適用します。
カスタムコストはログに下線付きで表示されるため、カスタム価格が適用されたかどうかを簡単に確認できます。
この例では、交渉価格は入力 100 万トークンあたり $1、出力 100 万トークンあたり $2、キャッシュ読み取り 100 万トークンあたり $0.10、キャッシュ書き込み 100 万トークンあたり $0.50 です。
curl https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai/chat/completions \
--header "Authorization: Bearer $TOKEN" \
--header 'Content-Type: application/json' \
--header 'cf-aig-custom-cost: {"per_token_in":0.000001,"per_token_out":0.000002,"per_cache_read_token":0.0000001,"per_cache_write_token":0.0000005}' \
--data ' {
"model": "gpt-4o-mini",
"messages": [
{
"role": "user",
"content": "When is Cloudflare’s Birthday Week?"
}
]
}'