- Cloudflare ホスト
- 関数呼び出し
- 推論
- 画像入力
Kimi K2.6 はフロンティア規模のオープンソース 1T パラメータモデルです。262.1k のコンテキストウィンドウ、マルチターンのツール呼び出し、ビジョン入力、構造化出力に対応し、エージェント型ワークロード向けです。
| モデル情報 | |
|---|---|
| コンテキストウィンドウ ↗ | 262,144 トークン |
| 利用規約とライセンス | リンク ↗ |
| 関数呼び出し ↗ | はい |
| 推論 | はい |
| 画像入力 | はい |
| 単価 | $0.95 per M input tokens, $0.16 per M cached input tokens, $4.00 per M output tokens |
Workers AI LLM Playground でこのモデルを試せます。セットアップや認証は不要で、ブラウザからすぐにプレビューとテストができます。
LLM Playground を開く
export interface Env {
AI: Ai;
}
export default {
async fetch(request, env): Promise<Response> {
const messages = [
{ role: "system", content: "You are a friendly assistant" },
{
role: "user",
content: "What is the origin of the phrase Hello, World",
},
];
const stream = await env.AI.run("@cf/moonshotai/kimi-k2.6", {
messages,
stream: true,
});
return new Response(stream, {
headers: { "content-type": "text/event-stream" },
});
},
} satisfies ExportedHandler<Env>;
export interface Env {
AI: Ai;
}
export default {
async fetch(request, env): Promise<Response> {
const messages = [
{ role: "system", content: "You are a friendly assistant" },
{
role: "user",
content: "What is the origin of the phrase Hello, World",
},
];
const response = await env.AI.run("@cf/moonshotai/kimi-k2.6", { messages });
return Response.json(response);
},
} satisfies ExportedHandler<Env>;
import os
import requests
ACCOUNT_ID = "your-account-id"
AUTH_TOKEN = os.environ.get("CLOUDFLARE_AUTH_TOKEN")
prompt = "Tell me all about PEP-8"
response = requests.post(
f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/moonshotai/kimi-k2.6",
headers={"Authorization": f"Bearer {AUTH_TOKEN}"},
json={
"messages": [
{"role": "system", "content": "You are a friendly assistant"},
{"role": "user", "content": prompt}
]
}
)
result = response.json()
print(result)
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/moonshotai/kimi-k2.6 \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{ "messages": [{ "role": "system", "content": "You are a friendly assistant" }, { "role": "user", "content": "Why is pizza so good" }]}'同期 — リクエストを送り、完了した応答を受け取ります
prompt
string必須minLength: 1モデルが応答を生成するための入力テキストプロンプトです。model
string使うモデルの ID です(例: `@cf/zai-org/glm-4.7-flash`)。▶audio{}
object音声出力のパラメーターです。`modalities` に `audio` が含まれるときに必須です。frequency_penalty
number | nullこれまでに出た頻度に応じて、新しいトークンにペナルティを与えます。logit_bias
object | null指定したトークンが補完に現れる可能性を調整します。トークン ID を -100〜100 のバイアス値に対応づけます。logprobs
boolean | null出力トークンの対数確率を返すかどうかです。top_logprobs
integer | null各トークン位置で返す上位の対数確率の数です(0〜20)。`logprobs=true` が必要です。max_tokens
integer | null`max_completion_tokens` の利用を推奨します。生成するトークンの最大数です。max_completion_tokens
integer | null1 回の補完で生成できるトークン数の上限です。metadata
object | nullオブジェクトに付けられる、最大 16 組のキーと値です。modalities
array | nullモデルに求める出力の種類です(例: `['text']` または `['text', 'audio']`)。n
integer | null各入力メッセージに対して生成するチャット補完の候補数です。parallel_tool_calls
booleanデフォルト: trueツール利用時に並列の関数呼び出しを有効にするかどうかです。▶prediction{}
objectpresence_penalty
number | nullこれまでに出現したかどうかに応じて、新しいトークンにペナルティを与えます。reasoning_effort
string | nullenum: low, medium, high推論モデル(o1、o3-mini など)の推論にかける労力を制限します。▶chat_template_kwargs{}
object▶response_format
いずれかモデルが出力しなければならない形式を指定します。seed
integer | null指定すると、システムは決定的なサンプリングを最善努力で行います。service_tier
string | nullenum: auto, default, flex, scale, priorityリクエストの処理に使う処理タイプです。▶stop
いずれかstore
boolean | nullモデルの蒸留や評価のために出力を保存するかどうかです。stream
boolean | null`true` の場合、部分的なメッセージ差分が Server-Sent Events として送られます。▶stream_options{}
objecttemperature
number | null0 から 2 のサンプリング temperature です。▶tool_choice
いずれかモデルがツールを呼び出すかどうかを制御します。`none` は呼び出さない、`auto` はモデルが判断、`required` は必ず呼び出します。▶tools[]
arrayモデルが呼び出してよいツールの一覧です。top_p
number | nullNucleus sampling です。累積確率が `top_p` までのトークンを候補にします。user
string不正利用の監視用に、エンドユーザーを表す一意の識別子です。▶web_search_options{}
object組み込み Web 検索を使うときの、Web 検索ツールのオプションです。▶function_call
いずれか▶functions[]
arrayminItems: 1maxItems: 128id
stringチャット補完の一意の識別子です。object
stringcreated
integer補完が作成された Unix タイムスタンプ(秒)です。model
stringチャット補完に使ったモデルです。▶choices[]
arrayminItems: 1▶usage{}
objectsystem_fingerprint
string | nullservice_tier
string | nullenum: auto, default, flex, scale, priorityストリーミング — `stream: true` でリクエストを送り、server-sent events を受け取ります
prompt
string必須minLength: 1モデルが応答を生成するための入力テキストプロンプトです。model
string使うモデルの ID です(例: `@cf/zai-org/glm-4.7-flash`)。▶audio{}
object音声出力のパラメーターです。`modalities` に `audio` が含まれるときに必須です。frequency_penalty
number | nullこれまでに出た頻度に応じて、新しいトークンにペナルティを与えます。logit_bias
object | null指定したトークンが補完に現れる可能性を調整します。トークン ID を -100〜100 のバイアス値に対応づけます。logprobs
boolean | null出力トークンの対数確率を返すかどうかです。top_logprobs
integer | null各トークン位置で返す上位の対数確率の数です(0〜20)。`logprobs=true` が必要です。max_tokens
integer | null`max_completion_tokens` の利用を推奨します。生成するトークンの最大数です。max_completion_tokens
integer | null1 回の補完で生成できるトークン数の上限です。metadata
object | nullオブジェクトに付けられる、最大 16 組のキーと値です。modalities
array | nullモデルに求める出力の種類です(例: `['text']` または `['text', 'audio']`)。n
integer | null各入力メッセージに対して生成するチャット補完の候補数です。parallel_tool_calls
booleanデフォルト: trueツール利用時に並列の関数呼び出しを有効にするかどうかです。▶prediction{}
objectpresence_penalty
number | nullこれまでに出現したかどうかに応じて、新しいトークンにペナルティを与えます。reasoning_effort
string | nullenum: low, medium, high推論モデル(o1、o3-mini など)の推論にかける労力を制限します。▶chat_template_kwargs{}
object▶response_format
いずれかモデルが出力しなければならない形式を指定します。seed
integer | null指定すると、システムは決定的なサンプリングを最善努力で行います。service_tier
string | nullenum: auto, default, flex, scale, priorityリクエストの処理に使う処理タイプです。▶stop
いずれかstore
boolean | nullモデルの蒸留や評価のために出力を保存するかどうかです。stream
boolean | null`true` の場合、部分的なメッセージ差分が Server-Sent Events として送られます。▶stream_options{}
objecttemperature
number | null0 から 2 のサンプリング temperature です。▶tool_choice
いずれかモデルがツールを呼び出すかどうかを制御します。`none` は呼び出さない、`auto` はモデルが判断、`required` は必ず呼び出します。▶tools[]
arrayモデルが呼び出してよいツールの一覧です。top_p
number | nullNucleus sampling です。累積確率が `top_p` までのトークンを候補にします。user
string不正利用の監視用に、エンドユーザーを表す一意の識別子です。▶web_search_options{}
object組み込み Web 検索を使うときの、Web 検索ツールのオプションです。▶function_call
いずれか▶functions[]
arrayminItems: 1maxItems: 128type
stringcontentType
text/event-streamformat
binaryバッチ — 1 回の API 呼び出しで複数のリクエストを送ります
▶requests[]
arrayid
stringチャット補完の一意の識別子です。object
stringcreated
integer補完が作成された Unix タイムスタンプ(秒)です。model
stringチャット補完に使ったモデルです。▶choices[]
arrayminItems: 1▶usage{}
objectsystem_fingerprint
string | nullservice_tier
string | nullenum: auto, default, flex, scale, priority