Skip to content

非公式本サイトは非公式の日本語ドキュメントであり、Cloudflare 公式サイトではありません。最新情報はdevelopers.cloudflare.comをご確認ください。

Moonshot AI のロゴ

kimi-k2.5

テキスト生成 • Moonshot AI

Markdown で表示Agent セットアップ
  • Cloudflare ホスト
  • 関数呼び出し
  • 非推奨
  • 推論
  • 画像入力

Kimi K2.5 はフロンティア規模のオープンソースモデルです。256k のコンテキストウィンドウ、マルチターンのツール呼び出し、ビジョン入力、構造化出力に対応し、エージェント型ワークロード向けです。

モデル情報
非推奨2026/5/30
コンテキストウィンドウ256,000 トークン
利用規約とライセンスリンク
関数呼び出し はい
推論はい
画像入力はい
バッチはい
単価$0.60 per M input tokens, $3.00 per M output tokens, $0.10 per M cached input tokens

プレイグラウンド

Workers AI LLM Playground でこのモデルを試せます。セットアップや認証は不要で、ブラウザからすぐにプレビューとテストができます。

LLM Playground を開く

使い方


export interface Env {
  AI: Ai;
}

export default {
  async fetch(request, env): Promise<Response> {

    const messages = [
      { role: "system", content: "You are a friendly assistant" },
      {
        role: "user",
        content: "What is the origin of the phrase Hello, World",
      },
    ];

    const stream = await env.AI.run("@cf/moonshotai/kimi-k2.5", {
      messages,
      stream: true,
    });

    return new Response(stream, {
      headers: { "content-type": "text/event-stream" },
    });
  },
} satisfies ExportedHandler<Env>;

export interface Env {
  AI: Ai;
}

export default {
  async fetch(request, env): Promise<Response> {

    const messages = [
      { role: "system", content: "You are a friendly assistant" },
      {
        role: "user",
        content: "What is the origin of the phrase Hello, World",
      },
    ];
    const response = await env.AI.run("@cf/moonshotai/kimi-k2.5", { messages });

    return Response.json(response);
  },
} satisfies ExportedHandler<Env>;

import os
import requests

ACCOUNT_ID = "your-account-id"
AUTH_TOKEN = os.environ.get("CLOUDFLARE_AUTH_TOKEN")

prompt = "Tell me all about PEP-8"
response = requests.post(
  f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/moonshotai/kimi-k2.5",
    headers={"Authorization": f"Bearer {AUTH_TOKEN}"},
    json={
      "messages": [
        {"role": "system", "content": "You are a friendly assistant"},
        {"role": "user", "content": prompt}
      ]
    }
)
result = response.json()
print(result)

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/moonshotai/kimi-k2.5 \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{ "messages": [{ "role": "system", "content": "You are a friendly assistant" }, { "role": "user", "content": "Why is pizza so good" }]}'

パラメーター

同期 — リクエストを送り、完了した応答を受け取ります
入力形式
prompt
string必須minLength: 1モデルが応答を生成するための入力テキストプロンプトです。
model
string使うモデルの ID です(例: `@cf/zai-org/glm-4.7-flash`)。
frequency_penalty
number | nullこれまでに出た頻度に応じて、新しいトークンにペナルティを与えます。
logit_bias
object | null指定したトークンが補完に現れる可能性を調整します。トークン ID を -100〜100 のバイアス値に対応づけます。
logprobs
boolean | null出力トークンの対数確率を返すかどうかです。
top_logprobs
integer | null各トークン位置で返す上位の対数確率の数です(0〜20)。`logprobs=true` が必要です。
max_tokens
integer | null`max_completion_tokens` の利用を推奨します。生成するトークンの最大数です。
max_completion_tokens
integer | null1 回の補完で生成できるトークン数の上限です。
metadata
object | nullオブジェクトに付けられる、最大 16 組のキーと値です。
modalities
array | nullモデルに求める出力の種類です(例: `['text']` または `['text', 'audio']`)。
n
integer | null各入力メッセージに対して生成するチャット補完の候補数です。
parallel_tool_calls
booleanデフォルト: trueツール利用時に並列の関数呼び出しを有効にするかどうかです。
presence_penalty
number | nullこれまでに出現したかどうかに応じて、新しいトークンにペナルティを与えます。
reasoning_effort
string | nullenum: low, medium, high推論モデル(o1、o3-mini など)の推論にかける労力を制限します。
seed
integer | null指定すると、システムは決定的なサンプリングを最善努力で行います。
service_tier
string | nullenum: auto, default, flex, scale, priorityリクエストの処理に使う処理タイプです。
store
boolean | nullモデルの蒸留や評価のために出力を保存するかどうかです。
stream
boolean | null`true` の場合、部分的なメッセージ差分が Server-Sent Events として送られます。
temperature
number | null0 から 2 のサンプリング temperature です。
top_p
number | nullNucleus sampling です。累積確率が `top_p` までのトークンを候補にします。
user
string不正利用の監視用に、エンドユーザーを表す一意の識別子です。
id
stringチャット補完の一意の識別子です。
object
string
created
integer補完が作成された Unix タイムスタンプ(秒)です。
model
stringチャット補完に使ったモデルです。
system_fingerprint
string | null
service_tier
string | nullenum: auto, default, flex, scale, priority
ストリーミング — `stream: true` でリクエストを送り、server-sent events を受け取ります
入力形式
prompt
string必須minLength: 1モデルが応答を生成するための入力テキストプロンプトです。
model
string使うモデルの ID です(例: `@cf/zai-org/glm-4.7-flash`)。
frequency_penalty
number | nullこれまでに出た頻度に応じて、新しいトークンにペナルティを与えます。
logit_bias
object | null指定したトークンが補完に現れる可能性を調整します。トークン ID を -100〜100 のバイアス値に対応づけます。
logprobs
boolean | null出力トークンの対数確率を返すかどうかです。
top_logprobs
integer | null各トークン位置で返す上位の対数確率の数です(0〜20)。`logprobs=true` が必要です。
max_tokens
integer | null`max_completion_tokens` の利用を推奨します。生成するトークンの最大数です。
max_completion_tokens
integer | null1 回の補完で生成できるトークン数の上限です。
metadata
object | nullオブジェクトに付けられる、最大 16 組のキーと値です。
modalities
array | nullモデルに求める出力の種類です(例: `['text']` または `['text', 'audio']`)。
n
integer | null各入力メッセージに対して生成するチャット補完の候補数です。
parallel_tool_calls
booleanデフォルト: trueツール利用時に並列の関数呼び出しを有効にするかどうかです。
presence_penalty
number | nullこれまでに出現したかどうかに応じて、新しいトークンにペナルティを与えます。
reasoning_effort
string | nullenum: low, medium, high推論モデル(o1、o3-mini など)の推論にかける労力を制限します。
seed
integer | null指定すると、システムは決定的なサンプリングを最善努力で行います。
service_tier
string | nullenum: auto, default, flex, scale, priorityリクエストの処理に使う処理タイプです。
store
boolean | nullモデルの蒸留や評価のために出力を保存するかどうかです。
stream
boolean | null`true` の場合、部分的なメッセージ差分が Server-Sent Events として送られます。
temperature
number | null0 から 2 のサンプリング temperature です。
top_p
number | nullNucleus sampling です。累積確率が `top_p` までのトークンを候補にします。
user
string不正利用の監視用に、エンドユーザーを表す一意の識別子です。
type
string
contentType
text/event-stream
format
binary
バッチ — 1 回の API 呼び出しで複数のリクエストを送ります
id
stringチャット補完の一意の識別子です。
object
string
created
integer補完が作成された Unix タイムスタンプ(秒)です。
model
stringチャット補完に使ったモデルです。
system_fingerprint
string | null
service_tier
string | nullenum: auto, default, flex, scale, priority

API スキーマ(Raw)

同期Input
同期Output
ストリーミングInput
ストリーミングOutput
バッチInput
バッチOutput

役に立ちましたか?