- Cloudflare ホスト
- 非推奨
Meta Llama 3.1 の多言語大規模言語モデル(LLM)コレクションは、事前学習済みおよび指示チューニング済みの生成モデル群です。Llama 3.1 の指示チューニング済みテキスト専用モデルは、多言語対話向けに最適化されており、一般的な業界ベンチマークで多くのオープンソースおよびクローズドなチャットモデルを上回ります。
| モデル情報 | |
|---|---|
| 非推奨 | 2026/5/30 |
| コンテキストウィンドウ ↗ | 24,000 トークン |
| 利用規約とライセンス | リンク ↗ |
Workers AI LLM Playground でこのモデルを試せます。セットアップや認証は不要で、ブラウザからすぐにプレビューとテストができます。
LLM Playground を開く
export interface Env {
AI: Ai;
}
export default {
async fetch(request, env): Promise<Response> {
const messages = [
{ role: "system", content: "You are a friendly assistant" },
{
role: "user",
content: "What is the origin of the phrase Hello, World",
},
];
const stream = await env.AI.run("@cf/meta/llama-3.1-70b-instruct", {
messages,
stream: true,
});
return new Response(stream, {
headers: { "content-type": "text/event-stream" },
});
},
} satisfies ExportedHandler<Env>;
export interface Env {
AI: Ai;
}
export default {
async fetch(request, env): Promise<Response> {
const messages = [
{ role: "system", content: "You are a friendly assistant" },
{
role: "user",
content: "What is the origin of the phrase Hello, World",
},
];
const response = await env.AI.run("@cf/meta/llama-3.1-70b-instruct", { messages });
return Response.json(response);
},
} satisfies ExportedHandler<Env>;
import os
import requests
ACCOUNT_ID = "your-account-id"
AUTH_TOKEN = os.environ.get("CLOUDFLARE_AUTH_TOKEN")
prompt = "Tell me all about PEP-8"
response = requests.post(
f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/meta/llama-3.1-70b-instruct",
headers={"Authorization": f"Bearer {AUTH_TOKEN}"},
json={
"messages": [
{"role": "system", "content": "You are a friendly assistant"},
{"role": "user", "content": prompt}
]
}
)
result = response.json()
print(result)
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/meta/llama-3.1-70b-instruct \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{ "messages": [{ "role": "system", "content": "You are a friendly assistant" }, { "role": "user", "content": "Why is pizza so good" }]}'入力
frequency_penalty
numbermaximum: 2minimum: 0同じ行をそのまま繰り返す可能性を下げます。▶image
いずれかlora
stringベースモデルを微調整する LoRA(Low-Rank Adaptation)モデルの名前です。max_tokens
integerデフォルト: 256応答で生成するトークンの最大数です。presence_penalty
numbermaximum: 2minimum: 0新しい話題を出す可能性を上げます。prompt
string必須maxLength: 131072minLength: 1モデルが応答を生成するための入力テキストプロンプトです。raw
booleanデフォルト: false`true` の場合、チャットテンプレートは適用されません。そのモデルが想定する形式に合わせてください。repetition_penalty
numbermaximum: 2minimum: 0繰り返しトークンへのペナルティです。値が高いほど繰り返しを抑えます。seed
integermaximum: 9999999999minimum: 1生成結果を再現するための乱数シードです。stream
booleanデフォルト: false`true` の場合、応答は SSE(Server-Sent Events)で順次ストリーミングされます。temperature
numberデフォルト: 0.6maximum: 5minimum: 0出力のランダムさを制御します。値が高いほど結果がランダムになります。top_k
integermaximum: 50minimum: 1上位 k 個の候補語からのみ選ばせます。値が低いほど焦点が絞られ、高いほど多様になります。top_p
numbermaximum: 2minimum: 0検討する語の数を制御して、応答の創造性を調整します。値が低いほど予測しやすく、高いほど多様で創造的になります。出力
同期 — リクエストを送り、完了した応答を受け取ります
response
stringモデルが生成したテキスト応答です▶tool_calls[]
array応答生成中に行われたツール呼び出しリクエストの配列ですストリーミング — `stream: true` でリクエストを送り、server-sent events を受け取ります
contentType
text/event-streamformat
binarytype
string