Skip to content

非公式本サイトは非公式の日本語ドキュメントであり、Cloudflare 公式サイトではありません。最新情報はdevelopers.cloudflare.comをご確認ください。

Deepgram のロゴ

nova-3

音声認識 • Deepgram

Markdown で表示Agent セットアップ
  • Cloudflare ホスト
  • バッチ
  • パートナー
  • リアルタイム

Deepgram の音声認識モデルで音声を文字起こしします。

モデル情報
利用規約とライセンスリンク
バッチはい
パートナーはい
リアルタイムはい
単価$0.0052 per audio minute, $0.0092 per audio minute (websocket)

パラメーター

custom_topic_mode
stringenum: extended, strict`custom_topic` に渡した文字列の解釈方法です。`strict` では渡したトピックだけを返し、`extended` ではモデルが検出したトピックも合わせて返します。
custom_topic
string入力音声またはテキストにあれば検出してほしいカスタムトピックです。最大 100 件です
custom_intent_mode
stringenum: extended, strict`custom_intent` に渡したインテントの解釈方法です。`strict` では渡したインテントだけを返し、`extended` ではモデルが検出したインテントも合わせて返します
custom_intent
string入力音声にあれば検出してほしいカスタムインテントです
detect_entities
boolean送信した音声の内容から主要なエンティティを識別して抽出します
detect_language
boolean送信した音声で主に話されている言語を識別します
diarize
boolean話者の切り替わりを認識します。書き起こしの各単語に 0 から始まる話者番号が付きます
dictation
boolean送信した音声の内容から主要なエンティティを識別して抽出します
encoding
stringenum: linear16, flac, mulaw, amr-nb, amr-wb, opus, speex, g729送信する音声の想定エンコードを指定します
extra
string後段処理で使うために API 応答に付ける、任意のキーと値です
filler_words
booleanフィラー語は、`uh` や `um` のような音声の途切れを書き起こすのに役立ちます
keyterm
stringキータームプロンプトは、専門用語やブランド名を強調または抑制できます。
keywords
stringキーワードは、専門用語やブランド名を強調または抑制できます。
language
string主な発話言語のヒントになる BCP-47 言語タグです。選んだモデルと API エンドポイントによって、使える言語は限られます。
measurements
boolean話し言葉の単位は、対応する略語に変換されます。
mip_opt_out
booleanリクエストを Deepgram Model Improvement Program からオプトアウトします。`true` にする前に、料金への影響はドキュメントを確認してください。https://dpgr.am/deepgram-mip
mode
stringenum: general, medical, finance送信した音声で話される広い話題領域を表す、モデルの動作モードです
multichannel
boolean各音声チャンネルを独立して書き起こします。
numerals
booleanNumerals は、書き言葉の数字を数値形式に変換します。
paragraphs
boolean読みやすさのため、音声を段落に分割します。
profanity_filter
booleanProfanity Filter は既知の不適切表現を探し、近い適切な語に置き換えるか、書き起こしから完全に除きます。
punctuate
boolean書き起こしに句読点と大文字化を付けます。
redact
stringRedaction は書き起こしから機密情報を除きます。
replace
string送信した音声内の語句を検索して置き換えます。
search
string送信した音声内の語句を検索します。
sentiment
boolean書き起こしまたはテキスト全体の感情を認識します。
smart_format
boolean書き起こし出力に書式を適用します。`true` の場合、読みやすさのための追加書式が付きます。
topics
boolean書き起こしまたはテキスト全体のトピックを検出します。
utterances
boolean発話を意味のある単位に分割します。
utt_split
number送信した音声で単語間のポーズを検出するまでの待ち秒数です。
channels
number送信した音声のチャンネル数です
interim_results
booleanストリーミングエンドポイントが、音声の受信に合わせて書き起こしを更新し続けるかどうかです。`true` の場合、継続的に更新され、書き起こし結果は時間とともに変わることがあります。対応は websocket のみです。
endpointing
string話者が話し終えたか、長くポーズしたかを検出するまでの待ち時間です。値を設定すると、処理済み時間範囲の書き起こしをすぐに確定し、`speech_final` が true の書き起こしを返します。`false` でエンドポインティングを無効にできます
vad_events
boolean発話が始まったことを示します。発話開始とともに Speech Started メッセージを受け取ります。対応は websocket のみです。
utterance_end_ms
boolean単語の書き起こし後、UtteranceEnd メッセージを送るまでの待ち時間です。`interim_results` と一緒に使います。対応は websocket のみです。

API スキーマ(Raw)

Input
Output

役に立ちましたか?