> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-wan3-30off-promo.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ByteDanceSeedAudio - ComfyUI Built-in Node Documentation

> ByteDance Seed Audio 1.0 を使用すると、1つのプロンプトから音声、音楽、効果音、複数話者による対話を生成できます。

ByteDance Seed Audio 1.0 を使用すると、1つのプロンプトから音声、音楽、効果音、複数話者による対話を生成できます。プロンプトには、音声、感情、雰囲気、BGM、効果音を記述し、発話する台詞も含めてください。必要に応じて、内蔵プリセット音声を選択するか、最大3つのリファレンスクリップ（プロンプト内で @Audio1-3 とタグ付け）から音声をクローンするか、キャラクター画像から音声を派生させることもできます。1回の実行につき最大2分間の音声を生成できます。多言語モデルは20言語に対応し、タイムスタンプによるタイミング制御もサポートしています。

## 入力

| パラメータ               | 説明                                                                                                                                                                                                                                                                             | データ型   | 必須 | 範囲                                                                                    |
| ------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ | ------ | -- | ------------------------------------------------------------------------------------- |
| `text_prompt`       | 音声、感情、ペース、雰囲気、BGM、効果音を記述し、発話する台詞（対話の場合はキャラクター名をインラインで指定）も含めてください。「audio reference」モードでは、接続したクリップを順番に @Audio1、@Audio2、@Audio3 として参照します。多言語モデルでは、引用符で囲まれた台詞の先頭に、発話タイミングと長さを制御するタイムスタンプ範囲を付けることができます（例: `[5.5s:8.0s] Wait for me!`）。プロンプトは、発話する台詞と同じ言語で記述してください。最小1文字、最大3000文字です。 | STRING | 必須 | 1～3000文字                                                                              |
| `reference_mode`    | 音声の条件付け方法を指定します。「text only」（すべてをプロンプトで記述）、「audio reference」（最大3つの音声をクローンし、@Audio1-3 とタグ付け）、「image reference」（1枚のキャラクター画像から音声を派生）、または「preset voice」（内蔵の名前付き音声を選択してプロンプトを読み上げる）から選択します。                                                                                          | COMBO  | 必須 | `"text only"`<br />`"audio reference"`<br />`"image reference"`<br />`"preset voice"` |
| `reference_audio_1` | 音声クローン用のリファレンスクリップです。プロンプト内では @Audio1 とタグ付けされます。最大30秒です。`reference_mode` が「audio reference」の場合にのみ使用できます。                                                                                                                                                                       | AUDIO  | 任意 | 最大30秒                                                                                 |
| `reference_audio_2` | プロンプト内で @Audio2 とタグ付けされるリファレンスクリップです。最大30秒です。`reference_mode` が「audio reference」の場合にのみ使用できます。                                                                                                                                                                                  | AUDIO  | 任意 | 最大30秒                                                                                 |
| `reference_audio_3` | プロンプト内で @Audio3 とタグ付けされるリファレンスクリップです。最大30秒です。`reference_mode` が「audio reference」の場合にのみ使用できます。                                                                                                                                                                                  | AUDIO  | 任意 | 最大30秒                                                                                 |
| `reference_image`   | 1枚のキャラクター画像です。モデルはこの画像から音声を派生させます。リファレンス音声とは併用できません。`reference_mode` が「image reference」の場合にのみ使用できます。                                                                                                                                                                           | IMAGE  | 任意 | -                                                                                     |
| `preset_voice`      | プロンプトを読み上げる内蔵の TTS 2.0 音声です。リファレンスクリップは不要で、このモードでは @AudioN タグは使用しません。`reference_mode` が「preset voice」の場合に必須です。                                                                                                                                                                 | COMBO  | 任意 | 複数の内蔵プリセット音声オプション（デフォルトで最初のオプションが選択されます）                                              |
| `sample_rate`       | 出力サンプルレート（Hz）です。（デフォルト: "24000"）                                                                                                                                                                                                                                               | COMBO  | 必須 | `"8000"`<br />`"16000"`<br />`"24000"`<br />`"32000"`<br />`"44100"`<br />`"48000"`   |
| `speech_rate`       | 話す速度です。0 = 通常、100 = 2.0倍、-50 = 0.5倍です。（デフォルト: 0）                                                                                                                                                                                                                               | INT    | 必須 | -50 to 100                                                                            |
| `loudness_rate`     | 音量です。0 = 通常、100 = 2.0倍、-50 = 0.5倍です。（デフォルト: 0）                                                                                                                                                                                                                                 | INT    | 必須 | -50 to 100                                                                            |
| `pitch_rate`        | ピッチシフト（半音単位、-12 から 12）です。（デフォルト: 0）                                                                                                                                                                                                                                            | INT    | 必須 | -12 to 12                                                                             |
| `seed`              | シードは、ノードを再実行するかどうかを制御します。結果はシードに関係なく非決定的です。（デフォルト: 42）                                                                                                                                                                                                                         | INT    | 必須 | 0 to 2147483647                                                                       |
| `model`             | モデルバージョンです。`seed-audio-1.0-multilingual` は20言語と、`[5.5s:8.0s]` 形式のタイムスタンプによる文単位のタイミング制御に対応しています。`seed-audio-1.0` は英語と中国語のみに対応し、タイミング制御には対応していません。（デフォルト: "seed-audio-1.0-multilingual"）                                                                                         | COMBO  | 任意 | `"seed-audio-1.0-multilingual"`<br />`"seed-audio-1.0"`                               |

### パラメータの制約事項

* **リファレンスモードの依存関係**: `reference_mode` パラメータは、他にどの入力が必要かを決定します。
  * **"text only"**: 追加の入力は不要です。プロンプトに @AudioN タグを含めてはなりません。
  * **"audio reference"**: `reference_audio_1`、`reference_audio_2`、`reference_audio_3` のうち少なくとも1つを接続する必要があります。リファレンスクリップは、順番に、欠落なく接続してください。各クリップは最大30秒です。プロンプト内で @AudioN タグを使用する場合、最大のタグ番号は接続されたリファレンスクリップ数を超えてはなりません。
  * **"image reference"**: `reference_image` を接続する必要があります。@AudioN タグは使用しません。プロンプトには合成するテキストのみを含めてください。
  * **"preset voice"**: プリセット音声を選択する必要があります。プロンプト全体が選択した音声で読み上げられます。@AudioN タグはリファレンスとして使用されず、@Audio2 以上のタグは拒否されます。

* **音声リファレンスの順序**: 「audio reference」モードでは、音声リファレンス入力は `reference_audio_1` から順番に、欠落なく接続する必要があります。例えば、`reference_audio_1` と `reference_audio_2` は接続できますが、`reference_audio_2` なしで `reference_audio_1` と `reference_audio_3` を接続することはできません。

* **音声タグの最大数**: 「audio reference」モードでは、最大3つのリファレンスクリップ（@Audio1、@Audio2、@Audio3）を接続でき、プロンプト内の @AudioN タグの最大番号は、接続されたリファレンス音声入力を超えてはなりません。

* **モデルの違い**: `seed-audio-1.0-multilingual` モデルは20言語（英語、中国語、日本語、韓国語、メキシコスペイン語、カスティーリャスペイン語、インドネシア語、ドイツ語、ブラジルポルトガル語、フランス語、タイ語、ベトナム語、マレー語、フィリピン語、イタリア語、ロシア語、オランダ語、ポーランド語、トルコ語、スウェーデン語）に対応し、さらに `[5.5s:8.0s]` 形式のタイムスタンプを使用した文単位のタイミング制御にも対応しています。`seed-audio-1.0` モデルは英語と中国語のみに対応し、タイミング制御には対応していません。

## 出力

| 出力名     | 説明                                                                             | データ型  |
| ------- | ------------------------------------------------------------------------------ | ----- |
| `AUDIO` | ByteDance Seed Audio 1.0 によって生成された音声出力です。プロンプトに記述された音声、音楽、効果音、複数話者による対話が含まれます。 | AUDIO |

> このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください！ [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ByteDanceSeedAudio/ja.md)

***

**Source fingerprint (SHA-256):** `e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163`
