From 062aa4b3ce12f61299043ca6a70988416a7ed207 Mon Sep 17 00:00:00 2001 From: lin-bot23 Date: Sat, 15 Aug 2026 16:26:42 +0800 Subject: [PATCH 1/2] docs: grouped inputs format for ElevenLabs DynamicCombo nodes (batch 6) --- .../docs/ElevenLabsSpeechToSpeech/ar.md | 39 ++++++----- .../docs/ElevenLabsSpeechToSpeech/en.md | 15 ++++- .../docs/ElevenLabsSpeechToSpeech/es.md | 37 +++++++---- .../docs/ElevenLabsSpeechToSpeech/fa.md | 37 +++++++---- .../docs/ElevenLabsSpeechToSpeech/fr.md | 33 ++++++---- .../docs/ElevenLabsSpeechToSpeech/ja.md | 39 +++++++---- .../docs/ElevenLabsSpeechToSpeech/ko.md | 39 +++++++---- .../docs/ElevenLabsSpeechToSpeech/pt-BR.md | 37 +++++++---- .../docs/ElevenLabsSpeechToSpeech/ru.md | 35 ++++++---- .../docs/ElevenLabsSpeechToSpeech/tr.md | 59 +++++++---------- .../docs/ElevenLabsSpeechToSpeech/zh-TW.md | 41 +++++++----- .../docs/ElevenLabsSpeechToSpeech/zh.md | 43 +++++++----- .../docs/ElevenLabsSpeechToText/ar.md | 65 +++++++------------ .../docs/ElevenLabsSpeechToText/en.md | 25 ++++--- .../docs/ElevenLabsSpeechToText/es.md | 41 +++++++----- .../docs/ElevenLabsSpeechToText/fa.md | 47 ++++++++------ .../docs/ElevenLabsSpeechToText/fr.md | 41 +++++++----- .../docs/ElevenLabsSpeechToText/ja.md | 45 +++++++------ .../docs/ElevenLabsSpeechToText/ko.md | 45 ++++++++----- .../docs/ElevenLabsSpeechToText/pt-BR.md | 37 +++++++---- .../docs/ElevenLabsSpeechToText/ru.md | 43 +++++++----- .../docs/ElevenLabsSpeechToText/tr.md | 61 ++++++----------- .../docs/ElevenLabsSpeechToText/zh-TW.md | 41 +++++++----- .../docs/ElevenLabsSpeechToText/zh.md | 43 +++++++----- .../docs/ElevenLabsTextToDialogue/ar.md | 26 ++++---- .../docs/ElevenLabsTextToDialogue/en.md | 18 ++--- .../docs/ElevenLabsTextToDialogue/es.md | 30 ++++----- .../docs/ElevenLabsTextToDialogue/fa.md | 26 ++++---- .../docs/ElevenLabsTextToDialogue/fr.md | 30 ++++----- .../docs/ElevenLabsTextToDialogue/ja.md | 28 ++++---- .../docs/ElevenLabsTextToDialogue/ko.md | 26 ++++---- .../docs/ElevenLabsTextToDialogue/pt-BR.md | 32 +++++---- .../docs/ElevenLabsTextToDialogue/ru.md | 34 +++++----- .../docs/ElevenLabsTextToDialogue/tr.md | 54 ++++----------- .../docs/ElevenLabsTextToDialogue/zh-TW.md | 30 ++++----- .../docs/ElevenLabsTextToDialogue/zh.md | 28 ++++---- .../docs/ElevenLabsTextToSoundEffects/ar.md | 32 +++++---- .../docs/ElevenLabsTextToSoundEffects/en.md | 20 ++++-- .../docs/ElevenLabsTextToSoundEffects/es.md | 30 +++++---- .../docs/ElevenLabsTextToSoundEffects/fa.md | 34 +++++----- .../docs/ElevenLabsTextToSoundEffects/fr.md | 26 +++++--- .../docs/ElevenLabsTextToSoundEffects/ja.md | 32 ++++----- .../docs/ElevenLabsTextToSoundEffects/ko.md | 28 ++++---- .../ElevenLabsTextToSoundEffects/pt-BR.md | 26 +++++--- .../docs/ElevenLabsTextToSoundEffects/ru.md | 28 ++++---- .../docs/ElevenLabsTextToSoundEffects/tr.md | 56 +++++----------- .../ElevenLabsTextToSoundEffects/zh-TW.md | 36 +++++----- .../docs/ElevenLabsTextToSoundEffects/zh.md | 30 +++++---- .../docs/ElevenLabsTextToSpeech/ar.md | 55 +++++++++------- .../docs/ElevenLabsTextToSpeech/en.md | 42 +++++++----- .../docs/ElevenLabsTextToSpeech/es.md | 53 ++++++++------- .../docs/ElevenLabsTextToSpeech/fa.md | 53 ++++++++------- .../docs/ElevenLabsTextToSpeech/fr.md | 53 ++++++++------- .../docs/ElevenLabsTextToSpeech/ja.md | 53 ++++++++------- .../docs/ElevenLabsTextToSpeech/ko.md | 51 ++++++++------- .../docs/ElevenLabsTextToSpeech/pt-BR.md | 51 ++++++++------- .../docs/ElevenLabsTextToSpeech/ru.md | 55 +++++++++------- .../docs/ElevenLabsTextToSpeech/tr.md | 53 ++++++++------- .../docs/ElevenLabsTextToSpeech/zh-TW.md | 53 ++++++++------- .../docs/ElevenLabsTextToSpeech/zh.md | 51 ++++++++------- 60 files changed, 1285 insertions(+), 1066 deletions(-) diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ar.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ar.md index 05e85b4fd..d533eae31 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ar.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ar.md @@ -1,30 +1,39 @@ # تحويل الكلام إلى كلام من ElevenLabs -هذه ترجمة الوثيقة التقنية لعقدة ElevenLabs Speech to Speech في ComfyUI إلى العربية، مع الالتزام بقواعد الترجمة المحددة: - -> تم إنشاء هذه الوثائق بواسطة الذكاء الاصطناعي. إذا وجدت أي أخطاء أو لديك اقتراحات للتحسين، فلا تتردد في المساهمة! [تحرير على GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/en.md) - -تقوم عقدة ElevenLabs Speech to Speech بتحويل ملف صوتي مدخل من صوت إلى آخر. تستخدم واجهة برمجة تطبيقات ElevenLabs لتحويل الكلام مع الحفاظ على المحتوى الأصلي والنبرة العاطفية للصوت. +عقدة ElevenLabs لتحويل الكلام إلى كلام تحوّل ملفًا صوتيًا مُدخلًا من صوت إلى آخر. تستخدم واجهة برمجة تطبيقات ElevenLabs لتحويل الكلام مع الحفاظ على المحتوى الأصلي والنبرة العاطفية للصوت. ## المدخلات +### المدخلات العامة + | المعامل | الوصف | نوع البيانات | إلزامي | النطاق | -| --- | --- | --- | --- | --- | -| `الصوت` | الصوت المستهدف للتحويل. قم بالتوصيل من محدد الصوت أو استنساخ الصوت الفوري. | CUSTOM | نعم | - | -| `الصوت` | الصوت المصدر المراد تحويله. | AUDIO | نعم | - | -| `الثبات` | استقرار الصوت. القيم المنخفضة تعطي نطاقًا عاطفيًا أوسع، بينما تنتج القيم الأعلى كلامًا أكثر اتساقًا ولكن قد يكون رتيبًا (الافتراضي: 0.5). | FLOAT | لا | 0.0 - 1.0 | -| `النموذج` | النموذج المستخدم لتحويل الكلام إلى كلام. يوفر كل خيار مجموعة محددة من إعدادات الصوت (تعزيز التشابه، الأسلوب، استخدام تعزيز المتحدث، السرعة). | DYNAMICCOMBO | لا | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +|-----------|-------------|-----------|----------|-------| +| `النموذج` | النموذج المستخدم لتحويل الكلام إلى كلام. يوفر كل خيار نموذج مجموعة مطابقة من إعدادات الصوت (similarity_boost، style، use_speaker_boost، speed). | DYNAMIC_COMBO | لا | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `الصوت` | الصوت الهدف للتحويل. قم بتوصيله من محدد الصوت أو استنساخ الصوت الفوري. | CUSTOM | نعم | - | +| `الصوت` | الصوت المصدر المطلوب تحويله. | AUDIO | نعم | - | +| `الثبات` | ثبات الصوت. القيم الأقل تعطي نطاقًا عاطفيًا أوسع، والقيم الأعلى تنتج كلامًا أكثر اتساقًا لكنه قد يكون رتيبًا (الافتراضي: 0.5). | FLOAT | لا | 0.0 - 1.0 | | `صيغة الإخراج` | تنسيق إخراج الصوت (الافتراضي: "mp3_44100_192"). | COMBO | لا | `"mp3_44100_192"`
`"opus_48000_192"` | -| `البذرة` | البذرة لإمكانية إعادة إنتاج النتائج (الافتراضي: 0). | INT | لا | 0 - 4294967295 | -| `إزالة الضوضاء الخلفية` | إزالة الضوضاء الخلفية من الصوت المدخل باستخدام عزل الصوت (الافتراضي: False). | BOOLEAN | لا | - | +| `البذرة` | بذرة التكرار (الافتراضي: 0). | INT | لا | 0 - 4294967295 | +| `إزالة الضوضاء الخلفية` | إزالة الضوضاء الخلفية من الصوت المُدخل باستخدام عزل الصوت (الافتراضي: False). | BOOLEAN | لا | - | + +### إعدادات الصوت (مشتركة بين `eleven_multilingual_sts_v2` و `eleven_english_sts_v2`) + +عند تحديد نموذج، تصبح إعدادات الصوت هذه متاحة للتحويل. + +| المعامل | الوصف | نوع البيانات | إلزامي | النطاق | +|-----------|-------------|-----------|----------|-------| +| `speed` | سرعة الكلام. 1.0 طبيعية، <1.0 أبطأ، >1.0 أسرع (الافتراضي: 1.0). | FLOAT | لا | 0.7 - 1.3 | +| `similarity_boost` | تعزيز التشابه. القيم الأعلى تجعل الصوت أكثر شبهاً بالصوت الأصلي (الافتراضي: 0.75). | FLOAT | لا | 0.0 - 1.0 | +| `use_speaker_boost` | تعزيز التشابه مع صوت المتحدث الأصلي (الافتراضي: False). | BOOLEAN | لا | - | +| `style` | المبالغة في الأسلوب. القيم الأعلى تزيد التعبير الأسلوبي لكنها قد تقلل الثبات (الافتراضي: 0.0). | FLOAT | لا | 0.0 - 0.2 | ## المخرجات | اسم المخرج | الوصف | نوع البيانات | -| --- | --- | --- | -| `الصوت` | الملف الصوتي المحول بالتنسيق المحدد للإخراج. | AUDIO | +|-------------|-------------|-----------| +| `audio` | الملف الصوتي المحوَّل بالتنسيق المحدد للإخراج. | AUDIO | > تم إنشاء هذه الوثيقة بواسطة الذكاء الاصطناعي. إذا وجدت أي أخطاء أو لديك اقتراحات للتحسين، فلا تتردد في المساهمة! [تحرير على GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ar.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/en.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/en.md index 1597b81d6..23b2cf5ba 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/en.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/en.md @@ -4,16 +4,29 @@ The ElevenLabs Speech to Speech node transforms an input audio file from one voi ## Inputs +### Common Inputs + | Parameter | Description | Data Type | Required | Range | |-----------|-------------|-----------|----------|-------| +| `model` | Model to use for speech-to-speech transformation. Each model option provides a matching set of voice settings (similarity_boost, style, use_speaker_boost, speed). | DYNAMIC_COMBO | No | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | | `voice` | Target voice for the transformation. Connect from Voice Selector or Instant Voice Clone. | CUSTOM | Yes | - | | `audio` | Source audio to transform. | AUDIO | Yes | - | | `stability` | Voice stability. Lower values give broader emotional range, higher values produce more consistent but potentially monotonous speech (default: 0.5). | FLOAT | No | 0.0 - 1.0 | -| `model` | Model to use for speech-to-speech transformation. Each option provides a specific set of voice settings (similarity_boost, style, use_speaker_boost, speed). | DYNAMICCOMBO | No | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | | `output_format` | Audio output format (default: "mp3_44100_192"). | COMBO | No | `"mp3_44100_192"`
`"opus_48000_192"` | | `seed` | Seed for reproducibility (default: 0). | INT | No | 0 - 4294967295 | | `remove_background_noise` | Remove background noise from input audio using audio isolation (default: False). | BOOLEAN | No | - | +### Voice Settings (Shared by `eleven_multilingual_sts_v2` and `eleven_english_sts_v2`) + +When a model is selected, these voice settings become available for the transformation. + +| Parameter | Description | Data Type | Required | Range | +|-----------|-------------|-----------|----------|-------| +| `speed` | Speech speed. 1.0 is normal, <1.0 slower, >1.0 faster (default: 1.0). | FLOAT | No | 0.7 - 1.3 | +| `similarity_boost` | Similarity boost. Higher values make the voice more similar to the original (default: 0.75). | FLOAT | No | 0.0 - 1.0 | +| `use_speaker_boost` | Boost similarity to the original speaker voice (default: False). | BOOLEAN | No | - | +| `style` | Style exaggeration. Higher values increase stylistic expression but may reduce stability (default: 0.0). | FLOAT | No | 0.0 - 0.2 | + ## Outputs | Output Name | Description | Data Type | diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/es.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/es.md index 42f6d8a98..9862d5489 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/es.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/es.md @@ -1,26 +1,39 @@ # ElevenLabs Conversión de Voz a Voz -El nodo ElevenLabs Speech to Speech transforma un archivo de audio de entrada de una voz a otra. Utiliza la API de ElevenLabs para convertir el habla preservando el contenido original y el tono emocional del audio. +El nodo ElevenLabs Speech to Speech transforma un archivo de audio de entrada de una voz a otra. Utiliza la API de ElevenLabs para convertir el habla, preservando el contenido original y el tono emocional del audio. ## Entradas -| Parámetro | Descripción | Tipo de dato | Obligatorio | Rango | -| --- | --- | --- | --- | --- | -| `voz` | Voz de destino para la transformación. Conéctelo desde el Selector de Voz o Clonación Instantánea de Voz. | CUSTOM | Sí | - | +### Entradas comunes + +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `modelo` | Modelo a utilizar para la transformación de voz a voz. Cada opción de modelo proporciona un conjunto correspondiente de ajustes de voz (similarity_boost, style, use_speaker_boost, speed). | DYNAMIC_COMBO | No | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `voz` | Voz de destino para la transformación. Conectar desde Voice Selector o Instant Voice Clone. | CUSTOM | Sí | - | | `audio` | Audio de origen a transformar. | AUDIO | Sí | - | -| `estabilidad` | Estabilidad de la voz. Valores más bajos brindan un rango emocional más amplio; valores más altos producen un habla más consistente pero potencialmente monótona (predeterminado: 0.5). | FLOAT | No | 0.0 - 1.0 | -| `modelo` | Modelo a utilizar para la transformación de voz a voz. Cada opción proporciona un conjunto específico de ajustes de voz (similarity_boost, style, use_speaker_boost, speed). | DYNAMICCOMBO | No | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | -| `formato_de_salida` | Formato de salida de audio (predeterminado: "mp3_44100_192"). | COMBO | No | `"mp3_44100_192"`
`"opus_48000_192"` | -| `semilla` | Semilla para reproducibilidad (predeterminado: 0). | INT | No | 0 - 4294967295 | -| `eliminar_ruido_de_fondo` | Eliminar el ruido de fondo del audio de entrada mediante aislamiento de audio (predeterminado: Falso). | BOOLEAN | No | - | +| `estabilidad` | Estabilidad de la voz. Los valores más bajos ofrecen un rango emocional más amplio; los valores más altos producen una voz más consistente pero potencialmente monótona (por defecto: 0.5). | FLOAT | No | 0.0 - 1.0 | +| `formato_de_salida` | Formato de audio de salida (por defecto: "mp3_44100_192"). | COMBO | No | `"mp3_44100_192"`
`"opus_48000_192"` | +| `semilla` | Semilla para reproducibilidad (por defecto: 0). | INT | No | 0 - 4294967295 | +| `eliminar_ruido_de_fondo` | Elimina el ruido de fondo del audio de entrada mediante aislamiento de audio (por defecto: False). | BOOLEAN | No | - | + +### Ajustes de voz (compartidos por `eleven_multilingual_sts_v2` y `eleven_english_sts_v2`) + +Cuando se selecciona un modelo, estos ajustes de voz quedan disponibles para la transformación. + +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `speed` | Velocidad del habla. 1.0 es normal, <1.0 más lenta, >1.0 más rápida (por defecto: 1.0). | FLOAT | No | 0.7 - 1.3 | +| `similarity_boost` | Refuerzo de similitud. Los valores más altos hacen que la voz sea más similar a la original (por defecto: 0.75). | FLOAT | No | 0.0 - 1.0 | +| `use_speaker_boost` | Refuerza la similitud con la voz del hablante original (por defecto: False). | BOOLEAN | No | - | +| `style` | Exageración del estilo. Los valores más altos aumentan la expresión estilística pero pueden reducir la estabilidad (por defecto: 0.0). | FLOAT | No | 0.0 - 0.2 | ## Salidas -| Nombre de salida | Descripción | Tipo de dato | -| --- | --- | --- | +| Nombre de salida | Descripción | Tipo de datos | +|------------------|-------------|---------------| | `audio` | El archivo de audio transformado en el formato de salida especificado. | AUDIO | > Esta documentación fue generada por IA. Si encuentra algún error o tiene sugerencias de mejora, ¡no dude en contribuir! [Editar en GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/es.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fa.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fa.md index ac986ef17..d15d7b5d5 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fa.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fa.md @@ -1,28 +1,39 @@ # تبدیل گفتار به گفتار ElevenLabs -### گره تبدیل گفتار به گفتار ElevenLabs - -گره تبدیل گفتار به گفتار ElevenLabs یک فایل صوتی ورودی را از یک صدا به صدای دیگر تبدیل می‌کند. این گره از API ElevenLabs برای تبدیل گفتار استفاده می‌کند و محتوای اصلی و لحن احساسی صدا را حفظ می‌نماید. +گره «ElevenLabs Speech to Speech» یک فایل صوتی ورودی را از یک صدا به صدای دیگر تبدیل می‌کند. این گره با استفاده از ElevenLabs API گفتار را تبدیل می‌کند و محتوای اصلی و لحن احساسی صدا را حفظ می‌نماید. ## ورودی‌ها -| پارامتر | توضیحات | نوع داده | اجباری | محدوده | -| --- | --- | --- | --- | --- | -| `voice` | صدای هدف برای تبدیل. از انتخاب‌گر صدا یا کلون صوتی فوری متصل کنید. | CUSTOM | بله | - | +### ورودی‌های عمومی + +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | +|-----------|-------------|-----------|----------|-------| +| `model` | مدل مورد استفاده برای تبدیل گفتار به گفتار. هر گزینه مدل، مجموعه متناظری از تنظیمات صدا (similarity_boost, style, use_speaker_boost, speed) را فراهم می‌کند. | DYNAMIC_COMBO | خیر | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `voice` | صدای هدف برای تبدیل. از Voice Selector یا Instant Voice Clone متصل کنید. | CUSTOM | بله | - | | `audio` | صدای منبع برای تبدیل. | AUDIO | بله | - | -| `stability` | پایداری صدا. مقادیر پایین‌تر دامنه احساسی گسترده‌تری می‌دهند، مقادیر بالاتر گفتاری یکنواخت‌تر اما احتمالاً خسته‌کننده تولید می‌کنند (پیش‌فرض: 0.5). | FLOAT | خیر | 0.0 - 1.0 | -| `model` | مدل مورد استفاده برای تبدیل گفتار به گفتار. هر گزینه مجموعه‌ای خاص از تنظیمات صدا (افزایش شباهت، سبک، استفاده از تقویت صدا، سرعت) را ارائه می‌دهد. | DYNAMICCOMBO | خیر | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | -| `output_format` | فرمت خروجی صدا (پیش‌فرض: "mp3_44100_192"). | COMBO | خیر | `"mp3_44100_192"`
`"opus_48000_192"` | -| `seed` | دانه (seed) برای تکرارپذیری (پیش‌فرض: 0). | INT | خیر | 0 - 4294967295 | +| `stability` | پایداری صدا. مقادیر پایین‌تر دامنه احساسی گسترده‌تری می‌دهند و مقادیر بالاتر گفتاری سازگارتر اما احتمالاً یکنواخت تولید می‌کنند (پیش‌فرض: 0.5). | FLOAT | خیر | 0.0 - 1.0 | +| `output_format` | قالب خروجی صدا (پیش‌فرض: "mp3_44100_192"). | COMBO | خیر | `"mp3_44100_192"`
`"opus_48000_192"` | +| `seed` | مقدار seed برای تکرارپذیری (پیش‌فرض: 0). | INT | خیر | 0 - 4294967295 | | `remove_background_noise` | حذف نویز پس‌زمینه از صدای ورودی با استفاده از جداسازی صدا (پیش‌فرض: False). | BOOLEAN | خیر | - | +### تنظیمات صدا (مشترک بین `eleven_multilingual_sts_v2` و `eleven_english_sts_v2`) + +وقتی مدلی انتخاب شود، این تنظیمات صدا برای تبدیل در دسترس قرار می‌گیرند. + +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | +|-----------|-------------|-----------|----------|-------| +| `speed` | سرعت گفتار. 1.0 عادی، <1.0 کندتر و >1.0 سریع‌تر است (پیش‌فرض: 1.0). | FLOAT | خیر | 0.7 - 1.3 | +| `similarity_boost` | افزایش شباهت. مقادیر بالاتر صدا را به صدای اصلی شبیه‌تر می‌کنند (پیش‌فرض: 0.75). | FLOAT | خیر | 0.0 - 1.0 | +| `use_speaker_boost` | افزایش شباهت به صدای گوینده اصلی (پیش‌فرض: False). | BOOLEAN | خیر | - | +| `style` | میزان اغراق سبک. مقادیر بالاتر بیان سبکی را افزایش می‌دهند اما ممکن است پایداری را کاهش دهند (پیش‌فرض: 0.0). | FLOAT | خیر | 0.0 - 0.2 | + ## خروجی‌ها | نام خروجی | توضیحات | نوع داده | -| --- | --- | --- | -| `audio` | فایل صوتی تبدیل‌شده در فرمت خروجی مشخص‌شده. | AUDIO | +|-------------|-------------|-----------| +| `audio` | فایل صوتی تبدیل‌شده در قالب خروجی مشخص‌شده. | AUDIO | > این مستند با هوش مصنوعی تهیه شده است. اگر خطایی دیدید یا پیشنهادی برای بهبود دارید، خوشحال می‌شویم مشارکت کنید! [ویرایش در GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fa.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fr.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fr.md index b978d36bf..8a982a734 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fr.md @@ -1,28 +1,39 @@ # ElevenLabs Conversion de Voix à Voix -Voici la traduction en français de la documentation du nœud ElevenLabs Speech to Speech : - Le nœud ElevenLabs Speech to Speech transforme un fichier audio d'entrée d'une voix à une autre. Il utilise l'API ElevenLabs pour convertir la parole tout en préservant le contenu original et le ton émotionnel de l'audio. ## Entrées -| Paramètre | Description | Type de données | Requis | Plage | -| --- | --- | --- | --- | --- | -| `voix` | Voix cible pour la transformation. Connectez depuis le sélecteur de voix ou le clonage vocal instantané. | CUSTOM | Oui | - | +### Entrées communes + +| Paramètre | Description | Type de données | Obligatoire | Plage | +|-----------|-------------|-----------------|-------------|-------| +| `modèle` | Modèle à utiliser pour la transformation de parole en parole. Chaque option de modèle fournit un ensemble correspondant de paramètres vocaux (similarity_boost, style, use_speaker_boost, speed). | DYNAMIC_COMBO | Non | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `voix` | Voix cible pour la transformation. Connectez depuis Voice Selector ou Instant Voice Clone. | CUSTOM | Oui | - | | `audio` | Audio source à transformer. | AUDIO | Oui | - | -| `stabilité` | Stabilité de la voix. Des valeurs plus faibles offrent une gamme émotionnelle plus large, des valeurs plus élevées produisent une parole plus cohérente mais potentiellement monotone (par défaut : 0.5). | FLOAT | Non | 0.0 - 1.0 | -| `modèle` | Modèle à utiliser pour la transformation parole-à-parole. Chaque option fournit un ensemble spécifique de paramètres vocaux (similarity_boost, style, use_speaker_boost, speed). | DYNAMICCOMBO | Non | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | -| `format_de_sortie` | Format de sortie audio (par défaut : "mp3_44100_192"). | COMBO | Non | `"mp3_44100_192"`
`"opus_48000_192"` | +| `stabilité` | Stabilité vocale. Des valeurs plus faibles offrent une gamme émotionnelle plus large, des valeurs plus élevées produisent une parole plus cohérente mais potentiellement monotone (par défaut : 0.5). | FLOAT | Non | 0.0 - 1.0 | +| `format_de_sortie` | Format de sortie audio (par défaut : « mp3_44100_192 »). | COMBO | Non | `"mp3_44100_192"`
`"opus_48000_192"` | | `graine` | Graine pour la reproductibilité (par défaut : 0). | INT | Non | 0 - 4294967295 | -| `supprimer_bruit_de_fond` | Supprimer le bruit de fond de l'audio d'entrée en utilisant l'isolation audio (par défaut : False). | BOOLEAN | Non | - | +| `supprimer_bruit_de_fond` | Supprimer le bruit de fond de l'audio d'entrée à l'aide de l'isolation audio (par défaut : False). | BOOLEAN | Non | - | + +### Paramètres vocaux (partagés par `eleven_multilingual_sts_v2` et `eleven_english_sts_v2`) + +Lorsqu'un modèle est sélectionné, ces paramètres vocaux deviennent disponibles pour la transformation. + +| Paramètre | Description | Type de données | Obligatoire | Plage | +|-----------|-------------|-----------------|-------------|-------| +| `speed` | Vitesse de parole. 1.0 est normal, <1.0 plus lent, >1.0 plus rapide (par défaut : 1.0). | FLOAT | Non | 0.7 - 1.3 | +| `similarity_boost` | Boost de similarité. Des valeurs plus élevées rendent la voix plus similaire à la voix originale (par défaut : 0.75). | FLOAT | Non | 0.0 - 1.0 | +| `use_speaker_boost` | Renforcer la similarité avec la voix du locuteur d'origine (par défaut : False). | BOOLEAN | Non | - | +| `style` | Exagération du style. Des valeurs plus élevées augmentent l'expression stylistique mais peuvent réduire la stabilité (par défaut : 0.0). | FLOAT | Non | 0.0 - 0.2 | ## Sorties | Nom de sortie | Description | Type de données | -| --- | --- | --- | +|---------------|-------------|-----------------| | `audio` | Le fichier audio transformé dans le format de sortie spécifié. | AUDIO | > Cette documentation a été générée par IA. Si vous trouvez des erreurs ou avez des suggestions d'amélioration, n'hésitez pas à contribuer ! [Modifier sur GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/fr.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ja.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ja.md index 41a06af03..7d4ea9d2d 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ja.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ja.md @@ -1,28 +1,39 @@ # ElevenLabs スピーチ・トゥ・スピーチ -以下が翻訳結果です。 - -ElevenLabs Speech to Speech ノードは、入力された音声ファイルを別の声に変換します。ElevenLabs API を使用して音声を変換し、元の音声の内容と感情的なトーンを保持します。 +ElevenLabs Speech to Speech ノードは、入力オーディオファイルの声を別の声に変換します。このノードは ElevenLabs API を使用して、音声の元の内容と感情的なトーンを保ちながら音声を変換します。 ## 入力 +### 共通入力 + +| パラメータ | 説明 | データ型 | 必須 | 範囲 | +|-----------|-------------|-----------|----------|-------| +| `モデル` | 音声から音声への変換に使用するモデルです。各モデルオプションには、対応するボイス設定(similarity_boost、style、use_speaker_boost、speed)が用意されています。 | DYNAMIC_COMBO | 任意 | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `ターゲットボイス` | 変換対象のボイスです。Voice Selector またはインスタントボイスクローンから接続します。 | CUSTOM | 必須 | - | +| `音声` | 変換元のオーディオです。 | AUDIO | 必須 | - | +| `安定性` | ボイスの安定性です。値が低いほど感情の幅が広がり、値が高いほどより一貫性のある、ただし単調になる可能性のある音声になります(デフォルト: 0.5)。 | FLOAT | 任意 | 0.0 - 1.0 | +| `出力フォーマット` | オーディオ出力形式です(デフォルト: "mp3_44100_192")。 | COMBO | 任意 | `"mp3_44100_192"`
`"opus_48000_192"` | +| `シード` | 再現性のためのシード値です(デフォルト: 0)。 | INT | 任意 | 0 - 4294967295 | +| `バックグラウンドノイズ除去` | オーディオ分離を使用して、入力オーディオから背景ノイズを除去します(デフォルト: False)。 | BOOLEAN | 任意 | - | + +### ボイス設定(`eleven_multilingual_sts_v2` と `eleven_english_sts_v2` に共通) + +モデルが選択されると、これらのボイス設定が変換に使用できるようになります。 + | パラメータ | 説明 | データ型 | 必須 | 範囲 | -| --- | --- | --- | --- | --- | -| `ターゲットボイス` | 変換先のターゲット音声です。Voice Selector または Instant Voice Clone から接続します。 | CUSTOM | はい | - | -| `音声` | 変換する元の音声です。 | AUDIO | はい | - | -| `安定性` | 音声の安定性です。値が低いほど感情の幅が広がり、値が高いほど一貫性が増しますが、単調になる可能性があります(デフォルト: 0.5)。 | FLOAT | いいえ | 0.0 - 1.0 | -| `モデル` | 音声変換に使用するモデルです。各オプションは特定の音声設定(類似性ブースト、スタイル、スピーカーブーストの使用、速度)を提供します。 | DYNAMICCOMBO | いいえ | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | -| `出力フォーマット` | 音声の出力フォーマットです(デフォルト: "mp3_44100_192")。 | COMBO | いいえ | `"mp3_44100_192"`
`"opus_48000_192"` | -| `シード` | 再現性のためのシード値です(デフォルト: 0)。 | INT | いいえ | 0 - 4294967295 | -| `バックグラウンドノイズ除去` | 音声分離を使用して、入力音声から背景ノイズを除去します(デフォルト: False)。 | BOOLEAN | いいえ | - | +|-----------|-------------|-----------|----------|-------| +| `speed` | 話す速度です。1.0 が通常で、<1.0 は遅く、>1.0 は速くなります(デフォルト: 1.0)。 | FLOAT | 任意 | 0.7 - 1.3 | +| `similarity_boost` | 類似性の強調です。値が高いほど、元の声に近くなります(デフォルト: 0.75)。 | FLOAT | 任意 | 0.0 - 1.0 | +| `use_speaker_boost` | 元の話者の声への類似性を強調します(デフォルト: False)。 | BOOLEAN | 任意 | - | +| `style` | スタイルの誇張です。値が高いほど様式的な表現が増えますが、安定性が低下する可能性があります(デフォルト: 0.0)。 | FLOAT | 任意 | 0.0 - 0.2 | ## 出力 | 出力名 | 説明 | データ型 | -| --- | --- | --- | -| `音声` | 指定された出力フォーマットで変換された音声ファイルです。 | AUDIO | +|-------------|-------------|-----------| +| `audio` | 指定された出力形式の変換済みオーディオファイルです。 | AUDIO | > このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ja.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ko.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ko.md index f66e40743..a11c261d4 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ko.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ko.md @@ -1,28 +1,39 @@ # ElevenLabs 음성 변환 -이 문서는 AI가 생성했습니다. 오류를 발견하거나 개선 제안이 있으시면 언제든지 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/en.md) - -ElevenLabs Speech to Speech 노드는 입력 오디오 파일의 음성을 다른 음성으로 변환합니다. ElevenLabs API를 사용하여 음성을 변환하며, 원본 오디오의 내용과 감정적 톤을 보존합니다. +ElevenLabs Speech to Speech 노드는 입력 오디오 파일을 한 목소리에서 다른 목소리로 변환합니다. ElevenLabs API를 사용하여 오디오의 원래 내용과 감정적 어조를 유지하면서 음성을 변환합니다. ## 입력 +### 공통 입력 + +| 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | +|-----------|-------------|-----------|----------|-------| +| `model` | 음성 간 변환에 사용할 모델입니다. 각 모델 옵션은 일치하는 음성 설정 세트(similarity_boost, style, use_speaker_boost, speed)를 제공합니다. | DYNAMIC_COMBO | 아니오 | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `voice` | 변환 대상 목소리입니다. Voice Selector 또는 Instant Voice Clone에서 연결하십시오. | CUSTOM | 예 | - | +| `audio` | 변환할 소스 오디오입니다. | AUDIO | 예 | - | +| `stability` | 음성 안정성입니다. 값이 낮을수록 더 넓은 감정 범위를 제공하고, 값이 높을수록 더 일관되지만 잠재적으로 단조로운 음성을 생성합니다(기본값: 0.5). | FLOAT | 아니오 | 0.0 - 1.0 | +| `output_format` | 오디오 출력 형식입니다(기본값: "mp3_44100_192"). | COMBO | 아니오 | `"mp3_44100_192"`
`"opus_48000_192"` | +| `seed` | 재현성을 위한 시드입니다(기본값: 0). | INT | 아니오 | 0 - 4294967295 | +| `remove_background_noise` | 오디오 분리를 사용하여 입력 오디오에서 배경 소음을 제거합니다(기본값: False). | BOOLEAN | 아니오 | - | + +### 음성 설정(`eleven_multilingual_sts_v2` 및 `eleven_english_sts_v2` 공유) + +모델을 선택하면 이러한 음성 설정을 변환에 사용할 수 있습니다. + | 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | -| --- | --- | --- | --- | --- | -| `voice` | 변환 대상 음성입니다. 음성 선택기 또는 즉시 음성 복제에서 연결하십시오. | CUSTOM | 예 | - | -| `audio` | 변환할 원본 오디오입니다. | AUDIO | 예 | - | -| `stability` | 음성 안정성입니다. 값이 낮을수록 더 넓은 감정 범위를 제공하고, 값이 높을수록 더 일관되지만 단조로운 음성을 생성합니다(기본값: 0.5). | FLOAT | 아니요 | 0.0 - 1.0 | -| `model` | 음성 간 변환에 사용할 모델입니다. 각 옵션은 특정 음성 설정 세트(similarity_boost, style, use_speaker_boost, speed)를 제공합니다. | DYNAMICCOMBO | 아니요 | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | -| `output_format` | 오디오 출력 형식입니다(기본값: "mp3_44100_192"). | COMBO | 아니요 | `"mp3_44100_192"`
`"opus_48000_192"` | -| `seed` | 재현성을 위한 시드 값입니다(기본값: 0). | INT | 아니요 | 0 - 4294967295 | -| `remove_background_noise` | 오디오 분리를 사용하여 입력 오디오에서 배경 소음을 제거합니다(기본값: False). | BOOLEAN | 아니요 | - | +|-----------|-------------|-----------|----------|-------| +| `speed` | 음성 속도입니다. 1.0은 보통 속도이며, <1.0은 더 느리게, >1.0은 더 빠르게 재생됩니다(기본값: 1.0). | FLOAT | 아니오 | 0.7 - 1.3 | +| `similarity_boost` | 유사도 부스트입니다. 값이 높을수록 목소리가 원본에 더 가까워집니다(기본값: 0.75). | FLOAT | 아니오 | 0.0 - 1.0 | +| `use_speaker_boost` | 원본 화자 음성과의 유사도를 높입니다(기본값: False). | BOOLEAN | 아니오 | - | +| `style` | 스타일 과장 정도입니다. 값이 높을수록 스타일 표현이 증가하지만 안정성이 감소할 수 있습니다(기본값: 0.0). | FLOAT | 아니오 | 0.0 - 0.2 | ## 출력 | 출력 이름 | 설명 | 데이터 타입 | -| --- | --- | --- | -| `audio` | 지정된 출력 형식으로 변환된 오디오 파일입니다. | AUDIO | +|-------------|-------------|-----------| +| `audio` | 지정된 출력 형식의 변환된 오디오 파일입니다. | AUDIO | > 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ko.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/pt-BR.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/pt-BR.md index 253ac5477..8fbc032f8 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/pt-BR.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/pt-BR.md @@ -1,28 +1,39 @@ # ElevenLabs Fala para Fala -Esta documentação foi gerada por IA. Se você encontrar algum erro ou tiver sugestões de melhoria, sinta-se à vontade para contribuir! [Editar no GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/en.md) - -O nó ElevenLabs Speech to Speech transforma um arquivo de áudio de entrada de uma voz para outra. Ele usa a API ElevenLabs para converter a fala, preservando o conteúdo original e o tom emocional do áudio. +O nó ElevenLabs Speech to Speech transforma um arquivo de áudio de entrada de uma voz para outra. Ele usa a API ElevenLabs para converter fala, preservando o conteúdo original e o tom emocional do áudio. ## Entradas -| Parâmetro | Descrição | Tipo de Dado | Obrigatório | Faixa | -| --- | --- | --- | --- | --- | -| `voz` | Voz de destino para a transformação. Conecte a partir do Seletor de Voz ou Clone de Voz Instantâneo. | CUSTOM | Sim | - | +### Entradas Comuns + +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | +|-----------|-------------|-----------|----------|-------| +| `modelo` | Modelo a ser usado para a transformação de fala em fala. Cada opção de modelo fornece um conjunto correspondente de configurações de voz (similarity_boost, style, use_speaker_boost, speed). | DYNAMIC_COMBO | Não | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `voz` | Voz de destino para a transformação. Conecte a partir do Seletor de Voz ou Clone Instantâneo de Voz. | CUSTOM | Sim | - | | `áudio` | Áudio de origem a ser transformado. | AUDIO | Sim | - | -| `estabilidade` | Estabilidade da voz. Valores mais baixos proporcionam uma gama emocional mais ampla; valores mais altos produzem uma fala mais consistente, mas potencialmente monótona (padrão: 0.5). | FLOAT | Não | 0.0 - 1.0 | -| `modelo` | Modelo a ser usado para a transformação de fala para fala. Cada opção fornece um conjunto específico de configurações de voz (similarity_boost, style, use_speaker_boost, speed). | DYNAMICCOMBO | Não | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `estabilidade` | Estabilidade da voz. Valores mais baixos proporcionam uma gama emocional mais ampla; valores mais altos produzem fala mais consistente, mas potencialmente monótona (padrão: 0.5). | FLOAT | Não | 0.0 - 1.0 | | `formato_de_saida` | Formato de saída do áudio (padrão: "mp3_44100_192"). | COMBO | Não | `"mp3_44100_192"`
`"opus_48000_192"` | | `semente` | Semente para reprodutibilidade (padrão: 0). | INT | Não | 0 - 4294967295 | -| `remover_ruído_de_fundo` | Remove o ruído de fundo do áudio de entrada usando isolamento de áudio (padrão: False). | BOOLEAN | Não | - | +| `remover_ruído_de_fundo` | Remover ruído de fundo do áudio de entrada usando isolamento de áudio (padrão: False). | BOOLEAN | Não | - | + +### Configurações de Voz (Compartilhadas por `eleven_multilingual_sts_v2` e `eleven_english_sts_v2`) + +Quando um modelo é selecionado, essas configurações de voz ficam disponíveis para a transformação. + +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | +|-----------|-------------|-----------|----------|-------| +| `speed` | Velocidade da fala. 1.0 é normal, <1.0 mais lento, >1.0 mais rápido (padrão: 1.0). | FLOAT | Não | 0.7 - 1.3 | +| `similarity_boost` | Reforço de similaridade. Valores mais altos tornam a voz mais semelhante à original (padrão: 0.75). | FLOAT | Não | 0.0 - 1.0 | +| `use_speaker_boost` | Reforçar a similaridade com a voz do locutor original (padrão: False). | BOOLEAN | Não | - | +| `style` | Exagero de estilo. Valores mais altos aumentam a expressão estilística, mas podem reduzir a estabilidade (padrão: 0.0). | FLOAT | Não | 0.0 - 0.2 | ## Saídas -| Nome da Saída | Descrição | Tipo de Dado | -| --- | --- | --- | -| `áudio` | O arquivo de áudio transformado no formato de saída especificado. | AUDIO | +| Nome da Saída | Descrição | Tipo de Dados | +|-------------|-------------|-----------| +| `audio` | O arquivo de áudio transformado no formato de saída especificado. | AUDIO | > Esta documentação foi gerada por IA. Se você encontrar erros ou tiver sugestões de melhoria, sinta-se à vontade para contribuir! [Editar no GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/pt-BR.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ru.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ru.md index 359d8a870..9df8242c2 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ru.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ru.md @@ -1,28 +1,39 @@ # ElevenLabs Speech to Speech -Вот перевод документации узла ComfyUI **ElevenLabs Speech to Speech** на русский язык: - -Узел ElevenLabs Speech to Speech преобразует входной аудиофайл из одного голоса в другой. Он использует API ElevenLabs для преобразования речи, сохраняя исходное содержание и эмоциональный тон аудио. +Узел ElevenLabs Speech to Speech преобразует входной аудиофайл из одного голоса в другой. Он использует ElevenLabs API для преобразования речи, сохраняя исходное содержание и эмоциональный тон аудио. ## Входы -| Параметр | Описание | Тип данных | Обязательный | Диапазон | -| --- | --- | --- | --- | --- | +### Общие входы + +| Параметр | Описание | Тип данных | Обязательность | Диапазон | +|-----------|-------------|-----------|----------|-------| +| `модель` | Модель для преобразования речи в речь. Каждый вариант модели предоставляет соответствующий набор настроек голоса (similarity_boost, style, use_speaker_boost, speed). | DYNAMIC_COMBO | Нет | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | | `голос` | Целевой голос для преобразования. Подключите от Voice Selector или Instant Voice Clone. | CUSTOM | Да | - | | `аудио` | Исходное аудио для преобразования. | AUDIO | Да | - | -| `стабильность` | Стабильность голоса. Более низкие значения дают более широкий эмоциональный диапазон, более высокие значения обеспечивают более последовательную, но потенциально монотонную речь (по умолчанию: 0.5). | FLOAT | Нет | 0.0 - 1.0 | -| `модель` | Модель для преобразования речи в речь. Каждый вариант предоставляет определенный набор голосовых настроек (similarity_boost, style, use_speaker_boost, speed). | DYNAMICCOMBO | Нет | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `стабильность` | Стабильность голоса. Более низкие значения дают более широкий эмоциональный диапазон, более высокие значения дают более стабильную, но потенциально монотонную речь (по умолчанию: 0.5). | FLOAT | Нет | 0.0 - 1.0 | | `формат_выхода` | Формат выходного аудио (по умолчанию: "mp3_44100_192"). | COMBO | Нет | `"mp3_44100_192"`
`"opus_48000_192"` | -| `seed` | Зерно для воспроизводимости результатов (по умолчанию: 0). | INT | Нет | 0 - 4294967295 | -| `удалить_фоновый_шум` | Удалить фоновый шум из входного аудио с помощью изоляции звука (по умолчанию: False). | BOOLEAN | Нет | - | +| `seed` | Сид для воспроизводимости (по умолчанию: 0). | INT | Нет | 0 - 4294967295 | +| `удалить_фоновый_шум` | Удаляет фоновый шум из входного аудио с помощью изоляции аудио (по умолчанию: False). | BOOLEAN | Нет | - | + +### Настройки голоса (общие для `eleven_multilingual_sts_v2` и `eleven_english_sts_v2`) + +При выборе модели эти настройки голоса становятся доступными для преобразования. + +| Параметр | Описание | Тип данных | Обязательность | Диапазон | +|-----------|-------------|-----------|----------|-------| +| `speed` | Скорость речи. 1.0 — нормальная, <1.0 — медленнее, >1.0 — быстрее (по умолчанию: 1.0). | FLOAT | Нет | 0.7 - 1.3 | +| `similarity_boost` | Усиление сходства. Более высокие значения делают голос более похожим на исходный (по умолчанию: 0.75). | FLOAT | Нет | 0.0 - 1.0 | +| `use_speaker_boost` | Усилить сходство с голосом исходного диктора (по умолчанию: False). | BOOLEAN | Нет | - | +| `style` | Преувеличение стиля. Более высокие значения усиливают стилистическую выразительность, но могут снизить стабильность (по умолчанию: 0.0). | FLOAT | Нет | 0.0 - 0.2 | ## Выходы | Имя выхода | Описание | Тип данных | -| --- | --- | --- | -| `аудио` | Преобразованный аудиофайл в указанном формате вывода. | AUDIO | +|-------------|-------------|-----------| +| `audio` | Преобразованный аудиофайл в указанном выходном формате. | AUDIO | > Эта документация была создана с помощью ИИ. Если вы обнаружите ошибки или у вас есть предложения по улучшению, пожалуйста, внесите свой вклад! [Редактировать на GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/ru.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/tr.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/tr.md index a793c3319..f2c3ed730 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/tr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/tr.md @@ -1,54 +1,39 @@ # ElevenLabs Sesten Sese -ComfyUI düğüm belgelerini İngilizceden Türkçeye çevirmede uzmanlaşmış teknik çeviri uzmanısınız. +ElevenLabs Speech to Speech düğümü, girdi ses dosyasını bir sesten başka bir sese dönüştürür. Sesin orijinal içeriğini ve duygusal tonunu koruyarak konuşmayı dönüştürmek için ElevenLabs API'sini kullanır. -## Çeviri Kuralları - -1. **Çevrilmemesi gereken içerik:** - - Ters tırnak içindeki parametre adları: `image`, `seed`, `model` - - BÜYÜK harflerle veri türleri: IMAGE, STRING, INT, FLOAT, MODEL, CONDITIONING, vb. - - Range sütunundaki değerler: sayılar, "auto", seçenek adları - - Kod, dosya yolları - -2. **Çevrilmesi gereken içerik:** - - Bölüm başlıkları: ## Genel Bakış, ## Girdiler, ## Çıktılar - - Tüm açıklayıcı metinler - - Parametre açıklamaları - -3. **Çeviri kalitesi:** - - Standart Türkçe kullanın - - Profesyonel ama anlaşılır bir üslup koruyun - - Teknik doğruluğu sağlayın - - Standart Türkçe teknik terminolojiyi kullanın +## Girişler -4. **Format:** - - Tüm Markdown biçimlendirmesini koruyun - - Tablo yapısını koruyun - - Belgenin başına herhangi bir not veya bağlantı eklemeyin (otomatik olarak eklenecektir) +### Ortak Girişler -Lütfen aşağıdaki belgeyi Türkçeye çevirin (belgenin başlangıç notunu dahil etmeyin): +| Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | +|-----------|-------------|-----------|----------|-------| +| `model` | Konuşmadan konuşmaya dönüşüm için kullanılacak model. Her model seçeneği, eşleşen bir ses ayarları kümesi sağlar (similarity_boost, style, use_speaker_boost, speed). | DYNAMIC_COMBO | Hayır | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `voice` | Dönüşüm için hedef ses. Voice Selector veya Instant Voice Clone'dan bağlayın. | CUSTOM | Evet | - | +| `audio` | Dönüştürülecek kaynak ses. | AUDIO | Evet | - | +| `stability` | Ses stabilitesi. Düşük değerler daha geniş duygusal yelpaze sağlar, yüksek değerler daha tutarlı ancak potansiyel olarak tekdüze konuşma üretir (varsayılan: 0.5). | FLOAT | Hayır | 0.0 - 1.0 | +| `output_format` | Ses çıktı biçimi (varsayılan: "mp3_44100_192"). | COMBO | Hayır | `"mp3_44100_192"`
`"opus_48000_192"` | +| `seed` | Tekrarlanabilirlik için seed değeri (varsayılan: 0). | INT | Hayır | 0 - 4294967295 | +| `remove_background_noise` | Ses izolasyonu kullanarak girdi sesinden arka plan gürültüsünü kaldırır (varsayılan: False). | BOOLEAN | Hayır | - | -ElevenLabs Konuşmadan Konuşmaya düğümü, bir giriş ses dosyasını bir sesten başka bir sese dönüştürür. Sesin orijinal içeriğini ve duygusal tonunu koruyarak konuşmayı dönüştürmek için ElevenLabs API'sini kullanır. +### Ses Ayarları (`eleven_multilingual_sts_v2` ve `eleven_english_sts_v2` tarafından paylaşılır) -## Girişler +Bir model seçildiğinde, bu ses ayarları dönüşüm için kullanılabilir hale gelir. | Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | -| --- | --- | --- | --- | --- | -| `ses` | Dönüşüm için hedef ses. Ses Seçici veya Anlık Ses Klonlama'dan bağlantı kurun. | CUSTOM | Evet | - | -| `ses` | Dönüştürülecek kaynak ses. | AUDIO | Evet | - | -| `kararlılık` | Ses kararlılığı. Düşük değerler daha geniş bir duygusal yelpaze sağlar, yüksek değerler daha tutarlı ancak potansiyel olarak monoton konuşma üretir (varsayılan: 0.5). | FLOAT | Hayır | 0.0 - 1.0 | -| `model` | Konuşmadan konuşmaya dönüşüm için kullanılacak model. Her seçenek belirli bir ses ayarları kümesi sağlar (similarity_boost, style, use_speaker_boost, speed). | DYNAMICCOMBO | Hayır | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | -| `çıktı_formatı` | Ses çıktı formatı (varsayılan: "mp3_44100_192"). | COMBO | Hayır | `"mp3_44100_192"`
`"opus_48000_192"` | -| `tohum` | Tekrarlanabilirlik için tohum değeri (varsayılan: 0). | INT | Hayır | 0 - 4294967295 | -| `arka_plan_gürültüsünü_kaldır` | Ses izolasyonu kullanarak giriş sesinden arka plan gürültüsünü kaldırır (varsayılan: False). | BOOLEAN | Hayır | - | +|-----------|-------------|-----------|----------|-------| +| `speed` | Konuşma hızı. 1.0 normal, <1.0 daha yavaş, >1.0 daha hızlı (varsayılan: 1.0). | FLOAT | Hayır | 0.7 - 1.3 | +| `similarity_boost` | Benzerlik artırma. Yüksek değerler sesi orijinale daha benzer hale getirir (varsayılan: 0.75). | FLOAT | Hayır | 0.0 - 1.0 | +| `use_speaker_boost` | Orijinal konuşmacı sesine benzerliği artırır (varsayılan: False). | BOOLEAN | Hayır | - | +| `style` | Stil abartısı. Yüksek değerler stilistik ifadeyi artırır ancak stabiliteyi azaltabilir (varsayılan: 0.0). | FLOAT | Hayır | 0.0 - 0.2 | ## Çıktılar | Çıktı Adı | Açıklama | Veri Türü | -| --- | --- | --- | -| `ses` | Belirtilen çıktı formatında dönüştürülmüş ses dosyası. | AUDIO | +|-------------|-------------|-----------| +| `audio` | Belirtilen çıktı biçiminde dönüştürülmüş ses dosyası. | AUDIO | > Bu belge yapay zeka tarafından oluşturulmuştur. Herhangi bir hata bulursanız veya iyileştirme önerileriniz varsa, katkıda bulunmaktan çekinmeyin! [GitHub'da Düzenle](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/tr.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh-TW.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh-TW.md index d3ab7ca06..e01d981e8 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh-TW.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh-TW.md @@ -1,28 +1,39 @@ # ElevenLabs 語音轉語音 -## 概述 - -ElevenLabs 語音轉語音節點可將輸入的音訊檔案從一種聲音轉換為另一種聲音。它使用 ElevenLabs API 進行語音轉換,同時保留原始音訊的內容和情感語調。 +ElevenLabs Speech to Speech 節點將輸入的音訊檔案從一種聲音轉換為另一種聲音。它使用 ElevenLabs API 轉換語音,同時保留音訊的原始內容和情緒語調。 ## 輸入 -| 參數 | 說明 | 資料類型 | 必要 | 範圍 | -| --- | --- | --- | --- | --- | -| `目標語音` | 轉換的目標聲音。從語音選擇器或即時語音克隆連接。 | CUSTOM | 是 | - | +### 通用輸入 + +| 參數 | 描述 | 資料類型 | 必要 | 範圍 | +|-----------|-------------|-----------|----------|-------| +| `模型` | 用於語音轉換的模型。每個模型選項都提供一組相符的語音設定(`similarity_boost`、`style`、`use_speaker_boost`、`speed`)。 | DYNAMIC_COMBO | 否 | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `目標語音` | 轉換的目標聲音。從 Voice Selector 或 Instant Voice Clone 連接。 | CUSTOM | 是 | - | | `音訊` | 要轉換的來源音訊。 | AUDIO | 是 | - | -| `穩定性` | 語音穩定性。較低的值提供更廣泛的情感範圍,較高的值產生更一致但可能單調的語音(預設值:0.5)。 | FLOAT | 否 | 0.0 - 1.0 | -| `模型` | 用於語音轉語音轉換的模型。每個選項提供一組特定的語音設定(相似度增強、風格、使用說話者增強、速度)。 | DYNAMICCOMBO | 否 | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | -| `輸出格式` | 音訊輸出格式(預設值:"mp3_44100_192")。 | COMBO | 否 | `"mp3_44100_192"`
`"opus_48000_192"` | -| `種子` | 用於可重現性的種子(預設值:0)。 | INT | 否 | 0 - 4294967295 | -| `移除背景噪音` | 使用音訊隔離技術從輸入音訊中移除背景噪音(預設值:False)。 | BOOLEAN | 否 | - | +| `穩定性` | 語音穩定性。較低的值提供更廣泛的情緒範圍,較高的值產生更一致但可能單調的語音(預設值:0.5)。 | FLOAT | 否 | 0.0 - 1.0 | +| `輸出格式` | 音訊輸出格式(預設值:\"mp3_44100_192\")。 | COMBO | 否 | `"mp3_44100_192"`
`"opus_48000_192"` | +| `種子` | 用於再現性的種子(預設值:0)。 | INT | 否 | 0 - 4294967295 | +| `移除背景噪音` | 使用音訊隔離從輸入音訊中移除背景雜訊(預設值:False)。 | BOOLEAN | 否 | - | + +### 語音設定(由 `eleven_multilingual_sts_v2` 和 `eleven_english_sts_v2` 共用) + +選擇模型後,這些語音設定即可用於轉換。 + +| 參數 | 描述 | 資料類型 | 必要 | 範圍 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 語音速度。1.0 為正常,<1.0 較慢,>1.0 較快(預設值:1.0)。 | FLOAT | 否 | 0.7 - 1.3 | +| `similarity_boost` | 相似度增強。較高的值使聲音更接近原始聲音(預設值:0.75)。 | FLOAT | 否 | 0.0 - 1.0 | +| `use_speaker_boost` | 增強與原始說話者聲音的相似度(預設值:False)。 | BOOLEAN | 否 | - | +| `style` | 風格誇張程度。較高的值會增加風格表現力,但可能降低穩定性(預設值:0.0)。 | FLOAT | 否 | 0.0 - 0.2 | ## 輸出 -| 輸出名稱 | 說明 | 資料類型 | -| --- | --- | --- | -| `音訊` | 以指定輸出格式轉換後的音訊檔案。 | AUDIO | +| 輸出名 | 描述 | 資料類型 | +|-------------|-------------|-----------| +| `audio` | 以指定輸出格式轉換後的音訊檔案。 | AUDIO | > 本文檔由 AI 生成。如果您發現任何錯誤或有改進建議,歡迎貢獻! [在 GitHub 上編輯](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh-TW.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md index 2e75a31de..a98d4ec69 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md @@ -1,28 +1,37 @@ # ElevenLabs 语音转换 -### 概述 +ElevenLabs 语音到语音节点可将输入音频文件从一种语音转换为另一种语音。它使用 ElevenLabs API 转换语音,同时保留音频的原始内容和情绪基调。 -ElevenLabs 语音转语音节点可将输入音频文件从一种声音转换为另一种声音。它利用 ElevenLabs API 进行语音转换,同时保留原始音频的内容和情感基调。 +## 输入 +### 通用输入 -### 输入 - -| 参数 | 描述 | 数据类型 | 是否必填 | 取值范围 | -| --- | --- | --- | --- | --- | -| `目标语音` | 转换的目标声音。从语音选择器或即时语音克隆连接。 | CUSTOM | 是 | - | -| `源音频` | 待转换的源音频。 | AUDIO | 是 | - | -| `稳定性` | 语音稳定性。较低的值提供更广泛的情感范围,较高的值产生更一致但可能单调的语音(默认值:0.5)。 | FLOAT | 否 | 0.0 - 1.0 | -| `模型` | 用于语音转语音转换的模型。每个选项提供一组特定的语音设置(相似度增强、风格、使用说话人增强、速度)。 | DYNAMICCOMBO | 否 | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| 参数 | 描述 | 数据类型 | 是否必需 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `模型` | 用于语音到语音转换的模型。每个模型选项都提供一组匹配的语音设置(similarity_boost、style、use_speaker_boost、speed)。 | DYNAMIC_COMBO | 否 | `eleven_multilingual_sts_v2`
`eleven_english_sts_v2` | +| `目标语音` | 转换的目标语音。从 Voice Selector 或 Instant Voice Clone 连接。 | CUSTOM | 是 | - | +| `源音频` | 要转换的源音频。 | AUDIO | 是 | - | +| `稳定性` | 语音稳定性。较低的值提供更宽的情感范围,较高的值产生更一致但可能单调的语音(默认值:0.5)。 | FLOAT | 否 | 0.0 - 1.0 | | `输出格式` | 音频输出格式(默认值:"mp3_44100_192")。 | COMBO | 否 | `"mp3_44100_192"`
`"opus_48000_192"` | -| `随机种子` | 用于结果可复现的随机种子(默认值:0)。 | INT | 否 | 0 - 4294967295 | -| `去除背景噪音` | 使用音频隔离技术去除输入音频中的背景噪音(默认值:False)。 | BOOLEAN | 否 | - | +| `随机种子` | 用于可重现性的种子(默认值:0)。 | INT | 否 | 0 - 4294967295 | +| `去除背景噪音` | 使用音频隔离从输入音频中移除背景噪音(默认值:False)。 | BOOLEAN | 否 | - | + +### 语音设置(由 `eleven_multilingual_sts_v2` 和 `eleven_english_sts_v2` 共享) + +当选择某个模型时,这些语音设置可用于转换。 -### 输出 +| 参数 | 描述 | 数据类型 | 是否必需 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 语速。1.0 为正常,<1.0 较慢,>1.0 较快(默认值:1.0)。 | FLOAT | 否 | 0.7 - 1.3 | +| `similarity_boost` | 相似度增强。较高的值使语音更接近原始语音(默认值:0.75)。 | FLOAT | 否 | 0.0 - 1.0 | +| `use_speaker_boost` | 增强与原始说话人语音的相似度(默认值:False)。 | BOOLEAN | 否 | - | +| `style` | 风格夸张程度。较高的值会增加风格化表达,但可能降低稳定性(默认值:0.0)。 | FLOAT | 否 | 0.0 - 0.2 | -| 输出名称 | 描述 | 数据类型 | -| --- | --- | --- | -| `源音频` | 以指定输出格式转换后的音频文件。 | AUDIO | +## 输出 +| 输出名 | 描述 | 数据类型 | +|-------------|-------------|-----------| +| `audio` | 以指定输出格式生成的转换后音频文件。 | AUDIO | > 本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md) --- -**Source fingerprint (SHA-256):** `118fe6e85b146d0649b104d814abb518d37f69ade2e53becac365a0ec90146fd` +**Source fingerprint (SHA-256):** `a3cd602181d134b9ab517bfac092ea30b62ef5a9942a905c0c3e6959b34370ca` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ar.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ar.md index 24118d0a5..3bf37ad38 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ar.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ar.md @@ -1,61 +1,42 @@ # ElevenLabs تحويل الكلام إلى نص -أنت خبير في الترجمة التقنية متخصص في توثيق عُقد ComfyUI من الإنجليزية إلى العربية. +تقوم عقدة ElevenLabs لتحويل الكلام إلى نص بنسخ الصوت إلى نص مكتوب باستخدام واجهة برمجة التطبيقات (API) الخاصة بـ ElevenLabs. وتدعم هذه العقدة الكشف التلقائي عن اللغة، وتحديد المتحدث الحالي، ووضع علامات على الأصوات غير الكلامية مثل (ضحك) أو (موسيقى) في النص المنسوخ. -## قواعد الترجمة - -1. **المحتوى الذي يجب عدم ترجمته:** - - أسماء المعاملات بين علامات الاقتباس الخلفية: `image`, `seed`, `model` - - أنواع البيانات بالأحرف الكبيرة: IMAGE, STRING, INT, FLOAT, MODEL, CONDITIONING, إلخ - - القيم في عمود Range: الأرقام، "auto"، أسماء الخيارات - - الكود، مسارات الملفات - -2. **المحتوى الذي يجب ترجمته:** - - عناوين الأقسام: ## نظرة عامة, ## المدخلات, ## المخرجات - - جميع النصوص الوصفية والتوضيحية - - أوصاف المعاملات - -3. **جودة الترجمة:** - - استخدام اللغة العربية الفصحى المعاصرة - - الحفاظ على نبرة احترافية ولكن سهلة الفهم - - ضمان الدقة التقنية - - استخدام المصطلحات التقنية العربية القياسية +## المدخلات -4. **التنسيق:** - - الحفاظ على جميع تنسيقات Markdown - - الحفاظ على بنية الجداول - - عدم إضافة أي ملاحظة أو رابط في بداية الوثيقة (سيتم إضافتها تلقائيًا) +### المدخلات الشائعة -الرجاء ترجمة الوثيقة التالية إلى العربية، دون تضمين الملاحظة الأولية للوثيقة: +| المعامل | الوصف | نوع البيانات | مطلوب | النطاق | +| --- | --- | --- | --- | --- | +| `النموذج` | النموذج المستخدم للنسخ. تحديد نموذج يعرض معاملاته الخاصة. | DYNAMIC_COMBO | نعم | `"scribe_v2"` | +| `الصوت` | الصوت المراد نسخه. | AUDIO | نعم | - | +| `رمز اللغة` | رمز اللغة وفق معيار ISO-639-1 أو ISO-639-3 (مثل 'en' أو 'es' أو 'fra'). اتركه فارغًا للكشف التلقائي. (الافتراضي: "") | STRING | لا | - | +| `عدد المتحدثين` | الحد الأقصى لعدد المتحدثين المتوقعين. اضبطه على 0 للكشف التلقائي. (الافتراضي: 0) | INT | لا | 0 - 32 | +| `البذرة` | بذرة لإمكانية إعادة إنتاج النتائج (لا يُضمن الحتمية). (الافتراضي: 1) | INT | لا | 0 - 2147483647 | -تقوم عقدة ElevenLabs لتحويل الكلام إلى نص بنسخ الملفات الصوتية إلى نص. تستخدم واجهة برمجة تطبيقات ElevenLabs لتحويل الكلمات المنطوقة إلى نص مكتوب، وتدعم ميزات مثل الكشف التلقائي عن اللغة، وتحديد المتحدثين المختلفين، ووضع علامات على الأصوات غير الكلامية مثل الموسيقى أو الضحك. +### مدخلات Scribe v2 -## المدخلات +تظهر هذه المعاملات عند تحديد نموذج `"scribe_v2"`. -| المعامل | الوصف | نوع البيانات | إلزامي | النطاق | +| المعامل | الوصف | نوع البيانات | مطلوب | النطاق | | --- | --- | --- | --- | --- | -| `الصوت` | الصوت المراد نسخه. | AUDIO | نعم | - | -| `النموذج` | النموذج المستخدم للنسخ. يؤدي اختيار هذا النموذج إلى إظهار معاملات إضافية. | COMBO | نعم | `"scribe_v2"` | -| `tag_audio_events` | إضافة تعليقات توضيحية للأصوات مثل (ضحك)، (موسيقى)، إلخ في النص المنسوخ. يظهر هذا المعامل عند تحديد نموذج `"scribe_v2"`. (الافتراضي: False) | BOOLEAN | لا | - | -| `diarize` | إضافة تعليقات توضيحية لتحديد المتحدث. يظهر هذا المعامل عند تحديد نموذج `"scribe_v2"`. (الافتراضي: False) | BOOLEAN | لا | - | -| `diarization_threshold` | حساسية فصل المتحدثين. القيم الأقل أكثر حساسية لتغيرات المتحدث. يظهر هذا المعامل عند تحديد نموذج `"scribe_v2"` وتفعيل `diarize`. (الافتراضي: 0.22) | FLOAT | لا | 0.1 - 0.4 | -| `temperature` | التحكم في العشوائية. القيمة 0.0 تستخدم الإعداد الافتراضي للنموذج. القيم الأعلى تزيد العشوائية. يظهر هذا المعامل عند تحديد نموذج `"scribe_v2"`. (الافتراضي: 0.0) | FLOAT | لا | 0.0 - 2.0 | -| `timestamps_granularity` | دقة التوقيت لكلمات النص المنسوخ. يظهر هذا المعامل عند تحديد نموذج `"scribe_v2"`. (الافتراضي: "word") | COMBO | لا | `"word"`
`"character"`
`"none"` | -| `رمز اللغة` | رمز اللغة وفقًا لمعيار ISO-639-1 أو ISO-639-3 (مثل 'en'، 'es'، 'fra'). اتركه فارغًا للكشف التلقائي. (الافتراضي: "") | STRING | لا | - | -| `عدد المتحدثين` | الحد الأقصى لعدد المتحدثين المتوقعين. اضبط على 0 للكشف التلقائي. (الافتراضي: 0) | INT | لا | 0 - 32 | -| `البذرة` | البذرة لإمكانية إعادة الإنتاج (لا يُضمن الحتمية). (الافتراضي: 1) | INT | لا | 0 - 2147483647 | - -**ملاحظة:** لا يمكن تعيين معامل `num_speakers` إلى قيمة أكبر من 0 عند تفعيل خيار `diarize`. يجب إما تعطيل `diarize` أو تعيين `num_speakers` إلى 0. +| `tag_audio_events` | وسم الأصوات مثل (ضحك)، (موسيقى)، إلخ في النص المنسوخ. (الافتراضي: False) | BOOLEAN | لا | - | +| `diarize` | توضيح المتحدث الحالي في النص. (الافتراضي: False) | BOOLEAN | لا | - | +| `diarization_threshold` | حساسية فصل المتحدثين. القيم الأقل أكثر حساسية لتغيّر المتحدث. يُستخدم فقط عند تفعيل `diarize`. (الافتراضي: 0.22) | FLOAT | لا | 0.1 - 0.4 | +| `temperature` | التحكم في العشوائية. القيمة 0.0 تستخدم الإعداد الافتراضي للنموذج. القيم الأعلى تزيد العشوائية. (الافتراضي: 0.0) | FLOAT | لا | 0.0 - 2.0 | +| `timestamps_granularity` | دقة التوقيت لكلمات النص المنسوخ. (الافتراضي: "word") | COMBO | لا | `"word"`
`"character"`
`"none"` | + +**ملاحظة:** لا يمكن تعيين `num_speakers` إلى قيمة أكبر من 0 عند تفعيل `diarize`. إما أن تعطّل `diarize` أو تضبط `num_speakers` على 0؛ وإلا سيتم رفع خطأ. ## المخرجات | اسم المخرج | الوصف | نوع البيانات | | --- | --- | --- | | `النص` | النص المنسوخ من الصوت. | STRING | -| `رمز اللغة` | رمز اللغة المكتشفة للصوت. | STRING | -| `كلمات بصيغة JSON` | سلسلة نصية بتنسيق JSON تحتوي على معلومات مفصلة على مستوى الكلمة، بما في ذلك الطوابع الزمنية وتسميات المتحدثين إذا تم تفعيلها. | STRING | +| `رمز اللغة` | رمز اللغة المكتشف للصوت. | STRING | +| `كلمات بصيغة JSON` | سلسلة نصية بتنسيق JSON تحتوي معلومات مفصلة على مستوى الكلمة، بما في ذلك الطوابع الزمنية وتسميات المتحدثين إذا كانت مفعّلة. | STRING | > تم إنشاء هذه الوثيقة بواسطة الذكاء الاصطناعي. إذا وجدت أي أخطاء أو لديك اقتراحات للتحسين، فلا تتردد في المساهمة! [تحرير على GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ar.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/en.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/en.md index 9a7b50c32..0c101ed71 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/en.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/en.md @@ -1,23 +1,32 @@ # ElevenLabs Speech to Text -The ElevenLabs Speech to Text node transcribes audio files into text. It uses ElevenLabs' API to convert spoken words into a written transcript, supporting features like automatic language detection, identifying different speakers, and tagging non-speech sounds like music or laughter. +The ElevenLabs Speech to Text node transcribes audio into text using ElevenLabs' speech-to-text API. It supports automatic language detection, identifying which speaker is talking, and tagging non-speech sounds like (laughter) or (music) in the transcript. ## Inputs +### Common Inputs + | Parameter | Description | Data Type | Required | Range | | --- | --- | --- | --- | --- | +| `model` | Model to use for transcription. Selecting a model reveals its specific parameters. | DYNAMIC_COMBO | Yes | `"scribe_v2"` | | `audio` | Audio to transcribe. | AUDIO | Yes | - | -| `model` | Model to use for transcription. Selecting this model reveals additional parameters. | COMBO | Yes | `"scribe_v2"` | -| `tag_audio_events` | Annotate sounds like (laughter), (music), etc. in transcript. This parameter is revealed when the `"scribe_v2"` model is selected. (default: False) | BOOLEAN | No | - | -| `diarize` | Annotate which speaker is talking. This parameter is revealed when the `"scribe_v2"` model is selected. (default: False) | BOOLEAN | No | - | -| `diarization_threshold` | Speaker separation sensitivity. Lower values are more sensitive to speaker changes. This parameter is revealed when the `"scribe_v2"` model is selected and `diarize` is enabled. (default: 0.22) | FLOAT | No | 0.1 - 0.4 | -| `temperature` | Randomness control. 0.0 uses model default. Higher values increase randomness. This parameter is revealed when the `"scribe_v2"` model is selected. (default: 0.0) | FLOAT | No | 0.0 - 2.0 | -| `timestamps_granularity` | Timing precision for transcript words. This parameter is revealed when the `"scribe_v2"` model is selected. (default: "word") | COMBO | No | `"word"`
`"character"`
`"none"` | | `language_code` | ISO-639-1 or ISO-639-3 language code (e.g., 'en', 'es', 'fra'). Leave empty for automatic detection. (default: "") | STRING | No | - | | `num_speakers` | Maximum number of speakers to predict. Set to 0 for automatic detection. (default: 0) | INT | No | 0 - 32 | | `seed` | Seed for reproducibility (determinism not guaranteed). (default: 1) | INT | No | 0 - 2147483647 | -**Note:** The `num_speakers` parameter cannot be set to a value greater than 0 when the `diarize` option is enabled. You must either disable `diarize` or set `num_speakers` to 0. +### Scribe v2 Inputs + +These parameters appear when the `"scribe_v2"` model is selected. + +| Parameter | Description | Data Type | Required | Range | +| --- | --- | --- | --- | --- | +| `tag_audio_events` | Annotate sounds like (laughter), (music), etc. in transcript. (default: False) | BOOLEAN | No | - | +| `diarize` | Annotate which speaker is talking. (default: False) | BOOLEAN | No | - | +| `diarization_threshold` | Speaker separation sensitivity. Lower values are more sensitive to speaker changes. Only used when `diarize` is enabled. (default: 0.22) | FLOAT | No | 0.1 - 0.4 | +| `temperature` | Randomness control. 0.0 uses model default. Higher values increase randomness. (default: 0.0) | FLOAT | No | 0.0 - 2.0 | +| `timestamps_granularity` | Timing precision for transcript words. (default: "word") | COMBO | No | `"word"`
`"character"`
`"none"` | + +**Note:** `num_speakers` cannot be set to a value greater than 0 when `diarize` is enabled. Either disable `diarize` or set `num_speakers` to 0; otherwise an error is raised. ## Outputs diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/es.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/es.md index 90595ef7e..55dbd16c4 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/es.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/es.md @@ -1,33 +1,42 @@ # ElevenLabs Voz a Texto -El nodo ElevenLabs Speech to Text transcribe archivos de audio a texto. Utiliza la API de ElevenLabs para convertir palabras habladas en una transcripción escrita, con funciones como detección automática de idioma, identificación de diferentes hablantes y etiquetado de sonidos no verbales como música o risas. +El nodo ElevenLabs Speech to Text transcribe audio a texto mediante la API de conversión de voz a texto de ElevenLabs. Es compatible con la detección automática de idioma, la identificación de qué hablante está hablando y el etiquetado de sonidos no lingüísticos, como (risas) o (música), en la transcripción. ## Entradas -| Parámetro | Descripción | Tipo de Dato | Obligatorio | Rango | +### Entradas comunes + +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | | --- | --- | --- | --- | --- | +| `modelo` | Modelo a utilizar para la transcripción. Al seleccionar un modelo se muestran sus parámetros específicos. | DYNAMIC_COMBO | Sí | `"scribe_v2"` | | `audio` | Audio a transcribir. | AUDIO | Sí | - | -| `modelo` | Modelo a utilizar para la transcripción. Al seleccionar este modelo se revelan parámetros adicionales. | COMBO | Sí | `"scribe_v2"` | -| `tag_audio_events` | Anotar sonidos como (risas), (música), etc. en la transcripción. Este parámetro se revela cuando se selecciona el modelo `"scribe_v2"`. (predeterminado: False) | BOOLEAN | No | - | -| `diarize` | Anotar qué hablante está hablando. Este parámetro se revela cuando se selecciona el modelo `"scribe_v2"`. (predeterminado: False) | BOOLEAN | No | - | -| `diarization_threshold` | Sensibilidad de separación de hablantes. Valores más bajos son más sensibles a cambios de hablante. Este parámetro se revela cuando se selecciona el modelo `"scribe_v2"` y `diarize` está habilitado. (predeterminado: 0.22) | FLOAT | No | 0.1 - 0.4 | -| `temperature` | Control de aleatoriedad. 0.0 usa el valor predeterminado del modelo. Valores más altos aumentan la aleatoriedad. Este parámetro se revela cuando se selecciona el modelo `"scribe_v2"`. (predeterminado: 0.0) | FLOAT | No | 0.0 - 2.0 | -| `timestamps_granularity` | Precisión de tiempo para las palabras de la transcripción. Este parámetro se revela cuando se selecciona el modelo `"scribe_v2"`. (predeterminado: "word") | COMBO | No | `"word"`
`"character"`
`"none"` | -| `código_de_idioma` | Código de idioma ISO-639-1 o ISO-639-3 (ej. 'en', 'es', 'fra'). Déjelo vacío para detección automática. (predeterminado: "") | STRING | No | - | -| `número_de_hablantes` | Número máximo de hablantes a predecir. Establezca en 0 para detección automática. (predeterminado: 0) | INT | No | 0 - 32 | -| `semilla` | Semilla para reproducibilidad (no se garantiza determinismo). (predeterminado: 1) | INT | No | 0 - 2147483647 | - -**Nota:** El parámetro `num_speakers` no puede establecerse en un valor mayor a 0 cuando la opción `diarize` está habilitada. Debe deshabilitar `diarize` o establecer `num_speakers` en 0. +| `código_de_idioma` | Código de idioma ISO-639-1 o ISO-639-3 (p. ej., 'en', 'es', 'fra'). Déjelo vacío para la detección automática. (predeterminado: "") | STRING | No | - | +| `número_de_hablantes` | Número máximo de hablantes a predecir. Establezca 0 para la detección automática. (predeterminado: 0) | INT | No | 0 - 32 | +| `semilla` | Semilla para reproducibilidad (no se garantiza el determinismo). (predeterminado: 1) | INT | No | 0 - 2147483647 | + +### Entradas de Scribe v2 + +Estos parámetros aparecen cuando se selecciona el modelo `"scribe_v2"`. + +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +| --- | --- | --- | --- | --- | +| `tag_audio_events` | Anota sonidos como (risas), (música), etc. en la transcripción. (predeterminado: False) | BOOLEAN | No | - | +| `diarize` | Anota qué hablante está hablando. (predeterminado: False) | BOOLEAN | No | - | +| `diarization_threshold` | Sensibilidad de separación de hablantes. Los valores más bajos son más sensibles a los cambios de hablante. Solo se usa cuando `diarize` está habilitado. (predeterminado: 0.22) | FLOAT | No | 0.1 - 0.4 | +| `temperature` | Control de aleatoriedad. 0.0 utiliza el valor predeterminado del modelo. Los valores más altos aumentan la aleatoriedad. (predeterminado: 0.0) | FLOAT | No | 0.0 - 2.0 | +| `timestamps_granularity` | Precisión temporal para las palabras de la transcripción. (predeterminado: "word") | COMBO | No | `"word"`
`"character"`
`"none"` | + +**Nota:** `num_speakers` no puede establecerse en un valor mayor que 0 cuando `diarize` está habilitado. Deshabilite `diarize` o establezca `num_speakers` en 0; de lo contrario, se producirá un error. ## Salidas -| Nombre de Salida | Descripción | Tipo de Dato | +| Nombre de salida | Descripción | Tipo de datos | | --- | --- | --- | | `texto` | El texto transcrito del audio. | STRING | | `código_de_idioma` | El código de idioma detectado del audio. | STRING | -| `palabras_json` | Una cadena con formato JSON que contiene información detallada a nivel de palabra, incluyendo marcas de tiempo y etiquetas de hablante si están habilitadas. | STRING | +| `palabras_json` | Una cadena con formato JSON que contiene información detallada a nivel de palabra, incluidas marcas de tiempo y etiquetas de hablante si están habilitadas. | STRING | > Esta documentación fue generada por IA. Si encuentra algún error o tiene sugerencias de mejora, ¡no dude en contribuir! [Editar en GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/es.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fa.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fa.md index b83288032..de7e5100d 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fa.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fa.md @@ -1,35 +1,42 @@ # تبدیل گفتار به متن ElevenLabs -### گره تبدیل گفتار به متن ElevenLabs - -گره تبدیل گفتار به متن ElevenLabs، فایل‌های صوتی را به متن تبدیل می‌کند. این گره از API شرکت ElevenLabs برای تبدیل کلمات گفتاری به متن نوشتاری استفاده می‌کند و از ویژگی‌هایی مانند تشخیص خودکار زبان، شناسایی گویندگان مختلف و برچسب‌گذاری صداهای غیرگفتاری مانند موسیقی یا خنده پشتیبانی می‌کند. +گره «ElevenLabs Speech to Text» با استفاده از API تبدیل گفتار به متن ElevenLabs، صدا را به متن رونویسی می‌کند. این گره از تشخیص خودکار زبان، شناسایی اینکه کدام گوینده صحبت می‌کند و برچسب‌گذاری صداهای غیرگفتاری مانند (خنده) یا (موسیقی) در متن رونویسی پشتیبانی می‌کند. ## ورودی‌ها -| پارامتر | توضیحات | نوع داده | ضروری | محدوده | +### ورودی‌های مشترک + +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | | --- | --- | --- | --- | --- | -| `audio` | فایل صوتی برای تبدیل به متن. | AUDIO | بله | - | -| `model` | مدل مورد استفاده برای تبدیل گفتار به متن. انتخاب این مدل، پارامترهای اضافی را نمایش می‌دهد. | COMBO | بله | `"scribe_v2"` | -| `tag_audio_events` | برچسب‌گذاری صداهایی مانند (خنده)، (موسیقی) و غیره در متن خروجی. این پارامتر زمانی نمایش داده می‌شود که مدل `"scribe_v2"` انتخاب شده باشد. (پیش‌فرض: False) | BOOLEAN | خیر | - | -| `diarize` | مشخص کردن اینکه کدام گوینده در حال صحبت است. این پارامتر زمانی نمایش داده می‌شود که مدل `"scribe_v2"` انتخاب شده باشد. (پیش‌فرض: False) | BOOLEAN | خیر | - | -| `diarization_threshold` | حساسیت تفکیک گویندگان. مقادیر پایین‌تر به تغییرات گوینده حساس‌تر هستند. این پارامتر زمانی نمایش داده می‌شود که مدل `"scribe_v2"` انتخاب شده و گزینه `diarize` فعال باشد. (پیش‌فرض: 0.22) | FLOAT | خیر | 0.1 - 0.4 | -| `temperature` | کنترل تصادفی بودن خروجی. مقدار 0.0 از پیش‌فرض مدل استفاده می‌کند. مقادیر بالاتر تصادفی بودن را افزایش می‌دهد. این پارامتر زمانی نمایش داده می‌شود که مدل `"scribe_v2"` انتخاب شده باشد. (پیش‌فرض: 0.0) | FLOAT | خیر | 0.0 - 2.0 | -| `timestamps_granularity` | دقت زمان‌بندی برای کلمات متن خروجی. این پارامتر زمانی نمایش داده می‌شود که مدل `"scribe_v2"` انتخاب شده باشد. (پیش‌فرض: "word") | COMBO | خیر | `"word"`
`"character"`
`"none"` | -| `language_code` | کد زبان بر اساس استاندارد ISO-639-1 یا ISO-639-3 (مانند 'en'، 'es'، 'fra'). برای تشخیص خودکار خالی بگذارید. (پیش‌فرض: "") | STRING | خیر | - | -| `num_speakers` | حداکثر تعداد گویندگان برای پیش‌بینی. برای تشخیص خودکار مقدار 0 را تنظیم کنید. (پیش‌فرض: 0) | INT | خیر | 0 - 32 | -| `seed` | دانه (seed) برای تکرارپذیری (تکرارپذیری تضمین نمی‌شود). (پیش‌فرض: 1) | INT | خیر | 0 - 2147483647 | - -**توجه:** پارامتر `num_speakers` زمانی که گزینه `diarize` فعال است، نمی‌تواند مقداری بیشتر از 0 داشته باشد. باید یا گزینه `diarize` را غیرفعال کنید یا `num_speakers` را روی 0 تنظیم نمایید. +| `model` | مدلی که برای رونویسی استفاده می‌شود. انتخاب یک مدل، پارامترهای خاص آن را نمایش می‌دهد. | DYNAMIC_COMBO | بله | `"scribe_v2"` | +| `audio` | صدایی که باید رونویسی شود. | AUDIO | بله | - | +| `language_code` | کد زبان ISO-639-1 یا ISO-639-3 (مانند 'en'، 'es'، 'fra'). برای تشخیص خودکار، خالی بگذارید. (پیش‌فرض: "") | STRING | خیر | - | +| `num_speakers` | حداکثر تعداد گویندگان برای پیش‌بینی. برای تشخیص خودکار، 0 قرار دهید. (پیش‌فرض: 0) | INT | خیر | 0 - 32 | +| `seed` | دانه (Seed) برای تکرارپذیری (عدم قطعیت تضمین نمی‌شود). (پیش‌فرض: 1) | INT | خیر | 0 - 2147483647 | + +### ورودی‌های Scribe v2 + +این پارامترها زمانی ظاهر می‌شوند که مدل `"scribe_v2"` انتخاب شده باشد. + +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | +| --- | --- | --- | --- | --- | +| `tag_audio_events` | صداهایی مانند (laughter)، (music) و غیره را در متن رونویسی برچسب‌گذاری کنید. (پیش‌فرض: False) | BOOLEAN | خیر | - | +| `diarize` | مشخص کنید کدام گوینده صحبت می‌کند. (پیش‌فرض: False) | BOOLEAN | خیر | - | +| `diarization_threshold` | حساسیت جداسازی گوینده. مقادیر کمتر نسبت به تغییر گوینده حساس‌تر هستند. فقط زمانی استفاده می‌شود که `diarize` فعال باشد. (پیش‌فرض: 0.22) | FLOAT | خیر | 0.1 - 0.4 | +| `temperature` | کنترل تصادفی‌بودن. 0.0 از پیش‌فرض مدل استفاده می‌کند. مقادیر بالاتر تصادفی‌بودن را افزایش می‌دهند. (پیش‌فرض: 0.0) | FLOAT | خیر | 0.0 - 2.0 | +| `timestamps_granularity` | دقت زمانی برای کلمات متن رونویسی. (پیش‌فرض: "word") | COMBO | خیر | `"word"`
`"character"`
`"none"` | + +**توجه:** `num_speakers` وقتی `diarize` فعال باشد نمی‌تواند مقداری بزرگ‌تر از 0 داشته باشد. یا `diarize` را غیرفعال کنید یا `num_speakers` را 0 قرار دهید؛ در غیر این صورت خطا ایجاد می‌شود. ## خروجی‌ها | نام خروجی | توضیحات | نوع داده | | --- | --- | --- | -| `text` | متن تبدیل‌شده از فایل صوتی. | STRING | -| `language_code` | کد زبان تشخیص‌داده‌شده از فایل صوتی. | STRING | -| `words_json` | یک رشته با فرمت JSON حاوی اطلاعات دقیق در سطح کلمه، شامل زمان‌بندی و برچسب‌های گوینده در صورت فعال بودن. | STRING | +| `text` | متن رونویسی‌شده از صدا. | STRING | +| `language_code` | کد زبان تشخیص‌داده‌شده صدا. | STRING | +| `words_json` | یک رشته با قالب JSON حاوی اطلاعات دقیق در سطح کلمه، شامل برچسب‌های زمانی و برچسب‌های گوینده در صورت فعال بودن. | STRING | > این مستند با هوش مصنوعی تهیه شده است. اگر خطایی دیدید یا پیشنهادی برای بهبود دارید، خوشحال می‌شویم مشارکت کنید! [ویرایش در GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fa.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fr.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fr.md index b179c47ba..3730913e7 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fr.md @@ -1,35 +1,42 @@ # ElevenLabs Speech to Text -Voici la traduction de la documentation du nœud ElevenLabs Speech to Text : - -Le nœud ElevenLabs Speech to Text transcrit des fichiers audio en texte. Il utilise l'API d'ElevenLabs pour convertir la parole en transcription écrite, prenant en charge des fonctionnalités telles que la détection automatique de la langue, l'identification des différents locuteurs et l'étiquetage des sons non vocaux comme la musique ou les rires. +Le nœud Speech to Text d'ElevenLabs transcrit l'audio en texte à l'aide de l'API de reconnaissance vocale d'ElevenLabs. Il prend en charge la détection automatique de la langue, l'identification du locuteur actif et l'étiquetage des sons non verbaux comme (rires) ou (musique) dans la transcription. ## Entrées +### Entrées communes + | Paramètre | Description | Type de données | Requis | Plage | | --- | --- | --- | --- | --- | +| `model` | Modèle à utiliser pour la transcription. La sélection d'un modèle révèle ses paramètres spécifiques. | DYNAMIC_COMBO | Oui | `"scribe_v2"` | | `audio` | Audio à transcrire. | AUDIO | Oui | - | -| `model` | Modèle à utiliser pour la transcription. La sélection de ce modèle révèle des paramètres supplémentaires. | COMBO | Oui | `"scribe_v2"` | -| `tag_audio_events` | Annoter les sons comme (rires), (musique), etc. dans la transcription. Ce paramètre est révélé lorsque le modèle `"scribe_v2"` est sélectionné. (par défaut : False) | BOOLEAN | Non | - | -| `diarize` | Annoter quel locuteur parle. Ce paramètre est révélé lorsque le modèle `"scribe_v2"` est sélectionné. (par défaut : False) | BOOLEAN | Non | - | -| `diarization_threshold` | Sensibilité de séparation des locuteurs. Des valeurs plus faibles sont plus sensibles aux changements de locuteur. Ce paramètre est révélé lorsque le modèle `"scribe_v2"` est sélectionné et que `diarize` est activé. (par défaut : 0.22) | FLOAT | Non | 0.1 - 0.4 | -| `temperature` | Contrôle de l'aléatoire. 0.0 utilise la valeur par défaut du modèle. Des valeurs plus élevées augmentent l'aléatoire. Ce paramètre est révélé lorsque le modèle `"scribe_v2"` est sélectionné. (par défaut : 0.0) | FLOAT | Non | 0.0 - 2.0 | -| `timestamps_granularity` | Précision temporelle pour les mots de la transcription. Ce paramètre est révélé lorsque le modèle `"scribe_v2"` est sélectionné. (par défaut : "word") | COMBO | Non | `"word"`
`"character"`
`"none"` | -| `language_code` | Code de langue ISO-639-1 ou ISO-639-3 (par exemple, 'en', 'es', 'fra'). Laissez vide pour la détection automatique. (par défaut : "") | STRING | Non | - | -| `num_speakers` | Nombre maximum de locuteurs à prédire. Réglez sur 0 pour la détection automatique. (par défaut : 0) | INT | Non | 0 - 32 | -| `seed` | Graine pour la reproductibilité (déterminisme non garanti). (par défaut : 1) | INT | Non | 0 - 2147483647 | - -**Remarque :** Le paramètre `num_speakers` ne peut pas être défini sur une valeur supérieure à 0 lorsque l'option `diarize` est activée. Vous devez soit désactiver `diarize`, soit définir `num_speakers` sur 0. +| `language_code` | Code de langue ISO-639-1 ou ISO-639-3 (par exemple, 'en', 'es', 'fra'). Laissez vide pour la détection automatique. (défaut : "") | STRING | Non | - | +| `num_speakers` | Nombre maximum de locuteurs à prédire. Mettez 0 pour la détection automatique. (défaut : 0) | INT | Non | 0 - 32 | +| `seed` | Graine (seed) pour la reproductibilité (déterminisme non garanti). (défaut : 1) | INT | Non | 0 - 2147483647 | + +### Entrées Scribe v2 + +Ces paramètres apparaissent lorsque le modèle `"scribe_v2"` est sélectionné. + +| Paramètre | Description | Type de données | Requis | Plage | +| --- | --- | --- | --- | --- | +| `tag_audio_events` | Annotez des sons comme (rires), (musique), etc. dans la transcription. (défaut : False) | BOOLEAN | Non | - | +| `diarize` | Annotez quel locuteur parle. (défaut : False) | BOOLEAN | Non | - | +| `diarization_threshold` | Sensibilité de séparation des locuteurs. Des valeurs plus faibles sont plus sensibles aux changements de locuteur. Utilisé uniquement lorsque `diarize` est activé. (défaut : 0.22) | FLOAT | Non | 0.1 - 0.4 | +| `temperature` | Contrôle du caractère aléatoire. 0.0 utilise le défaut du modèle. Des valeurs plus élevées augmentent le caractère aléatoire. (défaut : 0.0) | FLOAT | Non | 0.0 - 2.0 | +| `timestamps_granularity` | Précision temporelle pour les mots de la transcription. (défaut : "word") | COMBO | Non | `"word"`
`"character"`
`"none"` | + +**Remarque :** `num_speakers` ne peut pas être défini sur une valeur supérieure à 0 lorsque `diarize` est activé. Désactivez `diarize` ou définissez `num_speakers` sur 0 ; sinon, une erreur est levée. ## Sorties -| Nom de la sortie | Description | Type de données | +| Nom de sortie | Description | Type de données | | --- | --- | --- | | `text` | Le texte transcrit à partir de l'audio. | STRING | | `language_code` | Le code de langue détecté de l'audio. | STRING | -| `words_json` | Une chaîne formatée en JSON contenant des informations détaillées au niveau des mots, y compris les horodatages et les étiquettes de locuteur si activés. | STRING | +| `words_json` | Une chaîne au format JSON contenant des informations détaillées au niveau des mots, y compris les horodatages et les étiquettes de locuteur si activés. | STRING | > Cette documentation a été générée par IA. Si vous trouvez des erreurs ou avez des suggestions d'amélioration, n'hésitez pas à contribuer ! [Modifier sur GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/fr.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ja.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ja.md index d3b526d85..e41682d80 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ja.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ja.md @@ -1,35 +1,42 @@ # ElevenLabs 音声からテキストへ -以下が翻訳結果です。 - -ElevenLabs Speech to Text ノードは、オーディオファイルをテキストに文字起こしします。ElevenLabs の API を使用して、音声を書き起こしテキストに変換します。自動言語検出、話者の識別、音楽や笑い声などの非音声サウンドのタグ付けなどの機能をサポートしています。 +ElevenLabs Speech to Text ノードは、ElevenLabs の音声認識 API を使用して、音声をテキストに文字起こしします。自動言語検出、話者識別、そして (laughter) や (music) などの非音声サウンドをトランスクリプト内にタグ付けする機能に対応しています。 ## 入力 +### 共通入力 + +| パラメータ | 説明 | データ型 | 必須 | 範囲 | +| --- | --- | --- | --- | --- | +| `モデル` | 文字起こしに使用するモデル。モデルを選択すると、そのモデル固有のパラメータが表示されます。 | DYNAMIC_COMBO | はい | `"scribe_v2"` | +| `音声` | 文字起こしする音声。 | AUDIO | はい | - | +| `言語コード` | ISO-639-1 または ISO-639-3 の言語コード(例: 'en', 'es', 'fra')。自動検出する場合は空のままにします。(デフォルト: "") | STRING | いいえ | - | +| `話者数` | 予測する話者の最大数。自動検出の場合は 0 に設定します。(デフォルト: 0) | INT | いいえ | 0 - 32 | +| `シード値` | 再現性のためのシード(決定性は保証されません)。(デフォルト: 1) | INT | いいえ | 0 - 2147483647 | + +### Scribe v2 入力 + +これらのパラメータは、`"scribe_v2"` モデルが選択されている場合に表示されます。 + | パラメータ | 説明 | データ型 | 必須 | 範囲 | | --- | --- | --- | --- | --- | -| `音声` | 文字起こしするオーディオ。 | AUDIO | はい | - | -| `モデル` | 文字起こしに使用するモデル。このモデルを選択すると、追加のパラメータが表示されます。 | COMBO | はい | `"scribe_v2"` | -| `tag_audio_events` | 文字起こし内で (笑い声)、(音楽) などの音を注釈します。このパラメータは、`"scribe_v2"` モデルが選択されたときに表示されます。(デフォルト: False) | BOOLEAN | いいえ | - | -| `diarize` | どの話者が話しているかを注釈します。このパラメータは、`"scribe_v2"` モデルが選択されたときに表示されます。(デフォルト: False) | BOOLEAN | いいえ | - | -| `diarization_threshold` | 話者分離の感度。値が小さいほど、話者の変更に敏感になります。このパラメータは、`"scribe_v2"` モデルが選択され、`diarize` が有効な場合に表示されます。(デフォルト: 0.22) | FLOAT | いいえ | 0.1 - 0.4 | -| `temperature` | ランダム性の制御。0.0 はモデルのデフォルトを使用します。値が大きいほどランダム性が増します。このパラメータは、`"scribe_v2"` モデルが選択されたときに表示されます。(デフォルト: 0.0) | FLOAT | いいえ | 0.0 - 2.0 | -| `timestamps_granularity` | 文字起こしの単語に対するタイミングの精度。このパラメータは、`"scribe_v2"` モデルが選択されたときに表示されます。(デフォルト: "word") | COMBO | いいえ | `"word"`
`"character"`
`"none"` | -| `言語コード` | ISO-639-1 または ISO-639-3 言語コード (例: 'en'、'es'、'fra')。自動検出の場合は空のままにします。(デフォルト: "") | STRING | いいえ | - | -| `話者数` | 予測する話者の最大数。自動検出の場合は 0 に設定します。(デフォルト: 0) | INT | いいえ | 0 - 32 | -| `シード値` | 再現性のためのシード (決定性は保証されません)。(デフォルト: 1) | INT | いいえ | 0 - 2147483647 | - -**注:** `diarize` オプションが有効な場合、`num_speakers` パラメータを 0 より大きい値に設定することはできません。`diarize` を無効にするか、`num_speakers` を 0 に設定する必要があります。 +| `tag_audio_events` | トランスクリプト内の (laughter) や (music) などの音に注釈を付けます。(デフォルト: False) | BOOLEAN | いいえ | - | +| `diarize` | どの話者が話しているかに注釈を付けます。(デフォルト: False) | BOOLEAN | いいえ | - | +| `diarization_threshold` | 話者分離の感度。値が低いほど、話者の切り替わりにより敏感に反応します。`diarize` が有効な場合にのみ使用されます。(デフォルト: 0.22) | FLOAT | いいえ | 0.1 - 0.4 | +| `temperature` | ランダム性の制御。0.0 はモデルのデフォルトを使用します。値が大きいほどランダム性が高まります。(デフォルト: 0.0) | FLOAT | いいえ | 0.0 - 2.0 | +| `timestamps_granularity` | トランスクリプトの単語のタイミング精度。(デフォルト: "word") | COMBO | いいえ | `"word"`
`"character"`
`"none"` | + +**注記:** `diarize` が有効な場合、`num_speakers` に 0 より大きい値を設定することはできません。`diarize` を無効にするか、`num_speakers` を 0 に設定してください。そうしないとエラーが発生します。 ## 出力 | 出力名 | 説明 | データ型 | | --- | --- | --- | -| `テキスト` | オーディオから文字起こしされたテキスト。 | STRING | -| `言語コード` | 検出されたオーディオの言語コード。 | STRING | -| `単語JSON` | タイムスタンプや、有効な場合は話者ラベルを含む、詳細な単語レベルの情報を含む JSON 形式の文字列。 | STRING | +| `テキスト` | 音声から文字起こしされたテキスト。 | STRING | +| `言語コード` | 検出された音声の言語コード。 | STRING | +| `単語JSON` | 詳細な単語レベルの情報を含む JSON 形式の文字列。有効な場合、タイムスタンプと話者ラベルも含まれます。 | STRING | > このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ja.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ko.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ko.md index 124505277..51b1a0558 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ko.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ko.md @@ -1,33 +1,42 @@ # ElevenLabs 음성 → 텍스트 -ElevenLabs 음성-텍스트 노드는 오디오 파일을 텍스트로 변환합니다. ElevenLabs의 API를 사용하여 음성 단어를 문자 기록으로 변환하며, 자동 언어 감지, 화자 식별, 음악이나 웃음과 같은 비음성 사운드 태깅 기능을 지원합니다. +ElevenLabs Speech to Text 노드는 ElevenLabs의 음성-텍스트 API를 사용하여 오디오를 텍스트로 전사합니다. 자동 언어 감지, 현재 말하는 화자 식별, 대본에서 (웃음) 또는 (음악) 같은 비음성 사운드 태그 지정을 지원합니다. ## 입력 -| 매개변수 | 설명 | 데이터 타입 | 필수 여부 | 범위 | +### 공통 입력 + +| 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | +| --- | --- | --- | --- | --- | +| `model` | 전사에 사용할 모델입니다. 모델을 선택하면 해당 모델의 특정 매개변수가 표시됩니다. | DYNAMIC_COMBO | 예 | `"scribe_v2"` | +| `audio` | 전사할 오디오입니다. | AUDIO | 예 | - | +| `language_code` | ISO-639-1 또는 ISO-639-3 언어 코드입니다(예: 'en', 'es', 'fra'). 자동 감지하려면 비워 두세요. (기본값: "") | STRING | 아니요 | - | +| `num_speakers` | 예측할 최대 화자 수입니다. 자동 감지하려면 0으로 설정하세요. (기본값: 0) | INT | 아니요 | 0 - 32 | +| `seed` | 재현을 위한 시드입니다(결정성은 보장되지 않음). (기본값: 1) | INT | 아니요 | 0 - 2147483647 | + +### Scribe v2 입력 + +이 매개변수들은 `"scribe_v2"` 모델이 선택되었을 때 나타납니다. + +| 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | | --- | --- | --- | --- | --- | -| `audio` | 변환할 오디오입니다. | AUDIO | 예 | - | -| `model` | 변환에 사용할 모델입니다. 이 모델을 선택하면 추가 매개변수가 표시됩니다. | COMBO | 예 | `"scribe_v2"` | -| `tag_audio_events` | 기록에 (웃음), (음악) 등의 사운드에 주석을 추가합니다. 이 매개변수는 `"scribe_v2"` 모델을 선택하면 표시됩니다. (기본값: False) | BOOLEAN | 아니요 | - | -| `diarize` | 말하는 화자에 주석을 추가합니다. 이 매개변수는 `"scribe_v2"` 모델을 선택하면 표시됩니다. (기본값: False) | BOOLEAN | 아니요 | - | -| `diarization_threshold` | 화자 분리 민감도입니다. 값이 낮을수록 화자 변경에 더 민감하게 반응합니다. 이 매개변수는 `"scribe_v2"` 모델을 선택하고 `diarize`가 활성화된 경우 표시됩니다. (기본값: 0.22) | FLOAT | 아니요 | 0.1 - 0.4 | -| `temperature` | 무작위성 제어입니다. 0.0은 모델 기본값을 사용합니다. 값이 높을수록 무작위성이 증가합니다. 이 매개변수는 `"scribe_v2"` 모델을 선택하면 표시됩니다. (기본값: 0.0) | FLOAT | 아니요 | 0.0 - 2.0 | -| `timestamps_granularity` | 기록 단어의 시간 정밀도입니다. 이 매개변수는 `"scribe_v2"` 모델을 선택하면 표시됩니다. (기본값: "word") | COMBO | 아니요 | `"word"`
`"character"`
`"none"` | -| `language_code` | ISO-639-1 또는 ISO-639-3 언어 코드입니다(예: 'en', 'es', 'fra'). 자동 감지를 위해 비워 둡니다. (기본값: "") | STRING | 아니요 | - | -| `num_speakers` | 예측할 최대 화자 수입니다. 자동 감지를 위해 0으로 설정합니다. (기본값: 0) | INT | 아니요 | 0 - 32 | -| `seed` | 재현성을 위한 시드입니다(결정론은 보장되지 않습니다). (기본값: 1) | INT | 아니요 | 0 - 2147483647 | - -**참고:** `diarize` 옵션이 활성화된 경우 `num_speakers` 매개변수를 0보다 큰 값으로 설정할 수 없습니다. `diarize`를 비활성화하거나 `num_speakers`를 0으로 설정해야 합니다. +| `tag_audio_events` | 대본에서 (웃음), (음악) 등의 소리를 주석으로 표시합니다. (기본값: False) | BOOLEAN | 아니요 | - | +| `diarize` | 현재 말하는 화자를 주석으로 표시합니다. (기본값: False) | BOOLEAN | 아니요 | - | +| `diarization_threshold` | 화자 분리 민감도입니다. 값이 낮을수록 화자 변경에 더 민감하게 반응합니다. `diarize`가 활성화된 경우에만 사용됩니다. (기본값: 0.22) | FLOAT | 아니요 | 0.1 - 0.4 | +| `temperature` | 무작위성 제어입니다. 0.0은 모델 기본값을 사용합니다. 값이 높을수록 무작위성이 증가합니다. (기본값: 0.0) | FLOAT | 아니요 | 0.0 - 2.0 | +| `timestamps_granularity` | 전사 단어의 시간 정밀도입니다. (기본값: "word") | COMBO | 아니요 | `"word"`
`"character"`
`"none"` | + +**참고:** `diarize`가 활성화된 경우 `num_speakers`를 0보다 큰 값으로 설정할 수 없습니다. `diarize`를 비활성화하거나 `num_speakers`를 0으로 설정하세요. 그렇지 않으면 오류가 발생합니다. ## 출력 | 출력 이름 | 설명 | 데이터 타입 | | --- | --- | --- | -| `text` | 오디오에서 변환된 텍스트입니다. | STRING | -| `language_code` | 감지된 오디오의 언어 코드입니다. | STRING | -| `words_json` | 타임스탬프와 활성화된 경우 화자 레이블을 포함한 상세한 단어 수준 정보가 포함된 JSON 형식 문자열입니다. | STRING | +| `text` | 오디오에서 전사된 텍스트입니다. | STRING | +| `language_code` | 오디오에서 감지된 언어 코드입니다. | STRING | +| `words_json` | 타임스탬프와 활성화된 경우 화자 레이블을 포함한 상세한 단어 수준 정보가 담긴 JSON 형식 문자열입니다. | STRING | > 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ko.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md index 5ded86454..c7f2ec222 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md @@ -1,33 +1,42 @@ # ElevenLabs Fala para Texto -O nó ElevenLabs Speech to Text transcreve arquivos de áudio em texto. Ele utiliza a API da ElevenLabs para converter palavras faladas em uma transcrição escrita, oferecendo suporte a recursos como detecção automática de idioma, identificação de diferentes falantes e marcação de sons não falados, como música ou risadas. +O nó ElevenLabs Speech to Text transcreve áudio em texto usando a API de fala para texto da ElevenLabs. Ele oferece suporte à detecção automática de idioma, identifica qual locutor está falando e marca sons não relacionados à fala, como (risos) ou (música), na transcrição. ## Entradas -| Parâmetro | Descrição | Tipo de Dado | Obrigatório | Intervalo | +### Entradas Comuns + +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | | --- | --- | --- | --- | --- | +| `modelo` | Modelo a ser usado para transcrição. Selecionar um modelo revela seus parâmetros específicos. | DYNAMIC_COMBO | Sim | `"scribe_v2"` | | `áudio` | Áudio a ser transcrito. | AUDIO | Sim | - | -| `modelo` | Modelo a ser usado para transcrição. Selecionar este modelo revela parâmetros adicionais. | COMBO | Sim | `"scribe_v2"` | -| `tag_audio_events` | Anotar sons como (risadas), (música), etc. na transcrição. Este parâmetro é revelado quando o modelo `"scribe_v2"` é selecionado. (padrão: False) | BOOLEAN | Não | - | -| `diarize` | Anotar qual falante está falando. Este parâmetro é revelado quando o modelo `"scribe_v2"` é selecionado. (padrão: False) | BOOLEAN | Não | - | -| `diarization_threshold` | Sensibilidade de separação de falantes. Valores menores são mais sensíveis a mudanças de falante. Este parâmetro é revelado quando o modelo `"scribe_v2"` é selecionado e `diarize` está ativado. (padrão: 0,22) | FLOAT | Não | 0,1 - 0,4 | -| `temperature` | Controle de aleatoriedade. 0,0 usa o padrão do modelo. Valores maiores aumentam a aleatoriedade. Este parâmetro é revelado quando o modelo `"scribe_v2"` é selecionado. (padrão: 0,0) | FLOAT | Não | 0,0 - 2,0 | -| `timestamps_granularity` | Precisão de tempo para palavras da transcrição. Este parâmetro é revelado quando o modelo `"scribe_v2"` é selecionado. (padrão: "word") | COMBO | Não | `"word"`
`"character"`
`"none"` | | `código_idioma` | Código de idioma ISO-639-1 ou ISO-639-3 (ex.: 'en', 'es', 'fra'). Deixe vazio para detecção automática. (padrão: "") | STRING | Não | - | -| `num_locs` | Número máximo de falantes a prever. Defina como 0 para detecção automática. (padrão: 0) | INT | Não | 0 - 32 | +| `num_locs` | Número máximo de locutores a prever. Defina como 0 para detecção automática. (padrão: 0) | INT | Não | 0 - 32 | | `semente` | Semente para reprodutibilidade (determinismo não garantido). (padrão: 1) | INT | Não | 0 - 2147483647 | -**Nota:** O parâmetro `num_speakers` não pode ser definido com um valor maior que 0 quando a opção `diarize` está ativada. Você deve desativar `diarize` ou definir `num_speakers` como 0. +### Entradas do Scribe v2 + +Estes parâmetros aparecem quando o modelo `"scribe_v2"` é selecionado. + +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | +| --- | --- | --- | --- | --- | +| `tag_audio_events` | Anota sons como (risos), (música), etc. na transcrição. (padrão: False) | BOOLEAN | Não | - | +| `diarize` | Anota qual locutor está falando. (padrão: False) | BOOLEAN | Não | - | +| `diarization_threshold` | Sensibilidade da separação de locutores. Valores mais baixos são mais sensíveis a mudanças de locutor. Usado somente quando `diarize` está ativado. (padrão: 0.22) | FLOAT | Não | 0.1 - 0.4 | +| `temperature` | Controle de aleatoriedade. 0.0 usa o padrão do modelo. Valores mais altos aumentam a aleatoriedade. (padrão: 0.0) | FLOAT | Não | 0.0 - 2.0 | +| `timestamps_granularity` | Precisão temporal para as palavras da transcrição. (padrão: "word") | COMBO | Não | `"word"`
`"character"`
`"none"` | + +**Observação:** `num_speakers` não pode ser definido com valor maior que 0 quando `diarize` está ativado. Desative `diarize` ou defina `num_speakers` como 0; caso contrário, um erro será gerado. ## Saídas -| Nome da Saída | Descrição | Tipo de Dado | +| Nome da Saída | Descrição | Tipo de Dados | | --- | --- | --- | | `text` | O texto transcrito do áudio. | STRING | -| `código_idioma` | O código do idioma detectado no áudio. | STRING | -| `words_json` | Uma string formatada em JSON contendo informações detalhadas em nível de palavra, incluindo timestamps e rótulos de falante, se ativados. | STRING | +| `language_code` | O código de idioma detectado no áudio. | STRING | +| `words_json` | Uma string formatada em JSON contendo informações detalhadas em nível de palavra, incluindo timestamps e rótulos de locutor, se ativados. | STRING | > Esta documentação foi gerada por IA. Se você encontrar erros ou tiver sugestões de melhoria, sinta-se à vontade para contribuir! [Editar no GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ru.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ru.md index 60e09bc67..b39814d14 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ru.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ru.md @@ -1,33 +1,42 @@ # ElevenLabs Распознавание речи -Узел ElevenLabs Speech to Text преобразует аудиофайлы в текст. Он использует API ElevenLabs для преобразования произнесенных слов в письменную расшифровку, поддерживая такие функции, как автоматическое определение языка, идентификация разных говорящих и разметка неречевых звуков, таких как музыка или смех. +Узел ElevenLabs Speech to Text преобразует аудио в текст с помощью API преобразования речи в текст ElevenLabs. Он поддерживает автоматическое определение языка, определяет, какой говорящий говорит, и помечает неречевые звуки, такие как (смех) или (музыка), в расшифровке. -## Входные параметры +## Входы + +### Общие входы + +| Параметр | Описание | Тип данных | Обязательный | Диапазон | +| --- | --- | --- | --- | --- | +| `model` | Модель для транскрипции. Выбор модели отображает её специфические параметры. | DYNAMIC_COMBO | Да | `"scribe_v2"` | +| `audio` | Аудио для транскрипции. | AUDIO | Да | - | +| `language_code` | Код языка по стандартам ISO-639-1 или ISO-639-3 (например, 'en', 'es', 'fra'). Оставьте пустым для автоматического определения. (по умолчанию: "") | STRING | Нет | - | +| `num_speakers` | Максимальное количество говорящих для прогнозирования. Установите 0 для автоматического определения. (по умолчанию: 0) | INT | Нет | 0 - 32 | +| `seed` | Сид для воспроизводимости (детерминизм не гарантируется). (по умолчанию: 1) | INT | Нет | 0 - 2147483647 | + +### Входы Scribe v2 + +Эти параметры появляются, когда выбрана модель `"scribe_v2"`. | Параметр | Описание | Тип данных | Обязательный | Диапазон | | --- | --- | --- | --- | --- | -| `audio` | Аудио для расшифровки. | AUDIO | Да | - | -| `model` | Модель для расшифровки. Выбор этой модели открывает дополнительные параметры. | COMBO | Да | `"scribe_v2"` | -| `tag_audio_events` | Аннотировать звуки, такие как (смех), (музыка) и т.д., в расшифровке. Этот параметр отображается при выборе модели `"scribe_v2"`. (по умолчанию: False) | BOOLEAN | Нет | - | -| `diarize` | Аннотировать, какой говорящий говорит. Этот параметр отображается при выборе модели `"scribe_v2"`. (по умолчанию: False) | BOOLEAN | Нет | - | -| `diarization_threshold` | Чувствительность разделения говорящих. Более низкие значения более чувствительны к смене говорящего. Этот параметр отображается при выборе модели `"scribe_v2"` и включенном `diarize`. (по умолчанию: 0.22) | FLOAT | Нет | 0.1 - 0.4 | -| `temperature` | Контроль случайности. 0.0 использует значение по умолчанию модели. Более высокие значения увеличивают случайность. Этот параметр отображается при выборе модели `"scribe_v2"`. (по умолчанию: 0.0) | FLOAT | Нет | 0.0 - 2.0 | -| `timestamps_granularity` | Точность временных меток для слов расшифровки. Этот параметр отображается при выборе модели `"scribe_v2"`. (по умолчанию: "word") | COMBO | Нет | `"word"`
`"character"`
`"none"` | -| `language_code` | Код языка ISO-639-1 или ISO-639-3 (например, 'ru', 'en', 'fra'). Оставьте пустым для автоматического определения. (по умолчанию: "") | STRING | Нет | - | -| `num_speakers` | Максимальное количество говорящих для предсказания. Установите 0 для автоматического определения. (по умолчанию: 0) | INT | Нет | 0 - 32 | -| `seed` | Зерно для воспроизводимости (детерминизм не гарантируется). (по умолчанию: 1) | INT | Нет | 0 - 2147483647 | +| `tag_audio_events` | Аннотировать звуки, такие как (смех), (музыка) и т. д., в расшифровке. (по умолчанию: False) | BOOLEAN | Нет | - | +| `diarize` | Аннотировать, какой говорящий говорит. (по умолчанию: False) | BOOLEAN | Нет | - | +| `diarization_threshold` | Чувствительность разделения говорящих. Более низкие значения более чувствительны к смене говорящего. Используется только при включённом `diarize`. (по умолчанию: 0.22) | FLOAT | Нет | 0.1 - 0.4 | +| `temperature` | Управление случайностью. 0.0 использует значение по умолчанию модели. Более высокие значения увеличивают случайность. (по умолчанию: 0.0) | FLOAT | Нет | 0.0 - 2.0 | +| `timestamps_granularity` | Точность временных меток для слов в расшифровке. (по умолчанию: "word") | COMBO | Нет | `"word"`
`"character"`
`"none"` | -**Примечание:** Параметр `num_speakers` не может быть установлен в значение больше 0, когда включена опция `diarize`. Необходимо либо отключить `diarize`, либо установить `num_speakers` в 0. +**Примечание:** `num_speakers` не может быть установлено в значение больше 0, когда включён `diarize`. Либо отключите `diarize`, либо установите `num_speakers` в 0; в противном случае возникает ошибка. -## Выходные параметры +## Выходы | Имя выхода | Описание | Тип данных | | --- | --- | --- | -| `text` | Расшифрованный текст из аудио. | STRING | -| `language_code` | Определенный код языка аудио. | STRING | +| `text` | Транскрибированный текст из аудио. | STRING | +| `language_code` | Определённый код языка аудио. | STRING | | `words_json` | Строка в формате JSON, содержащая подробную информацию на уровне слов, включая временные метки и метки говорящих, если они включены. | STRING | > Эта документация была создана с помощью ИИ. Если вы обнаружите ошибки или у вас есть предложения по улучшению, пожалуйста, внесите свой вклад! [Редактировать на GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ru.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/tr.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/tr.md index ad2c9222a..fae491f81 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/tr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/tr.md @@ -1,61 +1,42 @@ # ElevenLabs Konuşmadan Metne -ComfyUI düğüm belgelerini İngilizceden Türkçeye çevirmede uzmanlaşmış teknik çeviri uzmanısınız. +ElevenLabs Speech to Text düğümü, ElevenLabs'ın konuşmayı metne dönüştürme API'sini kullanarak sesi metne dönüştürür. Otomatik dil algılamayı, hangi konuşmacının konuştuğunu belirlemeyi ve dökümde (kahkaha) veya (müzik) gibi konuşma dışı sesleri etiketlemeyi destekler. -## Çeviri Kuralları +## Girdiler -1. **Çevrilmemesi gereken içerik:** - - Ters tırnak içindeki parametre adları: `image`, `seed`, `model` - - BÜYÜK harflerle veri türleri: IMAGE, STRING, INT, FLOAT, MODEL, CONDITIONING, vb. - - Range sütunundaki değerler: sayılar, "auto", seçenek adları - - Kod, dosya yolları +### Genel Girdiler -2. **Çevrilmesi gereken içerik:** - - Bölüm başlıkları: ## Genel Bakış, ## Girdiler, ## Çıktılar - - Tüm açıklayıcı metinler - - Parametre açıklamaları - -3. **Çeviri kalitesi:** - - Standart Türkçe kullanın - - Profesyonel ama anlaşılır bir üslup koruyun - - Teknik doğruluğu sağlayın - - Standart Türkçe teknik terminolojiyi kullanın - -4. **Format:** - - Tüm Markdown biçimlendirmesini koruyun - - Tablo yapısını koruyun - - Belgenin başına herhangi bir not veya bağlantı eklemeyin (otomatik olarak eklenecektir) - -Lütfen aşağıdaki belgeyi Türkçeye çevirin (belgenin başlangıç notunu dahil etmeyin): +| Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | +| --- | --- | --- | --- | --- | +| `model` | Yazıya dökme için kullanılacak model. Bir model seçmek, o modele özgü parametreleri gösterir. | DYNAMIC_COMBO | Evet | `"scribe_v2"` | +| `ses` | Yazıya dökülecek ses. | AUDIO | Evet | - | +| `dil_kodu` | ISO-639-1 veya ISO-639-3 dil kodu (ör. 'en', 'es', 'fra'). Otomatik algılama için boş bırakın. (varsayılan: "") | STRING | Hayır | - | +| `konuşmacı_sayısı` | Tahmin edilecek maksimum konuşmacı sayısı. Otomatik algılama için 0 olarak ayarlayın. (varsayılan: 0) | INT | Hayır | 0 - 32 | +| `tohum` | Tekrarlanabilirlik için tohum (determinizm garanti edilmez). (varsayılan: 1) | INT | Hayır | 0 - 2147483647 | -ElevenLabs Konuşmayı Metne Çevir düğümü, ses dosyalarını metne dönüştürür. ElevenLabs'ın API'sini kullanarak konuşulan kelimeleri yazılı bir metne çevirir; otomatik dil algılama, farklı konuşmacıları tanımlama ve müzik veya kahkaha gibi konuşma dışı sesleri etiketleme gibi özellikleri destekler. +### Scribe v2 Girdileri -## Girişler +Bu parametreler, `"scribe_v2"` modeli seçildiğinde görünür. | Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | | --- | --- | --- | --- | --- | -| `ses` | Metne çevrilecek ses. | AUDIO | Evet | - | -| `model` | Metne çevirme için kullanılacak model. Bu modelin seçilmesi ek parametreleri ortaya çıkarır. | COMBO | Evet | `"scribe_v2"` | -| `tag_audio_events` | Metinde (kahkaha), (müzik) gibi sesleri açıklama. Bu parametre, `"scribe_v2"` modeli seçildiğinde görünür hale gelir. (varsayılan: False) | BOOLEAN | Hayır | - | -| `diarize` | Hangi konuşmacının konuştuğunu açıklama. Bu parametre, `"scribe_v2"` modeli seçildiğinde görünür hale gelir. (varsayılan: False) | BOOLEAN | Hayır | - | -| `diarization_threshold` | Konuşmacı ayırma hassasiyeti. Daha düşük değerler konuşmacı değişikliklerine karşı daha hassastır. Bu parametre, `"scribe_v2"` modeli seçildiğinde ve `diarize` etkinleştirildiğinde görünür hale gelir. (varsayılan: 0.22) | FLOAT | Hayır | 0.1 - 0.4 | -| `temperature` | Rastgelelik kontrolü. 0.0 model varsayılanını kullanır. Daha yüksek değerler rastgeleliği artırır. Bu parametre, `"scribe_v2"` modeli seçildiğinde görünür hale gelir. (varsayılan: 0.0) | FLOAT | Hayır | 0.0 - 2.0 | -| `timestamps_granularity` | Metin kelimeleri için zamanlama hassasiyeti. Bu parametre, `"scribe_v2"` modeli seçildiğinde görünür hale gelir. (varsayılan: "word") | COMBO | Hayır | `"word"`
`"character"`
`"none"` | -| `dil_kodu` | ISO-639-1 veya ISO-639-3 dil kodu (ör. 'en', 'es', 'fra'). Otomatik algılama için boş bırakın. (varsayılan: "") | STRING | Hayır | - | -| `konuşmacı_sayısı` | Tahmin edilecek maksimum konuşmacı sayısı. Otomatik algılama için 0 olarak ayarlayın. (varsayılan: 0) | INT | Hayır | 0 - 32 | -| `tohum` | Tekrarlanabilirlik için tohum değeri (determinizm garanti edilmez). (varsayılan: 1) | INT | Hayır | 0 - 2147483647 | +| `tag_audio_events` | Dökümde (kahkaha), (müzik) vb. sesleri etiketleyin. (varsayılan: False) | BOOLEAN | Hayır | - | +| `diarize` | Hangi konuşmacının konuştuğunu etiketleyin. (varsayılan: False) | BOOLEAN | Hayır | - | +| `diarization_threshold` | Konuşmacı ayırma hassasiyeti. Daha düşük değerler konuşmacı değişimlerine daha duyarlıdır. Yalnızca `diarize` etkinleştirildiğinde kullanılır. (varsayılan: 0.22) | FLOAT | Hayır | 0.1 - 0.4 | +| `temperature` | Rastgelelik kontrolü. 0.0 model varsayılanını kullanır. Daha yüksek değerler rastgeleliği artırır. (varsayılan: 0.0) | FLOAT | Hayır | 0.0 - 2.0 | +| `timestamps_granularity` | Döküm sözcükleri için zamanlama hassasiyeti. (varsayılan: "word") | COMBO | Hayır | `"word"`
`"character"`
`"none"` | -**Not:** `diarize` seçeneği etkinleştirildiğinde `num_speakers` parametresi 0'dan büyük bir değere ayarlanamaz. `diarize` seçeneğini devre dışı bırakmalı veya `num_speakers` değerini 0 olarak ayarlamalısınız. +**Not:** `diarize` etkinleştirildiğinde `num_speakers` 0'dan büyük bir değere ayarlanamaz. `diarize` özelliğini devre dışı bırakın veya `num_speakers` değerini 0 olarak ayarlayın; aksi takdirde bir hata oluşturulur. ## Çıktılar | Çıktı Adı | Açıklama | Veri Türü | | --- | --- | --- | -| `metin` | Sesten metne çevrilmiş metin. | STRING | +| `metin` | Ses dosyasından yazıya dökülen metin. | STRING | | `dil_kodu` | Sesin algılanan dil kodu. | STRING | -| `kelimeler_json` | Zaman damgaları ve etkinleştirilmişse konuşmacı etiketleri dahil olmak üzere kelime düzeyinde ayrıntılı bilgiler içeren JSON biçimli bir dize. | STRING | +| `kelimeler_json` | Etkinleştirilirse zaman damgaları ve konuşmacı etiketleri dahil olmak üzere sözcük düzeyinde ayrıntılı bilgi içeren JSON biçimli bir dize. | STRING | > Bu belge yapay zeka tarafından oluşturulmuştur. Herhangi bir hata bulursanız veya iyileştirme önerileriniz varsa, katkıda bulunmaktan çekinmeyin! [GitHub'da Düzenle](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/tr.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh-TW.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh-TW.md index 8b7dba592..b56c81dcb 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh-TW.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh-TW.md @@ -1,35 +1,42 @@ # ElevenLabs 語音轉文字 -## 概述 - -ElevenLabs 語音轉文字節點可將音訊檔案轉錄為文字。它使用 ElevenLabs 的 API 將語音內容轉換為書面文字記錄,支援自動語言偵測、辨識不同說話者,以及標記音樂或笑聲等非語音聲音。 +ElevenLabs 語音轉文字節點使用 ElevenLabs 的語音轉文字 API,將音訊轉錄為文字。它支援自動語言偵測、辨識目前說話的發言者,並在轉錄文字中標記非語音聲音,例如(笑聲)或(音樂)。 ## 輸入 -| 參數 | 說明 | 資料類型 | 必要 | 範圍 | +### 通用輸入 + +| 參數 | 描述 | 資料類型 | 必填 | 範圍 | | --- | --- | --- | --- | --- | +| `模型` | 用於轉錄的模型。選取模型後會顯示其特定參數。 | DYNAMIC_COMBO | 是 | `"scribe_v2"` | | `音訊` | 要轉錄的音訊。 | AUDIO | 是 | - | -| `模型` | 用於轉錄的模型。選擇此模型會顯示其他參數。 | COMBO | 是 | `"scribe_v2"` | -| `tag_audio_events` | 在轉錄文字中標註如(笑聲)、(音樂)等聲音。此參數在選擇 `"scribe_v2"` 模型時顯示。(預設值:False) | BOOLEAN | 否 | - | -| `diarize` | 標註哪個說話者正在發言。此參數在選擇 `"scribe_v2"` 模型時顯示。(預設值:False) | BOOLEAN | 否 | - | -| `diarization_threshold` | 說話者分離敏感度。數值越低對說話者變化的敏感度越高。此參數在選擇 `"scribe_v2"` 模型且啟用 `diarize` 時顯示。(預設值:0.22) | FLOAT | 否 | 0.1 - 0.4 | -| `temperature` | 隨機性控制。0.0 使用模型預設值。數值越高隨機性越強。此參數在選擇 `"scribe_v2"` 模型時顯示。(預設值:0.0) | FLOAT | 否 | 0.0 - 2.0 | -| `timestamps_granularity` | 轉錄文字的時間戳記精確度。此參數在選擇 `"scribe_v2"` 模型時顯示。(預設值:"word") | COMBO | 否 | `"word"`
`"character"`
`"none"` | | `語言代碼` | ISO-639-1 或 ISO-639-3 語言代碼(例如 'en'、'es'、'fra')。留空以自動偵測。(預設值:"") | STRING | 否 | - | -| `說話者數量` | 要預測的最大說話者數量。設為 0 以自動偵測。(預設值:0) | INT | 否 | 0 - 32 | -| `隨機種子` | 用於可重現性的種子值(不保證確定性)。(預設值:1) | INT | 否 | 0 - 2147483647 | +| `說話者數量` | 要預測的最大發言者人數。設為 0 以自動偵測。(預設值:0) | INT | 否 | 0 - 32 | +| `隨機種子` | 用於可重現性的種子(不保證確定性)。(預設值:1) | INT | 否 | 0 - 2147483647 | + +### Scribe v2 輸入 + +當選取 `"scribe_v2"` 模型時,會顯示這些參數。 + +| 參數 | 描述 | 資料類型 | 必填 | 範圍 | +| --- | --- | --- | --- | --- | +| `tag_audio_events` | 在轉錄文字中標記(笑聲)、(音樂)等聲音。(預設值:False) | BOOLEAN | 否 | - | +| `diarize` | 標記目前說話的發言者。(預設值:False) | BOOLEAN | 否 | - | +| `diarization_threshold` | 發言者分離敏感度。數值越低,對發言者變化的偵測越敏感。僅在啟用 `diarize` 時使用。(預設值:0.22) | FLOAT | 否 | 0.1 - 0.4 | +| `temperature` | 隨機性控制。0.0 使用模型預設值。數值越高,隨機性越高。(預設值:0.0) | FLOAT | 否 | 0.0 - 2.0 | +| `timestamps_granularity` | 轉錄文字中單詞的時間精確度。(預設值:"word") | COMBO | 否 | `"word"`
`"character"`
`"none"` | -**注意:** 當啟用 `diarize` 選項時,`num_speakers` 參數不能設定為大於 0 的值。您必須停用 `diarize`,或將 `num_speakers` 設定為 0。 +**注意:** 當啟用 `diarize` 時,`num_speakers` 不能設為大於 0 的值。請停用 `diarize` 或將 `num_speakers` 設為 0,否則會引發錯誤。 ## 輸出 -| 輸出名稱 | 說明 | 資料類型 | +| 輸出名 | 描述 | 資料類型 | | --- | --- | --- | -| `文字` | 從音訊轉錄的文字。 | STRING | +| `文字` | 從音訊轉錄而來的文字。 | STRING | | `語言代碼` | 偵測到的音訊語言代碼。 | STRING | -| `單詞 JSON` | 包含詳細詞彙層級資訊的 JSON 格式字串,若啟用則包含時間戳記和說話者標籤。 | STRING | +| `單詞 JSON` | 包含詳細單詞層級資訊的 JSON 格式字串,包括時間戳記及(若啟用)發言者標籤。 | STRING | > 本文檔由 AI 生成。如果您發現任何錯誤或有改進建議,歡迎貢獻! [在 GitHub 上編輯](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh-TW.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh.md index 35117bdd4..0b9051a45 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh.md @@ -1,33 +1,42 @@ # ElevenLabs 语音转文本 -ElevenLabs语音转文字节点可将音频文件转录为文本。它使用ElevenLabs的API将语音转换为书面文本,支持自动语言检测、识别不同说话者以及标记音乐、笑声等非语音声音。 +ElevenLabs 语音转文本节点使用 ElevenLabs 的语音转文本 API 将音频转录为文本。它支持自动语言检测、识别说话人,以及在转录文本中标注非语音声音,如(笑声)或(音乐)。 ## 输入 -| 参数 | 描述 | 数据类型 | 是否必填 | 取值范围 | +### 通用输入 + +| 参数 | 描述 | 数据类型 | 是否必需 | 范围 | +| --- | --- | --- | --- | --- | +| `模型` | 用于转录的模型。选择模型会显示其特定参数。 | DYNAMIC_COMBO | 是 | `"scribe_v2"` | +| `音频` | 要转录的音频。 | AUDIO | 是 | - | +| `语言代码` | ISO-639-1 或 ISO-639-3 语言代码(例如 'en'、'es'、'fra')。留空以进行自动检测。(默认值:"") | STRING | 否 | - | +| `说话人数` | 要预测的最大说话人数量。设置为 0 以进行自动检测。(默认值:0) | INT | 否 | 0 - 32 | +| `种子` | 用于可重现性的随机种子(不保证确定性)。(默认值:1) | INT | 否 | 0 - 2147483647 | + +### Scribe v2 输入 + +当选择了 `"scribe_v2"` 模型时,会出现这些参数。 + +| 参数 | 描述 | 数据类型 | 是否必需 | 范围 | | --- | --- | --- | --- | --- | -| `音频` | 待转录的音频。 | AUDIO | 是 | - | -| `模型` | 用于转录的模型。选择此模型后会显示额外参数。 | COMBO | 是 | `"scribe_v2"` | -| `tag_audio_events` | 在转录文本中标注(笑声)、(音乐)等声音。选择`"scribe_v2"`模型时显示此参数。(默认值:False) | BOOLEAN | 否 | - | -| `diarize` | 标注当前说话者。选择`"scribe_v2"`模型时显示此参数。(默认值:False) | BOOLEAN | 否 | - | -| `diarization_threshold` | 说话者分离灵敏度。数值越低对说话者变化越敏感。选择`"scribe_v2"`模型且启用`diarize`时显示此参数。(默认值:0.22) | FLOAT | 否 | 0.1 - 0.4 | -| `temperature` | 随机性控制。0.0使用模型默认值,数值越高随机性越大。选择`"scribe_v2"`模型时显示此参数。(默认值:0.0) | FLOAT | 否 | 0.0 - 2.0 | -| `timestamps_granularity` | 转录单词的时间精度。选择`"scribe_v2"`模型时显示此参数。(默认值:"word") | COMBO | 否 | `"word"`
`"character"`
`"none"` | -| `语言代码` | ISO-639-1或ISO-639-3语言代码(例如'en'、'es'、'fra')。留空则自动检测。(默认值:"") | STRING | 否 | - | -| `说话人数` | 预测的最大说话者数量。设为0表示自动检测。(默认值:0) | INT | 否 | 0 - 32 | -| `种子` | 用于结果复现的种子(不保证确定性)。(默认值:1) | INT | 否 | 0 - 2147483647 | - -**注意:** 当启用`diarize`选项时,`num_speakers`参数不能设置为大于0的值。您必须禁用`diarize`或将`num_speakers`设为0。 +| `tag_audio_events` | 在转录文本中标注类似(笑声)、(音乐)等声音。(默认值:False) | BOOLEAN | 否 | - | +| `diarize` | 标注正在说话的说话人。(默认值:False) | BOOLEAN | 否 | - | +| `diarization_threshold` | 说话人分离灵敏度。数值越低,对说话人变化越敏感。仅在启用 `diarize` 时使用。(默认值:0.22) | FLOAT | 否 | 0.1 - 0.4 | +| `temperature` | 随机性控制。0.0 使用模型默认值。数值越高,随机性越大。(默认值:0.0) | FLOAT | 否 | 0.0 - 2.0 | +| `timestamps_granularity` | 转录单词的时间戳精度。(默认值:"word") | COMBO | 否 | `"word"`
`"character"`
`"none"` | + +**注意:** 当启用 `diarize` 时,`num_speakers` 不能设置为大于 0 的值。要么禁用 `diarize`,要么将 `num_speakers` 设置为 0;否则会引发错误。 ## 输出 | 输出名称 | 描述 | 数据类型 | | --- | --- | --- | -| `文本` | 音频转录后的文本。 | STRING | +| `文本` | 音频转录出的文本。 | STRING | | `语言代码` | 检测到的音频语言代码。 | STRING | -| `单词 JSON` | 包含详细单词级别信息的JSON格式字符串,如果启用则包含时间戳和说话者标签。 | STRING | +| `单词 JSON` | 包含详细单词级信息的 JSON 格式字符串,如果启用,还包括时间戳和说话人标签。 | STRING | > 本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh.md) --- -**Source fingerprint (SHA-256):** `aca2ac04d7280ef2b604f7c8d29ad7fea1e7abcfc38beabb64ba6b268a8cade1` +**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ar.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ar.md index 4384faeaf..93283232a 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ar.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ar.md @@ -1,28 +1,28 @@ # ElevenLabs تحويل النص إلى حوار -تقوم عقدة ElevenLabs لتحويل النص إلى حوار بإنشاء حوار صوتي متعدد المتحدثين من النص. تتيح لك إنشاء محادثة من خلال تحديد أسطر نصية مختلفة وأصوات مميزة لكل مشارك. ترسل العقدة طلب الحوار إلى واجهة برمجة تطبيقات ElevenLabs وتعيد الصوت المُنشأ. +عقدة ElevenLabs Text to Dialogue تُولّد حوارًا صوتيًا متعدد المتحدثين من نص. تتيح لك إنشاء محادثة عن طريق تحديد أسطر نصية مختلفة وأصوات مميزة لكل مشارك. ترسل العقدة طلب الحوار إلى واجهة برمجة تطبيقات ElevenLabs وتُرجع الصوت المُولّد. ## المدخلات | المعامل | الوصف | نوع البيانات | إلزامي | النطاق | -| --- | --- | --- | --- | --- | -| `الثبات` | ثبات الصوت. القيم المنخفضة تعطي نطاقًا عاطفيًا أوسع، بينما تنتج القيم الأعلى كلامًا أكثر اتساقًا ولكن قد يكون رتيبًا. (الافتراضي: 0.5) | FLOAT | لا | 0.0 - 1.0 | -| `تطبيق تنسيق النص` | وضع تطبيع النص. يترك الخيار 'auto' للنظام اتخاذ القرار، بينما يطبق الخيار 'on' التطبيع دائمًا، ويتجاوزه الخيار 'off'. | COMBO | لا | `"auto"`
`"on"`
`"off"` | -| `النموذج` | النموذج المستخدم لإنشاء الحوار. | COMBO | لا | `"eleven_v3"` | -| `عدد الحوارات` | عدد إدخالات الحوار. سيؤدي تحديد رقم إلى إنشاء هذا العدد من حقول إدخال النص والصوت. | DYNAMICCOMBO | نعم | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `رمز اللغة` | رمز اللغة وفقًا لمعيار ISO-639-1 أو ISO-639-3 (مثل 'en' و'es' و'fra'). اتركه فارغًا للكشف التلقائي. (الافتراضي: فارغ) | STRING | لا | - | -| `البذرة` | بذرة لإمكانية إعادة الإنتاج. (الافتراضي: 1) | INT | لا | 0 - 4294967295 | -| `صيغة الإخراج` | تنسيق إخراج الصوت. | COMBO | لا | `"mp3_44100_192"`
`"opus_48000_192"` | +|---------|-------|---------------|--------|--------| +| `الثبات` | استقرار الصوت. القيم المنخفضة تعطي نطاقًا عاطفيًا أوسع، بينما القيم الأعلى تُنتج كلامًا أكثر اتساقًا لكنه قد يكون رتيبًا. (الافتراضي: 0.5) | FLOAT | نعم | 0.0 - 1.0 | +| `تطبيق تنسيق النص` | وضع تطبيع النص. الخيار 'auto' يترك النظام يقرر، و 'on' يطبق التطبيع دائمًا، و 'off' يتخطاه. | COMBO | نعم | `"auto"`
`"on"`
`"off"` | +| `النموذج` | النموذج المستخدم لتوليد الحوار. | COMBO | نعم | `"eleven_v3"` | +| `عدد الحوارات` | عدد إدخالات الحوار. تحديد رقم يُنشئ هذا العدد من حقول إدخال النص والصوت. | DYNAMIC_COMBO | نعم | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `رمز اللغة` | رمز اللغة وفقًا لمعيار ISO-639-1 أو ISO-639-3 (مثل: 'en'، 'es'، 'fra'). يُترك فارغًا للاكتشاف التلقائي. (الافتراضي: فارغ) | STRING | نعم | - | +| `البذرة` | بذرة (Seed) لإمكانية تكرار النتائج. (الافتراضي: 1) | INT | نعم | 0 - 4294967295 | +| `صيغة الإخراج` | تنسيق إخراج الصوت. | COMBO | نعم | `"mp3_44100_192"`
`"opus_48000_192"` | -**ملاحظة:** معامل `inputs` ديناميكي. عند تحديد رقم (مثل "3")، ستعرض العقدة ثلاثة حقول إدخال مقابلة للنص والصوت (مثل `text1` و`voice1` و`text2` و`voice2` و`text3` و`voice3`). يجب أن يحتوي كل حقل `text` على حرف واحد على الأقل. +**ملاحظة:** المعامل `inputs` ديناميكي. عند تحديد رقم (مثل: "3")، ستعرض العقدة ثلاثة حقول إدخال مقابلة من نوع `text` و `voice` (مثل: `text1`، `voice1`، `text2`، `voice2`، `text3`، `voice3`). يجب أن يحتوي كل حقل `text` على حرف واحد على الأقل. يقبل كل حقل `voice` صوتًا موصولًا من عقدة Voice Selector أو Instant Voice Clone. ## المخرجات | اسم المخرج | الوصف | نوع البيانات | -| --- | --- | --- | -| `audio` | الصوت المُنشأ للحوار متعدد المتحدثين بالتنسيق المحدد للإخراج. | AUDIO | +|------------|-------|--------------| +| `audio` | صوت الحوار متعدد المتحدثين المُولّد بالتنسيق المحدد. | AUDIO | > تم إنشاء هذه الوثيقة بواسطة الذكاء الاصطناعي. إذا وجدت أي أخطاء أو لديك اقتراحات للتحسين، فلا تتردد في المساهمة! [تحرير على GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ar.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/en.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/en.md index 048bf17a2..8ed958f1c 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/en.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/en.md @@ -6,15 +6,15 @@ The ElevenLabs Text to Dialogue node generates a multi-speaker audio dialogue fr | Parameter | Description | Data Type | Required | Range | |-----------|-------------|-----------|----------|-------| -| `stability` | Voice stability. Lower values give broader emotional range, higher values produce more consistent but potentially monotonous speech. (default: 0.5) | FLOAT | No | 0.0 - 1.0 | -| `apply_text_normalization` | Text normalization mode. 'auto' lets the system decide, 'on' always applies normalization, 'off' skips it. | COMBO | No | `"auto"`
`"on"`
`"off"` | -| `model` | Model to use for dialogue generation. | COMBO | No | `"eleven_v3"` | -| `inputs` | Number of dialogue entries. Selecting a number will generate that many text and voice input fields. | DYNAMICCOMBO | Yes | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `language_code` | ISO-639-1 or ISO-639-3 language code (e.g., 'en', 'es', 'fra'). Leave empty for automatic detection. (default: empty) | STRING | No | - | -| `seed` | Seed for reproducibility. (default: 1) | INT | No | 0 - 4294967295 | -| `output_format` | Audio output format. | COMBO | No | `"mp3_44100_192"`
`"opus_48000_192"` | - -**Note:** The `inputs` parameter is dynamic. When you select a number (e.g., "3"), the node will display three corresponding `text` and `voice` input fields (e.g., `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Each `text` field must contain at least one character. +| `stability` | Voice stability. Lower values give broader emotional range, higher values produce more consistent but potentially monotonous speech. (default: 0.5) | FLOAT | Yes | 0.0 - 1.0 | +| `apply_text_normalization` | Text normalization mode. 'auto' lets the system decide, 'on' always applies normalization, 'off' skips it. | COMBO | Yes | `"auto"`
`"on"`
`"off"` | +| `model` | Model to use for dialogue generation. | COMBO | Yes | `"eleven_v3"` | +| `inputs` | Number of dialogue entries. Selecting a number generates that many text and voice input fields. | DYNAMIC_COMBO | Yes | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `language_code` | ISO-639-1 or ISO-639-3 language code (e.g., 'en', 'es', 'fra'). Leave empty for automatic detection. (default: empty) | STRING | Yes | - | +| `seed` | Seed for reproducibility. (default: 1) | INT | Yes | 0 - 4294967295 | +| `output_format` | Audio output format. | COMBO | Yes | `"mp3_44100_192"`
`"opus_48000_192"` | + +**Note:** The `inputs` parameter is dynamic. When you select a number (e.g., "3"), the node will display three corresponding `text` and `voice` input fields (e.g., `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Each `text` field must contain at least one character. Each `voice` field accepts a voice connected from the Voice Selector or Instant Voice Clone node. ## Outputs diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/es.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/es.md index 5e7be8745..bc459a431 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/es.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/es.md @@ -1,28 +1,28 @@ # ElevenLabs Texto a Diálogo -El nodo ElevenLabs Text to Dialogue genera un diálogo de audio con múltiples hablantes a partir de texto. Permite crear una conversación especificando diferentes líneas de texto y voces distintas para cada participante. El nodo envía la solicitud de diálogo a la API de ElevenLabs y devuelve el audio generado. +El nodo ElevenLabs Text to Dialogue genera un diálogo de audio multiparlante a partir de texto. Permite crear una conversación especificando diferentes líneas de texto y voces distintas para cada participante. El nodo envía la solicitud de diálogo a la API de ElevenLabs y devuelve el audio generado. ## Entradas -| Parámetro | Descripción | Tipo de Dato | Obligatorio | Rango | -| --- | --- | --- | --- | --- | -| `estabilidad` | Estabilidad de la voz. Valores más bajos brindan un rango emocional más amplio, valores más altos producen un habla más consistente pero potencialmente monótona. (predeterminado: 0.5) | FLOAT | No | 0.0 - 1.0 | -| `aplicar_normalización_de_texto` | Modo de normalización de texto. 'auto' permite que el sistema decida, 'on' aplica siempre la normalización, 'off' la omite. | COMBO | No | `"auto"`
`"on"`
`"off"` | -| `modelo` | Modelo a utilizar para la generación del diálogo. | COMBO | No | `"eleven_v3"` | -| `entradas` | Número de entradas de diálogo. Seleccionar un número generará esa cantidad de campos de entrada de texto y voz. | DYNAMICCOMBO | Sí | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `código_de_idioma` | Código de idioma ISO-639-1 o ISO-639-3 (ej., 'en', 'es', 'fra'). Déjelo vacío para detección automática. (predeterminado: vacío) | STRING | No | - | -| `semilla` | Semilla para reproducibilidad. (predeterminado: 1) | INT | No | 0 - 4294967295 | -| `formato_de_salida` | Formato de salida de audio. | COMBO | No | `"mp3_44100_192"`
`"opus_48000_192"` | +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `estabilidad` | Estabilidad de la voz. Los valores más bajos ofrecen un rango emocional más amplio; los valores más altos producen un habla más consistente pero potencialmente monótona. (por defecto: 0.5) | FLOAT | Sí | 0.0 - 1.0 | +| `aplicar_normalización_de_texto` | Modo de normalización de texto. 'auto' permite que el sistema decida, 'on' aplica siempre la normalización, 'off' la omite. | COMBO | Sí | `"auto"`
`"on"`
`"off"` | +| `modelo` | Modelo a utilizar para la generación del diálogo. | COMBO | Sí | `"eleven_v3"` | +| `entradas` | Número de entradas de diálogo. Seleccionar un número genera esa cantidad de campos de entrada de texto y voz. | DYNAMIC_COMBO | Sí | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `código_de_idioma` | Código de idioma ISO-639-1 o ISO-639-3 (por ejemplo, 'en', 'es', 'fra'). Déjelo vacío para detección automática. (por defecto: vacío) | STRING | Sí | - | +| `semilla` | Semilla para reproducibilidad. (por defecto: 1) | INT | Sí | 0 - 4294967295 | +| `formato_de_salida` | Formato de salida de audio. | COMBO | Sí | `"mp3_44100_192"`
`"opus_48000_192"` | -**Nota:** El parámetro `inputs` es dinámico. Cuando selecciona un número (ej., "3"), el nodo mostrará tres campos de entrada `text` y `voice` correspondientes (ej., `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Cada campo `text` debe contener al menos un carácter. +**Nota:** El parámetro `inputs` es dinámico. Cuando selecciona un número (por ejemplo, "3"), el nodo mostrará tres campos de entrada `text` y `voice` correspondientes (por ejemplo, `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Cada campo `text` debe contener al menos un carácter. Cada campo `voice` acepta una voz conectada desde el nodo Voice Selector o Instant Voice Clone. ## Salidas -| Nombre de Salida | Descripción | Tipo de Dato | -| --- | --- | --- | -| `audio` | El audio del diálogo con múltiples hablantes generado en el formato de salida seleccionado. | AUDIO | +| Nombre de salida | Descripción | Tipo de datos | +|------------------|-------------|---------------| +| `audio` | El audio de diálogo multiparlante generado en el formato de salida seleccionado. | AUDIO | > Esta documentación fue generada por IA. Si encuentra algún error o tiene sugerencias de mejora, ¡no dude en contribuir! [Editar en GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/es.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md index 86d03ec81..3bb3deb3e 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md @@ -1,28 +1,26 @@ # تبدیل متن به دیالوگ ElevenLabs -گره ElevenLabs Text to Dialogue، یک دیالوگ صوتی چند‌گوینده از متن تولید می‌کند. این گره به شما امکان می‌دهد با مشخص کردن خطوط مختلف متن و صداهای مجزا برای هر شرکت‌کننده، یک مکالمه ایجاد کنید. این گره درخواست دیالوگ را به API ElevenLabs ارسال کرده و صدای تولید شده را بازمی‌گرداند. - ## ورودی‌ها | پارامتر | توضیحات | نوع داده | الزامی | محدوده | -| --- | --- | --- | --- | --- | -| `stability` | پایداری صدا. مقادیر پایین‌تر دامنه احساسی گسترده‌تری می‌دهند، مقادیر بالاتر گفتاری یکنواخت‌تر اما بالقوه خسته‌کننده تولید می‌کنند. (پیش‌فرض: 0.5) | FLOAT | خیر | 0.0 - 1.0 | -| `apply_text_normalization` | حالت نرمال‌سازی متن. 'auto' به سیستم اجازه تصمیم‌گیری می‌دهد، 'on' همیشه نرمال‌سازی را اعمال می‌کند، 'off' از آن صرف‌نظر می‌کند. | COMBO | خیر | `"auto"`
`"on"`
`"off"` | -| `model` | مدل مورد استفاده برای تولید دیالوگ. | COMBO | خیر | `"eleven_v3"` | -| `inputs` | تعداد ورودی‌های دیالوگ. انتخاب یک عدد، به همان تعداد فیلد ورودی متن و صدا ایجاد می‌کند. | DYNAMICCOMBO | بله | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `language_code` | کد زبان ISO-639-1 یا ISO-639-3 (مثلاً 'en'، 'es'، 'fra'). برای تشخیص خودکار خالی بگذارید. (پیش‌فرض: خالی) | STRING | خیر | - | -| `seed` | دانه (seed) برای تکرارپذیری. (پیش‌فرض: 1) | INT | خیر | 0 - 4294967295 | -| `output_format` | فرمت خروجی صوتی. | COMBO | خیر | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `stability` | پایداری صدا. مقادیر پایین‌تر دامنه احساسی گسترده‌تری می‌دهند؛ مقادیر بالاتر گفتار یکنواخت‌تر اما به‌طور بالقوه خسته‌کننده‌تری تولید می‌کنند. (پیش‌فرض: 0.5) | FLOAT | بله | 0.0 - 1.0 | +| `apply_text_normalization` | حالت عادی‌سازی متن. «auto» به سیستم اجازه تصمیم‌گیری می‌دهد، «on» همیشه عادی‌سازی را اعمال می‌کند و «off» از آن صرف‌نظر می‌کند. | COMBO | بله | `"auto"`
`"on"`
`"off"` | +| `model` | مدلی که برای تولید دیالوگ استفاده می‌شود. | COMBO | بله | `"eleven_v3"` | +| `inputs` | تعداد ورودی‌های دیالوگ. انتخاب یک عدد، به همان تعداد فیلد ورودی متن و صدا ایجاد می‌کند. | DYNAMIC_COMBO | بله | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `language_code` | کد زبان استاندارد ISO-639-1 یا ISO-639-3 (مانند 'en', 'es', 'fra'). برای تشخیص خودکار خالی بگذارید. (پیش‌فرض: خالی) | STRING | بله | - | +| `seed` | دانه (Seed) برای بازتولیدپذیری. (پیش‌فرض: 1) | INT | بله | 0 - 4294967295 | +| `output_format` | قالب خروجی صدا. | COMBO | بله | `"mp3_44100_192"`
`"opus_48000_192"` | -**توجه:** پارامتر `inputs` پویا است. وقتی عددی را انتخاب می‌کنید (مثلاً "3")، گره سه فیلد ورودی `text` و `voice` متناظر نمایش می‌دهد (مثلاً `text1`، `voice1`، `text2`، `voice2`، `text3`، `voice3`). هر فیلد `text` باید حداقل یک کاراکتر داشته باشد. +**نکته:** پارامتر `inputs` پویا است. وقتی عددی را انتخاب می‌کنید (مثلاً «3»)، گره سه فیلد ورودی متن و صدا متناظر نمایش می‌دهد (مثلاً `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). هر فیلد `text` باید حداقل یک نویسه داشته باشد. هر فیلد `voice` صدایی را می‌پذیرد که از گره Voice Selector یا Instant Voice Clone متصل شده است. ## خروجی‌ها | نام خروجی | توضیحات | نوع داده | -| --- | --- | --- | -| `audio` | صدای دیالوگ چند‌گوینده تولید شده در فرمت خروجی انتخاب شده. | AUDIO | +|-------------|-------------|-----------| +| `audio` | صدای دیالوگ چند‌گوینده تولیدشده در قالب خروجی انتخابی. | AUDIO | > این مستند با هوش مصنوعی تهیه شده است. اگر خطایی دیدید یا پیشنهادی برای بهبود دارید، خوشحال می‌شویم مشارکت کنید! [ویرایش در GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md index 19662d3d3..332dbacba 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md @@ -1,30 +1,28 @@ # ElevenLabs Text to Dialogue -Voici la traduction en français de la documentation du nœud ElevenLabs Text to Dialogue : - -Le nœud ElevenLabs Text to Dialogue génère un dialogue audio multipiste à partir d'un texte. Il permet de créer une conversation en spécifiant différentes lignes de texte et des voix distinctes pour chaque participant. Le nœud envoie la demande de dialogue à l'API ElevenLabs et retourne l'audio généré. +Le nœud ElevenLabs Text to Dialogue génère un dialogue audio multi-locuteur à partir d'un texte. Il vous permet de créer une conversation en spécifiant différentes lignes de texte et des voix distinctes pour chaque participant. Le nœud envoie la demande de dialogue à l'API ElevenLabs et renvoie l'audio généré. ## Entrées | Paramètre | Description | Type de données | Requis | Plage | -| --- | --- | --- | --- | --- | -| `stability` | Stabilité de la voix. Des valeurs plus faibles offrent une gamme émotionnelle plus large, des valeurs plus élevées produisent une parole plus cohérente mais potentiellement monotone. (par défaut : 0.5) | FLOAT | Non | 0.0 - 1.0 | -| `apply_text_normalization` | Mode de normalisation du texte. 'auto' laisse le système décider, 'on' applique toujours la normalisation, 'off' l'ignore. | COMBO | Non | `"auto"`
`"on"`
`"off"` | -| `model` | Modèle à utiliser pour la génération du dialogue. | COMBO | Non | `"eleven_v3"` | -| `inputs` | Nombre d'entrées de dialogue. La sélection d'un nombre génère autant de champs de saisie de texte et de voix. | DYNAMICCOMBO | Oui | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `language_code` | Code de langue ISO-639-1 ou ISO-639-3 (par exemple, 'en', 'es', 'fra'). Laissez vide pour une détection automatique. (par défaut : vide) | STRING | Non | - | -| `seed` | Graine pour la reproductibilité. (par défaut : 1) | INT | Non | 0 - 4294967295 | -| `output_format` | Format de sortie audio. | COMBO | Non | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------------|--------|-------| +| `stability` | Stabilité de la voix. Des valeurs plus faibles offrent une gamme émotionnelle plus large, des valeurs plus élevées produisent une parole plus cohérente mais potentiellement monotone. (défaut : 0.5) | FLOAT | Oui | 0.0 - 1.0 | +| `apply_text_normalization` | Mode de normalisation du texte. 'auto' laisse le système décider, 'on' applique toujours la normalisation, 'off' l'ignore. | COMBO | Oui | `"auto"`
`"on"`
`"off"` | +| `model` | Modèle à utiliser pour la génération de dialogue. | COMBO | Oui | `"eleven_v3"` | +| `inputs` | Nombre d'entrées de dialogue. La sélection d'un nombre génère autant de champs de saisie `text` et `voice`. | DYNAMIC_COMBO | Oui | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `language_code` | Code de langue ISO-639-1 ou ISO-639-3 (par ex., 'en', 'es', 'fra'). Laissez vide pour la détection automatique. (défaut : vide) | STRING | Oui | - | +| `seed` | Graine pour la reproductibilité. (défaut : 1) | INT | Oui | 0 - 4294967295 | +| `output_format` | Format de sortie audio. | COMBO | Oui | `"mp3_44100_192"`
`"opus_48000_192"` | -**Remarque :** Le paramètre `inputs` est dynamique. Lorsque vous sélectionnez un nombre (par exemple, "3"), le nœud affiche trois champs de saisie `text` et `voice` correspondants (par exemple, `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Chaque champ `text` doit contenir au moins un caractère. +**Remarque :** Le paramètre `inputs` est dynamique. Lorsque vous sélectionnez un nombre (par ex., « 3 »), le nœud affiche trois champs de saisie `text` et `voice` correspondants (par ex., `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Chaque champ `text` doit contenir au moins un caractère. Chaque champ `voice` accepte une voix connectée depuis le nœud Voice Selector ou Instant Voice Clone. ## Sorties -| Nom de la sortie | Description | Type de données | -| --- | --- | --- | -| `audio` | L'audio du dialogue multipiste généré dans le format de sortie sélectionné. | AUDIO | +| Nom de sortie | Description | Type de données | +|---------------|-------------|-----------------| +| `audio` | L'audio de dialogue multi-locuteur généré dans le format de sortie sélectionné. | AUDIO | > Cette documentation a été générée par IA. Si vous trouvez des erreurs ou avez des suggestions d'amélioration, n'hésitez pas à contribuer ! [Modifier sur GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ja.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ja.md index 97f0be05c..53e3546fd 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ja.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ja.md @@ -1,30 +1,28 @@ # ElevenLabs テキストから対話へ -以下が翻訳結果です。 - -ElevenLabs Text to Dialogue ノードは、テキストから複数の話者による音声ダイアログを生成します。異なるテキスト行と各参加者に個別の声を指定することで、会話を作成できます。このノードは、ダイアログリクエストを ElevenLabs API に送信し、生成された音声を返します。 +ElevenLabs Text to Dialogue ノードは、テキストから複数話者の音声ダイアログを生成します。異なるテキスト行と各参加者に異なる音声を指定して、会話を作成できます。ノードはダイアログリクエストを ElevenLabs API に送信し、生成された音声を返します。 ## 入力 | パラメータ | 説明 | データ型 | 必須 | 範囲 | -| --- | --- | --- | --- | --- | -| `安定性` | 声の安定性。値が低いほど感情の幅が広がり、値が高いほど一貫性はあるが単調になりがちな発話になります。(デフォルト:0.5) | FLOAT | いいえ | 0.0 - 1.0 | -| `テキスト正規化適用` | テキスト正規化モード。「auto」はシステムが判断し、「on」は常に正規化を適用し、「off」はスキップします。 | COMBO | いいえ | `"auto"`
`"on"`
`"off"` | -| `モデル` | ダイアログ生成に使用するモデル。 | COMBO | いいえ | `"eleven_v3"` | -| `入力数` | ダイアログエントリの数。数値を選択すると、その数だけテキスト入力フィールドと音声入力フィールドが生成されます。 | DYNAMICCOMBO | はい | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `言語コード` | ISO-639-1 または ISO-639-3 言語コード(例:「en」、「es」、「fra」)。自動検出の場合は空のままにします。(デフォルト:空) | STRING | いいえ | - | -| `シード値` | 再現性のためのシード値。(デフォルト:1) | INT | いいえ | 0 - 4294967295 | -| `出力フォーマット` | 音声出力形式。 | COMBO | いいえ | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `安定性` | 音声の安定性。値が低いほど感情表現の幅が広がり、値が高いほど一貫性が高まりますが、単調になる可能性があります。(デフォルト: 0.5) | FLOAT | はい | 0.0 - 1.0 | +| `テキスト正規化適用` | テキスト正規化モード。'auto' はシステムが判断し、'on' は常に正規化を適用し、'off' はスキップします。 | COMBO | はい | `"auto"`
`"on"`
`"off"` | +| `モデル` | ダイアログ生成に使用するモデル。 | COMBO | はい | `"eleven_v3"` | +| `入力数` | ダイアログエントリの数。数値を選択すると、その数のテキスト入力欄と音声入力欄が生成されます。 | DYNAMIC_COMBO | はい | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `言語コード` | ISO-639-1 または ISO-639-3 言語コード(例: 'en', 'es', 'fra')。自動検出する場合は空のままにします。(デフォルト: 空) | STRING | はい | - | +| `シード値` | 再現性のためのシード値。(デフォルト: 1) | INT | はい | 0 - 4294967295 | +| `出力フォーマット` | 音声出力形式。 | COMBO | はい | `"mp3_44100_192"`
`"opus_48000_192"` | -**注記:** `inputs` パラメータは動的です。数値(例:「3」)を選択すると、ノードは対応する3つの `text` および `voice` 入力フィールド(例:`text1`、`voice1`、`text2`、`voice2`、`text3`、`voice3`)を表示します。各 `text` フィールドには、少なくとも1文字以上を含める必要があります。 +**注:** `inputs` パラメータは動的です。数値(例: "3")を選択すると、ノードには対応する3つの `text` 入力欄と `voice` 入力欄(例: `text1`、`voice1`、`text2`、`voice2`、`text3`、`voice3`)が表示されます。各 `text` 欄には少なくとも1文字入力する必要があります。各 `voice` 欄には、Voice Selector または Instant Voice Clone ノードから接続された音声を受け入れます。 ## 出力 | 出力名 | 説明 | データ型 | -| --- | --- | --- | -| `audio` | 選択された出力形式で生成された、複数話者によるダイアログ音声。 | AUDIO | +|-------------|-------------|-----------| +| `audio` | 選択した出力形式で生成された複数話者のダイアログ音声。 | AUDIO | > このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ja.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ko.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ko.md index 3579f2a98..b7364b379 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ko.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ko.md @@ -1,28 +1,28 @@ # ElevenLabs 텍스트 → 대화 -ElevenLabs 텍스트-대화 노드는 텍스트로부터 여러 화자가 참여하는 오디오 대화를 생성합니다. 각 참여자에 대해 서로 다른 텍스트 줄과 개별 음성을 지정하여 대화를 만들 수 있습니다. 이 노드는 ElevenLabs API로 대화 요청을 전송하고 생성된 오디오를 반환합니다. +The ElevenLabs Text to Dialogue 노드는 텍스트에서 다중 화자 오디오 대화를 생성합니다. 이 노드를 사용하면 각 참가자에 대해 서로 다른 텍스트 줄과 개별 음성을 지정하여 대화를 만들 수 있습니다. 노드는 대화 요청을 ElevenLabs API로 전송하고 생성된 오디오를 반환합니다. ## 입력 | 매개변수 | 설명 | 데이터 타입 | 필수 여부 | 범위 | -| --- | --- | --- | --- | --- | -| `stability` | 음성 안정성. 값이 낮을수록 더 넓은 감정 표현 범위를 제공하고, 값이 높을수록 더 일관되지만 단조로운 발화를 생성합니다. (기본값: 0.5) | FLOAT | 아니요 | 0.0 - 1.0 | -| `apply_text_normalization` | 텍스트 정규화 모드. 'auto'는 시스템이 결정하도록 하며, 'on'은 항상 정규화를 적용하고, 'off'는 정규화를 건너뜁니다. | COMBO | 아니요 | `"auto"`
`"on"`
`"off"` | -| `model` | 대화 생성에 사용할 모델입니다. | COMBO | 아니요 | `"eleven_v3"` | -| `inputs` | 대화 항목 수입니다. 숫자를 선택하면 해당 개수만큼 텍스트 및 음성 입력 필드가 생성됩니다. | DYNAMICCOMBO | 예 | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `language_code` | ISO-639-1 또는 ISO-639-3 언어 코드입니다(예: 'en', 'es', 'fra'). 자동 감지를 위해 비워 둡니다. (기본값: 비어 있음) | STRING | 아니요 | - | -| `seed` | 재현성을 위한 시드 값입니다. (기본값: 1) | INT | 아니요 | 0 - 4294967295 | -| `output_format` | 오디오 출력 형식입니다. | COMBO | 아니요 | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `stability` | 음성 안정성. 값이 낮을수록 더 넓은 감정 표현 범위를 제공하고, 값이 높을수록 더 일관되지만 지루해질 수 있는 음성을 생성합니다. (기본값: 0.5) | FLOAT | 예 | 0.0 - 1.0 | +| `apply_text_normalization` | 텍스트 정규화 모드. 'auto'는 시스템이 결정하고, 'on'은 항상 정규화를 적용하며, 'off'는 건너뜁니다. | COMBO | 예 | `"auto"`
`"on"`
`"off"` | +| `model` | 대화 생성에 사용할 모델. | COMBO | 예 | `"eleven_v3"` | +| `inputs` | 대화 항목 수. 숫자를 선택하면 해당 개수의 텍스트 및 음성 입력 필드가 생성됩니다. | DYNAMIC_COMBO | 예 | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `language_code` | ISO-639-1 또는 ISO-639-3 언어 코드(예: 'en', 'es', 'fra'). 자동 감지를 위해 비워 두세요. (기본값: 비어 있음) | STRING | 예 | - | +| `seed` | 재현성을 위한 시드. (기본값: 1) | INT | 예 | 0 - 4294967295 | +| `output_format` | 오디오 출력 형식. | COMBO | 예 | `"mp3_44100_192"`
`"opus_48000_192"` | -**참고:** `inputs` 매개변수는 동적입니다. 숫자(예: "3")를 선택하면 노드에 세 개의 해당 `text` 및 `voice` 입력 필드(예: `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`)가 표시됩니다. 각 `text` 필드에는 최소 한 글자 이상이 포함되어야 합니다. +**참고:** `inputs` 매개변수는 동적입니다. 숫자(예: "3")를 선택하면 노드에 해당하는 세 개의 `text` 및 `voice` 입력 필드(예: `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`)가 표시됩니다. 각 `text` 필드에는 최소한 한 글자 이상이 포함되어야 합니다. 각 `voice` 필드는 Voice Selector 또는 Instant Voice Clone 노드에서 연결된 음성을 허용합니다. ## 출력 | 출력 이름 | 설명 | 데이터 타입 | -| --- | --- | --- | -| `audio` | 선택한 출력 형식으로 생성된 여러 화자 대화 오디오입니다. | AUDIO | +|-------------|-------------|-----------| +| `audio` | 선택한 출력 형식으로 생성된 다중 화자 대화 오디오. | AUDIO | > 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ko.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/pt-BR.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/pt-BR.md index 7f66ce98b..855b939bb 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/pt-BR.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/pt-BR.md @@ -1,30 +1,28 @@ # ElevenLabs Texto para Diálogo -Esta documentação foi gerada por IA. Se você encontrar algum erro ou tiver sugestões de melhoria, sinta-se à vontade para contribuir! [Editar no GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/en.md) - -O nó ElevenLabs Text to Dialogue gera um diálogo de áudio com múltiplos falantes a partir de texto. Ele permite criar uma conversa especificando diferentes linhas de texto e vozes distintas para cada participante. O nó envia a solicitação de diálogo para a API do ElevenLabs e retorna o áudio gerado. +O nó ElevenLabs Text to Dialogue gera um diálogo de áudio com vários falantes a partir de texto. Ele permite criar uma conversa especificando diferentes linhas de texto e vozes distintas para cada participante. O nó envia a solicitação de diálogo para a API do ElevenLabs e retorna o áudio gerado. ## Entradas -| Parâmetro | Descrição | Tipo de Dado | Obrigatório | Faixa | -| --- | --- | --- | --- | --- | -| `estabilidade` | Estabilidade da voz. Valores mais baixos proporcionam uma gama emocional mais ampla, valores mais altos produzem uma fala mais consistente, mas potencialmente monótona. (padrão: 0.5) | FLOAT | Não | 0.0 - 1.0 | -| `aplicar_normalização_texto` | Modo de normalização de texto. 'auto' permite que o sistema decida, 'on' sempre aplica a normalização, 'off' a ignora. | COMBO | Não | `"auto"`
`"on"`
`"off"` | -| `modelo` | Modelo a ser usado para geração de diálogo. | COMBO | Não | `"eleven_v3"` | -| `entradas` | Número de entradas de diálogo. Selecionar um número gerará essa quantidade de campos de entrada de texto e voz. | DYNAMICCOMBO | Sim | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `código_idioma` | Código de idioma ISO-639-1 ou ISO-639-3 (ex.: 'en', 'es', 'fra'). Deixe vazio para detecção automática. (padrão: vazio) | STRING | Não | - | -| `semente` | Semente para reprodutibilidade. (padrão: 1) | INT | Não | 0 - 4294967295 | -| `formato_saida` | Formato de saída de áudio. | COMBO | Não | `"mp3_44100_192"`
`"opus_48000_192"` | +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | +|-----------|-------------|-----------|----------|-------| +| `estabilidade` | Estabilidade da voz. Valores mais baixos proporcionam uma gama emocional mais ampla; valores mais altos produzem uma fala mais consistente, mas potencialmente monótona. (padrão: 0.5) | FLOAT | Sim | 0.0 - 1.0 | +| `aplicar_normalização_texto` | Modo de normalização de texto. 'auto' permite que o sistema decida, 'on' sempre aplica a normalização, 'off' a ignora. | COMBO | Sim | `"auto"`
`"on"`
`"off"` | +| `modelo` | Modelo a ser usado para geração de diálogo. | COMBO | Sim | `"eleven_v3"` | +| `entradas` | Número de entradas de diálogo. Selecionar um número gera essa quantidade de campos de entrada de texto e voz. | DYNAMIC_COMBO | Sim | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `código_idioma` | Código de idioma ISO-639-1 ou ISO-639-3 (por exemplo, 'en', 'es', 'fra'). Deixe vazio para detecção automática. (padrão: vazio) | STRING | Sim | - | +| `semente` | Semente para reprodutibilidade. (padrão: 1) | INT | Sim | 0 - 4294967295 | +| `formato_saida` | Formato de saída de áudio. | COMBO | Sim | `"mp3_44100_192"`
`"opus_48000_192"` | -**Nota:** O parâmetro `inputs` é dinâmico. Ao selecionar um número (ex.: "3"), o nó exibirá três campos de entrada `text` e `voice` correspondentes (ex.: `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Cada campo `text` deve conter pelo menos um caractere. +**Nota:** O parâmetro `inputs` é dinâmico. Ao selecionar um número (por exemplo, "3"), o nó exibirá três campos de entrada `text` e `voice` correspondentes (por exemplo, `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Cada campo `text` deve conter pelo menos um caractere. Cada campo `voice` aceita uma voz conectada a partir do nó Voice Selector ou do nó Instant Voice Clone. ## Saídas -| Nome da Saída | Descrição | Tipo de Dado | -| --- | --- | --- | -| `audio` | O áudio do diálogo com múltiplos falantes gerado no formato de saída selecionado. | AUDIO | +| Nome da Saída | Descrição | Tipo de Dados | +|-------------|-------------|-----------| +| `audio` | O áudio do diálogo de vários falantes gerado no formato de saída selecionado. | AUDIO | > Esta documentação foi gerada por IA. Se você encontrar erros ou tiver sugestões de melhoria, sinta-se à vontade para contribuir! [Editar no GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/pt-BR.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ru.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ru.md index ca4632780..d09a0f215 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ru.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ru.md @@ -1,30 +1,28 @@ # ElevenLabs Текст в диалог -Вот перевод документации на русский язык: +Узел ElevenLabs Text to Dialogue генерирует многоголосый аудиодиалог из текста. Он позволяет создавать разговор, указывая отдельные строки текста и разные голоса для каждого участника. Узел отправляет запрос на генерацию диалога в API ElevenLabs и возвращает сгенерированное аудио. -Узел ElevenLabs Text to Dialogue генерирует многоголосое аудиодиалог из текста. Он позволяет создавать беседу, задавая разные строки текста и отдельные голоса для каждого участника. Узел отправляет запрос на диалог в API ElevenLabs и возвращает сгенерированное аудио. +## Входы -## Входные параметры +| Параметр | Описание | Тип данных | Обязательность | Диапазон | +|----------|----------|------------|----------------|----------| +| `stability` | Стабильность голоса. Более низкие значения дают более широкий эмоциональный диапазон, более высокие — более последовательную, но потенциально монотонную речь. (по умолчанию: 0.5) | FLOAT | Да | 0.0 - 1.0 | +| `apply_text_normalization` | Режим нормализации текста. Значение 'auto' позволяет системе решать, 'on' всегда применяет нормализацию, 'off' пропускает её. | COMBO | Да | `"auto"`
`"on"`
`"off"` | +| `model` | Модель, используемая для генерации диалога. | COMBO | Да | `"eleven_v3"` | +| `inputs` | Количество записей диалога. Выбор числа создает соответствующее количество полей ввода текста и голоса. | DYNAMIC_COMBO | Да | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `language_code` | Код языка ISO-639-1 или ISO-639-3 (например, 'en', 'es', 'fra'). Оставьте пустым для автоматического определения. (по умолчанию: пусто) | STRING | Да | - | +| `seed` | Сид для воспроизводимости. (по умолчанию: 1) | INT | Да | 0 - 4294967295 | +| `output_format` | Формат аудиовыхода. | COMBO | Да | `"mp3_44100_192"`
`"opus_48000_192"` | -| Параметр | Описание | Тип данных | Обязательный | Диапазон | -| --- | --- | --- | --- | --- | -| `stability` | Стабильность голоса. Более низкие значения дают более широкий эмоциональный диапазон, более высокие значения обеспечивают более последовательную, но потенциально монотонную речь. (по умолчанию: 0.5) | FLOAT | Нет | 0.0 - 1.0 | -| `apply_text_normalization` | Режим нормализации текста. 'auto' позволяет системе решать, 'on' всегда применяет нормализацию, 'off' пропускает её. | COMBO | Нет | `"auto"`
`"on"`
`"off"` | -| `model` | Модель для генерации диалога. | COMBO | Нет | `"eleven_v3"` | -| `inputs` | Количество записей диалога. Выбор числа создаст соответствующее количество полей ввода текста и голоса. | DYNAMICCOMBO | Да | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `language_code` | Код языка ISO-639-1 или ISO-639-3 (например, 'en', 'es', 'fra'). Оставьте пустым для автоматического определения. (по умолчанию: пусто) | STRING | Нет | - | -| `seed` | Зерно для воспроизводимости результатов. (по умолчанию: 1) | INT | Нет | 0 - 4294967295 | -| `output_format` | Формат выходного аудио. | COMBO | Нет | `"mp3_44100_192"`
`"opus_48000_192"` | +**Примечание:** Параметр `inputs` является динамическим. Когда вы выбираете число (например, "3"), узел отобразит три соответствующих поля ввода `text` и `voice` (например, `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Каждое поле `text` должно содержать хотя бы один символ. Каждое поле `voice` принимает голос, подключенный от узла Voice Selector или Instant Voice Clone. -**Примечание:** Параметр `inputs` является динамическим. Когда вы выбираете число (например, "3"), узел отобразит три соответствующих поля ввода `text` и `voice` (например, `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Каждое поле `text` должно содержать хотя бы один символ. - -## Выходные параметры +## Выходы | Имя выхода | Описание | Тип данных | -| --- | --- | --- | -| `audio` | Сгенерированное многоголосое аудио диалога в выбранном формате вывода. | AUDIO | +|------------|----------|------------| +| `audio` | Сгенерированное многоголосое аудио диалога в выбранном выходном формате. | AUDIO | > Эта документация была создана с помощью ИИ. Если вы обнаружите ошибки или у вас есть предложения по улучшению, пожалуйста, внесите свой вклад! [Редактировать на GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/ru.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/tr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/tr.md index 845a5ee57..b3fb6e0f1 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/tr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/tr.md @@ -1,56 +1,28 @@ # ElevenLabs Metinden Diyaloğa -ComfyUI düğüm belgelerini İngilizceden Türkçeye çevirmede uzmanlaşmış teknik çeviri uzmanısınız. +ElevenLabs Text to Dialogue düğümü, metinden çok konuşmacılı bir sesli diyalog oluşturur. Her katılımcı için farklı metin satırları ve ayrı sesler belirleyerek bir konuşma oluşturmanıza olanak tanır. Düğüm, diyalog isteğini ElevenLabs API'sine gönderir ve oluşturulan sesi döndürür. -## Çeviri Kuralları - -1. **Çevrilmemesi gereken içerik:** - - Ters tırnak içindeki parametre adları: `image`, `seed`, `model` - - BÜYÜK harflerle veri türleri: IMAGE, STRING, INT, FLOAT, MODEL, CONDITIONING, vb. - - Range sütunundaki değerler: sayılar, "auto", seçenek adları - - Kod, dosya yolları - -2. **Çevrilmesi gereken içerik:** - - Bölüm başlıkları: ## Genel Bakış, ## Girdiler, ## Çıktılar - - Tüm açıklayıcı metinler - - Parametre açıklamaları - -3. **Çeviri kalitesi:** - - Standart Türkçe kullanın - - Profesyonel ama anlaşılır bir üslup koruyun - - Teknik doğruluğu sağlayın - - Standart Türkçe teknik terminolojiyi kullanın - -4. **Format:** - - Tüm Markdown biçimlendirmesini koruyun - - Tablo yapısını koruyun - - Belgenin başına herhangi bir not veya bağlantı eklemeyin (otomatik olarak eklenecektir) - -Lütfen aşağıdaki belgeyi Türkçeye çevirin (belgenin başlangıç notunu dahil etmeyin): - -ElevenLabs Metinden Diyaloğa düğümü, metinden çok konuşmacılı bir ses diyaloğu oluşturur. Farklı metin satırları ve her katılımcı için farklı sesler belirleyerek bir konuşma oluşturmanıza olanak tanır. Düğüm, diyalog isteğini ElevenLabs API'sine gönderir ve oluşturulan sesi döndürür. - -## Girişler +## Girdiler | Parametre | Açıklama | Veri Türü | Gerekli | Aralık | -| --- | --- | --- | --- | --- | -| `kararlılık` | Ses kararlılığı. Düşük değerler daha geniş bir duygusal yelpaze sağlarken, yüksek değerler daha tutarlı ancak potansiyel olarak monoton konuşma üretir. (varsayılan: 0.5) | FLOAT | Hayır | 0.0 - 1.0 | -| `metin normalizasyonunu uygula` | Metin normalizasyon modu. 'auto' sistemin karar vermesini sağlar, 'on' her zaman normalizasyonu uygular, 'off' atlar. | COMBO | Hayır | `"auto"`
`"on"`
`"off"` | -| `model` | Diyalog oluşturma için kullanılacak model. | COMBO | Hayır | `"eleven_v3"` | -| `girdiler` | Diyalog girişi sayısı. Bir sayı seçmek, o kadar sayıda metin ve ses giriş alanı oluşturacaktır. | DYNAMICCOMBO | Evet | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `dil_kodu` | ISO-639-1 veya ISO-639-3 dil kodu (ör. 'en', 'es', 'fra'). Otomatik algılama için boş bırakın. (varsayılan: boş) | STRING | Hayır | - | -| `tohum` | Tekrarlanabilirlik için tohum değeri. (varsayılan: 1) | INT | Hayır | 0 - 4294967295 | -| `çıktı_formatı` | Ses çıktı formatı. | COMBO | Hayır | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `kararlılık` | Ses stabilitesi. Düşük değerler daha geniş bir duygusal yelpaze sağlar; yüksek değerler daha tutarlı ancak potansiyel olarak tekdüze konuşma üretir. (varsayılan: 0.5) | FLOAT | Evet | 0.0 - 1.0 | +| `metin normalizasyonunu uygula` | Metin normalizasyon modu. 'auto' sistemin karar vermesini sağlar, 'on' her zaman normalizasyonu uygular, 'off' normalizasyonu atlar. | COMBO | Evet | `"auto"`
`"on"`
`"off"` | +| `model` | Diyalog üretimi için kullanılacak model. | COMBO | Evet | `"eleven_v3"` | +| `girdiler` | Diyalog girdisi sayısı. Bir sayı seçmek, bu sayıda metin ve ses girdi alanı oluşturur. | DYNAMIC_COMBO | Evet | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `dil_kodu` | ISO-639-1 veya ISO-639-3 dil kodu (örn. 'en', 'es', 'fra'). Otomatik algılama için boş bırakın. (varsayılan: boş) | STRING | Evet | - | +| `tohum` | Tekrarlanabilirlik için seed değeri. (varsayılan: 1) | INT | Evet | 0 - 4294967295 | +| `çıktı_formatı` | Ses çıktı formatı. | COMBO | Evet | `"mp3_44100_192"`
`"opus_48000_192"` | -**Not:** `inputs` parametresi dinamiktir. Bir sayı seçtiğinizde (ör. "3"), düğüm üç adet karşılık gelen `text` ve `voice` giriş alanı görüntüleyecektir (ör. `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Her `text` alanı en az bir karakter içermelidir. +**Not:** `inputs` parametresi dinamiktir. Bir sayı seçtiğinizde (örn. "3"), düğüm üç karşılık gelen `text` ve `voice` girdi alanı görüntüler (örn. `text1`, `voice1`, `text2`, `voice2`, `text3`, `voice3`). Her `text` alanı en az bir karakter içermelidir. Her `voice` alanı, Voice Selector veya Instant Voice Clone düğümünden bağlanan bir sesi kabul eder. ## Çıktılar | Çıktı Adı | Açıklama | Veri Türü | -| --- | --- | --- | +|-------------|-------------|-----------| | `audio` | Seçilen çıktı formatında oluşturulan çok konuşmacılı diyalog sesi. | AUDIO | > Bu belge yapay zeka tarafından oluşturulmuştur. Herhangi bir hata bulursanız veya iyileştirme önerileriniz varsa, katkıda bulunmaktan çekinmeyin! [GitHub'da Düzenle](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/tr.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh-TW.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh-TW.md index b755cbab0..3f8532d57 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh-TW.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh-TW.md @@ -1,28 +1,28 @@ # ElevenLabs 文字轉對話 -ElevenLabs 文字轉對話節點可從文字生成多說話者的音訊對話。您可以透過指定不同的文字行和每個參與者的獨特聲音來建立對話。該節點會將對話請求發送到 ElevenLabs API,並返回生成的音訊。 +ElevenLabs 文字轉對話節點可從文字生成多說話者的音訊對話。您可以指定不同的文字行與每個參與者各自的聲音來建立對話。此節點會將對話請求傳送至 ElevenLabs API,並回傳生成的音訊。 ## 輸入 -| 參數 | 描述 | 資料類型 | 必要 | 範圍 | -| --- | --- | --- | --- | --- | -| `穩定性` | 聲音穩定性。較低的值可提供更廣泛的情感範圍,較高的值會產生更一致但可能單調的語音。(預設值:0.5) | FLOAT | 否 | 0.0 - 1.0 | -| `套用文字正規化` | 文字正規化模式。'auto' 讓系統決定,'on' 始終套用正規化,'off' 則跳過。 | COMBO | 否 | `"auto"`
`"on"`
`"off"` | -| `模型` | 用於對話生成的模型。 | COMBO | 否 | `"eleven_v3"` | -| `對話項目數` | 對話條目數量。選擇一個數字將生成相應數量的文字和聲音輸入欄位。 | DYNAMICCOMBO | 是 | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `語言代碼` | ISO-639-1 或 ISO-639-3 語言代碼(例如 'en'、'es'、'fra')。留空以自動偵測。(預設值:空) | STRING | 否 | - | -| `隨機種子` | 用於可重現性的種子。(預設值:1) | INT | 否 | 0 - 4294967295 | -| `輸出格式` | 音訊輸出格式。 | COMBO | 否 | `"mp3_44100_192"`
`"opus_48000_192"` | +| 參數 | 說明 | 資料類型 | 必要 | 範圍 | +|-----------|-------------|-----------|----------|-------| +| `穩定性` | 聲音穩定性。數值越低可呈現更廣泛的情緒範圍,數值越高則產生更一致但可能較單調的語音。(預設值:0.5) | FLOAT | 是 | 0.0 - 1.0 | +| `套用文字正規化` | 文字正規化模式。'auto' 讓系統自行決定,'on' 一律套用正規化,'off' 則略過。 | COMBO | 是 | `"auto"`
`"on"`
`"off"` | +| `模型` | 用於對話生成的模型。 | COMBO | 是 | `"eleven_v3"` | +| `對話項目數` | 對話條目數量。選擇一個數字會生成對應數量的文字與聲音輸入欄位。 | DYNAMIC_COMBO | 是 | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `語言代碼` | ISO-639-1 或 ISO-639-3 語言代碼(例如 'en'、'es'、'fra')。留空以自動偵測。(預設值:空) | STRING | 是 | - | +| `隨機種子` | 用於可重現性的種子。(預設值:1) | INT | 是 | 0 - 4294967295 | +| `輸出格式` | 音訊輸出格式。 | COMBO | 是 | `"mp3_44100_192"`
`"opus_48000_192"` | -**注意:** `inputs` 參數是動態的。當您選擇一個數字(例如 "3")時,節點將顯示三個對應的 `text` 和 `voice` 輸入欄位(例如 `text1`、`voice1`、`text2`、`voice2`、`text3`、`voice3`)。每個 `text` 欄位必須包含至少一個字元。 +**注意:**`inputs` 參數是動態的。當您選擇一個數字(例如 "3")時,節點會顯示三個對應的 `text` 和 `voice` 輸入欄位(例如 `text1`、`voice1`、`text2`、`voice2`、`text3`、`voice3`)。每個 `text` 欄位至少必須包含一個字元。每個 `voice` 欄位皆可接受從 Voice Selector 或 Instant Voice Clone 節點連接而來的聲音。 ## 輸出 -| 輸出名稱 | 描述 | 資料類型 | -| --- | --- | --- | -| `audio` | 以所選輸出格式生成的多說話者對話音訊。 | AUDIO | +| 輸出名稱 | 說明 | 資料類型 | +|-------------|-------------|-----------| +| `audio` | 以選定輸出格式生成的多說話者對話音訊。 | AUDIO | > 本文檔由 AI 生成。如果您發現任何錯誤或有改進建議,歡迎貢獻! [在 GitHub 上編輯](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh-TW.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh.md index fcffc99aa..6854d901c 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh.md @@ -1,28 +1,28 @@ # ElevenLabs 文本转对话 -ElevenLabs 文本转对话节点可根据文本生成多说话人音频对话。您可以通过指定不同的文本行和每个参与者的独特声音来创建对话。该节点将对话请求发送至 ElevenLabs API,并返回生成的音频。 +ElevenLabs Text to Dialogue 节点根据文本生成多说话人音频对话。它允许你通过指定不同的文本行和每个参与者不同的声音来创建对话。该节点将对话请求发送到 ElevenLabs API,并返回生成的音频。 ## 输入 -| 参数 | 描述 | 数据类型 | 是否必填 | 范围 | -| --- | --- | --- | --- | --- | -| `稳定性` | 声音稳定性。较低的值可提供更广泛的情感范围,较高的值则产生更一致但可能单调的语音。(默认值:0.5) | FLOAT | 否 | 0.0 - 1.0 | -| `应用文本规范化` | 文本规范化模式。'auto' 让系统决定,'on' 始终应用规范化,'off' 跳过规范化。 | COMBO | 否 | `"auto"`
`"on"`
`"off"` | -| `模型` | 用于对话生成的模型。 | COMBO | 否 | `"eleven_v3"` | -| `对话条数` | 对话条目数量。选择一个数字将生成相应数量的文本和语音输入字段。 | DYNAMICCOMBO | 是 | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | -| `语言代码` | ISO-639-1 或 ISO-639-3 语言代码(例如 'en'、'es'、'fra')。留空则自动检测。(默认值:空) | STRING | 否 | - | -| `种子` | 用于结果可复现的随机种子。(默认值:1) | INT | 否 | 0 - 4294967295 | -| `输出格式` | 音频输出格式。 | COMBO | 否 | `"mp3_44100_192"`
`"opus_48000_192"` | +| 参数 | 描述 | 数据类型 | 必填 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `稳定性` | 声音稳定性。较低的值可提供更广泛的情感范围,较高的值会产生更一致但可能单调的语音。(默认值:0.5) | FLOAT | 是 | 0.0 - 1.0 | +| `应用文本规范化` | 文本规范化模式。'auto' 让系统决定,'on' 始终应用规范化,'off' 跳过规范化。 | COMBO | 是 | `"auto"`
`"on"`
`"off"` | +| `模型` | 用于对话生成的模型。 | COMBO | 是 | `"eleven_v3"` | +| `对话条数` | 对话条目数量。选择一个数字会生成相应数量的文本和语音输入字段。 | DYNAMIC_COMBO | 是 | `"1"`
`"2"`
`"3"`
`"4"`
`"5"`
`"6"`
`"7"`
`"8"`
`"9"`
`"10"` | +| `语言代码` | ISO-639-1 或 ISO-639-3 语言代码(例如 'en'、'es'、'fra')。留空以自动检测。(默认值:空) | STRING | 是 | - | +| `种子` | 用于可复现性的种子。(默认值:1) | INT | 是 | 0 - 4294967295 | +| `输出格式` | 音频输出格式。 | COMBO | 是 | `"mp3_44100_192"`
`"opus_48000_192"` | -**注意:** `inputs` 参数是动态的。当您选择一个数字(例如 "3")时,节点将显示三个对应的 `text` 和 `voice` 输入字段(例如 `text1`、`voice1`、`text2`、`voice2`、`text3`、`voice3`)。每个 `text` 字段必须至少包含一个字符。 +**注意:** `inputs` 参数是动态的。当你选择一个数字(例如 "3")时,节点将显示三个对应的 `text` 和 `voice` 输入字段(例如 `text1`、`voice1`、`text2`、`voice2`、`text3`、`voice3`)。每个 `text` 字段必须至少包含一个字符。每个 `voice` 字段接受来自 Voice Selector 或 Instant Voice Clone 节点连接的语音。 ## 输出 -| 输出名称 | 描述 | 数据类型 | -| --- | --- | --- | +| 输出名 | 描述 | 数据类型 | +|-------------|-------------|-----------| | `audio` | 以所选输出格式生成的多说话人对话音频。 | AUDIO | > 本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/zh.md) --- -**Source fingerprint (SHA-256):** `2e1634e90314167320d715346f8d0c691dfabe82b090391afa2b0b18a8a126d8` +**Source fingerprint (SHA-256):** `95b16143391a2282c58ebc66561b85338a8ce1f87e0ec769405225599d2c76ae` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ar.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ar.md index 7b81591d3..492d49f7f 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ar.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ar.md @@ -1,28 +1,34 @@ # ElevenLabs تحويل النص إلى مؤثرات صوتية -يقوم عقد ElevenLabs Text to Sound Effects بتوليد مؤثرات صوتية من وصف نصي. يستخدم واجهة برمجة تطبيقات ElevenLabs لإنشاء مؤثرات صوتية بناءً على طلبك، مما يتيح لك التحكم في المدة، وسلوك التكرار الحلقي، ومدى تطابق الصوت مع النص. +تقوم عقدة ElevenLabs Text to Sound Effects بتوليد صوت مؤثرات صوتية من وصف نصي باستخدام ElevenLabs API. وهي ترسل النص المكتوب إلى خدمة توليد الأصوات من ElevenLabs وتُرجع الصوت الناتج، مع تحكم في المدة، وسلوك التكرار، ومدى التزام الصوت بالنص. ## المدخلات -| المعامل | الوصف | نوع البيانات | إلزامي | النطاق | -| --- | --- | --- | --- | --- | -| `النص` | وصف نصي للمؤثر الصوتي المراد توليده. هذا حقل إلزامي. | STRING | نعم | غير متاح | -| `النموذج` | النموذج المستخدم لتوليد المؤثرات الصوتية. يؤدي اختيار هذا النموذج إلى إظهار معاملات إضافية: `duration` (الافتراضي: 5.0، النطاق: 0.5 إلى 30.0 ثانية)، `loop` (الافتراضي: False)، و`prompt_influence` (الافتراضي: 0.3، النطاق: 0.0 إلى 1.0). | COMBO | نعم | `"eleven_sfx_v2"` | -| `صيغة الإخراج` | تنسيق الصوت الناتج. | COMBO | نعم | `"mp3_44100_192"`
`"opus_48000_192"` | +### المدخلات الشائعة -**تفاصيل المعاملات:** +| المعامل | الوصف | نوع البيانات | مطلوب | النطاق | +|-----------|-------------|-----------|----------|-------| +| `النموذج` | النموذج المستخدم لتوليد المؤثرات الصوتية. يحدد النموذج المحدد معاملات التوليد المتاحة المذكورة أدناه. | DYNAMIC_COMBO | نعم | `"eleven_sfx_v2"` | +| `النص` | وصف نصي للمؤثر الصوتي المراد توليده. يجب أن يحتوي على حرف واحد على الأقل. (الافتراضي: empty) | STRING | نعم | N/A | +| `صيغة الإخراج` | تنسيق إخراج الصوت. | COMBO | نعم | `"mp3_44100_192"`
`"opus_48000_192"` | -* **`model["duration"]`**: مدة الصوت المُولَّد بالثواني. القيمة الافتراضية هي 5.0، مع حد أدنى 0.5 وحد أقصى 30.0. -* **`model["loop"]`**: عند تفعيله، يُنشئ مؤثرًا صوتيًا متكررًا بشكل حلقي سلس. القيمة الافتراضية هي False. -* **`model["prompt_influence"]`**: يتحكم في مدى تطابق التوليد مع النص المطلوب. القيم الأعلى تجعل الصوت يتبع النص بشكل أدق. القيمة الافتراضية هي 0.3، مع نطاق من 0.0 إلى 1.0. +### مدخلات Eleven SFX v2 + +المعاملات الفرعية المعروضة عندما يتم تعيين `model` إلى `"eleven_sfx_v2"`. + +| المعامل | الوصف | نوع البيانات | مطلوب | النطاق | +|-----------|-------------|-----------|----------|-------| +| `duration` | مدة الصوت المولّد بالثواني. (الافتراضي: 5.0) | FLOAT | نعم | 0.5 إلى 30.0 (خطوة: 0.1) | +| `loop` | إنشاء مؤثر صوتي يتكرر بسلاسة. (الافتراضي: False) | BOOLEAN | لا | True or False | +| `prompt_influence` | مدى التزام التوليد بالنص الموجِّه. القيم الأعلى تجعل الصوت يتبع النص بشكل أقرب. (الافتراضي: 0.3) | FLOAT | نعم | 0.0 إلى 1.0 (خطوة: 0.01) | ## المخرجات | اسم المخرج | الوصف | نوع البيانات | -| --- | --- | --- | -| `audio` | ملف الصوت الخاص بالمؤثر الصوتي المُولَّد. | AUDIO | +|-------------|-------------|-----------| +| `audio` | ملف الصوت الناتج للمؤثر الصوتي. | AUDIO | > تم إنشاء هذه الوثيقة بواسطة الذكاء الاصطناعي. إذا وجدت أي أخطاء أو لديك اقتراحات للتحسين، فلا تتردد في المساهمة! [تحرير على GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ar.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/en.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/en.md index 63c9e9a91..4c957d008 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/en.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/en.md @@ -1,20 +1,26 @@ # ElevenLabs Text to Sound Effects -The ElevenLabs Text to Sound Effects node generates audio sound effects from a text description. It uses the ElevenLabs API to create sound effects based on your prompt, allowing you to control the duration, looping behavior, and how closely the sound follows the text. +The ElevenLabs Text to Sound Effects node generates sound effect audio from a text description using the ElevenLabs API. It sends your written prompt to the ElevenLabs sound generation service and returns the resulting audio, with controls for the duration, looping behavior, and how closely the sound follows the text. ## Inputs +### Common Inputs + | Parameter | Description | Data Type | Required | Range | |-----------|-------------|-----------|----------|-------| -| `text` | Text description of the sound effect to generate. | STRING | Yes | N/A | -| `model` | Model to use for sound effect generation. Selecting this model reveals additional parameters: `duration` (default: 5.0, range: 0.5 to 30.0 seconds), `loop` (default: False), and `prompt_influence` (default: 0.3, range: 0.0 to 1.0). | COMBO | Yes | `"eleven_sfx_v2"` | +| `model` | Model to use for sound effect generation. The selected model determines the available generation parameters listed below. | DYNAMIC_COMBO | Yes | `"eleven_sfx_v2"` | +| `text` | Text description of the sound effect to generate. Must contain at least 1 character. (default: empty) | STRING | Yes | N/A | | `output_format` | Audio output format. | COMBO | Yes | `"mp3_44100_192"`
`"opus_48000_192"` | -**Parameter Details:** +### Eleven SFX v2 Inputs + +Sub-parameters shown when `model` is set to `"eleven_sfx_v2"`. -* **`model["duration"]`**: Duration of the generated sound in seconds. Default is 5.0, with a minimum of 0.5 and a maximum of 30.0. -* **`model["loop"]`**: When enabled, creates a smoothly looping sound effect. Default is False. -* **`model["prompt_influence"]`**: Controls how closely the generation follows the text prompt. Higher values make the sound follow the text more closely. Default is 0.3, with a range from 0.0 to 1.0. +| Parameter | Description | Data Type | Required | Range | +|-----------|-------------|-----------|----------|-------| +| `duration` | Duration of generated sound in seconds. (default: 5.0) | FLOAT | Yes | 0.5 to 30.0 (step: 0.1) | +| `loop` | Create a smoothly looping sound effect. (default: False) | BOOLEAN | No | True or False | +| `prompt_influence` | How closely generation follows the prompt. Higher values make the sound follow the text more closely. (default: 0.3) | FLOAT | Yes | 0.0 to 1.0 (step: 0.01) | ## Outputs diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/es.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/es.md index ad5fd2575..ff7d7250d 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/es.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/es.md @@ -1,28 +1,34 @@ # ElevenLabs Texto a Efectos de Sonido -El nodo ElevenLabs Text to Sound Effects genera efectos de sonido a partir de una descripción textual. Utiliza la API de ElevenLabs para crear efectos de sonido basados en tu indicación, permitiéndote controlar la duración, el comportamiento de bucle y qué tan fielmente sigue el sonido al texto. +El nodo ElevenLabs Text to Sound Effects genera audio de efectos de sonido a partir de una descripción de texto mediante la API de ElevenLabs. Envía tu indicación escrita al servicio de generación de sonidos de ElevenLabs y devuelve el audio resultante, con controles para la duración, el comportamiento de bucle y la fidelidad con la que el sonido sigue el texto. ## Entradas -| Parámetro | Descripción | Tipo de Dato | Obligatorio | Rango | -| --- | --- | --- | --- | --- | -| `texto` | Descripción textual del efecto de sonido a generar. Este campo es obligatorio. | STRING | Sí | N/A | -| `modelo` | Modelo a utilizar para la generación del efecto de sonido. Seleccionar este modelo revela parámetros adicionales: `duration` (predeterminado: 5.0, rango: 0.5 a 30.0 segundos), `loop` (predeterminado: Falso) y `prompt_influence` (predeterminado: 0.3, rango: 0.0 a 1.0). | COMBO | Sí | `"eleven_sfx_v2"` | +### Entradas comunes + +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `modelo` | Modelo a utilizar para la generación de efectos de sonido. El modelo seleccionado determina los parámetros de generación disponibles que se enumeran a continuación. | DYNAMIC_COMBO | Sí | `"eleven_sfx_v2"` | +| `texto` | Descripción de texto del efecto de sonido a generar. Debe contener al menos 1 carácter. (predeterminado: vacío) | STRING | Sí | N/A | | `formato_de_salida` | Formato de salida de audio. | COMBO | Sí | `"mp3_44100_192"`
`"opus_48000_192"` | -**Detalles de los parámetros:** +### Eleven SFX v2 Entradas + +Subparámetros que se muestran cuando `model` está configurado en `"eleven_sfx_v2"`. -* **`model["duration"]`**: Duración del sonido generado en segundos. El valor predeterminado es 5.0, con un mínimo de 0.5 y un máximo de 30.0. -* **`model["loop"]`**: Cuando está habilitado, crea un efecto de sonido que se repite suavemente. El valor predeterminado es Falso. -* **`model["prompt_influence"]`**: Controla qué tan fielmente la generación sigue la indicación de texto. Los valores más altos hacen que el sonido siga el texto con mayor precisión. El valor predeterminado es 0.3, con un rango de 0.0 a 1.0. +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `duration` | Duración del sonido generado en segundos. (predeterminado: 5.0) | FLOAT | Sí | 0.5 a 30.0 (paso: 0.1) | +| `loop` | Crea un efecto de sonido con bucle suave. (predeterminado: False) | BOOLEAN | No | True o False | +| `prompt_influence` | Qué tan de cerca sigue la generación la indicación. Los valores más altos hacen que el sonido siga el texto más de cerca. (predeterminado: 0.3) | FLOAT | Sí | 0.0 a 1.0 (paso: 0.01) | ## Salidas -| Nombre de Salida | Descripción | Tipo de Dato | -| --- | --- | --- | +| Nombre de salida | Descripción | Tipo de datos | +|------------------|-------------|---------------| | `audio` | El archivo de audio del efecto de sonido generado. | AUDIO | > Esta documentación fue generada por IA. Si encuentra algún error o tiene sugerencias de mejora, ¡no dude en contribuir! [Editar en GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/es.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fa.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fa.md index a44718a26..d1b90eb18 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fa.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fa.md @@ -1,30 +1,34 @@ # تبدیل متن به افکت صوتی ElevenLabs -### مرور کلی - -گره **تبدیل متن به افکت صوتی ElevenLabs** افکت‌های صوتی را از روی توضیحات متنی تولید می‌کند. این گره با استفاده از API شرکت ElevenLabs، افکت‌های صوتی را بر اساس prompt شما می‌سازد و به شما امکان کنترل مدت‌زمان، رفتار حلقه‌زنی (looping) و میزان تطابق صدا با متن را می‌دهد. +گره «ElevenLabs Text to Sound Effects» با استفاده از API سرویس ElevenLabs، صداهای افکتی را از یک توصیف متنی تولید می‌کند. این گره پرامپت نوشته‌شدهٔ شما را به سرویس تولید صدای ElevenLabs ارسال کرده و خروجی صوتی حاصل را بازمی‌گرداند. همچنین امکان کنترل مدت‌زمان، رفتار حلقه‌ای و میزان تطابق صدا با متن فراهم است. ## ورودی‌ها -| پارامتر | توضیحات | نوع داده | اجباری | محدوده | -| --- | --- | --- | --- | --- | -| `text` | توضیحات متنی افکت صوتی مورد نظر برای تولید. این فیلد اجباری است. | STRING | بله | نامعتبر | -| `model` | مدل مورد استفاده برای تولید افکت صوتی. انتخاب این مدل پارامترهای اضافی زیر را آشکار می‌کند: `duration` (پیش‌فرض: 5.0، محدوده: 0.5 تا 30.0 ثانیه)، `loop` (پیش‌فرض: False)، و `prompt_influence` (پیش‌فرض: 0.3، محدوده: 0.0 تا 1.0). | COMBO | بله | `"eleven_sfx_v2"` | -| `output_format` | فرمت خروجی صوتی. | COMBO | بله | `"mp3_44100_192"`
`"opus_48000_192"` | +### ورودی‌های مشترک + +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | +|-----------|-------------|-----------|----------|-------| +| `model` | مدل مورد استفاده برای تولید افکت صوتی. مدل انتخابی، پارامترهای تولید موجود را که در ادامه فهرست شده‌اند تعیین می‌کند. | DYNAMIC_COMBO | بله | `"eleven_sfx_v2"` | +| `text` | توصیف متنی افکت صوتی موردنظر برای تولید. باید حداقل شامل ۱ نویسه باشد. (پیش‌فرض: خالی) | STRING | بله | N/A | +| `output_format` | قالب خروجی صوتی. | COMBO | بله | `"mp3_44100_192"`
`"opus_48000_192"` | + +### ورودی‌های Eleven SFX v2 -**جزئیات پارامترها:** +زیرپارامترهایی که وقتی `model` روی `"eleven_sfx_v2"` تنظیم شود نمایش داده می‌شوند. -* **`model["duration"]`**: مدت‌زمان صدای تولید شده بر حسب ثانیه. پیش‌فرض 5.0، با حداقل 0.5 و حداکثر 30.0. -* **`model["loop"]`**: در صورت فعال‌سازی، یک افکت صوتی با حلقه‌زنی روان ایجاد می‌کند. پیش‌فرض False است. -* **`model["prompt_influence"]`**: میزان تطابق تولید صدا با prompt متنی را کنترل می‌کند. مقادیر بالاتر باعث می‌شود صدا بیشتر از متن پیروی کند. پیش‌فرض 0.3، با محدوده 0.0 تا 1.0. +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | +|-----------|-------------|-----------|----------|-------| +| `duration` | مدت‌زمان صدای تولیدشده بر حسب ثانیه. (پیش‌فرض: 5.0) | FLOAT | بله | 0.5 تا 30.0 (گام: 0.1) | +| `loop` | ایجاد یک افکت صوتی حلقه‌شونده روان. (پیش‌فرض: False) | BOOLEAN | خیر | True یا False | +| `prompt_influence` | میزان تطابق تولید با پرامپت. مقادیر بالاتر باعث می‌شود صدا بیشتر از متن پیروی کند. (پیش‌فرض: 0.3) | FLOAT | بله | 0.0 تا 1.0 (گام: 0.01) | ## خروجی‌ها | نام خروجی | توضیحات | نوع داده | -| --- | --- | --- | -| `audio` | فایل صوتی افکت صوتی تولید شده. | AUDIO | +|-------------|-------------|-----------| +| `audio` | فایل صوتی افکت تولیده‌شده. | AUDIO | > این مستند با هوش مصنوعی تهیه شده است. اگر خطایی دیدید یا پیشنهادی برای بهبود دارید، خوشحال می‌شویم مشارکت کنید! [ویرایش در GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fa.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fr.md index 7fde010c6..27248b746 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fr.md @@ -1,28 +1,34 @@ # ElevenLabs Text to Sound Effects -Le nœud ElevenLabs Text to Sound Effects génère des effets sonores audio à partir d'une description textuelle. Il utilise l'API ElevenLabs pour créer des effets sonores basés sur votre prompt, vous permettant de contrôler la durée, le comportement de boucle et la fidélité du son au texte. +Le nœud ElevenLabs Text to Sound Effects génère un effet sonore à partir d'une description textuelle à l'aide de l'API ElevenLabs. Il envoie votre prompt écrit au service de génération d'effets sonores ElevenLabs et renvoie l'audio résultant, avec des contrôles pour la durée, le comportement de boucle et la fidélité du son au texte. ## Entrées +### Entrées communes + | Paramètre | Description | Type de données | Requis | Plage | -| --- | --- | --- | --- | --- | -| `text` | Description textuelle de l'effet sonore à générer. Ce champ est obligatoire. | STRING | Oui | N/A | -| `model` | Modèle à utiliser pour la génération d'effets sonores. La sélection de ce modèle révèle des paramètres supplémentaires : `duration` (par défaut : 5,0, plage : 0,5 à 30,0 secondes), `loop` (par défaut : False) et `prompt_influence` (par défaut : 0,3, plage : 0,0 à 1,0). | COMBO | Oui | `"eleven_sfx_v2"` | +|-----------|-------------|-----------|----------|-------| +| `model` | Modèle à utiliser pour la génération d'effets sonores. Le modèle sélectionné détermine les paramètres de génération disponibles listés ci-dessous. | DYNAMIC_COMBO | Oui | `"eleven_sfx_v2"` | +| `text` | Description textuelle de l'effet sonore à générer. Doit contenir au moins 1 caractère. (par défaut : vide) | STRING | Oui | N/A | | `output_format` | Format de sortie audio. | COMBO | Oui | `"mp3_44100_192"`
`"opus_48000_192"` | -**Détails des paramètres :** +### Entrées Eleven SFX v2 + +Sous-paramètres affichés lorsque `model` est défini sur `"eleven_sfx_v2"`. -* **`model["duration"]`** : Durée de l'effet sonore généré en secondes. La valeur par défaut est 5,0, avec un minimum de 0,5 et un maximum de 30,0. -* **`model["loop"]`** : Lorsqu'il est activé, crée un effet sonore en boucle fluide. La valeur par défaut est False. -* **`model["prompt_influence"]`** : Contrôle la fidélité de la génération au prompt textuel. Des valeurs plus élevées font correspondre le son plus étroitement au texte. La valeur par défaut est 0,3, avec une plage de 0,0 à 1,0. +| Paramètre | Description | Type de données | Requis | Plage | +|-----------|-------------|-----------|----------|-------| +| `duration` | Durée du son généré en secondes. (par défaut : 5.0) | FLOAT | Oui | 0.5 à 30.0 (pas de 0.1) | +| `loop` | Crée un effet sonore en boucle fluide. (par défaut : False) | BOOLEAN | Non | True ou False | +| `prompt_influence` | Degré de fidélité de la génération au prompt. Des valeurs plus élevées rendent le son plus proche du texte. (par défaut : 0.3) | FLOAT | Oui | 0.0 à 1.0 (pas de 0.01) | ## Sorties | Nom de sortie | Description | Type de données | -| --- | --- | --- | +|---------------|-------------|-----------| | `audio` | Le fichier audio de l'effet sonore généré. | AUDIO | > Cette documentation a été générée par IA. Si vous trouvez des erreurs ou avez des suggestions d'amélioration, n'hésitez pas à contribuer ! [Modifier sur GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/fr.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ja.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ja.md index ac5e5f6f9..5109e2ac4 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ja.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ja.md @@ -1,32 +1,34 @@ # ElevenLabs テキストから効果音へ -以下は、指定されたルールに従って翻訳した日本語版ドキュメントです。 - ---- - -ElevenLabs Text to Sound Effects ノードは、テキストの説明からオーディオの効果音を生成します。ElevenLabs API を使用してプロンプトに基づいた効果音を作成し、長さ、ループ動作、テキストへの追従度を制御できます。 +ElevenLabs Text to Sound Effects ノードは、ElevenLabs API を使用して、テキストの説明から効果音のオーディオを生成します。書き込んだプロンプトを ElevenLabs のサウンド生成サービスに送信し、その結果得られたオーディオを返します。生成時間、ループ動作、テキストへの追従度などを制御できます。 ## 入力 +### 共通入力 + | パラメータ | 説明 | データ型 | 必須 | 範囲 | -| --- | --- | --- | --- | --- | -| `テキスト` | 生成する効果音のテキスト説明。必須フィールドです。 | STRING | はい | N/A | -| `モデル` | 効果音生成に使用するモデル。このモデルを選択すると、追加パラメータが表示されます:`duration`(デフォルト: 5.0、範囲: 0.5~30.0秒)、`loop`(デフォルト: False)、`prompt_influence`(デフォルト: 0.3、範囲: 0.0~1.0)。 | COMBO | はい | `"eleven_sfx_v2"` | -| `出力フォーマット` | オーディオ出力形式。 | COMBO | はい | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `モデル` | 効果音生成に使用するモデル。選択したモデルによって、以下に示す生成パラメータが決まります。 | DYNAMIC_COMBO | はい | `"eleven_sfx_v2"` | +| `テキスト` | 生成する効果音のテキストによる説明。少なくとも 1 文字以上含める必要があります。(デフォルト: 空) | STRING | はい | N/A | +| `出力フォーマット` | オーディオの出力形式。 | COMBO | はい | `"mp3_44100_192"`
`"opus_48000_192"` | + +### Eleven SFX v2 入力 -**パラメータの詳細:** +`model` が `"eleven_sfx_v2"` に設定されている場合に表示されるサブパラメータです。 -* **`model["duration"]`**:生成されるサウンドの長さ(秒)。デフォルトは 5.0、最小 0.5、最大 30.0 です。 -* **`model["loop"]`**:有効にすると、スムーズにループする効果音を作成します。デフォルトは False です。 -* **`model["prompt_influence"]`**:生成がテキストプロンプトにどの程度追従するかを制御します。値が大きいほど、サウンドがテキストに忠実になります。デフォルトは 0.3、範囲は 0.0 から 1.0 です。 +| パラメータ | 説明 | データ型 | 必須 | 範囲 | +|-----------|-------------|-----------|----------|-------| +| `duration` | 生成されるサウンドの長さ(秒)。(デフォルト: 5.0) | FLOAT | はい | 0.5 ~ 30.0(ステップ: 0.1) | +| `loop` | ループに適した滑らかな効果音を作成します。(デフォルト: False) | BOOLEAN | いいえ | True または False | +| `prompt_influence` | 生成がプロンプトにどの程度忠実に従うか。値が大きいほど、テキストに忠実なサウンドになります。(デフォルト: 0.3) | FLOAT | はい | 0.0 ~ 1.0(ステップ: 0.01) | ## 出力 | 出力名 | 説明 | データ型 | -| --- | --- | --- | +|-------------|-------------|-----------| | `audio` | 生成された効果音のオーディオファイル。 | AUDIO | > このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ja.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ko.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ko.md index 0c1eba093..8eca9acb8 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ko.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ko.md @@ -1,28 +1,34 @@ # ElevenLabs 텍스트 → 효과음 -ElevenLabs 텍스트-음향 효과 노드는 텍스트 설명으로부터 오디오 음향 효과를 생성합니다. ElevenLabs API를 사용하여 프롬프트를 기반으로 음향 효과를 만들며, 지속 시간, 반복 동작, 텍스트와 소리의 일치 정도를 제어할 수 있습니다. +ElevenLabs Text to Sound Effects 노드는 ElevenLabs API를 사용하여 텍스트 설명에서 효과음 오디오를 생성합니다. 작성한 프롬프트를 ElevenLabs 사운드 생성 서비스에 전송하고 결과 오디오를 반환하며, 지속 시간, 반복 동작, 사운드가 텍스트를 따르는 정도를 제어할 수 있습니다. ## 입력 +### 공통 입력 + | 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | -| --- | --- | --- | --- | --- | -| `text` | 생성할 음향 효과의 텍스트 설명입니다. 필수 입력 항목입니다. | STRING | 예 | 해당 없음 | -| `model` | 음향 효과 생성에 사용할 모델입니다. 이 모델을 선택하면 추가 매개변수가 표시됩니다: `duration`(기본값: 5.0, 범위: 0.5~30.0초), `loop`(기본값: False), `prompt_influence`(기본값: 0.3, 범위: 0.0~1.0). | COMBO | 예 | `"eleven_sfx_v2"` | +|-----------|-------------|-----------|----------|-------| +| `model` | 효과음 생성을 위해 사용할 모델입니다. 선택한 모델에 따라 아래에 나열된 사용 가능한 생성 매개변수가 결정됩니다. | DYNAMIC_COMBO | 예 | `"eleven_sfx_v2"` | +| `text` | 생성할 효과음에 대한 텍스트 설명입니다. 최소 1자 이상이어야 합니다. (기본값: 빈 문자열) | STRING | 예 | 해당 없음 | | `output_format` | 오디오 출력 형식입니다. | COMBO | 예 | `"mp3_44100_192"`
`"opus_48000_192"` | -**매개변수 세부 설명:** +### Eleven SFX v2 입력 + +`model`이(가) `"eleven_sfx_v2"`(으)로 설정된 경우 표시되는 하위 매개변수입니다. -* **`model["duration"]`**: 생성된 사운드의 지속 시간(초)입니다. 기본값은 5.0이며, 최소 0.5초, 최대 30.0초입니다. -* **`model["loop"]`**: 활성화하면 부드럽게 반복되는 음향 효과를 생성합니다. 기본값은 False입니다. -* **`model["prompt_influence"]`**: 생성 결과가 텍스트 프롬프트를 얼마나 밀접하게 따를지 제어합니다. 값이 높을수록 텍스트를 더 정확하게 따르는 소리가 생성됩니다. 기본값은 0.3이며, 범위는 0.0에서 1.0까지입니다. +| 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | +|-----------|-------------|-----------|----------|-------| +| `duration` | 생성된 사운드의 길이(초)입니다. (기본값: 5.0) | FLOAT | 예 | 0.5 ~ 30.0 (단계: 0.1) | +| `loop` | 자연스럽게 반복되는 효과음을 생성합니다. (기본값: False) | BOOLEAN | 아니오 | True or False | +| `prompt_influence` | 생성 결과가 프롬프트를 얼마나 밀접하게 따르는지 결정합니다. 값이 높을수록 사운드가 텍스트를 더 가깝게 따릅니다. (기본값: 0.3) | FLOAT | 예 | 0.0 ~ 1.0 (단계: 0.01) | ## 출력 | 출력 이름 | 설명 | 데이터 타입 | -| --- | --- | --- | -| `audio` | 생성된 음향 효과 오디오 파일입니다. | AUDIO | +|-------------|-------------|-----------| +| `audio` | 생성된 효과음 오디오 파일입니다. | AUDIO | > 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ko.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/pt-BR.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/pt-BR.md index 07209be4c..96bb0996b 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/pt-BR.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/pt-BR.md @@ -1,28 +1,34 @@ # ElevenLabs Texto para Efeitos Sonoros -O nó ElevenLabs Text to Sound Effects gera efeitos sonoros de áudio a partir de uma descrição textual. Ele utiliza a API do ElevenLabs para criar efeitos sonoros com base no seu prompt, permitindo controlar a duração, o comportamento de repetição e o quão fielmente o som segue o texto. +O nó ElevenLabs Text to Sound Effects gera áudio de efeitos sonoros a partir de uma descrição em texto usando a API ElevenLabs. Ele envia seu prompt escrito para o serviço de geração de sons da ElevenLabs e retorna o áudio resultante, com controles de duração, comportamento de loop e o quão fielmente o som segue o texto. ## Entradas +### Entradas Comuns + | Parâmetro | Descrição | Tipo de Dado | Obrigatório | Intervalo | -| --- | --- | --- | --- | --- | -| `texto` | Descrição textual do efeito sonoro a ser gerado. Este é um campo obrigatório. | STRING | Sim | N/A | -| `modelo` | Modelo a ser usado para a geração do efeito sonoro. Selecionar este modelo revela parâmetros adicionais: `duration` (padrão: 5,0, intervalo: 0,5 a 30,0 segundos), `loop` (padrão: Falso) e `prompt_influence` (padrão: 0,3, intervalo: 0,0 a 1,0). | COMBO | Sim | `"eleven_sfx_v2"` | +|-----------|-------------|-----------|----------|-------| +| `modelo` | Modelo a ser usado para geração de efeitos sonoros. O modelo selecionado determina os parâmetros de geração disponíveis listados abaixo. | DYNAMIC_COMBO | Sim | `"eleven_sfx_v2"` | +| `texto` | Descrição em texto do efeito sonoro a ser gerado. Deve conter pelo menos 1 caractere. (padrão: vazio) | STRING | Sim | N/A | | `formato_saida` | Formato de saída do áudio. | COMBO | Sim | `"mp3_44100_192"`
`"opus_48000_192"` | -**Detalhes dos Parâmetros:** +### Entradas do Eleven SFX v2 + +Subparâmetros exibidos quando `model` está definido como `"eleven_sfx_v2"`. -* **`model["duration"]`**: Duração do som gerado em segundos. O padrão é 5,0, com um mínimo de 0,5 e um máximo de 30,0. -* **`model["loop"]`**: Quando ativado, cria um efeito sonoro com repetição suave. O padrão é Falso. -* **`model["prompt_influence"]`**: Controla o quão fielmente a geração segue o prompt de texto. Valores mais altos fazem o som seguir o texto mais de perto. O padrão é 0,3, com um intervalo de 0,0 a 1,0. +| Parâmetro | Descrição | Tipo de Dado | Obrigatório | Intervalo | +|-----------|-------------|-----------|----------|-------| +| `duration` | Duração do som gerado em segundos. (padrão: 5.0) | FLOAT | Sim | 0.5 a 30.0 (passo: 0.1) | +| `loop` | Cria um efeito sonoro com loop suave. (padrão: Falso) | BOOLEAN | Não | True ou False | +| `prompt_influence` | O quão fielmente a geração segue o prompt. Valores mais altos fazem o som seguir o texto mais de perto. (padrão: 0.3) | FLOAT | Sim | 0.0 a 1.0 (passo: 0.01) | ## Saídas | Nome da Saída | Descrição | Tipo de Dado | -| --- | --- | --- | +|-------------|-------------|-----------| | `audio` | O arquivo de áudio do efeito sonoro gerado. | AUDIO | > Esta documentação foi gerada por IA. Se você encontrar erros ou tiver sugestões de melhoria, sinta-se à vontade para contribuir! [Editar no GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/pt-BR.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ru.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ru.md index 570c1fabc..ab98e64fe 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ru.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ru.md @@ -1,30 +1,34 @@ # ElevenLabs Текст в звуковые эффекты -Вот перевод документации на русский язык: - -Узел ElevenLabs Text to Sound Effects генерирует аудио-звуковые эффекты на основе текстового описания. Он использует API ElevenLabs для создания звуковых эффектов на основе вашего запроса, позволяя контролировать длительность, зацикливание и степень соответствия звука тексту. +Узел ElevenLabs Text to Sound Effects генерирует звуковые эффекты на основе текстового описания с использованием API ElevenLabs. Он отправляет ваш письменный запрос в сервис генерации звуков ElevenLabs и возвращает полученное аудио, с возможностью управления длительностью, зацикливанием и степенью соответствия звука тексту. ## Входы +### Общие входы + | Параметр | Описание | Тип данных | Обязательный | Диапазон | -| --- | --- | --- | --- | --- | -| `text` | Текстовое описание звукового эффекта для генерации. Это обязательное поле. | STRING | Да | N/A | -| `model` | Модель для генерации звуковых эффектов. Выбор этой модели открывает дополнительные параметры: `duration` (по умолчанию: 5.0, диапазон: от 0.5 до 30.0 секунд), `loop` (по умолчанию: False) и `prompt_influence` (по умолчанию: 0.3, диапазон: от 0.0 до 1.0). | COMBO | Да | `"eleven_sfx_v2"` | +|-----------|-------------|-----------|----------|-------| +| `model` | Модель для генерации звуковых эффектов. Выбранная модель определяет доступные параметры генерации, перечисленные ниже. | DYNAMIC_COMBO | Да | `"eleven_sfx_v2"` | +| `text` | Текстовое описание звукового эффекта для генерации. Должно содержать не менее 1 символа. (по умолчанию: пусто) | STRING | Да | N/A | | `output_format` | Формат выходного аудио. | COMBO | Да | `"mp3_44100_192"`
`"opus_48000_192"` | -**Детали параметров:** +### Входы Eleven SFX v2 -* **`model["duration"]`**: Длительность генерируемого звука в секундах. По умолчанию 5.0, минимум 0.5, максимум 30.0. -* **`model["loop"]`**: При включении создает плавно зацикленный звуковой эффект. По умолчанию False. -* **`model["prompt_influence"]`**: Управляет степенью соответствия генерации текстовому запросу. Более высокие значения заставляют звук точнее следовать тексту. По умолчанию 0.3, диапазон от 0.0 до 1.0. +Дополнительные параметры, отображаемые, когда `model` установлен в `"eleven_sfx_v2"`. + +| Параметр | Описание | Тип данных | Обязательный | Диапазон | +|-----------|-------------|-----------|----------|-------| +| `duration` | Длительность генерируемого звука в секундах. (по умолчанию: 5.0) | FLOAT | Да | от 0.5 до 30.0 (шаг: 0.1) | +| `loop` | Создать плавно зацикленный звуковой эффект. (по умолчанию: False) | BOOLEAN | Нет | True или False | +| `prompt_influence` | Насколько точно генерация следует запросу. Более высокие значения обеспечивают более точное соответствие звука тексту. (по умолчанию: 0.3) | FLOAT | Да | от 0.0 до 1.0 (шаг: 0.01) | ## Выходы | Имя выхода | Описание | Тип данных | -| --- | --- | --- | +|-------------|-------------|-----------| | `audio` | Сгенерированный аудиофайл звукового эффекта. | AUDIO | > Эта документация была создана с помощью ИИ. Если вы обнаружите ошибки или у вас есть предложения по улучшению, пожалуйста, внесите свой вклад! [Редактировать на GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/ru.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/tr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/tr.md index b7b20ac3a..8c1452b8b 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/tr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/tr.md @@ -1,56 +1,34 @@ # ElevenLabs Metinden Ses Efektine -ComfyUI düğüm belgelerini İngilizceden Türkçeye çevirmede uzmanlaşmış teknik çeviri uzmanısınız. +ElevenLabs Text to Sound Effects düğümü, ElevenLabs API'sini kullanarak bir metin açıklamasından ses efekti sesi üretir. Yazılı isteminizi ElevenLabs ses üretim hizmetine gönderir ve ortaya çıkan sesi; süre, döngü davranışı ve sesin metni ne kadar yakından takip ettiği kontrolleriyle birlikte döndürür. -## Çeviri Kuralları +## Girdiler -1. **Çevrilmemesi gereken içerik:** - - Ters tırnak içindeki parametre adları: `image`, `seed`, `model` - - BÜYÜK harflerle veri türleri: IMAGE, STRING, INT, FLOAT, MODEL, CONDITIONING, vb. - - Range sütunundaki değerler: sayılar, "auto", seçenek adları - - Kod, dosya yolları +### Genel Girdiler -2. **Çevrilmesi gereken içerik:** - - Bölüm başlıkları: ## Genel Bakış, ## Girdiler, ## Çıktılar - - Tüm açıklayıcı metinler - - Parametre açıklamaları - -3. **Çeviri kalitesi:** - - Standart Türkçe kullanın - - Profesyonel ama anlaşılır bir üslup koruyun - - Teknik doğruluğu sağlayın - - Standart Türkçe teknik terminolojiyi kullanın - -4. **Format:** - - Tüm Markdown biçimlendirmesini koruyun - - Tablo yapısını koruyun - - Belgenin başına herhangi bir not veya bağlantı eklemeyin (otomatik olarak eklenecektir) - -Lütfen aşağıdaki belgeyi Türkçeye çevirin (belgenin başlangıç notunu dahil etmeyin): +| Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | +|-----------|-------------|-----------|----------|-------| +| `model` | Ses efekti üretimi için kullanılacak model. Seçilen model, aşağıda listelenen mevcut üretim parametrelerini belirler. | DYNAMIC_COMBO | Evet | `"eleven_sfx_v2"` | +| `metin` | Üretilecek ses efektinin metin açıklaması. En az 1 karakter içermelidir. (varsayılan: boş) | STRING | Evet | N/A | +| `çıktı_formatı` | Ses çıktı biçimi. | COMBO | Evet | `"mp3_44100_192"`
`"opus_48000_192"` | -ElevenLabs Metinden Ses Efektlerine düğümü, bir metin açıklamasından ses efektleri üretir. Ses efektlerini isteminize göre oluşturmak için ElevenLabs API'sini kullanır; süreyi, döngü davranışını ve sesin metni ne kadar yakından takip edeceğini kontrol etmenize olanak tanır. +### Eleven SFX v2 Girdileri -## Girişler +`model` `"eleven_sfx_v2"` olarak ayarlandığında gösterilen alt parametreler. | Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | -| --- | --- | --- | --- | --- | -| `metin` | Oluşturulacak ses efektinin metin açıklaması. Bu zorunlu bir alandır. | STRING | Evet | Yok | -| `model` | Ses efekti oluşturmak için kullanılacak model. Bu modelin seçilmesi ek parametreleri ortaya çıkarır: `duration` (varsayılan: 5.0, aralık: 0.5 ila 30.0 saniye), `loop` (varsayılan: False) ve `prompt_influence` (varsayılan: 0.3, aralık: 0.0 ila 1.0). | COMBO | Evet | `"eleven_sfx_v2"` | -| `çıktı_formatı` | Ses çıktı formatı. | COMBO | Evet | `"mp3_44100_192"`
`"opus_48000_192"` | - -**Parametre Detayları:** - -* **`model["duration"]`**: Oluşturulan sesin saniye cinsinden süresi. Varsayılan 5.0 olup, minimum 0.5 ve maksimum 30.0'dır. -* **`model["loop"]`**: Etkinleştirildiğinde, sorunsuz bir şekilde döngü yapan bir ses efekti oluşturur. Varsayılan False'dur. -* **`model["prompt_influence"]`**: Oluşturmanın metin istemini ne kadar yakından takip edeceğini kontrol eder. Daha yüksek değerler, sesin metni daha yakından takip etmesini sağlar. Varsayılan 0.3 olup, aralık 0.0 ile 1.0 arasındadır. +|-----------|-------------|-----------|----------|-------| +| `duration` | Üretilen sesin saniye cinsinden süresi. (varsayılan: 5.0) | FLOAT | Evet | 0.5 ile 30.0 (adım: 0.1) | +| `loop` | Sorunsuz döngü yapan bir ses efekti oluşturur. (varsayılan: False) | BOOLEAN | Hayır | True veya False | +| `prompt_influence` | Üretimin istemi ne kadar yakından takip ettiğini belirler. Daha yüksek değerler sesin metni daha yakından takip etmesini sağlar. (varsayılan: 0.3) | FLOAT | Evet | 0.0 ile 1.0 (adım: 0.01) | ## Çıktılar | Çıktı Adı | Açıklama | Veri Türü | -| --- | --- | --- | -| `audio` | Oluşturulan ses efekti ses dosyası. | AUDIO | +|-------------|-------------|-----------| +| `audio` | Üretilen ses efekti ses dosyası. | AUDIO | > Bu belge yapay zeka tarafından oluşturulmuştur. Herhangi bir hata bulursanız veya iyileştirme önerileriniz varsa, katkıda bulunmaktan çekinmeyin! [GitHub'da Düzenle](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/tr.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh-TW.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh-TW.md index 4f2019a58..326f89d8d 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh-TW.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh-TW.md @@ -1,30 +1,34 @@ # ElevenLabs 文字轉音效 -## 概述 - -ElevenLabs 文字轉音效節點可根據文字描述生成音效。它使用 ElevenLabs API 根據您的提示詞創建音效,讓您能夠控制持續時間、循環行為以及音效與文字的貼合程度。 +ElevenLabs 文字轉音效節點使用 ElevenLabs API,從文字描述產生音效音訊。它會將您輸入的提示文字傳送至 ElevenLabs 音效生成服務,並傳回產生的音訊,同時提供控制項,可調整音訊長度、循環行為,以及音效跟隨文字描述的貼合程度。 ## 輸入 -| 參數 | 說明 | 資料類型 | 必要 | 範圍 | -| --- | --- | --- | --- | --- | -| `文字` | 要生成音效的文字描述。此為必填欄位。 | STRING | 是 | 不適用 | -| `模型` | 用於音效生成的模型。選擇此模型會顯示額外參數:`duration`(預設值:5.0,範圍:0.5 至 30.0 秒)、`loop`(預設值:False)和 `prompt_influence`(預設值:0.3,範圍:0.0 至 1.0)。 | COMBO | 是 | `"eleven_sfx_v2"` | -| `輸出格式` | 音頻輸出格式。 | COMBO | 是 | `"mp3_44100_192"`
`"opus_48000_192"` | +### 通用輸入 + +| 參數 | 描述 | 資料型別 | 必填 | 範圍 | +|-----------|-------------|-----------|----------|-------| +| `模型` | 用於音效生成的模型。所選模型決定下方列出的可用生成參數。 | DYNAMIC_COMBO | 是 | `"eleven_sfx_v2"` | +| `文字` | 要生成之音效的文字描述。至少需包含 1 個字元。(預設:空) | STRING | 是 | N/A | +| `輸出格式` | 音訊輸出格式。 | COMBO | 是 | `"mp3_44100_192"`
`"opus_48000_192"` | + +### Eleven SFX v2 輸入 -**參數詳細說明:** +當 `model` 設為 `"eleven_sfx_v2"` 時顯示的子參數。 -* **`model["duration"]`**:生成音效的持續時間(以秒為單位)。預設值為 5.0,最小值為 0.5,最大值為 30.0。 -* **`model["loop"]`**:啟用後可創建平滑循環的音效。預設值為 False。 -* **`model["prompt_influence"]`**:控制生成結果與文字提示的貼合程度。數值越高,音效越貼近文字描述。預設值為 0.3,範圍從 0.0 到 1.0。 +| 參數 | 描述 | 資料型別 | 必填 | 範圍 | +|-----------|-------------|-----------|----------|-------| +| `duration` | 生成音效的持續時間(秒)。(預設:5.0) | FLOAT | 是 | 0.5 至 30.0 (步長: 0.1) | +| `loop` | 建立平滑循環的音效。(預設:False) | BOOLEAN | 否 | True or False | +| `prompt_influence` | 生成結果跟隨提示文字的程度。數值越高,音效越貼近文字描述。(預設:0.3) | FLOAT | 是 | 0.0 至 1.0 (步長: 0.01) | ## 輸出 -| 輸出名稱 | 說明 | 資料類型 | -| --- | --- | --- | -| `audio` | 生成的音效音頻檔案。 | AUDIO | +| 輸出名稱 | 描述 | 資料型別 | +|-------------|-------------|-----------| +| `audio` | 生成的音效音訊檔案。 | AUDIO | > 本文檔由 AI 生成。如果您發現任何錯誤或有改進建議,歡迎貢獻! [在 GitHub 上編輯](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh-TW.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh.md index 111aa14c0..0de13eea6 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh.md @@ -1,28 +1,34 @@ # ElevenLabs 文本转音效 -ElevenLabs 文本转音效节点可根据文本描述生成音频音效。该节点利用 ElevenLabs API,基于您的提示词创建音效,并允许您控制时长、循环行为以及音效与文本的匹配程度。 +ElevenLabs Text to Sound Effects 节点使用 ElevenLabs API 根据文本描述生成音效音频。它会将您编写的提示词发送到 ElevenLabs 声音生成服务,并返回生成的音频,同时提供对持续时间、循环行为以及声音与文本匹配程度的控制。 ## 输入 -| 参数 | 描述 | 数据类型 | 是否必填 | 取值范围 | -| --- | --- | --- | --- | --- | -| `文本` | 待生成音效的文本描述。此为必填字段。 | STRING | 是 | 不适用 | -| `模型` | 用于音效生成的模型。选择此模型后会显示额外参数:`duration`(默认值:5.0,范围:0.5 至 30.0 秒)、`loop`(默认值:False)和 `prompt_influence`(默认值:0.3,范围:0.0 至 1.0)。 | COMBO | 是 | `"eleven_sfx_v2"` | +### 通用输入 + +| 参数 | 描述 | 数据类型 | 必需 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `模型` | 用于音效生成的模型。所选模型决定了下文列出的可用生成参数。 | DYNAMIC_COMBO | 是 | `"eleven_sfx_v2"` | +| `文本` | 要生成的音效的文本描述。必须包含至少 1 个字符。(默认值:空) | STRING | 是 | N/A | | `输出格式` | 音频输出格式。 | COMBO | 是 | `"mp3_44100_192"`
`"opus_48000_192"` | -**参数详情:** +### Eleven SFX v2 输入 + +当 `model` 设置为 `"eleven_sfx_v2"` 时显示的子参数。 -* **`model["duration"]`**:生成音效的时长(秒)。默认值为 5.0,最小值为 0.5,最大值为 30.0。 -* **`model["loop"]`**:启用后,可创建平滑循环的音效。默认值为 False。 -* **`model["prompt_influence"]`**:控制生成结果与文本提示词的匹配程度。数值越高,音效越贴合文本。默认值为 0.3,取值范围为 0.0 至 1.0。 +| 参数 | 描述 | 数据类型 | 必需 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `duration` | 生成声音的持续时间(秒)。(默认值:5.0) | FLOAT | 是 | 0.5 到 30.0 (步长: 0.1) | +| `loop` | 创建平滑循环播放的音效。(默认值:False) | BOOLEAN | 否 | True or False | +| `prompt_influence` | 生成结果遵循提示词的程度。数值越高,声音与文本的匹配度越高。(默认值:0.3) | FLOAT | 是 | 0.0 到 1.0 (步长: 0.01) | ## 输出 -| 输出名称 | 描述 | 数据类型 | -| --- | --- | --- | +| 输出名 | 描述 | 数据类型 | +|-------------|-------------|-----------| | `audio` | 生成的音效音频文件。 | AUDIO | > 本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSoundEffects/zh.md) --- -**Source fingerprint (SHA-256):** `c23c4dd3c9c12f0e891d40683265c5b74b5c6320601aaadb686489510db9f107` +**Source fingerprint (SHA-256):** `218ff617256cea33f310c1bcfc6407c46aaadc59201a0324b0ec64583166ce58` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md index 2b5737d58..8df757b03 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md @@ -1,40 +1,49 @@ # ElevenLabs تحويل النص إلى كلام -يقوم عقد ElevenLabs لتحويل النص إلى كلام بتحويل النص المكتوب إلى صوت منطوق باستخدام واجهة برمجة تطبيقات ElevenLabs. يتيح لك اختيار صوت معين وضبط خصائص الكلام المختلفة مثل الثبات والسرعة والأسلوب لتوليد مخرجات صوتية مخصصة. +```markdown +تقوم عقدة ElevenLabs لتحويل النص إلى كلام بتحويل النص المكتوب إلى صوت منطوق باستخدام واجهة برمجة تطبيقات ElevenLabs. وهي تتيح لك اختيار صوت وضبط خصائص الكلام مثل الثبات والسرعة والأسلوب لإنشاء مخرجات صوتية مخصصة. ## المدخلات -| المعامل | الوصف | نوع البيانات | إلزامي | النطاق | -| --- | --- | --- | --- | --- | -| `الصوت` | الصوت المستخدم في تركيب الكلام. قم بالتوصيل من محدد الصوت أو استنساخ الصوت الفوري. | CUSTOM | نعم | غير متاح | -| `النص` | النص المراد تحويله إلى كلام. | STRING | نعم | غير متاح | -| `الثبات` | ثبات الصوت. القيم المنخفضة تعطي نطاقًا عاطفيًا أوسع، والقيم الأعلى تنتج كلامًا أكثر اتساقًا ولكن قد يكون رتيبًا (الافتراضي: 0.5). | FLOAT | لا | 0.0 - 1.0 | -| `تطبيق تنسيق النص` | وضع تطبيع النص. 'auto' يترك النظام يقرر، 'on' يطبق التطبيع دائمًا، 'off' يتجاوزه. | COMBO | لا | `"auto"`
`"on"`
`"off"` | -| `النموذج` | النموذج المستخدم في تحويل النص إلى كلام. اختيار نموذج يكشف عن معاملاته الخاصة. | DYNAMICCOMBO | لا | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `رمز اللغة` | رمز اللغة وفقًا لمعيار ISO-639-1 أو ISO-639-3 (مثل 'en' و'es' و'fra'). اتركه فارغًا للكشف التلقائي (الافتراضي: ""). | STRING | لا | غير متاح | -| `البذرة` | البذرة لإمكانية إعادة الإنتاج (غير مضمونة الحتمية) (الافتراضي: 1). | INT | لا | 0 - 2147483647 | -| `صيغة الإخراج` | تنسيق إخراج الصوت. | COMBO | لا | `"mp3_44100_192"`
`"opus_48000_192"` | +### المدخلات المشتركة -**معاملات خاصة بالنموذج:** -عند تعيين المعامل `model` إلى `"eleven_multilingual_v2"`، تصبح المعاملات الإضافية التالية متاحة: +| المعامل | الوصف | نوع البيانات | مطلوب | النطاق | +|-----------|-------------|-----------|----------|-------| +| `النموذج` | النموذج المستخدم لتحويل النص إلى كلام. يؤدي تحديد نموذج إلى إظهار معاملاته الخاصة. | DYNAMIC_COMBO | نعم | "eleven_multilingual_v2"
"eleven_v3" | +| `الصوت` | الصوت المستخدم في تركيب الكلام. قم بالتوصيل من محدد الصوت أو استنساخ الصوت الفوري. | ELEVENLABS_VOICE | نعم | N/A | +| `النص` | النص المطلوب تحويله إلى كلام. يجب أن يحتوي على حرف واحد على الأقل. | STRING | نعم | N/A | +| `الثبات` | ثبات الصوت. القيم الأقل تمنح نطاقًا عاطفيًا أوسع، بينما تنتج القيم الأعلى كلامًا أكثر اتساقًا لكنه قد يصبح رتيبًا (الافتراضي: 0.5). | FLOAT | نعم | 0.0 - 1.0 | +| `تطبيق تنسيق النص` | وضع تطبيع النص. يسمح 'auto' للنظام باتخاذ القرار، بينما يطبق 'on' التطبيع دائمًا، ويتخطاه 'off'. | COMBO | نعم | "auto"
"on"
"off" | +| `رمز اللغة` | رمز اللغة ISO-639-1 أو ISO-639-3 (مثل 'en' و'es' و'fra'). اتركه فارغًا للاكتشاف التلقائي (الافتراضي: ""). | STRING | نعم | N/A | +| `البذرة` | بذرة لإعادة إنتاج النتائج (ليست الحتمية مضمونة) (الافتراضي: 1). | INT | نعم | 0 - 2147483647 | +| `صيغة الإخراج` | تنسيق إخراج الصوت. | COMBO | نعم | "mp3_44100_192"
"opus_48000_192" | -* `speed`: سرعة الكلام. 1.0 طبيعي، <1.0 أبطأ، >1.0 أسرع (الافتراضي: 1.0، النطاق: 0.7 - 1.3). -* `similarity_boost`: تعزيز التشابه. القيم الأعلى تجعل الصوت أكثر تشابهًا مع الصوت الأصلي (الافتراضي: 0.75، النطاق: 0.0 - 1.0). -* `use_speaker_boost`: تعزيز التشابه مع صوت المتحدث الأصلي (الافتراضي: False). -* `style`: المبالغة في الأسلوب. القيم الأعلى تزيد من التعبير الأسلوبي ولكنها قد تقلل الثبات (الافتراضي: 0.0، النطاق: 0.0 - 0.2). +### مدخلات eleven_multilingual_v2 -عند تعيين المعامل `model` إلى `"eleven_v3"`، تصبح المعاملات الإضافية التالية متاحة: +| المعامل | الوصف | نوع البيانات | مطلوب | النطاق | +|-----------|-------------|-----------|----------|-------| +| `speed` | سرعة الكلام. 1.0 هو الوضع الطبيعي، و<1.0 أبطأ، و>1.0 أسرع (الافتراضي: 1.0). | FLOAT | نعم | 0.7 - 1.3 | +| `similarity_boost` | تعزيز التشابه. القيم الأعلى تجعل الصوت أكثر تشابهًا مع الصوت الأصلي (الافتراضي: 0.75). | FLOAT | نعم | 0.0 - 1.0 | +| `use_speaker_boost` | تعزيز التشابه مع صوت المتحدث الأصلي (الافتراضي: False). | BOOLEAN | نعم | True
False | +| `style` | مبالغة الأسلوب. القيم الأعلى تزيد التعبير الأسلوبي لكنها قد تقلل الثبات (الافتراضي: 0.0). | FLOAT | نعم | 0.0 - 0.2 | -* `speed`: سرعة الكلام. 1.0 طبيعي، <1.0 أبطأ، >1.0 أسرع (الافتراضي: 1.0، النطاق: 0.7 - 1.3). -* `similarity_boost`: تعزيز التشابه. القيم الأعلى تجعل الصوت أكثر تشابهًا مع الصوت الأصلي (الافتراضي: 0.75، النطاق: 0.0 - 1.0). +### مدخلات eleven_v3 + +| المعامل | الوصف | نوع البيانات | مطلوب | النطاق | +|-----------|-------------|-----------|----------|-------| +| `speed` | سرعة الكلام. 1.0 هو الوضع الطبيعي، و<1.0 أبطأ، و>1.0 أسرع (الافتراضي: 1.0). | FLOAT | نعم | 0.7 - 1.3 | +| `similarity_boost` | تعزيز التشابه. القيم الأعلى تجعل الصوت أكثر تشابهًا مع الصوت الأصلي (الافتراضي: 0.75). | FLOAT | نعم | 0.0 - 1.0 | + +**ملاحظة:** يجب أن يحتوي إدخال `text` على حرف واحد على الأقل. إذا تُرك `language_code` فارغًا، يتم اكتشاف اللغة تلقائيًا. المعاملان `use_speaker_boost` و`style` متاحان فقط لنموذج `eleven_multilingual_v2`. ## المخرجات | اسم المخرج | الوصف | نوع البيانات | -| --- | --- | --- | -| `audio` | الصوت المُنشأ من عملية تحويل النص إلى كلام. | AUDIO | +|-------------|-------------|-----------| +| `audio` | الصوت الناتج من تحويل النص إلى كلام. | AUDIO | +``` > تم إنشاء هذه الوثيقة بواسطة الذكاء الاصطناعي. إذا وجدت أي أخطاء أو لديك اقتراحات للتحسين، فلا تتردد في المساهمة! [تحرير على GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/en.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/en.md index bc28f19c8..b5a872bab 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/en.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/en.md @@ -1,33 +1,39 @@ # ElevenLabs Text to Speech -The ElevenLabs Text to Speech node converts written text into spoken audio using the ElevenLabs API. It allows you to select a specific voice and fine-tune various speech characteristics like stability, speed, and style to generate a customized audio output. +The ElevenLabs Text to Speech node converts written text into spoken audio using the ElevenLabs API. It lets you choose a voice and adjust speech characteristics such as stability, speed, and style to create customized audio output. ## Inputs +### Common Inputs + | Parameter | Description | Data Type | Required | Range | |-----------|-------------|-----------|----------|-------| -| `voice` | Voice to use for speech synthesis. Connect from Voice Selector or Instant Voice Clone. | CUSTOM | Yes | N/A | -| `text` | The text to convert to speech. | STRING | Yes | N/A | -| `stability` | Voice stability. Lower values give broader emotional range, higher values produce more consistent but potentially monotonous speech (default: 0.5). | FLOAT | No | 0.0 - 1.0 | -| `apply_text_normalization` | Text normalization mode. 'auto' lets the system decide, 'on' always applies normalization, 'off' skips it. | COMBO | No | `"auto"`
`"on"`
`"off"` | -| `model` | Model to use for text-to-speech. Selecting a model reveals its specific parameters. | DYNAMICCOMBO | No | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `language_code` | ISO-639-1 or ISO-639-3 language code (e.g., 'en', 'es', 'fra'). Leave empty for automatic detection (default: ""). | STRING | No | N/A | -| `seed` | Seed for reproducibility (determinism not guaranteed) (default: 1). | INT | No | 0 - 2147483647 | -| `output_format` | Audio output format. | COMBO | No | `"mp3_44100_192"`
`"opus_48000_192"` | +| `model` | Model to use for text-to-speech. Selecting a model reveals its specific parameters. | DYNAMIC_COMBO | Yes | "eleven_multilingual_v2"
"eleven_v3" | +| `voice` | Voice to use for speech synthesis. Connect from Voice Selector or Instant Voice Clone. | ELEVENLABS_VOICE | Yes | N/A | +| `text` | The text to convert to speech. Must contain at least one character. | STRING | Yes | N/A | +| `stability` | Voice stability. Lower values give broader emotional range, higher values produce more consistent but potentially monotonous speech (default: 0.5). | FLOAT | Yes | 0.0 - 1.0 | +| `apply_text_normalization` | Text normalization mode. 'auto' lets the system decide, 'on' always applies normalization, 'off' skips it. | COMBO | Yes | "auto"
"on"
"off" | +| `language_code` | ISO-639-1 or ISO-639-3 language code (e.g., 'en', 'es', 'fra'). Leave empty for automatic detection (default: ""). | STRING | Yes | N/A | +| `seed` | Seed for reproducibility (determinism not guaranteed) (default: 1). | INT | Yes | 0 - 2147483647 | +| `output_format` | Audio output format. | COMBO | Yes | "mp3_44100_192"
"opus_48000_192" | -**Model-Specific Parameters:** +### eleven_multilingual_v2 Inputs -When the `model` parameter is set to `"eleven_multilingual_v2"`, the following additional parameters become available: +| Parameter | Description | Data Type | Required | Range | +|-----------|-------------|-----------|----------|-------| +| `speed` | Speech speed. 1.0 is normal, <1.0 slower, >1.0 faster (default: 1.0). | FLOAT | Yes | 0.7 - 1.3 | +| `similarity_boost` | Similarity boost. Higher values make the voice more similar to the original (default: 0.75). | FLOAT | Yes | 0.0 - 1.0 | +| `use_speaker_boost` | Boost similarity to the original speaker voice (default: False). | BOOLEAN | Yes | True
False | +| `style` | Style exaggeration. Higher values increase stylistic expression but may reduce stability (default: 0.0). | FLOAT | Yes | 0.0 - 0.2 | -- `speed`: Speech speed. 1.0 is normal, <1.0 slower, >1.0 faster (default: 1.0, range: 0.7 - 1.3). -- `similarity_boost`: Similarity boost. Higher values make the voice more similar to the original (default: 0.75, range: 0.0 - 1.0). -- `use_speaker_boost`: Boost similarity to the original speaker voice (default: False). -- `style`: Style exaggeration. Higher values increase stylistic expression but may reduce stability (default: 0.0, range: 0.0 - 0.2). +### eleven_v3 Inputs -When the `model` parameter is set to `"eleven_v3"`, the following additional parameters become available: +| Parameter | Description | Data Type | Required | Range | +|-----------|-------------|-----------|----------|-------| +| `speed` | Speech speed. 1.0 is normal, <1.0 slower, >1.0 faster (default: 1.0). | FLOAT | Yes | 0.7 - 1.3 | +| `similarity_boost` | Similarity boost. Higher values make the voice more similar to the original (default: 0.75). | FLOAT | Yes | 0.0 - 1.0 | -- `speed`: Speech speed. 1.0 is normal, <1.0 slower, >1.0 faster (default: 1.0, range: 0.7 - 1.3). -- `similarity_boost`: Similarity boost. Higher values make the voice more similar to the original (default: 0.75, range: 0.0 - 1.0). +**Note:** The `text` input must contain at least one character. If `language_code` is left empty, the language is detected automatically. The `use_speaker_boost` and `style` parameters are available only for the `eleven_multilingual_v2` model. ## Outputs diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/es.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/es.md index 8461f4b05..64a47fc3d 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/es.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/es.md @@ -1,40 +1,47 @@ # ElevenLabs Texto a Voz -El nodo ElevenLabs Text to Speech convierte texto escrito en audio hablado utilizando la API de ElevenLabs. Permite seleccionar una voz específica y ajustar diversas características del habla como estabilidad, velocidad y estilo para generar una salida de audio personalizada. +El nodo ElevenLabs Text to Speech convierte texto escrito en audio hablado mediante la API de ElevenLabs. Permite elegir una voz y ajustar características del habla como estabilidad, velocidad y estilo para crear una salida de audio personalizada. ## Entradas -| Parámetro | Descripción | Tipo de Dato | Obligatorio | Rango | -| --- | --- | --- | --- | --- | -| `voz` | Voz a utilizar para la síntesis de voz. Conéctelo desde el Selector de Voz o Clonación Instantánea de Voz. | CUSTOM | Sí | N/A | -| `texto` | El texto a convertir en voz. | STRING | Sí | N/A | -| `estabilidad` | Estabilidad de la voz. Valores más bajos proporcionan un rango emocional más amplio, valores más altos producen un habla más consistente pero potencialmente monótona (predeterminado: 0.5). | FLOAT | No | 0.0 - 1.0 | -| `aplicar_normalización_de_texto` | Modo de normalización de texto. 'auto' permite que el sistema decida, 'on' aplica siempre la normalización, 'off' la omite. | COMBO | No | `"auto"`
`"on"`
`"off"` | -| `modelo` | Modelo a utilizar para la conversión de texto a voz. Seleccionar un modelo revela sus parámetros específicos. | DYNAMICCOMBO | No | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `código_de_idioma` | Código de idioma ISO-639-1 o ISO-639-3 (ej., 'en', 'es', 'fra'). Déjelo vacío para detección automática (predeterminado: ""). | STRING | No | N/A | -| `semilla` | Semilla para reproducibilidad (no se garantiza determinismo) (predeterminado: 1). | INT | No | 0 - 2147483647 | -| `formato_de_salida` | Formato de salida de audio. | COMBO | No | `"mp3_44100_192"`
`"opus_48000_192"` | +### Entradas comunes -**Parámetros Específicos del Modelo:** -Cuando el parámetro `model` está configurado en `"eleven_multilingual_v2"`, los siguientes parámetros adicionales están disponibles: +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `modelo` | Modelo a utilizar para la conversión de texto a voz. Al seleccionar un modelo, se muestran sus parámetros específicos. | DYNAMIC_COMBO | Sí | "eleven_multilingual_v2"
"eleven_v3" | +| `voz` | Voz a utilizar para la síntesis de voz. Conéctela desde Voice Selector o Instant Voice Clone. | ELEVENLABS_VOICE | Sí | N/A | +| `texto` | El texto a convertir en voz. Debe contener al menos un carácter. | STRING | Sí | N/A | +| `estabilidad` | Estabilidad de la voz. Los valores más bajos proporcionan un rango emocional más amplio; los valores más altos producen un habla más consistente pero potencialmente monótona (por defecto: 0.5). | FLOAT | Sí | 0.0 - 1.0 | +| `aplicar_normalización_de_texto` | Modo de normalización de texto. 'auto' permite que el sistema decida, 'on' aplica siempre la normalización, 'off' la omite. | COMBO | Sí | "auto"
"on"
"off" | +| `código_de_idioma` | Código de idioma ISO-639-1 o ISO-639-3 (p. ej., 'en', 'es', 'fra'). Déjelo vacío para la detección automática (por defecto: ""). | STRING | Sí | N/A | +| `semilla` | Semilla para reproducibilidad (no se garantiza el determinismo) (por defecto: 1). | INT | Sí | 0 - 2147483647 | +| `formato_de_salida` | Formato de salida de audio. | COMBO | Sí | "mp3_44100_192"
"opus_48000_192" | -* `speed`: Velocidad del habla. 1.0 es normal, <1.0 más lento, >1.0 más rápido (predeterminado: 1.0, rango: 0.7 - 1.3). -* `similarity_boost`: Refuerzo de similitud. Valores más altos hacen que la voz sea más similar a la original (predeterminado: 0.75, rango: 0.0 - 1.0). -* `use_speaker_boost`: Refuerza la similitud con la voz del hablante original (predeterminado: Falso). -* `style`: Exageración del estilo. Valores más altos aumentan la expresión estilística pero pueden reducir la estabilidad (predeterminado: 0.0, rango: 0.0 - 0.2). +### Entradas de eleven_multilingual_v2 -Cuando el parámetro `model` está configurado en `"eleven_v3"`, los siguientes parámetros adicionales están disponibles: +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `speed` | Velocidad del habla. 1.0 es normal, <1.0 más lento, >1.0 más rápido (por defecto: 1.0). | FLOAT | Sí | 0.7 - 1.3 | +| `similarity_boost` | Refuerzo de similitud. Los valores más altos hacen que la voz sea más similar a la original (por defecto: 0.75). | FLOAT | Sí | 0.0 - 1.0 | +| `use_speaker_boost` | Aumenta la similitud con la voz del hablante original (por defecto: False). | BOOLEAN | Sí | True
False | +| `style` | Exageración del estilo. Los valores más altos aumentan la expresión estilística pero pueden reducir la estabilidad (por defecto: 0.0). | FLOAT | Sí | 0.0 - 0.2 | -* `speed`: Velocidad del habla. 1.0 es normal, <1.0 más lento, >1.0 más rápido (predeterminado: 1.0, rango: 0.7 - 1.3). -* `similarity_boost`: Refuerzo de similitud. Valores más altos hacen que la voz sea más similar a la original (predeterminado: 0.75, rango: 0.0 - 1.0). +### Entradas de eleven_v3 + +| Parámetro | Descripción | Tipo de datos | Requerido | Rango | +|-----------|-------------|---------------|-----------|-------| +| `speed` | Velocidad del habla. 1.0 es normal, <1.0 más lento, >1.0 más rápido (por defecto: 1.0). | FLOAT | Sí | 0.7 - 1.3 | +| `similarity_boost` | Refuerzo de similitud. Los valores más altos hacen que la voz sea más similar a la original (por defecto: 0.75). | FLOAT | Sí | 0.0 - 1.0 | + +**Nota:** La entrada `text` debe contener al menos un carácter. Si `language_code` se deja vacío, el idioma se detecta automáticamente. Los parámetros `use_speaker_boost` y `style` están disponibles únicamente para el modelo `eleven_multilingual_v2`. ## Salidas -| Nombre de Salida | Descripción | Tipo de Dato | -| --- | --- | --- | +| Nombre de salida | Descripción | Tipo de datos | +|------------------|-------------|---------------| | `audio` | El audio generado a partir de la conversión de texto a voz. | AUDIO | > Esta documentación fue generada por IA. Si encuentra algún error o tiene sugerencias de mejora, ¡no dude en contribuir! [Editar en GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/es.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md index 5ae3dcf04..a431c6136 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md @@ -1,42 +1,47 @@ # تبدیل متن به گفتار ElevenLabs -### مرور کلی - -گره تبدیل متن به گفتار ElevenLabs، متن نوشته شده را با استفاده از API ElevenLabs به صدای گفتاری تبدیل می‌کند. این گره به شما امکان می‌دهد یک صدای خاص را انتخاب کرده و ویژگی‌های مختلف گفتار مانند ثبات، سرعت و سبک را تنظیم کنید تا خروجی صوتی سفارشی‌سازی شده تولید شود. +گره ElevenLabs Text to Speech متن نوشته‌شده را با استفاده از API مربوط به ElevenLabs به گفتار صوتی تبدیل می‌کند. این گره به شما امکان می‌دهد صدا را انتخاب کرده و ویژگی‌های گفتار مانند پایداری، سرعت و سبک را برای تولید خروجی صوتی سفارشی تنظیم کنید. ## ورودی‌ها +### ورودی‌های عمومی + | پارامتر | توضیحات | نوع داده | الزامی | محدوده | -| --- | --- | --- | --- | --- | -| `voice` | صدای مورد استفاده برای سنتز گفتار. از انتخابگر صدا یا شبیه‌سازی صدای فوری متصل کنید. | CUSTOM | بله | نامشخص | -| `text` | متنی که باید به گفتار تبدیل شود. | STRING | بله | نامشخص | -| `stability` | ثبات صدا. مقادیر پایین‌تر دامنه احساسی گسترده‌تری می‌دهند، مقادیر بالاتر گفتاری سازگارتر اما احتمالاً یکنواخت تولید می‌کنند (پیش‌فرض: 0.5). | FLOAT | خیر | 0.0 - 1.0 | -| `apply_text_normalization` | حالت نرمال‌سازی متن. 'auto' به سیستم اجازه تصمیم‌گیری می‌دهد، 'on' همیشه نرمال‌سازی را اعمال می‌کند، 'off' از آن صرف‌نظر می‌کند. | COMBO | خیر | `"auto"`
`"on"`
`"off"` | -| `model` | مدل مورد استفاده برای تبدیل متن به گفتار. انتخاب یک مدل پارامترهای خاص آن را نمایش می‌دهد. | DYNAMICCOMBO | خیر | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `language_code` | کد زبان ISO-639-1 یا ISO-639-3 (مثلاً 'en'، 'es'، 'fra'). برای تشخیص خودکار خالی بگذارید (پیش‌فرض: ""). | STRING | خیر | نامشخص | -| `seed` | دانه (seed) برای تکرارپذیری (تکرارپذیری تضمین نشده است) (پیش‌فرض: 1). | INT | خیر | 0 - 2147483647 | -| `output_format` | فرمت خروجی صوتی. | COMBO | خیر | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `model` | مدلی که برای تبدیل متن به گفتار استفاده می‌شود. انتخاب یک مدل، پارامترهای خاص آن را نمایش می‌دهد. | DYNAMIC_COMBO | بله | "eleven_multilingual_v2"
"eleven_v3" | +| `voice` | صدایی که برای تولید گفتار استفاده می‌شود. از Voice Selector یا Instant Voice Clone متصل کنید. | ELEVENLABS_VOICE | بله | N/A | +| `text` | متنی که به گفتار تبدیل می‌شود. باید حداقل یک نویسه داشته باشد. | STRING | بله | N/A | +| `stability` | پایداری صدا. مقادیر پایین‌تر دامنه احساسی گسترده‌تری می‌دهند، مقادیر بالاتر گفتاری منسجم‌تر اما احتمالاً یکنواخت تولید می‌کنند (پیش‌فرض: 0.5). | FLOAT | بله | 0.0 - 1.0 | +| `apply_text_normalization` | حالت نرمال‌سازی متن. 'auto' به سیستم اجازه تصمیم‌گیری می‌دهد، 'on' همیشه نرمال‌سازی را اعمال می‌کند، 'off' آن را نادیده می‌گیرد. | COMBO | بله | "auto"
"on"
"off" | +| `language_code` | کد زبان ISO-639-1 یا ISO-639-3 (مانند 'en', 'es', 'fra'). برای تشخیص خودکار خالی بگذارید (پیش‌فرض: ""). | STRING | بله | N/A | +| `seed` | مقدار seed برای تکرارپذیری (قطعیت تضمین نشده است) (پیش‌فرض: 1). | INT | بله | 0 - 2147483647 | +| `output_format` | قالب خروجی صدا. | COMBO | بله | "mp3_44100_192"
"opus_48000_192" | + +### ورودی‌های eleven_multilingual_v2 -**پارامترهای خاص مدل:** -زمانی که پارامتر `model` روی `"eleven_multilingual_v2"` تنظیم شود، پارامترهای اضافی زیر در دسترس قرار می‌گیرند: +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | +|-----------|-------------|-----------|----------|-------| +| `speed` | سرعت گفتار. 1.0 نرمال است، <1.0 کندتر، >1.0 سریع‌تر (پیش‌فرض: 1.0). | FLOAT | بله | 0.7 - 1.3 | +| `similarity_boost` | افزایش شباهت. مقادیر بالاتر صدا را به صدای اصلی شبیه‌تر می‌کنند (پیش‌فرض: 0.75). | FLOAT | بله | 0.0 - 1.0 | +| `use_speaker_boost` | افزایش شباهت به صدای گوینده اصلی (پیش‌فرض: False). | BOOLEAN | بله | True
False | +| `style` | غرابت سبک. مقادیر بالاتر بیان سبکی را افزایش می‌دهند اما ممکن است پایداری را کاهش دهند (پیش‌فرض: 0.0). | FLOAT | بله | 0.0 - 0.2 | -* `speed`: سرعت گفتار. 1.0 نرمال است، <1.0 کندتر، >1.0 سریع‌تر (پیش‌فرض: 1.0، محدوده: 0.7 - 1.3). -* `similarity_boost`: افزایش شباهت. مقادیر بالاتر صدا را به صدای اصلی شبیه‌تر می‌کند (پیش‌فرض: 0.75، محدوده: 0.0 - 1.0). -* `use_speaker_boost`: افزایش شباهت به صدای گوینده اصلی (پیش‌فرض: False). -* `style`: اغراق در سبک. مقادیر بالاتر بیان سبکی را افزایش می‌دهد اما ممکن است ثبات را کاهش دهد (پیش‌فرض: 0.0، محدوده: 0.0 - 0.2). +### ورودی‌های eleven_v3 -زمانی که پارامتر `model` روی `"eleven_v3"` تنظیم شود، پارامترهای اضافی زیر در دسترس قرار می‌گیرند: +| پارامتر | توضیحات | نوع داده | الزامی | محدوده | +|-----------|-------------|-----------|----------|-------| +| `speed` | سرعت گفتار. 1.0 نرمال است، <1.0 کندتر، >1.0 سریع‌تر (پیش‌فرض: 1.0). | FLOAT | بله | 0.7 - 1.3 | +| `similarity_boost` | افزایش شباهت. مقادیر بالاتر صدا را به صدای اصلی شبیه‌تر می‌کنند (پیش‌فرض: 0.75). | FLOAT | بله | 0.0 - 1.0 | -* `speed`: سرعت گفتار. 1.0 نرمال است، <1.0 کندتر، >1.0 سریع‌تر (پیش‌فرض: 1.0، محدوده: 0.7 - 1.3). -* `similarity_boost`: افزایش شباهت. مقادیر بالاتر صدا را به صدای اصلی شبیه‌تر می‌کند (پیش‌فرض: 0.75، محدوده: 0.0 - 1.0). +**نکته:** ورودی `text` باید حداقل یک نویسه داشته باشد. اگر `language_code` خالی بماند، زبان به صورت خودکار تشخیص داده می‌شود. پارامترهای `use_speaker_boost` و `style` فقط برای مدل `eleven_multilingual_v2` در دسترس هستند. ## خروجی‌ها | نام خروجی | توضیحات | نوع داده | -| --- | --- | --- | -| `audio` | صدای تولید شده از تبدیل متن به گفتار. | AUDIO | +|-------------|-------------|-----------| +| `audio` | صوت تولیدشده از تبدیل متن به گفتار. | AUDIO | > این مستند با هوش مصنوعی تهیه شده است. اگر خطایی دیدید یا پیشنهادی برای بهبود دارید، خوشحال می‌شویم مشارکت کنید! [ویرایش در GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fr.md index a80743fff..94fca8755 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fr.md @@ -1,42 +1,47 @@ # ElevenLabs Text to Speech -Voici la traduction en français de la documentation du nœud ElevenLabs Text to Speech : - -Le nœud ElevenLabs Text to Speech convertit du texte écrit en audio parlé à l'aide de l'API ElevenLabs. Il vous permet de sélectionner une voix spécifique et d'affiner diverses caractéristiques de la parole comme la stabilité, la vitesse et le style pour générer un résultat audio personnalisé. +Le nœud ElevenLabs Text to Speech convertit du texte écrit en audio parlé à l'aide de l'API ElevenLabs. Il permet de choisir une voix et d'ajuster des caractéristiques de la parole telles que la stabilité, la vitesse et le style pour créer une sortie audio personnalisée. ## Entrées +### Entrées communes + | Paramètre | Description | Type de données | Requis | Plage | -| --- | --- | --- | --- | --- | -| `voix` | Voix à utiliser pour la synthèse vocale. Connectez depuis le sélecteur de voix ou Instant Voice Clone. | CUSTOM | Oui | N/A | -| `texte` | Le texte à convertir en parole. | STRING | Oui | N/A | -| `stabilité` | Stabilité de la voix. Des valeurs plus faibles offrent une gamme émotionnelle plus large, des valeurs plus élevées produisent une parole plus cohérente mais potentiellement monotone (par défaut : 0.5). | FLOAT | Non | 0.0 - 1.0 | -| `appliquer la normalisation du texte` | Mode de normalisation du texte. 'auto' laisse le système décider, 'on' applique toujours la normalisation, 'off' l'ignore. | COMBO | Non | `"auto"`
`"on"`
`"off"` | -| `modèle` | Modèle à utiliser pour la synthèse vocale. La sélection d'un modèle révèle ses paramètres spécifiques. | DYNAMICCOMBO | Non | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `code langue` | Code de langue ISO-639-1 ou ISO-639-3 (par exemple, 'en', 'es', 'fra'). Laissez vide pour la détection automatique (par défaut : ""). | STRING | Non | N/A | -| `graine` | Graine pour la reproductibilité (déterminisme non garanti) (par défaut : 1). | INT | Non | 0 - 2147483647 | -| `format de sortie` | Format de sortie audio. | COMBO | Non | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------------|--------|-------| +| `modèle` | Modèle à utiliser pour la synthèse vocale. La sélection d'un modèle révèle ses paramètres spécifiques. | DYNAMIC_COMBO | Oui | "eleven_multilingual_v2"
"eleven_v3" | +| `voix` | Voix à utiliser pour la synthèse de la parole. Connectez-la depuis le sélecteur de voix ou le clone vocal instantané. | ELEVENLABS_VOICE | Oui | N/A | +| `texte` | Le texte à convertir en parole. Doit contenir au moins un caractère. | STRING | Oui | N/A | +| `stabilité` | Stabilité de la voix. Des valeurs plus faibles offrent une gamme émotionnelle plus large, des valeurs plus élevées produisent une parole plus cohérente mais potentiellement monotone (défaut : 0.5). | FLOAT | Oui | 0.0 - 1.0 | +| `appliquer la normalisation du texte` | Mode de normalisation du texte. 'auto' laisse le système décider, 'on' applique toujours la normalisation, 'off' l'ignore. | COMBO | Oui | "auto"
"on"
"off" | +| `code langue` | Code de langue ISO-639-1 ou ISO-639-3 (par ex., 'en', 'es', 'fra'). Laissez vide pour une détection automatique (défaut : ""). | STRING | Oui | N/A | +| `graine` | Graine pour la reproductibilité (déterminisme non garanti) (défaut : 1). | INT | Oui | 0 - 2147483647 | +| `format de sortie` | Format de sortie audio. | COMBO | Oui | "mp3_44100_192"
"opus_48000_192" | + +### Entrées eleven_multilingual_v2 -**Paramètres spécifiques au modèle :** -Lorsque le paramètre `model` est défini sur `"eleven_multilingual_v2"`, les paramètres supplémentaires suivants deviennent disponibles : +| Paramètre | Description | Type de données | Requis | Plage | +|-----------|-------------|-----------------|--------|-------| +| `speed` | Vitesse de la parole. 1.0 est normal, <1.0 plus lent, >1.0 plus rapide (défaut : 1.0). | FLOAT | Oui | 0.7 - 1.3 | +| `similarity_boost` | Renforcement de similarité. Des valeurs plus élevées rendent la voix plus similaire à l'originale (défaut : 0.75). | FLOAT | Oui | 0.0 - 1.0 | +| `use_speaker_boost` | Renforce la similarité avec la voix du locuteur d'origine (défaut : False). | BOOLEAN | Oui | True
False | +| `style` | Exagération du style. Des valeurs plus élevées augmentent l'expression stylistique mais peuvent réduire la stabilité (défaut : 0.0). | FLOAT | Oui | 0.0 - 0.2 | -* `speed` : Vitesse de la parole. 1.0 est normal, <1.0 plus lent, >1.0 plus rapide (par défaut : 1.0, plage : 0.7 - 1.3). -* `similarity_boost` : Renforcement de la similarité. Des valeurs plus élevées rendent la voix plus similaire à l'originale (par défaut : 0.75, plage : 0.0 - 1.0). -* `use_speaker_boost` : Renforcer la similarité avec la voix du locuteur d'origine (par défaut : False). -* `style` : Exagération du style. Des valeurs plus élevées augmentent l'expression stylistique mais peuvent réduire la stabilité (par défaut : 0.0, plage : 0.0 - 0.2). +### Entrées eleven_v3 -Lorsque le paramètre `model` est défini sur `"eleven_v3"`, les paramètres supplémentaires suivants deviennent disponibles : +| Paramètre | Description | Type de données | Requis | Plage | +|-----------|-------------|-----------------|--------|-------| +| `speed` | Vitesse de la parole. 1.0 est normal, <1.0 plus lent, >1.0 plus rapide (défaut : 1.0). | FLOAT | Oui | 0.7 - 1.3 | +| `similarity_boost` | Renforcement de similarité. Des valeurs plus élevées rendent la voix plus similaire à l'originale (défaut : 0.75). | FLOAT | Oui | 0.0 - 1.0 | -* `speed` : Vitesse de la parole. 1.0 est normal, <1.0 plus lent, >1.0 plus rapide (par défaut : 1.0, plage : 0.7 - 1.3). -* `similarity_boost` : Renforcement de la similarité. Des valeurs plus élevées rendent la voix plus similaire à l'originale (par défaut : 0.75, plage : 0.0 - 1.0). +**Remarque :** L'entrée `text` doit contenir au moins un caractère. Si `language_code` est laissé vide, la langue est détectée automatiquement. Les paramètres `use_speaker_boost` et `style` sont disponibles uniquement pour le modèle `eleven_multilingual_v2`. ## Sorties -| Nom de la sortie | Description | Type de données | -| --- | --- | --- | +| Nom de sortie | Description | Type de données | +|---------------|-------------|-----------------| | `audio` | L'audio généré à partir de la conversion texte-parole. | AUDIO | > Cette documentation a été générée par IA. Si vous trouvez des erreurs ou avez des suggestions d'amélioration, n'hésitez pas à contribuer ! [Modifier sur GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fr.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ja.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ja.md index 339d598ab..691d497ed 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ja.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ja.md @@ -1,42 +1,47 @@ # ElevenLabs テキスト読み上げ -以下が翻訳結果です。 - -ElevenLabs Text to Speech ノードは、ElevenLabs API を使用して、書き込まれたテキストを音声に変換します。特定の音声を選択し、安定性、速度、スタイルなどのさまざまな音声特性を微調整して、カスタマイズされた音声出力を生成できます。 +ElevenLabs Text to Speech ノードは、ElevenLabs API を使用して、テキストを音声に変換します。音声を選択し、安定性、速度、スタイルなどの音声特性を調整して、カスタマイズされた音声出力を作成できます。 ## 入力 +### 共通入力 + | パラメータ | 説明 | データ型 | 必須 | 範囲 | -| --- | --- | --- | --- | --- | -| `voice` | 音声合成に使用する音声です。Voice Selector または Instant Voice Clone から接続します。 | CUSTOM | はい | なし | -| `text` | 音声に変換するテキストです。 | STRING | はい | なし | -| `stability` | 音声の安定性です。値が低いと感情表現の幅が広がり、値が高いとより一貫性のある、ただし単調になりがちな音声になります(デフォルト: 0.5)。 | FLOAT | いいえ | 0.0 - 1.0 | -| `apply_text_normalization` | テキスト正規化モードです。"auto" はシステムが判断し、"on" は常に正規化を適用し、"off" はスキップします。 | COMBO | いいえ | `"auto"`
`"on"`
`"off"` | -| `model` | テキスト読み上げに使用するモデルです。モデルを選択すると、そのモデル固有のパラメータが表示されます。 | DYNAMICCOMBO | いいえ | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `language_code` | ISO-639-1 または ISO-639-3 言語コードです(例: 'en', 'es', 'fra')。自動検出の場合は空のままにします(デフォルト: "")。 | STRING | いいえ | なし | -| `seed` | 再現性のためのシード値です(決定性は保証されません)(デフォルト: 1)。 | INT | いいえ | 0 - 2147483647 | -| `output_format` | 音声出力フォーマットです。 | COMBO | いいえ | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `model` | テキスト読み上げに使用するモデル。モデルを選択すると、そのモデル固有のパラメータが表示されます。 | DYNAMIC_COMBO | はい | "eleven_multilingual_v2"
"eleven_v3" | +| `voice` | 音声合成に使用する音声。Voice Selector または Instant Voice Clone から接続します。 | ELEVENLABS_VOICE | はい | N/A | +| `text` | 音声に変換するテキスト。少なくとも1文字以上含める必要があります。 | STRING | はい | N/A | +| `stability` | 音声の安定性。値が低いほど感情表現の幅が広がり、値が高いほど一貫性がありますが、単調になる可能性があります(デフォルト: 0.5)。 | FLOAT | はい | 0.0 - 1.0 | +| `apply_text_normalization` | テキスト正規化モード。'auto' はシステムが自動的に判断し、'on' は常に正規化を適用し、'off' は正規化をスキップします。 | COMBO | はい | "auto"
"on"
"off" | +| `language_code` | ISO-639-1 または ISO-639-3 の言語コード(例: 'en', 'es', 'fra')。自動検出する場合は空のままにします(デフォルト: "")。 | STRING | はい | N/A | +| `seed` | 再現性のためのシード(決定性は保証されません)(デフォルト: 1)。 | INT | はい | 0 - 2147483647 | +| `output_format` | 音声出力形式。 | COMBO | はい | "mp3_44100_192"
"opus_48000_192" | + +### eleven_multilingual_v2 入力 -**モデル固有のパラメータ:** -`model` パラメータが `"eleven_multilingual_v2"` に設定されている場合、以下の追加パラメータが使用可能になります。 +| パラメータ | 説明 | データ型 | 必須 | 範囲 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 音声の速度。1.0 は通常、<1.0 は遅く、>1.0 は速くなります(デフォルト: 1.0)。 | FLOAT | はい | 0.7 - 1.3 | +| `similarity_boost` | 類似性の強調。値が高いほど、元の音声により似た音声になります(デフォルト: 0.75)。 | FLOAT | はい | 0.0 - 1.0 | +| `use_speaker_boost` | 元の話者音声への類似性を強調します(デフォルト: False)。 | BOOLEAN | はい | True
False | +| `style` | スタイルの誇張。値が高いほど様式的な表現が増しますが、安定性が低下する可能性があります(デフォルト: 0.0)。 | FLOAT | はい | 0.0 - 0.2 | -* `speed`: 音声の速度です。1.0 が標準で、<1.0 で遅く、>1.0 で速くなります(デフォルト: 1.0、範囲: 0.7 - 1.3)。 -* `similarity_boost`: 類似性の強調です。値が高いほど、元の音声に近くなります(デフォルト: 0.75、範囲: 0.0 - 1.0)。 -* `use_speaker_boost`: 元の話者の音声への類似性を強調します(デフォルト: False)。 -* `style`: スタイルの誇張です。値が高いとスタイル表現が強まりますが、安定性が低下する可能性があります(デフォルト: 0.0、範囲: 0.0 - 0.2)。 +### eleven_v3 入力 -`model` パラメータが `"eleven_v3"` に設定されている場合、以下の追加パラメータが使用可能になります。 +| パラメータ | 説明 | データ型 | 必須 | 範囲 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 音声の速度。1.0 は通常、<1.0 は遅く、>1.0 は速くなります(デフォルト: 1.0)。 | FLOAT | はい | 0.7 - 1.3 | +| `similarity_boost` | 類似性の強調。値が高いほど、元の音声により似た音声になります(デフォルト: 0.75)。 | FLOAT | はい | 0.0 - 1.0 | -* `speed`: 音声の速度です。1.0 が標準で、<1.0 で遅く、>1.0 で速くなります(デフォルト: 1.0、範囲: 0.7 - 1.3)。 -* `similarity_boost`: 類似性の強調です。値が高いほど、元の音声に近くなります(デフォルト: 0.75、範囲: 0.0 - 1.0)。 +**注記:** `text` 入力には少なくとも1文字以上含める必要があります。`language_code` を空のままにすると、言語が自動的に検出されます。`use_speaker_boost` と `style` パラメータは、`eleven_multilingual_v2` モデルでのみ使用できます。 ## 出力 | 出力名 | 説明 | データ型 | -| --- | --- | --- | -| `audio` | テキスト読み上げ変換によって生成された音声です。 | AUDIO | +|-------------|-------------|-----------| +| `audio` | テキスト読み上げ変換によって生成された音声。 | AUDIO | > このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ja.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ko.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ko.md index 59c5cbbd0..e99dca76f 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ko.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ko.md @@ -1,40 +1,47 @@ # ElevenLabs 텍스트 음성 변환 -ElevenLabs 텍스트 음성 변환 노드는 ElevenLabs API를 사용하여 작성된 텍스트를 음성 오디오로 변환합니다. 특정 음성을 선택하고 안정성, 속도, 스타일과 같은 다양한 음성 특성을 미세 조정하여 맞춤형 오디오 출력을 생성할 수 있습니다. +ElevenLabs Text to Speech 노드는 ElevenLabs API를 사용하여 작성된 텍스트를 음성 오디오로 변환합니다. 음성을 선택하고 안정성, 속도, 스타일과 같은 음성 특성을 조정하여 맞춤형 오디오 출력을 생성할 수 있습니다. ## 입력 -| 매개변수 | 설명 | 데이터 타입 | 필수 여부 | 범위 | -| --- | --- | --- | --- | --- | -| `voice` | 음성 합성에 사용할 음성입니다. 음성 선택기 또는 즉시 음성 복제에서 연결하세요. | CUSTOM | 예 | 해당 없음 | -| `text` | 음성으로 변환할 텍스트입니다. | STRING | 예 | 해당 없음 | -| `stability` | 음성 안정성입니다. 값이 낮을수록 더 넓은 감정 표현 범위를 제공하고, 값이 높을수록 더 일관되지만 단조로운 음성을 생성합니다(기본값: 0.5). | FLOAT | 아니요 | 0.0 - 1.0 | -| `apply_text_normalization` | 텍스트 정규화 모드입니다. 'auto'는 시스템이 결정하도록 하고, 'on'은 항상 정규화를 적용하며, 'off'는 정규화를 건너뜁니다. | COMBO | 아니요 | `"auto"`
`"on"`
`"off"` | -| `model` | 텍스트 음성 변환에 사용할 모델입니다. 모델을 선택하면 해당 모델의 특정 매개변수가 표시됩니다. | DYNAMICCOMBO | 아니요 | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `language_code` | ISO-639-1 또는 ISO-639-3 언어 코드입니다(예: 'en', 'es', 'fra'). 자동 감지를 위해 비워 두세요(기본값: ""). | STRING | 아니요 | 해당 없음 | -| `seed` | 재현성을 위한 시드입니다(결정론적 결과는 보장되지 않음)(기본값: 1). | INT | 아니요 | 0 - 2147483647 | -| `output_format` | 오디오 출력 형식입니다. | COMBO | 아니요 | `"mp3_44100_192"`
`"opus_48000_192"` | +### 공통 입력 -**모델별 매개변수:** -`model` 매개변수가 `"eleven_multilingual_v2"`로 설정된 경우 다음 추가 매개변수를 사용할 수 있습니다: +| 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | +|-----------|-------------|-----------|----------|-------| +| `model` | 텍스트 음성 변환에 사용할 모델입니다. 모델을 선택하면 해당 모델의 특정 매개변수가 표시됩니다. | DYNAMIC_COMBO | 예 | "eleven_multilingual_v2"
"eleven_v3" | +| `voice` | 음성 합성에 사용할 음성입니다. Voice Selector 또는 Instant Voice Clone에서 연결하세요. | ELEVENLABS_VOICE | 예 | N/A | +| `text` | 음성으로 변환할 텍스트입니다. 최소 한 글자 이상이어야 합니다. | STRING | 예 | N/A | +| `stability` | 음성 안정성입니다. 값이 낮을수록 더 넓은 감정 표현이 가능하고, 값이 높을수록 더 일관되지만 잠재적으로 단조로운 음성이 생성됩니다 (기본값: 0.5). | FLOAT | 예 | 0.0 - 1.0 | +| `apply_text_normalization` | 텍스트 정규화 모드입니다. 'auto'는 시스템이 결정하고, 'on'은 항상 정규화를 적용하며, 'off'는 정규화를 건너뜁니다. | COMBO | 예 | "auto"
"on"
"off" | +| `language_code` | ISO-639-1 또는 ISO-639-3 언어 코드입니다 (예: 'en', 'es', 'fra'). 자동 감지를 위해 비워 두세요 (기본값: ""). | STRING | 예 | N/A | +| `seed` | 재현을 위한 시드입니다 (결정적 결과는 보장되지 않음) (기본값: 1). | INT | 예 | 0 - 2147483647 | +| `output_format` | 오디오 출력 형식입니다. | COMBO | 예 | "mp3_44100_192"
"opus_48000_192" | -* `speed`: 음성 속도입니다. 1.0은 보통, <1.0은 느리게, >1.0은 빠르게 설정합니다(기본값: 1.0, 범위: 0.7 - 1.3). -* `similarity_boost`: 유사도 향상입니다. 값이 높을수록 음성이 원본과 더 유사해집니다(기본값: 0.75, 범위: 0.0 - 1.0). -* `use_speaker_boost`: 원본 화자 음성과의 유사도를 향상시킵니다(기본값: False). -* `style`: 스타일 강조입니다. 값이 높을수록 스타일 표현이 증가하지만 안정성이 감소할 수 있습니다(기본값: 0.0, 범위: 0.0 - 0.2). +### eleven_multilingual_v2 입력 -`model` 매개변수가 `"eleven_v3"`로 설정된 경우 다음 추가 매개변수를 사용할 수 있습니다: +| 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 음성 속도입니다. 1.0은 보통 속도이며, <1.0은 느리게, >1.0은 빠르게 재생됩니다 (기본값: 1.0). | FLOAT | 예 | 0.7 - 1.3 | +| `similarity_boost` | 유사도 부스트입니다. 값이 높을수록 원본 음성과 더 유사해집니다 (기본값: 0.75). | FLOAT | 예 | 0.0 - 1.0 | +| `use_speaker_boost` | 원본 화자 음성과의 유사도를 향상시킵니다 (기본값: False). | BOOLEAN | 예 | True
False | +| `style` | 스타일 과장 정도입니다. 값이 높을수록 스타일 표현이 증가하지만 안정성이 감소할 수 있습니다 (기본값: 0.0). | FLOAT | 예 | 0.0 - 0.2 | -* `speed`: 음성 속도입니다. 1.0은 보통, <1.0은 느리게, >1.0은 빠르게 설정합니다(기본값: 1.0, 범위: 0.7 - 1.3). -* `similarity_boost`: 유사도 향상입니다. 값이 높을수록 음성이 원본과 더 유사해집니다(기본값: 0.75, 범위: 0.0 - 1.0). +### eleven_v3 입력 + +| 매개변수 | 설명 | 데이터 타입 | 필수 | 범위 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 음성 속도입니다. 1.0은 보통 속도이며, <1.0은 느리게, >1.0은 빠르게 재생됩니다 (기본값: 1.0). | FLOAT | 예 | 0.7 - 1.3 | +| `similarity_boost` | 유사도 부스트입니다. 값이 높을수록 원본 음성과 더 유사해집니다 (기본값: 0.75). | FLOAT | 예 | 0.0 - 1.0 | + +**참고:** `text` 입력에는 최소 한 글자 이상이 포함되어야 합니다. `language_code`를 비워 두면 언어가 자동으로 감지됩니다. `use_speaker_boost` 및 `style` 매개변수는 `eleven_multilingual_v2` 모델에서만 사용할 수 있습니다. ## 출력 | 출력 이름 | 설명 | 데이터 타입 | -| --- | --- | --- | +|-------------|-------------|-----------| | `audio` | 텍스트 음성 변환으로 생성된 오디오입니다. | AUDIO | > 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ko.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/pt-BR.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/pt-BR.md index 085533640..2fc3b7a33 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/pt-BR.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/pt-BR.md @@ -1,40 +1,47 @@ # ElevenLabs Text to Speech -O nó ElevenLabs Text to Speech converte texto escrito em áudio falado usando a API ElevenLabs. Ele permite selecionar uma voz específica e ajustar várias características da fala, como estabilidade, velocidade e estilo, para gerar uma saída de áudio personalizada. +O nó ElevenLabs Text to Speech converte texto escrito em áudio falado usando a API ElevenLabs. Ele permite escolher uma voz e ajustar características da fala, como estabilidade, velocidade e estilo, para criar uma saída de áudio personalizada. ## Entradas -| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Faixa | -| --- | --- | --- | --- | --- | -| `voz` | Voz a ser usada na síntese de fala. Conecte a partir do Seletor de Voz ou Clone Instantâneo de Voz. | CUSTOM | Sim | N/A | -| `texto` | O texto a ser convertido em fala. | STRING | Sim | N/A | -| `estabilidade` | Estabilidade da voz. Valores mais baixos proporcionam uma faixa emocional mais ampla; valores mais altos produzem uma fala mais consistente, mas potencialmente monótona (padrão: 0.5). | FLOAT | Não | 0.0 - 1.0 | -| `aplicar normalização de texto` | Modo de normalização de texto. 'auto' permite que o sistema decida, 'on' sempre aplica a normalização, 'off' a ignora. | COMBO | Não | `"auto"`
`"on"`
`"off"` | -| `modelo` | Modelo a ser usado para conversão de texto em fala. Selecionar um modelo revela seus parâmetros específicos. | DYNAMICCOMBO | Não | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `código do idioma` | Código de idioma ISO-639-1 ou ISO-639-3 (ex.: 'en', 'es', 'fra'). Deixe vazio para detecção automática (padrão: ""). | STRING | Não | N/A | -| `semente` | Semente para reprodutibilidade (determinismo não garantido) (padrão: 1). | INT | Não | 0 - 2147483647 | -| `formato de saída` | Formato de saída de áudio. | COMBO | Não | `"mp3_44100_192"`
`"opus_48000_192"` | +### Entradas comuns -**Parâmetros Específicos do Modelo:** -Quando o parâmetro `model` está definido como `"eleven_multilingual_v2"`, os seguintes parâmetros adicionais ficam disponíveis: +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | +|-----------|-------------|-----------|----------|-------| +| `modelo` | Modelo a ser usado para conversão de texto em fala. Selecionar um modelo revela seus parâmetros específicos. | DYNAMIC_COMBO | Sim | "eleven_multilingual_v2"
"eleven_v3" | +| `voz` | Voz a ser usada para a síntese de fala. Conecte a partir do Voice Selector ou do Instant Voice Clone. | ELEVENLABS_VOICE | Sim | N/A | +| `texto` | O texto a ser convertido em fala. Deve conter pelo menos um caractere. | STRING | Sim | N/A | +| `estabilidade` | Estabilidade da voz. Valores mais baixos proporcionam uma gama emocional mais ampla; valores mais altos produzem fala mais consistente, mas potencialmente monótona (padrão: 0,5). | FLOAT | Sim | 0.0 - 1.0 | +| `aplicar normalização de texto` | Modo de normalização de texto. 'auto' permite que o sistema decida, 'on' sempre aplica a normalização, 'off' a ignora. | COMBO | Sim | "auto"
"on"
"off" | +| `código do idioma` | Código de idioma ISO-639-1 ou ISO-639-3 (por exemplo, 'en', 'es', 'fra'). Deixe vazio para detecção automática (padrão: ""). | STRING | Sim | N/A | +| `semente` | Semente para reprodutibilidade (determinismo não garantido) (padrão: 1). | INT | Sim | 0 - 2147483647 | +| `formato de saída` | Formato de saída de áudio. | COMBO | Sim | "mp3_44100_192"
"opus_48000_192" | -* `speed`: Velocidade da fala. 1.0 é normal, <1.0 mais lento, >1.0 mais rápido (padrão: 1.0, faixa: 0.7 - 1.3). -* `similarity_boost`: Reforço de similaridade. Valores mais altos tornam a voz mais semelhante à original (padrão: 0.75, faixa: 0.0 - 1.0). -* `use_speaker_boost`: Reforça a similaridade com a voz do locutor original (padrão: Falso). -* `style`: Exagero de estilo. Valores mais altos aumentam a expressão estilística, mas podem reduzir a estabilidade (padrão: 0.0, faixa: 0.0 - 0.2). +### Entradas do eleven_multilingual_v2 -Quando o parâmetro `model` está definido como `"eleven_v3"`, os seguintes parâmetros adicionais ficam disponíveis: +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | +|-----------|-------------|-----------|----------|-------| +| `speed` | Velocidade da fala. 1.0 é o normal, <1.0 mais lenta, >1.0 mais rápida (padrão: 1,0). | FLOAT | Sim | 0.7 - 1.3 | +| `similarity_boost` | Reforço de similaridade. Valores mais altos tornam a voz mais semelhante à original (padrão: 0,75). | FLOAT | Sim | 0.0 - 1.0 | +| `use_speaker_boost` | Reforçar a similaridade com a voz do locutor original (padrão: False). | BOOLEAN | Sim | True
False | +| `style` | Exagero de estilo. Valores mais altos aumentam a expressão estilística, mas podem reduzir a estabilidade (padrão: 0,0). | FLOAT | Sim | 0.0 - 0.2 | -* `speed`: Velocidade da fala. 1.0 é normal, <1.0 mais lento, >1.0 mais rápido (padrão: 1.0, faixa: 0.7 - 1.3). -* `similarity_boost`: Reforço de similaridade. Valores mais altos tornam a voz mais semelhante à original (padrão: 0.75, faixa: 0.0 - 1.0). +### Entradas do eleven_v3 + +| Parâmetro | Descrição | Tipo de Dados | Obrigatório | Intervalo | +|-----------|-------------|-----------|----------|-------| +| `speed` | Velocidade da fala. 1.0 é o normal, <1.0 mais lenta, >1.0 mais rápida (padrão: 1,0). | FLOAT | Sim | 0.7 - 1.3 | +| `similarity_boost` | Reforço de similaridade. Valores mais altos tornam a voz mais semelhante à original (padrão: 0,75). | FLOAT | Sim | 0.0 - 1.0 | + +**Observação:** A entrada `text` deve conter pelo menos um caractere. Se `language_code` for deixado vazio, o idioma será detectado automaticamente. Os parâmetros `use_speaker_boost` e `style` estão disponíveis apenas para o modelo `eleven_multilingual_v2`. ## Saídas | Nome da Saída | Descrição | Tipo de Dados | -| --- | --- | --- | +|-------------|-------------|-----------| | `audio` | O áudio gerado a partir da conversão de texto em fala. | AUDIO | > Esta documentação foi gerada por IA. Se você encontrar erros ou tiver sugestões de melhoria, sinta-se à vontade para contribuir! [Editar no GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/pt-BR.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ru.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ru.md index b46dc76dc..42a87e79a 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ru.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ru.md @@ -1,42 +1,47 @@ # ElevenLabs Text to Speech -Вот перевод документации на русский язык: +Узел ElevenLabs Text to Speech преобразует письменный текст в озвученное аудио с помощью API ElevenLabs. Он позволяет выбрать голос и настроить характеристики речи, такие как стабильность, скорость и стиль, для создания настраиваемого аудиовыхода. -Узел ElevenLabs Text to Speech преобразует письменный текст в озвученное аудио с использованием API ElevenLabs. Он позволяет выбрать конкретный голос и точно настроить различные характеристики речи, такие как стабильность, скорость и стиль, для создания настраиваемого аудиовыхода. +## Входы -## Входные параметры +### Общие входы | Параметр | Описание | Тип данных | Обязательный | Диапазон | -| --- | --- | --- | --- | --- | -| `voice` | Голос для синтеза речи. Подключите от Voice Selector или Instant Voice Clone. | CUSTOM | Да | Н/Д | -| `text` | Текст для преобразования в речь. | STRING | Да | Н/Д | -| `stability` | Стабильность голоса. Более низкие значения дают более широкий эмоциональный диапазон, более высокие значения обеспечивают более стабильную, но потенциально монотонную речь (по умолчанию: 0.5). | FLOAT | Нет | 0.0 - 1.0 | -| `apply_text_normalization` | Режим нормализации текста. 'auto' позволяет системе решать, 'on' всегда применяет нормализацию, 'off' пропускает её. | COMBO | Нет | `"auto"`
`"on"`
`"off"` | -| `model` | Модель для преобразования текста в речь. Выбор модели открывает её специфические параметры. | DYNAMICCOMBO | Нет | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `language_code` | Код языка ISO-639-1 или ISO-639-3 (например, 'en', 'es', 'fra'). Оставьте пустым для автоматического определения (по умолчанию: ""). | STRING | Нет | Н/Д | -| `seed` | Сид для воспроизводимости (детерминированность не гарантируется) (по умолчанию: 1). | INT | Нет | 0 - 2147483647 | -| `output_format` | Формат аудиовыхода. | COMBO | Нет | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `model` | Модель для преобразования текста в речь. Выбор модели отображает её специфические параметры. | DYNAMIC_COMBO | Да | "eleven_multilingual_v2"
"eleven_v3" | +| `voice` | Голос для синтеза речи. Подключите из Voice Selector или Instant Voice Clone. | ELEVENLABS_VOICE | Да | Н/Д | +| `text` | Текст для преобразования в речь. Должен содержать хотя бы один символ. | STRING | Да | Н/Д | +| `stability` | Стабильность голоса. Более низкие значения дают более широкий эмоциональный диапазон, более высокие значения обеспечивают более стабильную, но потенциально монотонную речь (по умолчанию: 0.5). | FLOAT | Да | 0.0 - 1.0 | +| `apply_text_normalization` | Режим нормализации текста. 'auto' позволяет системе решать, 'on' всегда применяет нормализацию, 'off' пропускает её. | COMBO | Да | "auto"
"on"
"off" | +| `language_code` | Код языка ISO-639-1 или ISO-639-3 (например, 'en', 'es', 'fra'). Оставьте пустым для автоматического определения (по умолчанию: ""). | STRING | Да | Н/Д | +| `seed` | Сид для воспроизводимости (детерминизм не гарантируется) (по умолчанию: 1). | INT | Да | 0 - 2147483647 | +| `output_format` | Формат аудиовыхода. | COMBO | Да | "mp3_44100_192"
"opus_48000_192" | + +### eleven_multilingual_v2 Входы -**Параметры, специфичные для модели:** -Когда параметр `model` установлен в `"eleven_multilingual_v2"`, становятся доступны следующие дополнительные параметры: +| Параметр | Описание | Тип данных | Обязательный | Диапазон | +|-----------|-------------|-----------|----------|-------| +| `speed` | Скорость речи. 1.0 — нормальная, <1.0 — медленнее, >1.0 — быстрее (по умолчанию: 1.0). | FLOAT | Да | 0.7 - 1.3 | +| `similarity_boost` | Усиление сходства. Более высокие значения делают голос более похожим на оригинал (по умолчанию: 0.75). | FLOAT | Да | 0.0 - 1.0 | +| `use_speaker_boost` | Усилить сходство с оригинальным голосом диктора (по умолчанию: False). | BOOLEAN | Да | True
False | +| `style` | Стилистическое преувеличение. Более высокие значения усиливают стилистическую выразительность, но могут снизить стабильность (по умолчанию: 0.0). | FLOAT | Да | 0.0 - 0.2 | -* `speed`: Скорость речи. 1.0 — нормальная, <1.0 — медленнее, >1.0 — быстрее (по умолчанию: 1.0, диапазон: 0.7 - 1.3). -* `similarity_boost`: Усиление сходства. Более высокие значения делают голос более похожим на оригинал (по умолчанию: 0.75, диапазон: 0.0 - 1.0). -* `use_speaker_boost`: Усилить сходство с оригинальным голосом диктора (по умолчанию: False). -* `style`: Преувеличение стиля. Более высокие значения усиливают стилистическую выразительность, но могут снизить стабильность (по умолчанию: 0.0, диапазон: 0.0 - 0.2). +### eleven_v3 Входы -Когда параметр `model` установлен в `"eleven_v3"`, становятся доступны следующие дополнительные параметры: +| Параметр | Описание | Тип данных | Обязательный | Диапазон | +|-----------|-------------|-----------|----------|-------| +| `speed` | Скорость речи. 1.0 — нормальная, <1.0 — медленнее, >1.0 — быстрее (по умолчанию: 1.0). | FLOAT | Да | 0.7 - 1.3 | +| `similarity_boost` | Усиление сходства. Более высокие значения делают голос более похожим на оригинал (по умолчанию: 0.75). | FLOAT | Да | 0.0 - 1.0 | -* `speed`: Скорость речи. 1.0 — нормальная, <1.0 — медленнее, >1.0 — быстрее (по умолчанию: 1.0, диапазон: 0.7 - 1.3). -* `similarity_boost`: Усиление сходства. Более высокие значения делают голос более похожим на оригинал (по умолчанию: 0.75, диапазон: 0.0 - 1.0). +**Примечание:** Входной параметр `text` должен содержать хотя бы один символ. Если `language_code` оставлен пустым, язык определяется автоматически. Параметры `use_speaker_boost` и `style` доступны только для модели `eleven_multilingual_v2`. -## Выходные параметры +## Выходы | Имя выхода | Описание | Тип данных | -| --- | --- | --- | -| `audio` | Сгенерированное аудио в результате преобразования текста в речь. | AUDIO | +|-------------|-------------|-----------| +| `audio` | Сгенерированное аудио из преобразования текста в речь. | AUDIO | > Эта документация была создана с помощью ИИ. Если вы обнаружите ошибки или у вас есть предложения по улучшению, пожалуйста, внесите свой вклад! [Редактировать на GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ru.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md index 922ced015..2b856ba0b 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md @@ -1,40 +1,47 @@ # ElevenLabs Metinden Konuşmaya -ElevenLabs Metin-Konuşma düğümü, yazılı metni ElevenLabs API'sini kullanarak sesli konuşmaya dönüştürür. Belirli bir ses seçmenize ve stabilite, hız ve stil gibi çeşitli konuşma özelliklerini ince ayarlayarak özelleştirilmiş bir ses çıktısı oluşturmanıza olanak tanır. +ElevenLabs Text to Speech düğümü, ElevenLabs API'sini kullanarak yazılı metni sese dönüştürür. Bir ses seçmenize ve özelleştirilmiş ses çıktısı oluşturmak için stabilite, hız ve stil gibi konuşma özelliklerini ayarlamanıza olanak tanır. -## Girişler +## Girdiler + +### Genel Girdiler | Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | -| --- | --- | --- | --- | --- | -| `ses` | Ses sentezi için kullanılacak ses. Ses Seçici veya Anlık Ses Klonlama'dan bağlayın. | CUSTOM | Evet | Yok | -| `metin` | Sese dönüştürülecek metin. | STRING | Evet | Yok | -| `kararlılık` | Ses stabilitesi. Düşük değerler daha geniş duygusal aralık sağlar, yüksek değerler daha tutarlı ancak potansiyel olarak monoton konuşma üretir (varsayılan: 0.5). | FLOAT | Hayır | 0.0 - 1.0 | -| `metin normalizasyonunu uygula` | Metin normalizasyon modu. 'auto' sistemin karar vermesini sağlar, 'on' her zaman normalizasyon uygular, 'off' atlar. | COMBO | Hayır | `"auto"`
`"on"`
`"off"` | -| `model` | Metin-konuşma için kullanılacak model. Bir model seçmek, o modele özgü parametreleri gösterir. | DYNAMICCOMBO | Hayır | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `dil_kodu` | ISO-639-1 veya ISO-639-3 dil kodu (örn. 'en', 'es', 'fra'). Otomatik algılama için boş bırakın (varsayılan: ""). | STRING | Hayır | Yok | -| `tohum` | Tekrarlanabilirlik için tohum değeri (determinizm garanti edilmez) (varsayılan: 1). | INT | Hayır | 0 - 2147483647 | -| `çıktı_formatı` | Ses çıktı formatı. | COMBO | Hayır | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `model` | Metinden sese sentez için kullanılacak model. Bir model seçmek, modele özgü parametreleri görüntüler. | DYNAMIC_COMBO | Evet | "eleven_multilingual_v2"
"eleven_v3" | +| `ses` | Konuşma sentezi için kullanılacak ses. Voice Selector veya Instant Voice Clone'dan bağlayın. | ELEVENLABS_VOICE | Evet | N/A | +| `metin` | Konuşmaya dönüştürülecek metin. En az bir karakter içermelidir. | STRING | Evet | N/A | +| `kararlılık` | Ses stabilitesi. Düşük değerler daha geniş duygusal aralık sağlar, yüksek değerler daha tutarlı ancak potansiyel olarak tekdüze konuşma üretir (varsayılan: 0.5). | FLOAT | Evet | 0.0 - 1.0 | +| `metin normalizasyonunu uygula` | Metin normalizasyon modu. 'auto' sistemin karar vermesini sağlar, 'on' normalizasyonu her zaman uygular, 'off' atlar. | COMBO | Evet | "auto"
"on"
"off" | +| `dil_kodu` | ISO-639-1 veya ISO-639-3 dil kodu (örn. 'en', 'es', 'fra'). Otomatik algılama için boş bırakın (varsayılan: ""). | STRING | Evet | N/A | +| `tohum` | Tekrarlanabilirlik için tohum (determinizm garanti edilmez) (varsayılan: 1). | INT | Evet | 0 - 2147483647 | +| `çıktı_formatı` | Ses çıktı biçimi. | COMBO | Evet | "mp3_44100_192"
"opus_48000_192" | + +### eleven_multilingual_v2 Girdileri -**Modele Özgü Parametreler:** -`model` parametresi `"eleven_multilingual_v2"` olarak ayarlandığında, aşağıdaki ek parametreler kullanılabilir hale gelir: +| Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | +|-----------|-------------|-----------|----------|-------| +| `speed` | Konuşma hızı. 1.0 normal, <1.0 yavaş, >1.0 hızlı (varsayılan: 1.0). | FLOAT | Evet | 0.7 - 1.3 | +| `similarity_boost` | Benzerlik artırma. Yüksek değerler sesi orijinaline daha benzer hale getirir (varsayılan: 0.75). | FLOAT | Evet | 0.0 - 1.0 | +| `use_speaker_boost` | Orijinal konuşmacı sesine benzerliği artır (varsayılan: False). | BOOLEAN | Evet | True
False | +| `style` | Stil abartısı. Yüksek değerler stilistik ifadeyi artırır ancak stabiliteyi azaltabilir (varsayılan: 0.0). | FLOAT | Evet | 0.0 - 0.2 | -* `speed`: Konuşma hızı. 1.0 normal, <1.0 yavaş, >1.0 hızlı (varsayılan: 1.0, aralık: 0.7 - 1.3). -* `similarity_boost`: Benzerlik artırma. Yüksek değerler sesi orijinale daha benzer hale getirir (varsayılan: 0.75, aralık: 0.0 - 1.0). -* `use_speaker_boost`: Orijinal konuşmacı sesine benzerliği artırır (varsayılan: False). -* `style`: Stil abartma. Yüksek değerler stilistik ifadeyi artırır ancak stabiliteyi azaltabilir (varsayılan: 0.0, aralık: 0.0 - 0.2). +### eleven_v3 Girdileri -`model` parametresi `"eleven_v3"` olarak ayarlandığında, aşağıdaki ek parametreler kullanılabilir hale gelir: +| Parametre | Açıklama | Veri Türü | Zorunlu | Aralık | +|-----------|-------------|-----------|----------|-------| +| `speed` | Konuşma hızı. 1.0 normal, <1.0 yavaş, >1.0 hızlı (varsayılan: 1.0). | FLOAT | Evet | 0.7 - 1.3 | +| `similarity_boost` | Benzerlik artırma. Yüksek değerler sesi orijinaline daha benzer hale getirir (varsayılan: 0.75). | FLOAT | Evet | 0.0 - 1.0 | -* `speed`: Konuşma hızı. 1.0 normal, <1.0 yavaş, >1.0 hızlı (varsayılan: 1.0, aralık: 0.7 - 1.3). -* `similarity_boost`: Benzerlik artırma. Yüksek değerler sesi orijinale daha benzer hale getirir (varsayılan: 0.75, aralık: 0.0 - 1.0). +**Not:** `text` girdisi en az bir karakter içermelidir. `language_code` boş bırakılırsa dil otomatik olarak algılanır. `use_speaker_boost` ve `style` parametreleri yalnızca `eleven_multilingual_v2` modeli için kullanılabilir. ## Çıktılar | Çıktı Adı | Açıklama | Veri Türü | -| --- | --- | --- | -| `audio` | Metin-konuşma dönüşümünden oluşturulan ses. | AUDIO | +|-------------|-------------|-----------| +| `audio` | Metinden sese dönüştürme sonucu oluşturulan ses. | AUDIO | > Bu belge yapay zeka tarafından oluşturulmuştur. Herhangi bir hata bulursanız veya iyileştirme önerileriniz varsa, katkıda bulunmaktan çekinmeyin! [GitHub'da Düzenle](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md index 08d26ffdc..88f0ff6c9 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md @@ -1,42 +1,47 @@ # ElevenLabs 語音合成 -## 概述 - -ElevenLabs 文字轉語音節點使用 ElevenLabs API 將書面文字轉換為口語音訊。它允許您選擇特定的語音,並微調各種語音特徵,如穩定性、速度和風格,以產生自訂的音訊輸出。 +ElevenLabs 文字轉語音節點使用 ElevenLabs API 將書面文字轉換為語音音訊。您可以選擇語音,並調整穩定性、速度和風格等語音特徵,以建立自訂音訊輸出。 ## 輸入 +### 通用輸入 + | 參數 | 說明 | 資料類型 | 必要 | 範圍 | -| --- | --- | --- | --- | --- | -| `語音` | 用於語音合成的語音。從語音選擇器或即時語音克隆連接。 | CUSTOM | 是 | N/A | -| `文字` | 要轉換為語音的文字。 | STRING | 是 | N/A | -| `穩定性` | 語音穩定性。較低的值提供更廣泛的情感範圍,較高的值產生更一致但可能單調的語音(預設值:0.5)。 | FLOAT | 否 | 0.0 - 1.0 | -| `套用文字正規化` | 文字正規化模式。'auto' 讓系統決定,'on' 始終套用正規化,'off' 跳過正規化。 | COMBO | 否 | `"auto"`
`"on"`
`"off"` | -| `模型` | 用於文字轉語音的模型。選擇模型會顯示其特定參數。 | DYNAMICCOMBO | 否 | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `語言代碼` | ISO-639-1 或 ISO-639-3 語言代碼(例如 'en'、'es'、'fra')。留空以進行自動偵測(預設值:"")。 | STRING | 否 | N/A | -| `種子值` | 用於可重現性的種子(不保證確定性)(預設值:1)。 | INT | 否 | 0 - 2147483647 | -| `輸出格式` | 音訊輸出格式。 | COMBO | 否 | `"mp3_44100_192"`
`"opus_48000_192"` | +|-----------|-------------|-----------|----------|-------| +| `模型` | 用於文字轉語音的模型。選擇模型會顯示其特定參數。 | DYNAMIC_COMBO | 是 | "eleven_multilingual_v2"
"eleven_v3" | +| `語音` | 用於語音合成的語音。從語音選擇器或即時語音複製連接。 | ELEVENLABS_VOICE | 是 | N/A | +| `文字` | 要轉換為語音的文字。必須至少包含一個字元。 | STRING | 是 | N/A | +| `穩定性` | 語音穩定性。較低的值提供更廣泛的情緒範圍,較高的值產生更一致但可能單調的語音(預設值:0.5)。 | FLOAT | 是 | 0.0 - 1.0 | +| `套用文字正規化` | 文字正規化模式。'auto' 讓系統自行決定,'on' 一律套用正規化,'off' 則跳過。 | COMBO | 是 | "auto"
"on"
"off" | +| `語言代碼` | ISO-639-1 或 ISO-639-3 語言代碼(例如 'en'、'es'、'fra')。留空以進行自動偵測(預設值:"")。 | STRING | 是 | N/A | +| `種子值` | 用於可重現性的種子(不保證確定性)(預設值:1)。 | INT | 是 | 0 - 2147483647 | +| `輸出格式` | 音訊輸出格式。 | COMBO | 是 | "mp3_44100_192"
"opus_48000_192" | + +### eleven_multilingual_v2 輸入 -**模型特定參數:** -當 `model` 參數設定為 `"eleven_multilingual_v2"` 時,以下額外參數將變為可用: +| 參數 | 說明 | 資料類型 | 必要 | 範圍 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 語音速度。1.0 為正常,<1.0 較慢,>1.0 較快(預設值:1.0)。 | FLOAT | 是 | 0.7 - 1.3 | +| `similarity_boost` | 相似度增強。較高的值使語音更接近原始語音(預設值:0.75)。 | FLOAT | 是 | 0.0 - 1.0 | +| `use_speaker_boost` | 增強與原始說話者語音的相似度(預設值:False)。 | BOOLEAN | 是 | True
False | +| `style` | 風格誇張程度。較高的值增加風格表現,但可能降低穩定性(預設值:0.0)。 | FLOAT | 是 | 0.0 - 0.2 | -* `speed`:語音速度。1.0 為正常,<1.0 較慢,>1.0 較快(預設值:1.0,範圍:0.7 - 1.3)。 -* `similarity_boost`:相似度增強。較高的值使語音更接近原始語音(預設值:0.75,範圍:0.0 - 1.0)。 -* `use_speaker_boost`:增強與原始說話者語音的相似度(預設值:False)。 -* `style`:風格誇張程度。較高的值會增加風格表現力,但可能降低穩定性(預設值:0.0,範圍:0.0 - 0.2)。 +### eleven_v3 輸入 -當 `model` 參數設定為 `"eleven_v3"` 時,以下額外參數將變為可用: +| 參數 | 說明 | 資料類型 | 必要 | 範圍 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 語音速度。1.0 為正常,<1.0 較慢,>1.0 較快(預設值:1.0)。 | FLOAT | 是 | 0.7 - 1.3 | +| `similarity_boost` | 相似度增強。較高的值使語音更接近原始語音(預設值:0.75)。 | FLOAT | 是 | 0.0 - 1.0 | -* `speed`:語音速度。1.0 為正常,<1.0 較慢,>1.0 較快(預設值:1.0,範圍:0.7 - 1.3)。 -* `similarity_boost`:相似度增強。較高的值使語音更接近原始語音(預設值:0.75,範圍:0.0 - 1.0)。 +**注意:** `text` 輸入必須至少包含一個字元。如果 `language_code` 留空,則會自動偵測語言。`use_speaker_boost` 和 `style` 參數僅適用於 `eleven_multilingual_v2` 模型。 ## 輸出 | 輸出名稱 | 說明 | 資料類型 | -| --- | --- | --- | -| `audio` | 從文字轉語音轉換產生的音訊。 | AUDIO | +|-------------|-------------|-----------| +| `audio` | 文字轉語音轉換所產生的音訊。 | AUDIO | > 本文檔由 AI 生成。如果您發現任何錯誤或有改進建議,歡迎貢獻! [在 GitHub 上編輯](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh.md index 49a2d75f1..574e7ba12 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh.md @@ -1,40 +1,45 @@ # ElevenLabs 文字转语音 -ElevenLabs文本转语音节点使用ElevenLabs API将书面文本转换为语音音频。它允许您选择特定语音并微调稳定性、速度和风格等各种语音特性,以生成自定义音频输出。 +ElevenLabs Text to Speech 节点使用 ElevenLabs API 将书面文本转换为语音音频。您可以选择音色,并调整稳定性、速度和风格等语音特征,以创建自定义音频输出。 ## 输入 +### 通用输入 -| 参数 | 描述 | 数据类型 | 是否必需 | 范围 | -| --- | --- | --- | --- | --- | -| `voice` | 用于语音合成的语音。从语音选择器或即时语音克隆连接。 | CUSTOM | 是 | 不适用 | -| `text` | 要转换为语音的文本。 | STRING | 是 | 不适用 | -| `stability` | 语音稳定性。较低的值提供更广泛的情感范围,较高的值产生更一致但可能单调的语音(默认值:0.5)。 | FLOAT | 否 | 0.0 - 1.0 | -| `apply_text_normalization` | 文本规范化模式。"auto"让系统决定,"on"始终应用规范化,"off"跳过规范化。 | COMBO | 否 | `"auto"`
`"on"`
`"off"` | -| `model` | 用于文本转语音的模型。选择模型后会显示其特定参数。 | DYNAMICCOMBO | 否 | `"eleven_multilingual_v2"`
`"eleven_v3"` | -| `language_code` | ISO-639-1或ISO-639-3语言代码(例如"en"、"es"、"fra")。留空以自动检测(默认值:"")。 | STRING | 否 | 不适用 | -| `seed` | 用于可复现性的种子(不保证确定性)(默认值:1)。 | INT | 否 | 0 - 2147483647 | -| `output_format` | 音频输出格式。 | COMBO | 否 | `"mp3_44100_192"`
`"opus_48000_192"` | +| 参数 | 描述 | 数据类型 | 必需 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `model` | 用于文本转语音的模型。选择模型后会显示其特定参数。 | DYNAMIC_COMBO | 是 | "eleven_multilingual_v2"
"eleven_v3" | +| `voice` | 用于语音合成的音色。从 Voice Selector 或 Instant Voice Clone 连接。 | ELEVENLABS_VOICE | 是 | N/A | +| `text` | 要转换为语音的文本。必须至少包含一个字符。 | STRING | 是 | N/A | +| `stability` | 语音稳定性。数值越低,情感范围越广;数值越高,语音更一致,但也可能更单调(默认值:0.5)。 | FLOAT | 是 | 0.0 - 1.0 | +| `apply_text_normalization` | 文本规范化模式。'auto' 由系统自动决定,'on' 始终应用规范化,'off' 跳过规范化。 | COMBO | 是 | "auto"
"on"
"off" | +| `language_code` | ISO-639-1 或 ISO-639-3 语言代码(例如 'en'、'es'、'fra')。留空则自动检测(默认值:"")。 | STRING | 是 | N/A | +| `seed` | 用于可复现性的随机种子(不保证确定性)(默认值:1)。 | INT | 是 | 0 - 2147483647 | +| `output_format` | 音频输出格式。 | COMBO | 是 | "mp3_44100_192"
"opus_48000_192" | -**模型特定参数:** -当`model`参数设置为`"eleven_multilingual_v2"`时,以下额外参数可用: +### eleven_multilingual_v2 输入 -* `speed`:语速。1.0为正常,<1.0为较慢,>1.0为较快(默认值:1.0,范围:0.7 - 1.3)。 -* `similarity_boost`:相似度增强。较高的值使语音更接近原始语音(默认值:0.75,范围:0.0 - 1.0)。 -* `use_speaker_boost`:增强与原始说话人语音的相似度(默认值:False)。 -* `style`:风格夸张程度。较高的值增加风格表现力,但可能降低稳定性(默认值:0.0,范围:0.0 - 0.2)。 +| 参数 | 描述 | 数据类型 | 必需 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 语速。1.0 为正常速度,<1.0 较慢,>1.0 较快(默认值:1.0)。 | FLOAT | 是 | 0.7 - 1.3 | +| `similarity_boost` | 相似度增强。数值越高,音色与原始声音越相似(默认值:0.75)。 | FLOAT | 是 | 0.0 - 1.0 | +| `use_speaker_boost` | 增强与原始说话人声音的相似度(默认值:False)。 | BOOLEAN | 是 | True
False | +| `style` | 风格夸张程度。数值越高,风格化表现越强,但可能降低稳定性(默认值:0.0)。 | FLOAT | 是 | 0.0 - 0.2 | -当`model`参数设置为`"eleven_v3"`时,以下额外参数可用: +### eleven_v3 输入 -* `speed`:语速。1.0为正常,<1.0为较慢,>1.0为较快(默认值:1.0,范围:0.7 - 1.3)。 -* `similarity_boost`:相似度增强。较高的值使语音更接近原始语音(默认值:0.75,范围:0.0 - 1.0)。 +| 参数 | 描述 | 数据类型 | 必需 | 范围 | +|-----------|-------------|-----------|----------|-------| +| `speed` | 语速。1.0 为正常速度,<1.0 较慢,>1.0 较快(默认值:1.0)。 | FLOAT | 是 | 0.7 - 1.3 | +| `similarity_boost` | 相似度增强。数值越高,音色与原始声音越相似(默认值:0.75)。 | FLOAT | 是 | 0.0 - 1.0 | -## 输出 +**注意:** `text` 输入必须至少包含一个字符。如果 `language_code` 留空,将自动检测语言。`use_speaker_boost` 和 `style` 参数仅适用于 `eleven_multilingual_v2` 模型。 +## 输出 | 输出名称 | 描述 | 数据类型 | -| --- | --- | --- | +|-------------|-------------|-----------| | `audio` | 文本转语音转换生成的音频。 | AUDIO | > 本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh.md) --- -**Source fingerprint (SHA-256):** `d11d4ffa2d1f11dfd5ce378d9496cd9788d2197bf7f4135092ecefb287f3c2f7` +**Source fingerprint (SHA-256):** `78ed1c6af2d0b1cc0293d725492a8b104b6d0c6bc18d9971b75047db946cdd33` From 2d819116bdd0228a0c4f12d0137199cdf0611c42 Mon Sep 17 00:00:00 2001 From: lin-bot23 Date: Sat, 15 Aug 2026 16:39:40 +0800 Subject: [PATCH 2/2] docs: fix review findings on ElevenLabs docs (ar fence, fa overview, param consistency) --- comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md | 1 + comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md | 2 +- comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md | 2 ++ comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md | 4 ++-- comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md | 2 -- comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md | 2 +- comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md | 2 +- comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md | 2 +- 8 files changed, 9 insertions(+), 8 deletions(-) diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md index a98d4ec69..424d9e4bb 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToSpeech/zh.md @@ -3,6 +3,7 @@ ElevenLabs 语音到语音节点可将输入音频文件从一种语音转换为另一种语音。它使用 ElevenLabs API 转换语音,同时保留音频的原始内容和情绪基调。 ## 输入 + ### 通用输入 | 参数 | 描述 | 数据类型 | 是否必需 | 范围 | diff --git a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md index c7f2ec222..4d0a039ef 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md +++ b/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/pt-BR.md @@ -26,7 +26,7 @@ Estes parâmetros aparecem quando o modelo `"scribe_v2"` é selecionado. | `temperature` | Controle de aleatoriedade. 0.0 usa o padrão do modelo. Valores mais altos aumentam a aleatoriedade. (padrão: 0.0) | FLOAT | Não | 0.0 - 2.0 | | `timestamps_granularity` | Precisão temporal para as palavras da transcrição. (padrão: "word") | COMBO | Não | `"word"`
`"character"`
`"none"` | -**Observação:** `num_speakers` não pode ser definido com valor maior que 0 quando `diarize` está ativado. Desative `diarize` ou defina `num_speakers` como 0; caso contrário, um erro será gerado. +**Observação:** `num_locs` não pode ser definido com valor maior que 0 quando `diarize` está ativado. Desative `diarize` ou defina `num_locs` como 0; caso contrário, um erro será gerado. ## Saídas diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md index 3bb3deb3e..f664725d4 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fa.md @@ -1,5 +1,7 @@ # تبدیل متن به دیالوگ ElevenLabs +گره ElevenLabs Text to Dialogue یک دیالوگ صوتی چند‌گوینده از روی متن تولید می‌کند. این گره به شما امکان می‌دهد با مشخص کردن خطوط مختلف متن و صداهای مجزا برای هر شرکت‌کننده، یک مکالمه ایجاد کنید. این گره درخواست دیالوگ را به API ElevenLabs ارسال کرده و صدای تولید شده را بازمی‌گرداند. + ## ورودی‌ها | پارامتر | توضیحات | نوع داده | الزامی | محدوده | diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md index 332dbacba..530c63287 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md @@ -1,6 +1,6 @@ # ElevenLabs Text to Dialogue -Le nœud ElevenLabs Text to Dialogue génère un dialogue audio multi-locuteur à partir d'un texte. Il vous permet de créer une conversation en spécifiant différentes lignes de texte et des voix distinctes pour chaque participant. Le nœud envoie la demande de dialogue à l'API ElevenLabs et renvoie l'audio généré. +Le nœud ElevenLabs Text to Dialogue génère un dialogue audio multilocuteur à partir d'un texte. Il vous permet de créer une conversation en spécifiant différentes lignes de texte et des voix distinctes pour chaque participant. Le nœud envoie la demande de dialogue à l'API ElevenLabs et renvoie l'audio généré. ## Entrées @@ -20,7 +20,7 @@ Le nœud ElevenLabs Text to Dialogue génère un dialogue audio multi-locuteur | Nom de sortie | Description | Type de données | |---------------|-------------|-----------------| -| `audio` | L'audio de dialogue multi-locuteur généré dans le format de sortie sélectionné. | AUDIO | +| `audio` | L'audio de dialogue multilocuteur généré dans le format de sortie sélectionné. | AUDIO | > Cette documentation a été générée par IA. Si vous trouvez des erreurs ou avez des suggestions d'amélioration, n'hésitez pas à contribuer ! [Modifier sur GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToDialogue/fr.md) diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md index 8df757b03..9cc6beebf 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md @@ -1,6 +1,5 @@ # ElevenLabs تحويل النص إلى كلام -```markdown تقوم عقدة ElevenLabs لتحويل النص إلى كلام بتحويل النص المكتوب إلى صوت منطوق باستخدام واجهة برمجة تطبيقات ElevenLabs. وهي تتيح لك اختيار صوت وضبط خصائص الكلام مثل الثبات والسرعة والأسلوب لإنشاء مخرجات صوتية مخصصة. ## المدخلات @@ -41,7 +40,6 @@ | اسم المخرج | الوصف | نوع البيانات | |-------------|-------------|-----------| | `audio` | الصوت الناتج من تحويل النص إلى كلام. | AUDIO | -``` > تم إنشاء هذه الوثيقة بواسطة الذكاء الاصطناعي. إذا وجدت أي أخطاء أو لديك اقتراحات للتحسين، فلا تتردد في المساهمة! [تحرير على GitHub](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/ar.md) diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md index a431c6136..48c3febe9 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/fa.md @@ -24,7 +24,7 @@ | `speed` | سرعت گفتار. 1.0 نرمال است، <1.0 کندتر، >1.0 سریع‌تر (پیش‌فرض: 1.0). | FLOAT | بله | 0.7 - 1.3 | | `similarity_boost` | افزایش شباهت. مقادیر بالاتر صدا را به صدای اصلی شبیه‌تر می‌کنند (پیش‌فرض: 0.75). | FLOAT | بله | 0.0 - 1.0 | | `use_speaker_boost` | افزایش شباهت به صدای گوینده اصلی (پیش‌فرض: False). | BOOLEAN | بله | True
False | -| `style` | غرابت سبک. مقادیر بالاتر بیان سبکی را افزایش می‌دهند اما ممکن است پایداری را کاهش دهند (پیش‌فرض: 0.0). | FLOAT | بله | 0.0 - 0.2 | +| `style` | اغراق در سبک. مقادیر بالاتر بیان سبکی را افزایش می‌دهند اما ممکن است پایداری را کاهش دهند (پیش‌فرض: 0.0). | FLOAT | بله | 0.0 - 0.2 | ### ورودی‌های eleven_v3 diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md index 2b856ba0b..4f385d633 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/tr.md @@ -33,7 +33,7 @@ ElevenLabs Text to Speech düğümü, ElevenLabs API'sini kullanarak yazılı me | `speed` | Konuşma hızı. 1.0 normal, <1.0 yavaş, >1.0 hızlı (varsayılan: 1.0). | FLOAT | Evet | 0.7 - 1.3 | | `similarity_boost` | Benzerlik artırma. Yüksek değerler sesi orijinaline daha benzer hale getirir (varsayılan: 0.75). | FLOAT | Evet | 0.0 - 1.0 | -**Not:** `text` girdisi en az bir karakter içermelidir. `language_code` boş bırakılırsa dil otomatik olarak algılanır. `use_speaker_boost` ve `style` parametreleri yalnızca `eleven_multilingual_v2` modeli için kullanılabilir. +**Not:** `metin` girdisi en az bir karakter içermelidir. `dil_kodu` boş bırakılırsa dil otomatik olarak algılanır. `use_speaker_boost` ve `style` parametreleri yalnızca `eleven_multilingual_v2` modeli için kullanılabilir. ## Çıktılar diff --git a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md index 88f0ff6c9..b82d9a0b5 100644 --- a/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md +++ b/comfyui_embedded_docs/docs/ElevenLabsTextToSpeech/zh-TW.md @@ -33,7 +33,7 @@ ElevenLabs 文字轉語音節點使用 ElevenLabs API 將書面文字轉換為 | `speed` | 語音速度。1.0 為正常,<1.0 較慢,>1.0 較快(預設值:1.0)。 | FLOAT | 是 | 0.7 - 1.3 | | `similarity_boost` | 相似度增強。較高的值使語音更接近原始語音(預設值:0.75)。 | FLOAT | 是 | 0.0 - 1.0 | -**注意:** `text` 輸入必須至少包含一個字元。如果 `language_code` 留空,則會自動偵測語言。`use_speaker_boost` 和 `style` 參數僅適用於 `eleven_multilingual_v2` 模型。 +**注意:** `文字` 輸入必須至少包含一個字元。如果 `語言代碼` 留空,則會自動偵測語言。`use_speaker_boost` 和 `style` 參數僅適用於 `eleven_multilingual_v2` 模型。 ## 輸出