Texto a voz
Convierte texto a voz con voces de IA
Configuración
OpenAI TTS
Proveedor*
OpenAI TTS
Texto*
Introduce el texto que quieres convertir a voz...
Clave de API*
••••••••
Modelo
TTS-1
Voz
Alloy
Formato de audio
MP3
Velocidad
0.25
OpenAI TTS (
tts_openai)Convierte texto a voz con los modelos TTS de OpenAI
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
text | string | Sí | El texto que se convertirá a voz |
apiKey | string | Sí | Clave de API de OpenAI |
model | string | No | Modelo TTS que se usará (tts-1, tts-1-hd o gpt-4o-mini-tts) |
voice | string | No | Voz que se usará (alloy, ash, ballad, cedar, coral, echo, marin, sage, shimmer, verse) |
responseFormat | string | No | Formato de audio (mp3, opus, aac, flac, wav, pcm) |
speed | number | No | Velocidad del habla (0.25 a 4.0, valor predeterminado: 1.0) |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
audioUrl | string | URL del archivo de audio generado |
audioFile | file | Objeto del archivo de audio generado |
duration | number | Duración del audio en segundos |
characterCount | number | Número de caracteres procesados |
format | string | Formato de audio |
provider | string | Proveedor TTS utilizado |
Deepgram Aura
Proveedor*
Deepgram Aura
Texto*
Introduce el texto que quieres convertir a voz...
Clave de API*
••••••••
Voz*
Asteria
Formato de audio
MP3
Frecuencia de muestreo
24000 Hz
Se muestra cuando la codificación es 'linear16'.
Deepgram Aura (
tts_deepgram)Convierte texto a voz con Deepgram Aura
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
text | string | Sí | El texto que se convertirá a voz |
apiKey | string | Sí | Clave de API de Deepgram |
model | string | No | Modelo/voz de Deepgram (p. ej., aura-asteria-en, aura-luna-en) |
voice | string | No | Identificador de voz (alternativa al parámetro model) |
encoding | string | No | Codificación de audio (linear16, mp3, opus, aac, flac) |
sampleRate | number | No | Frecuencia de muestreo (8000, 16000, 24000, 48000) |
bitRate | number | No | Tasa de bits para formatos comprimidos |
container | string | No | Formato de contenedor (none, wav, ogg) |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
audioUrl | string | URL del archivo de audio generado |
audioFile | file | Objeto del archivo de audio generado |
duration | number | Duración del audio en segundos |
characterCount | number | Número de caracteres procesados |
format | string | Formato de audio |
provider | string | Proveedor TTS usado |
ElevenLabs
Proveedor*
ElevenLabs
Texto*
Introduce el texto que se convertirá a voz...
Clave de API*
••••••••
ID de voz*
Introduce el ID de voz de ElevenLabs
Modelo
Turbo v2.5
Estabilidad
0
Refuerzo de similitud
0
Estilo
0
ElevenLabs (
tts_elevenlabs)Convierte texto a voz con voces de ElevenLabs
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
text | string | Sí | El texto que se convertirá a voz |
voiceId | string | Sí | El ID de la voz que se usará |
apiKey | string | Sí | Clave de API de ElevenLabs |
modelId | string | No | Modelo que se usará (p. ej., eleven_monolingual_v1, eleven_turbo_v2_5, eleven_flash_v2_5) |
stability | number | No | Estabilidad de la voz (0.0 a 1.0, valor predeterminado: 0.5) |
similarityBoost | number | No | Aumento de similitud (0.0 a 1.0, valor predeterminado: 0.8) |
style | number | No | Exageración de estilo (0.0 a 1.0) |
useSpeakerBoost | boolean | No | Usar refuerzo de locutor (valor predeterminado: true) |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
audioUrl | string | URL del archivo de audio generado |
audioFile | file | Objeto del archivo de audio generado |
duration | number | Duración del audio en segundos |
characterCount | number | Número de caracteres procesados |
format | string | Formato de audio |
provider | string | Proveedor TTS utilizado |
Cartesia Sonic
Proveedor*
Cartesia Sonic
Texto*
Introduce el texto que se convertirá a voz...
Clave de API*
••••••••
Modelo
Sonic 3
ID de voz*
Introduce el ID de voz de Cartesia
Velocidad
0.5
Cartesia Sonic (
tts_cartesia)Convierte texto a voz con Cartesia Sonic (latencia ultrabaja)
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
text | string | Sí | El texto que se convertirá a voz |
apiKey | string | Sí | Clave de API de Cartesia |
modelId | string | No | ID del modelo (sonic-english, sonic-multilingual) |
voice | string | No | ID de voz o embedding |
language | string | No | Código de idioma (en, es, fr, de, it, pt, etc.) |
outputFormat | json | No | Configuración del formato de salida (container, encoding, sampleRate) |
speed | number | No | Multiplicador de velocidad |
emotion | array | No | Etiquetas de emoción para Sonic-3 (p. ej., ['positivity:high']) |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
audioUrl | string | URL del archivo de audio generado |
audioFile | file | Objeto del archivo de audio generado |
duration | number | Duración del audio en segundos |
characterCount | number | Número de caracteres procesados |
format | string | Formato de audio |
provider | string | Proveedor TTS utilizado |
Google Cloud TTS
Proveedor*
Google Cloud TTS
Texto*
Introduce el texto que se convertirá a voz...
Clave de API*
••••••••
ID de voz
p. ej., en-US-Neural2-A
Código de idioma*
p. ej., en-US, es-ES
Velocidad de habla
0.25
Tono
-20
Google Cloud TTS (
tts_google)Convierte texto a voz con Google Cloud Text-to-Speech
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
text | string | Sí | El texto a convertir a voz |
apiKey | string | Sí | Clave de API de Google Cloud |
voiceId | string | No | ID de voz (p. ej., en-US-Neural2-A, en-US-Wavenet-D) |
languageCode | string | Sí | Código de idioma (p. ej., en-US, es-ES, fr-FR) |
gender | string | No | Género de la voz (MALE, FEMALE, NEUTRAL) |
audioEncoding | string | No | Codificación de audio (LINEAR16, MP3, OGG_OPUS, MULAW, ALAW) |
speakingRate | number | No | Velocidad de habla (0.25 a 2.0, predeterminado: 1.0) |
pitch | number | No | Tono de voz (-20.0 a 20.0, predeterminado: 0.0) |
volumeGainDb | number | No | Ganancia de volumen en dB (-96.0 a 16.0) |
sampleRateHertz | number | No | Frecuencia de muestreo en Hz |
effectsProfileId | array | No | Perfil de efectos (p. ej., ['headphone-class-device']) |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
audioUrl | string | URL del archivo de audio generado |
audioFile | file | Objeto del archivo de audio generado |
duration | number | Duración del audio en segundos |
characterCount | number | Número de caracteres procesados |
format | string | Formato de audio |
provider | string | Proveedor de TTS utilizado |
Azure TTS
Proveedor*
Azure TTS
Texto*
Introduce el texto que quieres convertir a voz...
Clave de API*
••••••••
ID de voz
p. ej., en-US-JennyNeural
Región
p. ej., eastus, westus
Formato de salida
MP3 24kHz 96kbps
Estilo de habla
p. ej., cheerful, sad, angry
Azure TTS (
tts_azure)Convierte texto a voz con Azure Cognitive Services
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
text | string | Sí | El texto que se convertirá a voz |
apiKey | string | Sí | Clave de API de Azure Speech Services |
voiceId | string | No | ID de voz (p. ej., en-US-JennyNeural, en-US-GuyNeural) |
region | string | No | Región de Azure (p. ej., eastus, westus, westeurope) |
outputFormat | string | No | Formato de audio de salida |
rate | string | No | Velocidad de habla (p. ej., +10%, -20%, 1.5) |
pitch | string | No | Tono de voz (p. ej., +5Hz, -2st, low) |
style | string | No | Estilo de habla (p. ej., cheerful, sad, angry; solo voces neurales) |
styleDegree | number | No | Intensidad del estilo (0.01 a 2.0) |
role | string | No | Rol (p. ej., Girl, Boy, YoungAdultFemale) |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
audioUrl | string | URL del archivo de audio generado |
audioFile | file | Objeto del archivo de audio generado |
duration | number | Duración del audio en segundos |
characterCount | number | Número de caracteres procesados |
format | string | Formato de audio |
provider | string | Proveedor TTS utilizado |
PlayHT
Proveedor*
PlayHT
Texto*
Introduce el texto para convertirlo en voz...
Clave API*
••••••••
ID de usuario*
••••••••
Voz
ID de voz o URL del manifiesto
Calidad
Estándar
Velocidad
0.5
PlayHT (
tts_playht)Convertir texto a voz con PlayHT (clonación de voz)
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
text | string | Sí | El texto que se convertirá a voz |
apiKey | string | Sí | Clave de API de PlayHT (encabezado AUTHORIZATION) |
userId | string | Sí | ID de usuario de PlayHT (encabezado X-USER-ID) |
voice | string | No | ID de voz o URL del manifiesto |
quality | string | No | Nivel de calidad (draft, standard, premium) |
outputFormat | string | No | Formato de salida (mp3, wav, ogg, flac, mulaw) |
speed | number | No | Multiplicador de velocidad (0.5 a 2.0) |
temperature | number | No | Creatividad/aleatoriedad (0.0 a 2.0) |
voiceGuidance | number | No | Estabilidad de la voz (1.0 a 6.0) |
textGuidance | number | No | Adherencia al texto (1.0 a 6.0) |
sampleRate | number | No | Frecuencia de muestreo (8000, 16000, 22050, 24000, 44100, 48000) |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
audioUrl | string | URL del archivo de audio generado |
audioFile | file | Objeto del archivo de audio generado |
duration | number | Duración del audio en segundos |
characterCount | number | Número de caracteres procesados |
format | string | Formato de audio |
provider | string | Proveedor TTS utilizado |
Instrucciones de uso
Genera voz de sonido natural a partir de texto usando voces de IA de última generación de OpenAI, Deepgram, ElevenLabs, Cartesia, Google Cloud, Azure y PlayHT. Admite múltiples voces, idiomas y formatos de audio.
Notas
- Categoría:
tools - Tipo:
tts