Texto a voz

Convierte texto a voz con voces de IA

Configuración

OpenAI TTS

Proveedor*
OpenAI TTS
Texto*
Introduce el texto que quieres convertir a voz...
Clave de API*
••••••••
Modelo
TTS-1
Voz
Alloy
Formato de audio
MP3
Velocidad
0.25
OpenAI TTS (tts_openai)

Convierte texto a voz con los modelos TTS de OpenAI

Entrada
ParámetroTipoObligatorioDescripción
textstringSíEl texto que se convertirá a voz
apiKeystringSíClave de API de OpenAI
modelstringNoModelo TTS que se usará (tts-1, tts-1-hd o gpt-4o-mini-tts)
voicestringNoVoz que se usará (alloy, ash, ballad, cedar, coral, echo, marin, sage, shimmer, verse)
responseFormatstringNoFormato de audio (mp3, opus, aac, flac, wav, pcm)
speednumberNoVelocidad del habla (0.25 a 4.0, valor predeterminado: 1.0)
Salida
ParámetroTipoDescripción
audioUrlstringURL del archivo de audio generado
audioFilefileObjeto del archivo de audio generado
durationnumberDuración del audio en segundos
characterCountnumberNúmero de caracteres procesados
formatstringFormato de audio
providerstringProveedor TTS utilizado

Deepgram Aura

Proveedor*
Deepgram Aura
Texto*
Introduce el texto que quieres convertir a voz...
Clave de API*
••••••••
Voz*
Asteria
Formato de audio
MP3
Frecuencia de muestreo
24000 Hz
Se muestra cuando la codificación es 'linear16'.
Deepgram Aura (tts_deepgram)

Convierte texto a voz con Deepgram Aura

Entrada
ParámetroTipoObligatorioDescripción
textstringSíEl texto que se convertirá a voz
apiKeystringSíClave de API de Deepgram
modelstringNoModelo/voz de Deepgram (p. ej., aura-asteria-en, aura-luna-en)
voicestringNoIdentificador de voz (alternativa al parámetro model)
encodingstringNoCodificación de audio (linear16, mp3, opus, aac, flac)
sampleRatenumberNoFrecuencia de muestreo (8000, 16000, 24000, 48000)
bitRatenumberNoTasa de bits para formatos comprimidos
containerstringNoFormato de contenedor (none, wav, ogg)
Salida
ParámetroTipoDescripción
audioUrlstringURL del archivo de audio generado
audioFilefileObjeto del archivo de audio generado
durationnumberDuración del audio en segundos
characterCountnumberNúmero de caracteres procesados
formatstringFormato de audio
providerstringProveedor TTS usado

ElevenLabs

Proveedor*
ElevenLabs
Texto*
Introduce el texto que se convertirá a voz...
Clave de API*
••••••••
ID de voz*
Introduce el ID de voz de ElevenLabs
Modelo
Turbo v2.5
Estabilidad
0
Refuerzo de similitud
0
Estilo
0
ElevenLabs (tts_elevenlabs)

Convierte texto a voz con voces de ElevenLabs

Entrada
ParámetroTipoObligatorioDescripción
textstringSíEl texto que se convertirá a voz
voiceIdstringSíEl ID de la voz que se usará
apiKeystringSíClave de API de ElevenLabs
modelIdstringNoModelo que se usará (p. ej., eleven_monolingual_v1, eleven_turbo_v2_5, eleven_flash_v2_5)
stabilitynumberNoEstabilidad de la voz (0.0 a 1.0, valor predeterminado: 0.5)
similarityBoostnumberNoAumento de similitud (0.0 a 1.0, valor predeterminado: 0.8)
stylenumberNoExageración de estilo (0.0 a 1.0)
useSpeakerBoostbooleanNoUsar refuerzo de locutor (valor predeterminado: true)
Salida
ParámetroTipoDescripción
audioUrlstringURL del archivo de audio generado
audioFilefileObjeto del archivo de audio generado
durationnumberDuración del audio en segundos
characterCountnumberNúmero de caracteres procesados
formatstringFormato de audio
providerstringProveedor TTS utilizado

Cartesia Sonic

Proveedor*
Cartesia Sonic
Texto*
Introduce el texto que se convertirá a voz...
Clave de API*
••••••••
Modelo
Sonic 3
ID de voz*
Introduce el ID de voz de Cartesia
Velocidad
0.5
Cartesia Sonic (tts_cartesia)

Convierte texto a voz con Cartesia Sonic (latencia ultrabaja)

Entrada
ParámetroTipoObligatorioDescripción
textstringSíEl texto que se convertirá a voz
apiKeystringSíClave de API de Cartesia
modelIdstringNoID del modelo (sonic-english, sonic-multilingual)
voicestringNoID de voz o embedding
languagestringNoCódigo de idioma (en, es, fr, de, it, pt, etc.)
outputFormatjsonNoConfiguración del formato de salida (container, encoding, sampleRate)
speednumberNoMultiplicador de velocidad
emotionarrayNoEtiquetas de emoción para Sonic-3 (p. ej., ['positivity:high'])
Salida
ParámetroTipoDescripción
audioUrlstringURL del archivo de audio generado
audioFilefileObjeto del archivo de audio generado
durationnumberDuración del audio en segundos
characterCountnumberNúmero de caracteres procesados
formatstringFormato de audio
providerstringProveedor TTS utilizado

Google Cloud TTS

Proveedor*
Google Cloud TTS
Texto*
Introduce el texto que se convertirá a voz...
Clave de API*
••••••••
ID de voz
p. ej., en-US-Neural2-A
Código de idioma*
p. ej., en-US, es-ES
Velocidad de habla
0.25
Tono
-20
Google Cloud TTS (tts_google)

Convierte texto a voz con Google Cloud Text-to-Speech

Entrada
ParámetroTipoObligatorioDescripción
textstringSíEl texto a convertir a voz
apiKeystringSíClave de API de Google Cloud
voiceIdstringNoID de voz (p. ej., en-US-Neural2-A, en-US-Wavenet-D)
languageCodestringSíCódigo de idioma (p. ej., en-US, es-ES, fr-FR)
genderstringNoGénero de la voz (MALE, FEMALE, NEUTRAL)
audioEncodingstringNoCodificación de audio (LINEAR16, MP3, OGG_OPUS, MULAW, ALAW)
speakingRatenumberNoVelocidad de habla (0.25 a 2.0, predeterminado: 1.0)
pitchnumberNoTono de voz (-20.0 a 20.0, predeterminado: 0.0)
volumeGainDbnumberNoGanancia de volumen en dB (-96.0 a 16.0)
sampleRateHertznumberNoFrecuencia de muestreo en Hz
effectsProfileIdarrayNoPerfil de efectos (p. ej., ['headphone-class-device'])
Salida
ParámetroTipoDescripción
audioUrlstringURL del archivo de audio generado
audioFilefileObjeto del archivo de audio generado
durationnumberDuración del audio en segundos
characterCountnumberNúmero de caracteres procesados
formatstringFormato de audio
providerstringProveedor de TTS utilizado

Azure TTS

Proveedor*
Azure TTS
Texto*
Introduce el texto que quieres convertir a voz...
Clave de API*
••••••••
ID de voz
p. ej., en-US-JennyNeural
Región
p. ej., eastus, westus
Formato de salida
MP3 24kHz 96kbps
Estilo de habla
p. ej., cheerful, sad, angry
Azure TTS (tts_azure)

Convierte texto a voz con Azure Cognitive Services

Entrada
ParámetroTipoObligatorioDescripción
textstringSíEl texto que se convertirá a voz
apiKeystringSíClave de API de Azure Speech Services
voiceIdstringNoID de voz (p. ej., en-US-JennyNeural, en-US-GuyNeural)
regionstringNoRegión de Azure (p. ej., eastus, westus, westeurope)
outputFormatstringNoFormato de audio de salida
ratestringNoVelocidad de habla (p. ej., +10%, -20%, 1.5)
pitchstringNoTono de voz (p. ej., +5Hz, -2st, low)
stylestringNoEstilo de habla (p. ej., cheerful, sad, angry; solo voces neurales)
styleDegreenumberNoIntensidad del estilo (0.01 a 2.0)
rolestringNoRol (p. ej., Girl, Boy, YoungAdultFemale)
Salida
ParámetroTipoDescripción
audioUrlstringURL del archivo de audio generado
audioFilefileObjeto del archivo de audio generado
durationnumberDuración del audio en segundos
characterCountnumberNúmero de caracteres procesados
formatstringFormato de audio
providerstringProveedor TTS utilizado

PlayHT

Proveedor*
PlayHT
Texto*
Introduce el texto para convertirlo en voz...
Clave API*
••••••••
ID de usuario*
••••••••
Voz
ID de voz o URL del manifiesto
Calidad
Estándar
Velocidad
0.5
PlayHT (tts_playht)

Convertir texto a voz con PlayHT (clonación de voz)

Entrada
ParámetroTipoObligatorioDescripción
textstringSíEl texto que se convertirá a voz
apiKeystringSíClave de API de PlayHT (encabezado AUTHORIZATION)
userIdstringSíID de usuario de PlayHT (encabezado X-USER-ID)
voicestringNoID de voz o URL del manifiesto
qualitystringNoNivel de calidad (draft, standard, premium)
outputFormatstringNoFormato de salida (mp3, wav, ogg, flac, mulaw)
speednumberNoMultiplicador de velocidad (0.5 a 2.0)
temperaturenumberNoCreatividad/aleatoriedad (0.0 a 2.0)
voiceGuidancenumberNoEstabilidad de la voz (1.0 a 6.0)
textGuidancenumberNoAdherencia al texto (1.0 a 6.0)
sampleRatenumberNoFrecuencia de muestreo (8000, 16000, 22050, 24000, 44100, 48000)
Salida
ParámetroTipoDescripción
audioUrlstringURL del archivo de audio generado
audioFilefileObjeto del archivo de audio generado
durationnumberDuración del audio en segundos
characterCountnumberNúmero de caracteres procesados
formatstringFormato de audio
providerstringProveedor TTS utilizado

Instrucciones de uso

Genera voz de sonido natural a partir de texto usando voces de IA de última generación de OpenAI, Deepgram, ElevenLabs, Cartesia, Google Cloud, Azure y PlayHT. Admite múltiples voces, idiomas y formatos de audio.

Notas

  • Categoría: tools
  • Tipo: tts