文本转语音

使用AI语音将文本转换为语音

配置

OpenAI TTS

提供商*
OpenAI TTS
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
模型
TTS-1
语音
Alloy
音频格式
MP3
语速
0.25
OpenAI TTS (tts_openai)

使用 OpenAI TTS 模型将文本转换为语音

输入
参数类型必填说明
textstring是要转换为语音的文本
apiKeystring是OpenAI API 密钥
modelstring否要使用的 TTS 模型 (tts-1、tts-1-hd 或 gpt-4o-mini-tts)
voicestring否要使用的音色 (alloy、ash、ballad、cedar、coral、echo、marin、sage、shimmer、verse)
responseFormatstring否音频格式 (mp3、opus、aac、flac、wav、pcm)
speednumber否语速 (0.25 到 4.0,默认:1.0)
输出
参数类型说明
audioUrlstring生成的音频文件 URL
audioFilefile生成的音频文件对象
durationnumber音频时长(秒)
characterCountnumber已处理的字符数
formatstring音频格式
providerstring使用的 TTS 提供商

Deepgram Aura

提供商*
Deepgram Aura
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
音色*
Asteria
音频格式
MP3
采样率
24000 Hz
编码为 'linear16' 时显示。
Deepgram Aura (tts_deepgram)

使用 Deepgram Aura 将文本转换为语音

输入
参数类型必填说明
textstring是要转换为语音的文本
apiKeystring是Deepgram API 密钥
modelstring否Deepgram 模型/音色 (例如 aura-asteria-en、aura-luna-en)
voicestring否音色标识 (model 参数的替代项)
encodingstring否音频编码 (linear16、mp3、opus、aac、flac)
sampleRatenumber否采样率 (8000、16000、24000、48000)
bitRatenumber否压缩格式的比特率
containerstring否容器格式 (none、wav、ogg)
输出
参数类型说明
audioUrlstring生成的音频文件 URL
audioFilefile生成的音频文件对象
durationnumber音频时长(秒)
characterCountnumber已处理的字符数
formatstring音频格式
providerstring所用 TTS 提供商

ElevenLabs

提供商*
ElevenLabs
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
音色 ID*
输入 ElevenLabs 音色 ID
模型
Turbo v2.5
稳定性
0
相似度增强
0
风格
0
ElevenLabs (tts_elevenlabs)

使用 ElevenLabs 音色将文本转换为语音

输入
参数类型必填说明
textstring是要转换为语音的文本
voiceIdstring是要使用的音色 ID
apiKeystring是ElevenLabs API 密钥
modelIdstring否要使用的模型(例如 eleven_monolingual_v1、eleven_turbo_v2_5、eleven_flash_v2_5)
stabilitynumber否音色稳定性(0.0 到 1.0,默认:0.5)
similarityBoostnumber否相似度增强(0.0 到 1.0,默认:0.8)
stylenumber否风格夸张度(0.0 到 1.0)
useSpeakerBoostboolean否使用说话人增强(默认:true)
输出
参数类型说明
audioUrlstring生成的音频文件 URL
audioFilefile生成的音频文件对象
durationnumber音频时长(秒)
characterCountnumber已处理的字符数
formatstring音频格式
providerstring所用 TTS 提供商

Cartesia Sonic

提供商*
Cartesia Sonic
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
模型
Sonic 3
语音 ID*
输入 Cartesia 语音 ID
语速
0.5
Cartesia Sonic (tts_cartesia)

使用 Cartesia Sonic 将文本转换为语音(超低延迟)

输入
参数类型必填说明
textstring是要转换为语音的文本
apiKeystring是Cartesia API 密钥
modelIdstring否模型 ID (sonic-english, sonic-multilingual)
voicestring否语音 ID 或 embedding
languagestring否语言代码 (en, es, fr, de, it, pt 等)
outputFormatjson否输出格式配置 (container, encoding, sampleRate)
speednumber否语速倍率
emotionarray否Sonic-3 的情感标签 (例如:['positivity:high'])
输出
参数类型说明
audioUrlstring生成的音频文件 URL
audioFilefile生成的音频文件对象
durationnumber音频时长(秒)
characterCountnumber已处理的字符数
formatstring音频格式
providerstring所用 TTS 提供商

Google Cloud TTS

提供商*
Google Cloud TTS
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
语音 ID
例如:en-US-Neural2-A
语言代码*
例如:en-US, es-ES
语速
0.25
音调
-20
Google Cloud TTS (tts_google)

使用 Google Cloud Text-to-Speech 将文本转换为语音

输入
参数类型必填说明
textstring是要转换为语音的文本
apiKeystring是Google Cloud API 密钥
voiceIdstring否语音 ID(例如 en-US-Neural2-A、en-US-Wavenet-D)
languageCodestring是语言代码(例如 en-US、es-ES、fr-FR)
genderstring否语音性别(MALE、FEMALE、NEUTRAL)
audioEncodingstring否音频编码(LINEAR16、MP3、OGG_OPUS、MULAW、ALAW)
speakingRatenumber否语速(0.25 到 2.0,默认:1.0)
pitchnumber否音调(-20.0 到 20.0,默认:0.0)
volumeGainDbnumber否音量增益,单位为 dB(-96.0 到 16.0)
sampleRateHertznumber否采样率,单位为 Hz
effectsProfileIdarray否效果配置(例如 ['headphone-class-device'])
输出
参数类型说明
audioUrlstring生成的音频文件 URL
audioFilefile生成的音频文件对象
durationnumber音频时长(秒)
characterCountnumber已处理的字符数
formatstring音频格式
providerstring所用的 TTS 提供商

Azure TTS

提供商*
Azure TTS
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
语音 ID
例如:en-US-JennyNeural
区域
例如:eastus、westus
输出格式
MP3 24kHz 96kbps
说话风格
例如:cheerful、sad、angry
Azure TTS (tts_azure)

使用 Azure Cognitive Services 将文本转换为语音

输入
参数类型必填说明
textstring是要转换为语音的文本
apiKeystring是Azure Speech Services API 密钥
voiceIdstring否语音 ID (例如:en-US-JennyNeural、en-US-GuyNeural)
regionstring否Azure 区域 (例如:eastus、westus、westeurope)
outputFormatstring否输出音频格式
ratestring否语速 (例如:+10%、-20%、1.5)
pitchstring否音调 (例如:+5Hz、-2st、low)
stylestring否说话风格 (例如:cheerful、sad、angry,仅限神经语音)
styleDegreenumber否风格强度 (0.01 到 2.0)
rolestring否角色 (例如:Girl、Boy、YoungAdultFemale)
输出
参数类型说明
audioUrlstring生成的音频文件 URL
audioFilefile生成的音频文件对象
durationnumber音频时长(秒)
characterCountnumber已处理的字符数
formatstring音频格式
providerstring使用的 TTS 提供商

PlayHT

提供商*
PlayHT
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
用户 ID*
••••••••
音色
音色 ID 或清单 URL
质量
标准
语速
0.5
PlayHT (tts_playht)

使用 PlayHT 将文本转换为语音(语音克隆)

输入
参数类型必填说明
textstring是要转换为语音的文本
apiKeystring是PlayHT API 密钥(AUTHORIZATION 请求头)
userIdstring是PlayHT 用户 ID(X-USER-ID 请求头)
voicestring否语音 ID 或清单 URL
qualitystring否质量级别(draft、standard、premium)
outputFormatstring否输出格式(mp3、wav、ogg、flac、mulaw)
speednumber否语速倍数(0.5 到 2.0)
temperaturenumber否创意度/随机度(0.0 到 2.0)
voiceGuidancenumber否语音稳定性(1.0 到 6.0)
textGuidancenumber否文本遵循度(1.0 到 6.0)
sampleRatenumber否采样率(8000、16000、22050、24000、44100、48000)
输出
参数类型说明
audioUrlstring生成的音频文件 URL
audioFilefile生成的音频文件对象
durationnumber音频时长(秒)
characterCountnumber已处理的字符数
formatstring音频格式
providerstring所用 TTS 提供商

使用说明

使用 OpenAI、Deepgram、ElevenLabs、Cartesia、Google Cloud、Azure 和 PlayHT 的先进 AI 音色,将文本转换为自然流畅的语音。支持多种音色、语言和音频格式。

备注

  • 分类:tools
  • 类型:tts