文本转语音
使用AI语音将文本转换为语音
配置
OpenAI TTS
提供商*
OpenAI TTS
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
模型
TTS-1
语音
Alloy
音频格式
MP3
语速
0.25
OpenAI TTS (
tts_openai)使用 OpenAI TTS 模型将文本转换为语音
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 是 | 要转换为语音的文本 |
apiKey | string | 是 | OpenAI API 密钥 |
model | string | 否 | 要使用的 TTS 模型 (tts-1、tts-1-hd 或 gpt-4o-mini-tts) |
voice | string | 否 | 要使用的音色 (alloy、ash、ballad、cedar、coral、echo、marin、sage、shimmer、verse) |
responseFormat | string | 否 | 音频格式 (mp3、opus、aac、flac、wav、pcm) |
speed | number | 否 | 语速 (0.25 到 4.0,默认:1.0) |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
audioUrl | string | 生成的音频文件 URL |
audioFile | file | 生成的音频文件对象 |
duration | number | 音频时长(秒) |
characterCount | number | 已处理的字符数 |
format | string | 音频格式 |
provider | string | 使用的 TTS 提供商 |
Deepgram Aura
提供商*
Deepgram Aura
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
音色*
Asteria
音频格式
MP3
采样率
24000 Hz
编码为 'linear16' 时显示。
Deepgram Aura (
tts_deepgram)使用 Deepgram Aura 将文本转换为语音
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 是 | 要转换为语音的文本 |
apiKey | string | 是 | Deepgram API 密钥 |
model | string | 否 | Deepgram 模型/音色 (例如 aura-asteria-en、aura-luna-en) |
voice | string | 否 | 音色标识 (model 参数的替代项) |
encoding | string | 否 | 音频编码 (linear16、mp3、opus、aac、flac) |
sampleRate | number | 否 | 采样率 (8000、16000、24000、48000) |
bitRate | number | 否 | 压缩格式的比特率 |
container | string | 否 | 容器格式 (none、wav、ogg) |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
audioUrl | string | 生成的音频文件 URL |
audioFile | file | 生成的音频文件对象 |
duration | number | 音频时长(秒) |
characterCount | number | 已处理的字符数 |
format | string | 音频格式 |
provider | string | 所用 TTS 提供商 |
ElevenLabs
提供商*
ElevenLabs
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
音色 ID*
输入 ElevenLabs 音色 ID
模型
Turbo v2.5
稳定性
0
相似度增强
0
风格
0
ElevenLabs (
tts_elevenlabs)使用 ElevenLabs 音色将文本转换为语音
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 是 | 要转换为语音的文本 |
voiceId | string | 是 | 要使用的音色 ID |
apiKey | string | 是 | ElevenLabs API 密钥 |
modelId | string | 否 | 要使用的模型(例如 eleven_monolingual_v1、eleven_turbo_v2_5、eleven_flash_v2_5) |
stability | number | 否 | 音色稳定性(0.0 到 1.0,默认:0.5) |
similarityBoost | number | 否 | 相似度增强(0.0 到 1.0,默认:0.8) |
style | number | 否 | 风格夸张度(0.0 到 1.0) |
useSpeakerBoost | boolean | 否 | 使用说话人增强(默认:true) |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
audioUrl | string | 生成的音频文件 URL |
audioFile | file | 生成的音频文件对象 |
duration | number | 音频时长(秒) |
characterCount | number | 已处理的字符数 |
format | string | 音频格式 |
provider | string | 所用 TTS 提供商 |
Cartesia Sonic
提供商*
Cartesia Sonic
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
模型
Sonic 3
语音 ID*
输入 Cartesia 语音 ID
语速
0.5
Cartesia Sonic (
tts_cartesia)使用 Cartesia Sonic 将文本转换为语音(超低延迟)
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 是 | 要转换为语音的文本 |
apiKey | string | 是 | Cartesia API 密钥 |
modelId | string | 否 | 模型 ID (sonic-english, sonic-multilingual) |
voice | string | 否 | 语音 ID 或 embedding |
language | string | 否 | 语言代码 (en, es, fr, de, it, pt 等) |
outputFormat | json | 否 | 输出格式配置 (container, encoding, sampleRate) |
speed | number | 否 | 语速倍率 |
emotion | array | 否 | Sonic-3 的情感标签 (例如:['positivity:high']) |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
audioUrl | string | 生成的音频文件 URL |
audioFile | file | 生成的音频文件对象 |
duration | number | 音频时长(秒) |
characterCount | number | 已处理的字符数 |
format | string | 音频格式 |
provider | string | 所用 TTS 提供商 |
Google Cloud TTS
提供商*
Google Cloud TTS
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
语音 ID
例如:en-US-Neural2-A
语言代码*
例如:en-US, es-ES
语速
0.25
音调
-20
Google Cloud TTS (
tts_google)使用 Google Cloud Text-to-Speech 将文本转换为语音
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 是 | 要转换为语音的文本 |
apiKey | string | 是 | Google Cloud API 密钥 |
voiceId | string | 否 | 语音 ID(例如 en-US-Neural2-A、en-US-Wavenet-D) |
languageCode | string | 是 | 语言代码(例如 en-US、es-ES、fr-FR) |
gender | string | 否 | 语音性别(MALE、FEMALE、NEUTRAL) |
audioEncoding | string | 否 | 音频编码(LINEAR16、MP3、OGG_OPUS、MULAW、ALAW) |
speakingRate | number | 否 | 语速(0.25 到 2.0,默认:1.0) |
pitch | number | 否 | 音调(-20.0 到 20.0,默认:0.0) |
volumeGainDb | number | 否 | 音量增益,单位为 dB(-96.0 到 16.0) |
sampleRateHertz | number | 否 | 采样率,单位为 Hz |
effectsProfileId | array | 否 | 效果配置(例如 ['headphone-class-device']) |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
audioUrl | string | 生成的音频文件 URL |
audioFile | file | 生成的音频文件对象 |
duration | number | 音频时长(秒) |
characterCount | number | 已处理的字符数 |
format | string | 音频格式 |
provider | string | 所用的 TTS 提供商 |
Azure TTS
提供商*
Azure TTS
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
语音 ID
例如:en-US-JennyNeural
区域
例如:eastus、westus
输出格式
MP3 24kHz 96kbps
说话风格
例如:cheerful、sad、angry
Azure TTS (
tts_azure)使用 Azure Cognitive Services 将文本转换为语音
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 是 | 要转换为语音的文本 |
apiKey | string | 是 | Azure Speech Services API 密钥 |
voiceId | string | 否 | 语音 ID (例如:en-US-JennyNeural、en-US-GuyNeural) |
region | string | 否 | Azure 区域 (例如:eastus、westus、westeurope) |
outputFormat | string | 否 | 输出音频格式 |
rate | string | 否 | 语速 (例如:+10%、-20%、1.5) |
pitch | string | 否 | 音调 (例如:+5Hz、-2st、low) |
style | string | 否 | 说话风格 (例如:cheerful、sad、angry,仅限神经语音) |
styleDegree | number | 否 | 风格强度 (0.01 到 2.0) |
role | string | 否 | 角色 (例如:Girl、Boy、YoungAdultFemale) |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
audioUrl | string | 生成的音频文件 URL |
audioFile | file | 生成的音频文件对象 |
duration | number | 音频时长(秒) |
characterCount | number | 已处理的字符数 |
format | string | 音频格式 |
provider | string | 使用的 TTS 提供商 |
PlayHT
提供商*
PlayHT
文本*
输入要转换为语音的文本...
API 密钥*
••••••••
用户 ID*
••••••••
音色
音色 ID 或清单 URL
质量
标准
语速
0.5
PlayHT (
tts_playht)使用 PlayHT 将文本转换为语音(语音克隆)
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
text | string | 是 | 要转换为语音的文本 |
apiKey | string | 是 | PlayHT API 密钥(AUTHORIZATION 请求头) |
userId | string | 是 | PlayHT 用户 ID(X-USER-ID 请求头) |
voice | string | 否 | 语音 ID 或清单 URL |
quality | string | 否 | 质量级别(draft、standard、premium) |
outputFormat | string | 否 | 输出格式(mp3、wav、ogg、flac、mulaw) |
speed | number | 否 | 语速倍数(0.5 到 2.0) |
temperature | number | 否 | 创意度/随机度(0.0 到 2.0) |
voiceGuidance | number | 否 | 语音稳定性(1.0 到 6.0) |
textGuidance | number | 否 | 文本遵循度(1.0 到 6.0) |
sampleRate | number | 否 | 采样率(8000、16000、22050、24000、44100、48000) |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
audioUrl | string | 生成的音频文件 URL |
audioFile | file | 生成的音频文件对象 |
duration | number | 音频时长(秒) |
characterCount | number | 已处理的字符数 |
format | string | 音频格式 |
provider | string | 所用 TTS 提供商 |
使用说明
使用 OpenAI、Deepgram、ElevenLabs、Cartesia、Google Cloud、Azure 和 PlayHT 的先进 AI 音色,将文本转换为自然流畅的语音。支持多种音色、语言和音频格式。
备注
- 分类:
tools - 类型:
tts