语音转文字
使用 AI 将语音转换为文字
配置
OpenAI Whisper
提供商*
OpenAI Whisper
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用上一模块的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Whisper-1
翻译为英语
Disabled
OpenAI Whisper (
stt_whisper)使用 OpenAI Whisper 将音频转录为文本
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
provider | string | 是 | STT 提供方 (whisper) |
apiKey | string | 是 | OpenAI API 密钥 |
model | string | 否 | 要使用的 Whisper 模型 (默认:whisper-1) |
audioFile | file | 否 | 要转录的音频或视频文件 |
audioFileReference | file | 否 | 引用先前区块中的音频/视频文件 |
audioUrl | string | 否 | 音频或视频文件的 URL |
language | string | 否 | 语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测 |
timestamps | string | 否 | 时间戳粒度:none、sentence 或 word |
translateToEnglish | boolean | 否 | 将音频翻译为英语 |
prompt | string | 否 | 可选文本,用于引导模型风格或接续上一段音频。有助于专有名词和上下文。 |
temperature | number | 否 | 采样温度,范围为 0 到 1。值越高输出越随机,值越低越集中、确定性越强。 |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
transcript | string | 完整转录文本 |
segments | array | 带时间戳的片段 |
language | string | 检测到的或指定的语言 |
duration | number | 音频时长(秒) |
Deepgram
提供商*
Deepgram
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用先前模块中的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Nova 3
说话人分离
Disabled
Deepgram (
stt_deepgram)使用 Deepgram 将音频转录为文本
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
provider | string | 是 | STT 提供商 (deepgram) |
apiKey | string | 是 | Deepgram API 密钥 |
model | string | 否 | 要使用的 Deepgram 模型 (nova-3、nova-2、whisper-large 等) |
audioFile | file | 否 | 要转录的音频或视频文件 |
audioFileReference | file | 否 | 来自先前模块的音频/视频文件引用 |
audioUrl | string | 否 | 音频或视频文件的 URL |
language | string | 否 | 语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测 |
timestamps | string | 否 | 时间戳粒度:none、sentence 或 word |
diarization | boolean | 否 | 启用说话人分离 |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
transcript | string | 完整转录文本 |
segments | array | 带说话人标签的时间戳片段 |
language | string | 检测到的或指定的语言 |
duration | number | 音频时长(秒) |
confidence | number | 总体置信度 |
ElevenLabs
提供商*
ElevenLabs
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用先前模块中的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Scribe v1
ElevenLabs (
stt_elevenlabs)使用 ElevenLabs 将音频转写为文本
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
provider | string | 是 | STT 提供商 (elevenlabs) |
apiKey | string | 是 | ElevenLabs API 密钥 |
model | string | 否 | 要使用的 ElevenLabs 模型 (scribe_v1、scribe_v1_experimental) |
audioFile | file | 否 | 要转写的音频或视频文件 |
audioFileReference | file | 否 | 引用先前模块中的音频/视频文件 |
audioUrl | string | 否 | 音频或视频文件的 URL |
language | string | 否 | 语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测 |
timestamps | string | 否 | 时间戳粒度:none、sentence 或 word |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
transcript | string | 完整转写文本 |
segments | array | 带时间戳的片段 |
language | string | 检测到的或指定的语言 |
duration | number | 音频时长(秒) |
confidence | number | 总体置信度分数 |
AssemblyAI
提供商*
AssemblyAI
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用先前模块中的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Best
说话人分离
Disabled
情感分析
Disabled
实体检测
Disabled
PII 脱敏
Disabled
自动摘要
Disabled
AssemblyAI (
stt_assemblyai)使用 AssemblyAI 将音频转录为文本,支持高级 NLP 功能
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
provider | string | 是 | STT 提供商 (assemblyai) |
apiKey | string | 是 | AssemblyAI API 密钥 |
model | string | 否 | 要使用的 AssemblyAI 模型 (默认:best) |
audioFile | file | 否 | 要转录的音频或视频文件 |
audioFileReference | file | 否 | 来自先前区块的音频/视频文件引用 |
audioUrl | string | 否 | 音频或视频文件的 URL |
language | string | 否 | 语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测 |
timestamps | string | 否 | 时间戳粒度:none、sentence 或 word |
diarization | boolean | 否 | 启用说话人分离 |
sentiment | boolean | 否 | 启用情感分析 |
entityDetection | boolean | 否 | 启用实体检测 |
piiRedaction | boolean | 否 | 启用 PII 脱敏 |
summarization | boolean | 否 | 启用自动摘要 |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
transcript | string | 完整转录文本 |
segments | array | 带说话人标签的时间戳片段 |
language | string | 检测到或指定的语言 |
duration | number | 音频时长(秒) |
confidence | number | 总体置信度分数 |
sentiment | array | 情感分析结果 |
entities | array | 检测到的实体 |
summary | string | 自动生成的摘要 |
Google Gemini
提供商*
Google Gemini
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用上一模块的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Gemini 2.5 Flash
Google Gemini (
stt_gemini)使用具备多模态能力的 Google Gemini 将音频转录为文本
输入
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
provider | string | 是 | STT 提供商 (gemini) |
apiKey | string | 是 | Google API 密钥 |
model | string | 否 | 要使用的 Gemini 模型 (默认:gemini-2.5-flash) |
audioFile | file | 否 | 要转录的音频或视频文件 |
audioFileReference | file | 否 | 对先前区块中音频/视频文件的引用 |
audioUrl | string | 否 | 音频或视频文件的 URL |
language | string | 否 | 语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测 |
timestamps | string | 否 | 时间戳粒度:none、sentence 或 word |
输出
| 参数 | 类型 | 说明 |
|---|---|---|
transcript | string | 完整转录文本 |
segments | array | 带时间戳的分段 |
language | string | 检测到或指定的语言 |
duration | number | 音频时长(秒) |
confidence | number | 总体置信度分数 |
使用说明
使用领先的 AI 提供商将音频和视频文件转录为文本。支持多语言、时间戳和说话人分离。
备注
- 类别:
tools - 类型:
stt