语音转文字

使用 AI 将语音转换为文字

配置

OpenAI Whisper

提供商*
OpenAI Whisper
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用上一模块的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Whisper-1
翻译为英语
Disabled
OpenAI Whisper (stt_whisper)

使用 OpenAI Whisper 将音频转录为文本

输入
参数类型必填说明
providerstring是STT 提供方 (whisper)
apiKeystring是OpenAI API 密钥
modelstring否要使用的 Whisper 模型 (默认:whisper-1)
audioFilefile否要转录的音频或视频文件
audioFileReferencefile否引用先前区块中的音频/视频文件
audioUrlstring否音频或视频文件的 URL
languagestring否语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测
timestampsstring否时间戳粒度:none、sentence 或 word
translateToEnglishboolean否将音频翻译为英语
promptstring否可选文本,用于引导模型风格或接续上一段音频。有助于专有名词和上下文。
temperaturenumber否采样温度,范围为 0 到 1。值越高输出越随机,值越低越集中、确定性越强。
输出
参数类型说明
transcriptstring完整转录文本
segmentsarray带时间戳的片段
languagestring检测到的或指定的语言
durationnumber音频时长(秒)

Deepgram

提供商*
Deepgram
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用先前模块中的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Nova 3
说话人分离
Disabled
Deepgram (stt_deepgram)

使用 Deepgram 将音频转录为文本

输入
参数类型必填说明
providerstring是STT 提供商 (deepgram)
apiKeystring是Deepgram API 密钥
modelstring否要使用的 Deepgram 模型 (nova-3、nova-2、whisper-large 等)
audioFilefile否要转录的音频或视频文件
audioFileReferencefile否来自先前模块的音频/视频文件引用
audioUrlstring否音频或视频文件的 URL
languagestring否语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测
timestampsstring否时间戳粒度:none、sentence 或 word
diarizationboolean否启用说话人分离
输出
参数类型说明
transcriptstring完整转录文本
segmentsarray带说话人标签的时间戳片段
languagestring检测到的或指定的语言
durationnumber音频时长(秒)
confidencenumber总体置信度

ElevenLabs

提供商*
ElevenLabs
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用先前模块中的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Scribe v1
ElevenLabs (stt_elevenlabs)

使用 ElevenLabs 将音频转写为文本

输入
参数类型必填说明
providerstring是STT 提供商 (elevenlabs)
apiKeystring是ElevenLabs API 密钥
modelstring否要使用的 ElevenLabs 模型 (scribe_v1、scribe_v1_experimental)
audioFilefile否要转写的音频或视频文件
audioFileReferencefile否引用先前模块中的音频/视频文件
audioUrlstring否音频或视频文件的 URL
languagestring否语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测
timestampsstring否时间戳粒度:none、sentence 或 word
输出
参数类型说明
transcriptstring完整转写文本
segmentsarray带时间戳的片段
languagestring检测到的或指定的语言
durationnumber音频时长(秒)
confidencenumber总体置信度分数

AssemblyAI

提供商*
AssemblyAI
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用先前模块中的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Best
说话人分离
Disabled
情感分析
Disabled
实体检测
Disabled
PII 脱敏
Disabled
自动摘要
Disabled
AssemblyAI (stt_assemblyai)

使用 AssemblyAI 将音频转录为文本,支持高级 NLP 功能

输入
参数类型必填说明
providerstring是STT 提供商 (assemblyai)
apiKeystring是AssemblyAI API 密钥
modelstring否要使用的 AssemblyAI 模型 (默认:best)
audioFilefile否要转录的音频或视频文件
audioFileReferencefile否来自先前区块的音频/视频文件引用
audioUrlstring否音频或视频文件的 URL
languagestring否语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测
timestampsstring否时间戳粒度:none、sentence 或 word
diarizationboolean否启用说话人分离
sentimentboolean否启用情感分析
entityDetectionboolean否启用实体检测
piiRedactionboolean否启用 PII 脱敏
summarizationboolean否启用自动摘要
输出
参数类型说明
transcriptstring完整转录文本
segmentsarray带说话人标签的时间戳片段
languagestring检测到或指定的语言
durationnumber音频时长(秒)
confidencenumber总体置信度分数
sentimentarray情感分析结果
entitiesarray检测到的实体
summarystring自动生成的摘要

Google Gemini

提供商*
Google Gemini
音频/视频文件*
上传音频或视频文件
音频/视频文件引用*
引用上一模块的音频/视频
音频/视频 URL
或输入可公开访问的音频/视频 URL
语言*
自动检测
时间戳*
无
API 密钥*
••••••••
模型*
Gemini 2.5 Flash
Google Gemini (stt_gemini)

使用具备多模态能力的 Google Gemini 将音频转录为文本

输入
参数类型必填说明
providerstring是STT 提供商 (gemini)
apiKeystring是Google API 密钥
modelstring否要使用的 Gemini 模型 (默认:gemini-2.5-flash)
audioFilefile否要转录的音频或视频文件
audioFileReferencefile否对先前区块中音频/视频文件的引用
audioUrlstring否音频或视频文件的 URL
languagestring否语言代码 (例如 "en"、"es"、"fr") 或 "auto" 表示自动检测
timestampsstring否时间戳粒度:none、sentence 或 word
输出
参数类型说明
transcriptstring完整转录文本
segmentsarray带时间戳的分段
languagestring检测到或指定的语言
durationnumber音频时长(秒)
confidencenumber总体置信度分数

使用说明

使用领先的 AI 提供商将音频和视频文件转录为文本。支持多语言、时间戳和说话人分离。

备注

  • 类别: tools
  • 类型: stt