Voz a texto
Convierte voz a texto con IA
Configuración
OpenAI Whisper
Proveedor*
OpenAI Whisper
Archivo de audio/video*
Sube un archivo de audio o video
Referencia de archivo de audio/video*
Referencia audio/video de bloques anteriores
URL de audio/video
O introduce una URL de audio/video de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave API*
••••••••
Modelo*
Whisper-1
Traducir al inglés
Disabled
OpenAI Whisper (
stt_whisper)Transcribir audio a texto usando OpenAI Whisper
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
provider | string | Sí | Proveedor STT (whisper) |
apiKey | string | Sí | Clave de API de OpenAI |
model | string | No | Modelo Whisper a usar (predeterminado: whisper-1) |
audioFile | file | No | Archivo de audio o video para transcribir |
audioFileReference | file | No | Referencia a un archivo de audio/video de bloques anteriores |
audioUrl | string | No | URL de un archivo de audio o video |
language | string | No | Código de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática |
timestamps | string | No | Granularidad de marcas de tiempo: none, sentence o word |
translateToEnglish | boolean | No | Traducir el audio al inglés |
prompt | string | No | Texto opcional para orientar el estilo del modelo o continuar un segmento de audio anterior. Ayuda con nombres propios y el contexto. |
temperature | number | No | Temperatura de muestreo entre 0 y 1. Valores más altos hacen la salida más aleatoria; valores más bajos, más enfocada y determinista. |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
transcript | string | Texto transcrito completo |
segments | array | Segmentos con marcas de tiempo |
language | string | Idioma detectado o especificado |
duration | number | Duración del audio en segundos |
Deepgram
Proveedor*
Deepgram
Archivo de audio/vídeo*
Sube un archivo de audio o vídeo
Referencia de archivo de audio/vídeo*
Referencia audio/vídeo de bloques anteriores
URL de audio/vídeo
O introduce una URL de audio/vídeo de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave de API*
••••••••
Modelo*
Nova 3
Diarización de hablantes
Disabled
Deepgram (
stt_deepgram)Transcribe audio a texto con Deepgram
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
provider | string | Sí | Proveedor STT (deepgram) |
apiKey | string | Sí | Clave API de Deepgram |
model | string | No | Modelo de Deepgram a usar (nova-3, nova-2, whisper-large, etc.) |
audioFile | file | No | Archivo de audio o vídeo para transcribir |
audioFileReference | file | No | Referencia a un archivo de audio/vídeo de bloques anteriores |
audioUrl | string | No | URL de un archivo de audio o vídeo |
language | string | No | Código de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática |
timestamps | string | No | Granularidad de marcas de tiempo: none, sentence o word |
diarization | boolean | No | Activar diarización de locutores |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
transcript | string | Texto transcrito completo |
segments | array | Segmentos con marcas de tiempo y etiquetas de locutor |
language | string | Idioma detectado o especificado |
duration | number | Duración del audio en segundos |
confidence | number | Puntuación de confianza general |
ElevenLabs
Proveedor*
ElevenLabs
Archivo de audio/vídeo*
Carga un archivo de audio o vídeo
Referencia de archivo de audio/vídeo*
Referencia de audio/vídeo de bloques anteriores
URL de audio/vídeo
O introduce una URL pública de audio/vídeo
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave API*
••••••••
Modelo*
Scribe v1
ElevenLabs (
stt_elevenlabs)Transcribir audio a texto con ElevenLabs
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
provider | string | Sí | Proveedor STT (elevenlabs) |
apiKey | string | Sí | Clave API de ElevenLabs |
model | string | No | Modelo de ElevenLabs a usar (scribe_v1, scribe_v1_experimental) |
audioFile | file | No | Archivo de audio o video para transcribir |
audioFileReference | file | No | Referencia a un archivo de audio/video de bloques anteriores |
audioUrl | string | No | URL de un archivo de audio o video |
language | string | No | Código de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática |
timestamps | string | No | Granularidad de marcas de tiempo: none, sentence o word |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
transcript | string | Texto transcrito completo |
segments | array | Segmentos con marcas de tiempo |
language | string | Idioma detectado o especificado |
duration | number | Duración del audio en segundos |
confidence | number | Puntuación de confianza general |
AssemblyAI
Proveedor*
AssemblyAI
Archivo de audio/video*
Cargar un archivo de audio o video
Referencia de archivo de audio/video*
Referenciar audio/video de bloques anteriores
URL de audio/video
O introduzca una URL de audio/video de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguna
Clave API*
••••••••
Modelo*
Best
Diarización de locutores
Disabled
Análisis de sentimiento
Disabled
Detección de entidades
Disabled
Redacción de PII
Disabled
Resumen automático
Disabled
AssemblyAI (
stt_assemblyai)Transcribe audio a texto usando AssemblyAI con funciones avanzadas de NLP
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
provider | string | Sí | Proveedor STT (assemblyai) |
apiKey | string | Sí | Clave de API de AssemblyAI |
model | string | No | Modelo de AssemblyAI que se usará (predeterminado: best) |
audioFile | file | No | Archivo de audio o video para transcribir |
audioFileReference | file | No | Referencia a un archivo de audio/video de bloques anteriores |
audioUrl | string | No | URL de un archivo de audio o video |
language | string | No | Código de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática |
timestamps | string | No | Granularidad de marcas de tiempo: none, sentence o word |
diarization | boolean | No | Habilitar diarización de hablantes |
sentiment | boolean | No | Habilitar análisis de sentimiento |
entityDetection | boolean | No | Habilitar detección de entidades |
piiRedaction | boolean | No | Habilitar redacción de PII |
summarization | boolean | No | Habilitar resumen automático |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
transcript | string | Texto transcrito completo |
segments | array | Segmentos con marcas de tiempo y etiquetas de hablante |
language | string | Idioma detectado o especificado |
duration | number | Duración del audio en segundos |
confidence | number | Puntuación de confianza general |
sentiment | array | Resultados del análisis de sentimiento |
entities | array | Entidades detectadas |
summary | string | Resumen generado automáticamente |
Google Gemini
Proveedor*
Google Gemini
Archivo de audio/video*
Cargue un archivo de audio o video
Referencia de archivo de audio/video*
Referencie audio/video de bloques anteriores
URL de audio/video
O introduzca una URL de audio/video de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave de API*
••••••••
Modelo*
Gemini 2.5 Flash
Google Gemini (
stt_gemini)Transcribe audio a texto usando Google Gemini con capacidades multimodales
Entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
provider | string | Sí | Proveedor STT (gemini) |
apiKey | string | Sí | Clave de API de Google |
model | string | No | Modelo de Gemini a usar (predeterminado: gemini-2.5-flash) |
audioFile | file | No | Archivo de audio o vídeo para transcribir |
audioFileReference | file | No | Referencia a un archivo de audio/vídeo de bloques anteriores |
audioUrl | string | No | URL del archivo de audio o vídeo |
language | string | No | Código de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática |
timestamps | string | No | Granularidad de las marcas de tiempo: none, sentence o word |
Salida
| Parámetro | Tipo | Descripción |
|---|---|---|
transcript | string | Texto transcrito completo |
segments | array | Segmentos con marcas de tiempo |
language | string | Idioma detectado o especificado |
duration | number | Duración del audio en segundos |
confidence | number | Puntuación general de confianza |
Instrucciones de uso
Transcribe archivos de audio y vídeo a texto usando los principales proveedores de IA. Admite varios idiomas, marcas de tiempo y diarización de hablantes.
Notas
- Categoría:
tools - Tipo:
stt