Voz a texto

Convierte voz a texto con IA

Configuración

OpenAI Whisper

Proveedor*
OpenAI Whisper
Archivo de audio/video*
Sube un archivo de audio o video
Referencia de archivo de audio/video*
Referencia audio/video de bloques anteriores
URL de audio/video
O introduce una URL de audio/video de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave API*
••••••••
Modelo*
Whisper-1
Traducir al inglés
Disabled
OpenAI Whisper (stt_whisper)

Transcribir audio a texto usando OpenAI Whisper

Entrada
ParámetroTipoObligatorioDescripción
providerstringSíProveedor STT (whisper)
apiKeystringSíClave de API de OpenAI
modelstringNoModelo Whisper a usar (predeterminado: whisper-1)
audioFilefileNoArchivo de audio o video para transcribir
audioFileReferencefileNoReferencia a un archivo de audio/video de bloques anteriores
audioUrlstringNoURL de un archivo de audio o video
languagestringNoCódigo de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática
timestampsstringNoGranularidad de marcas de tiempo: none, sentence o word
translateToEnglishbooleanNoTraducir el audio al inglés
promptstringNoTexto opcional para orientar el estilo del modelo o continuar un segmento de audio anterior. Ayuda con nombres propios y el contexto.
temperaturenumberNoTemperatura de muestreo entre 0 y 1. Valores más altos hacen la salida más aleatoria; valores más bajos, más enfocada y determinista.
Salida
ParámetroTipoDescripción
transcriptstringTexto transcrito completo
segmentsarraySegmentos con marcas de tiempo
languagestringIdioma detectado o especificado
durationnumberDuración del audio en segundos

Deepgram

Proveedor*
Deepgram
Archivo de audio/vídeo*
Sube un archivo de audio o vídeo
Referencia de archivo de audio/vídeo*
Referencia audio/vídeo de bloques anteriores
URL de audio/vídeo
O introduce una URL de audio/vídeo de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave de API*
••••••••
Modelo*
Nova 3
Diarización de hablantes
Disabled
Deepgram (stt_deepgram)

Transcribe audio a texto con Deepgram

Entrada
ParámetroTipoObligatorioDescripción
providerstringSíProveedor STT (deepgram)
apiKeystringSíClave API de Deepgram
modelstringNoModelo de Deepgram a usar (nova-3, nova-2, whisper-large, etc.)
audioFilefileNoArchivo de audio o vídeo para transcribir
audioFileReferencefileNoReferencia a un archivo de audio/vídeo de bloques anteriores
audioUrlstringNoURL de un archivo de audio o vídeo
languagestringNoCódigo de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática
timestampsstringNoGranularidad de marcas de tiempo: none, sentence o word
diarizationbooleanNoActivar diarización de locutores
Salida
ParámetroTipoDescripción
transcriptstringTexto transcrito completo
segmentsarraySegmentos con marcas de tiempo y etiquetas de locutor
languagestringIdioma detectado o especificado
durationnumberDuración del audio en segundos
confidencenumberPuntuación de confianza general

ElevenLabs

Proveedor*
ElevenLabs
Archivo de audio/vídeo*
Carga un archivo de audio o vídeo
Referencia de archivo de audio/vídeo*
Referencia de audio/vídeo de bloques anteriores
URL de audio/vídeo
O introduce una URL pública de audio/vídeo
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave API*
••••••••
Modelo*
Scribe v1
ElevenLabs (stt_elevenlabs)

Transcribir audio a texto con ElevenLabs

Entrada
ParámetroTipoObligatorioDescripción
providerstringSíProveedor STT (elevenlabs)
apiKeystringSíClave API de ElevenLabs
modelstringNoModelo de ElevenLabs a usar (scribe_v1, scribe_v1_experimental)
audioFilefileNoArchivo de audio o video para transcribir
audioFileReferencefileNoReferencia a un archivo de audio/video de bloques anteriores
audioUrlstringNoURL de un archivo de audio o video
languagestringNoCódigo de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática
timestampsstringNoGranularidad de marcas de tiempo: none, sentence o word
Salida
ParámetroTipoDescripción
transcriptstringTexto transcrito completo
segmentsarraySegmentos con marcas de tiempo
languagestringIdioma detectado o especificado
durationnumberDuración del audio en segundos
confidencenumberPuntuación de confianza general

AssemblyAI

Proveedor*
AssemblyAI
Archivo de audio/video*
Cargar un archivo de audio o video
Referencia de archivo de audio/video*
Referenciar audio/video de bloques anteriores
URL de audio/video
O introduzca una URL de audio/video de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguna
Clave API*
••••••••
Modelo*
Best
Diarización de locutores
Disabled
Análisis de sentimiento
Disabled
Detección de entidades
Disabled
Redacción de PII
Disabled
Resumen automático
Disabled
AssemblyAI (stt_assemblyai)

Transcribe audio a texto usando AssemblyAI con funciones avanzadas de NLP

Entrada
ParámetroTipoObligatorioDescripción
providerstringSíProveedor STT (assemblyai)
apiKeystringSíClave de API de AssemblyAI
modelstringNoModelo de AssemblyAI que se usará (predeterminado: best)
audioFilefileNoArchivo de audio o video para transcribir
audioFileReferencefileNoReferencia a un archivo de audio/video de bloques anteriores
audioUrlstringNoURL de un archivo de audio o video
languagestringNoCódigo de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática
timestampsstringNoGranularidad de marcas de tiempo: none, sentence o word
diarizationbooleanNoHabilitar diarización de hablantes
sentimentbooleanNoHabilitar análisis de sentimiento
entityDetectionbooleanNoHabilitar detección de entidades
piiRedactionbooleanNoHabilitar redacción de PII
summarizationbooleanNoHabilitar resumen automático
Salida
ParámetroTipoDescripción
transcriptstringTexto transcrito completo
segmentsarraySegmentos con marcas de tiempo y etiquetas de hablante
languagestringIdioma detectado o especificado
durationnumberDuración del audio en segundos
confidencenumberPuntuación de confianza general
sentimentarrayResultados del análisis de sentimiento
entitiesarrayEntidades detectadas
summarystringResumen generado automáticamente

Google Gemini

Proveedor*
Google Gemini
Archivo de audio/video*
Cargue un archivo de audio o video
Referencia de archivo de audio/video*
Referencie audio/video de bloques anteriores
URL de audio/video
O introduzca una URL de audio/video de acceso público
Idioma*
Detección automática
Marcas de tiempo*
Ninguno
Clave de API*
••••••••
Modelo*
Gemini 2.5 Flash
Google Gemini (stt_gemini)

Transcribe audio a texto usando Google Gemini con capacidades multimodales

Entrada
ParámetroTipoObligatorioDescripción
providerstringSíProveedor STT (gemini)
apiKeystringSíClave de API de Google
modelstringNoModelo de Gemini a usar (predeterminado: gemini-2.5-flash)
audioFilefileNoArchivo de audio o vídeo para transcribir
audioFileReferencefileNoReferencia a un archivo de audio/vídeo de bloques anteriores
audioUrlstringNoURL del archivo de audio o vídeo
languagestringNoCódigo de idioma (p. ej., "en", "es", "fr") o "auto" para detección automática
timestampsstringNoGranularidad de las marcas de tiempo: none, sentence o word
Salida
ParámetroTipoDescripción
transcriptstringTexto transcrito completo
segmentsarraySegmentos con marcas de tiempo
languagestringIdioma detectado o especificado
durationnumberDuración del audio en segundos
confidencenumberPuntuación general de confianza

Instrucciones de uso

Transcribe archivos de audio y vídeo a texto usando los principales proveedores de IA. Admite varios idiomas, marcas de tiempo y diarización de hablantes.

Notas

  • Categoría: tools
  • Tipo: stt