Definición·
Capacidades

Speech-to-Text

Tecnología que transcribe automáticamente la voz en texto escrito.

Explicación detallada

El Speech-to-Text (STT) o ASR (Automatic Speech Recognition) se basa en modelos de deep learning capaces de manejar múltiples idiomas, acentos y ruidos de fondo. Alimenta el dictado, la transcripción de reuniones, los subtítulos y el control por voz.

Ejemplos

Transcripción de reuniones en Zoom
Subtítulos automáticos de YouTube
Dictado por voz en iPhone
Whisper (OpenAI)

Preguntas frecuentes

¿Qué precisión se puede esperar?

Los mejores modelos superan el 95% en condiciones favorables; el ruido, los acentos y la terminología específica del sector reducen la calidad.

Términos relacionados

Última actualización: 15/7/2026

Talent AI

Pasa de la teoría a la práctica

Publica una misión o únete a la comunidad de los mejores expertos en IA, Data y Machine Learning.