Lo que vamos aprendiendo montando esto. Sin notas de prensa: fallos que nos costaron un día, medidas que salieron al revés de lo esperado y decisiones que hay que explicar.
Whisper es el modelo de reconocimiento de voz de OpenAI, publicado con licencia abierta, y es lo que hay debajo de casi todo lo que transcribe hoy. Aquí tienes qué es, cómo funciona, cuándo te conviene montártelo tú y qué límites tiene.
MCP es la forma estándar de darle herramientas a un asistente de IA. En vez de describirle cada API a mano, le das una dirección y él descubre solo lo que puede hacer. Aquí tienes qué es, cómo funciona y cuándo te conviene montar uno.
Una marca de agua es una señal imperceptible incrustada dentro del sonido que dice «esto lo hizo una máquina». Aquí tienes qué es, por qué importa la procedencia del audio, y por qué una firma sirve sobre todo para descartar, no para presumir.
Speech-to-text convierte audio hablado en texto escrito. Aquí tienes qué es, cómo funciona por dentro sin jerga, y en qué fijarte de verdad —precisión, idiomas, latencia y coste— antes de elegir un proveedor.
Text-to-speech convierte texto escrito en audio hablado. Aquí tienes qué es, cómo funciona por dentro sin jerga, y en qué fijarte de verdad —calidad, idiomas, latencia y coste— antes de elegir un proveedor.
La diarización responde a una sola pregunta: quién habla y cuándo. No dice quién es cada uno; separa voces y les pone etiquetas. Aquí tienes qué es, cómo funciona, cuándo la necesitas y dónde están sus límites.
Clonar una voz es construir una voz sintética que reproduce el timbre de otra a partir de una muestra corta. Aquí tienes qué es de verdad, cómo aprende de esa muestra, cuándo suena nativa y cuándo con acento, y de quién puedes clonarla.
IA sostenible de verdad: Uttera no corre en la nube de nadie: los motores están en instalaciones propias con energía solar de autoconsumo. Factura eléctrica cero desde hace tres años, medida en el contador del distribuidor y comprobable en vivo.
Qué servicios ofrece cada API de voz —TTS, transcripción, diarización, clonado, traducción— y cuánto cobra por ellos. Una comparación honesta y con los precios a fecha, para que elijas con datos y no con marketing.
Dos licencias apiladas, un umbral de facturación, una atribución obligatoria y un dato de entrenamiento que casi nadie cuenta. Lo que necesitas saber antes de poner una pieza generada en algo que se publica.
El artículo 50 se aplica desde agosto de 2026 y nuestro plazo termina en diciembre. Lo cumplimos desde septiembre, con una herramienta pública de Meta — así que puedes comprobarlo tú, sin pedirnos nada.
Lo que de verdad distingue a un proveedor no es dónde dice que procesa, es qué hace cuando se llena. Nosotros contestamos 503. Lo que no hacemos es reenviar tu audio a la API de otro para que no se note.
Bajar un efecto de un vídeo ajeno es una licencia que no tienes, con la duración equivocada y el ruido de la sala de otro. Generarlo cuesta segundos y sale a medida — con sus límites, que también contamos.
Cada informe lleva dos firmas y cada una contesta una pregunta distinta: si el texto salió de aquí, y si el fichero es exactamente el que emitimos. Se comprueban subiendo el PDF, sin cuenta y sin fiarte de nadie.
Escribes la frase que necesitas, la oyes, la dices tú y te devolvemos lo que hemos entendido, palabra a palabra. Sin nota, sin puntuación y sin gamificación: un espejo honesto.
Si le das audio vacío, no devuelve cadena vacía: se inventa una frase. Y lo peor no es pagarla, es que tu automatización actúe sobre ella.
Son estimaciones acústicas. Se equivocan. Y hay un uso que no vamos a apoyar aunque nos lo pidan pagando.
No es una etiqueta de marketing. Es la diferencia entre un expediente que pasa y uno que se queda esperando un informe jurídico.
Una grabación de 70 minutos son 15.410 tokens de transcripción y menos de 700 de resumen. Entre veinte y treinta veces menos, y la grabación no sale de aquí.
La frase corta decía más de lo que queríamos decir, y nos cerraba una puerta legítima. Repasamos las cinco veces que aparecía en la web.
Los motores que mueven Uttera son código abierto. Esto es lo que hace falta para levantarlos en tu máquina, sin pasar por nosotros.
No es una decisión de calidad. Es de cómo cada uno usa la memoria de la GPU, y elegir mal es la forma más rápida de perder una tarde.
La diferencia entre «separar interlocutores» e «identificar personas» se explica en dos párrafos y ahorra una decepción cara.
Mismas rutas, mismos parámetros, mismos nombres de voz. Lo que hay que cambiar es la URL base, la clave… y una cosa más que no es obvia.
Empezó como una herramienta para uso propio en un grupo empresarial familiar español. No se diseñó para vender. Por eso está hecha como está.
Diez guiones y un fichero de instrucciones. Lo difícil no es la API: es decirle al agente cuándo usar cada cosa y qué no creerse.
Se cobra por segundo de audio, no por petición. Eso cambia cómo conviene trocear el trabajo, y hay un truco que te ahorra dinero antes de enviar nada.
La parte técnica se resuelve con diez segundos de audio limpio. La parte que casi nadie escribe es la otra: que una voz es un atributo de una persona.
Guardamos una hora el audio que generamos, y cuesta el 10 %. Una hora de caché no es una hora de acceso a tus datos, y puedes apagarla en cada petición.
Tu centralita ya está escribiendo ficheros .wav en algún sitio. Apuntar un guion a esa carpeta es media hora. Meter la voz dentro de la llamada es un día, y aquí están las cinco trampas.