Por API, o conectando lo que ya tienes. Hay código publicado y probado para
lo de abajo.
Atención telefónica
La centralita graba, Uttera transcribe y resume, y el resultado aterriza donde
trabaja tu gente. No es teoría: hay dos AGI para Asterisk publicados, uno para
hablarle a quien llama y otro para escucharle.
Y la música de espera también sale de aquí: hecha a medida, tan larga como
haga falta y sin una licencia anual detrás.
Cómo se conecta una centralita →
Ventas y CRM
Cada llamada deja una nota escrita con los acuerdos y los siguientes pasos, en vez
de depender de que alguien se acuerde de escribirla. El resumen viene estructurado,
así que se mapea a campos.
Calidad y formación
Sobre una muestra de llamadas: qué se dijo, quién habló cuánto, y en qué tono. Para
detectar dónde se atasca el guion y qué hay que enseñar.
Con un límite que ponemos nosotros: el tono y el perfil son
estimaciones acústicas, se equivocan, y no deben usarse para decidir sobre una
persona — ni para contratar, ni para puntuar a nadie. Están para mejorar procesos,
no para juzgar gente.
Salir de España
Formación, avisos, atención grabada: una vez y en un idioma, y después traducidos y
con voz en los demás. Sin volver a convocar al locutor cada vez que cambia una
frase.
Automatizar sin programar
Si ya usas n8n, hay un nodo y flujos listos para importar: carpeta de
grabaciones dentro, resumen al correo o al chat fuera.
El código, en GitHub →
Juegos y aplicaciones
Aquí el sonido no es postproducción, es parte del producto: los efectos y
la música se piden por la API mientras la aplicación corre, con una descripción y
una duración.
Y lo que se genera es tuyo, así que no hay que revisar la licencia de cada
pieza antes de publicar una versión.
Accesibilidad, que ya es obligación
Desde el 28 de junio de 2025, la Ley 11/2023 exige subtítulos y
audiodescripción en el contenido audiovisual que publiques, y alcanza al comercio
electrónico, la banca, el transporte y las telecomunicaciones.
Los subtítulos salen de la transcripción y la audiodescripción de la voz: es
exactamente el trabajo que esto ya hace. Cumplir deja de ser un proyecto y pasa a
ser una casilla.
Marketing y contenido de marca
Una campaña son muchas piezas pequeñas: la cuña, el vídeo de producto, el
mensaje del stand, y las mismas cuatro veces en cuatro idiomas.
Voz, música y efectos salen del mismo sitio y con licencia comercial. No
hay que comprar una licencia de librería por pieza, ni volver al estudio porque
alguien cambió una frase el día antes.
Agentes de IA
Somos compatibles con la API de OpenAI: si tu agente ya habla con ella, cambias la
URL base y ya oye y habla. Hay además una skill hecha para agentes.
Y si eres programador de inteligencia artificial, esto va antes que el
producto: hablarle a tu propio agente en vez de teclearle, y oír lo que responde
mientras miras otra cosa. La misma clave sirve para las dos cosas.
Y uno que casi nadie ve: pagar menos a tu LLM
Si un modelo de lenguaje de otro proveedor tiene que razonar sobre una llamada, la
vía cara es mandarle la transcripción entera. La barata es mandarle el resumen.
Medido sobre una grabación real de 70 minutos: 15.410 tokens de
transcripción frente a menos de 700 de resumen. Entre veinte y treinta veces
menos. Y de paso, la grabación no sale de aquí.
Las cifras y cuándo NO
conviene →
Lo que cuesta empezar
Una cuenta gratuita con créditos para probar, sin tarjeta y sin pagos. Lo que se
cobra se cobra por segundo de audio, no por petición, y la respuesta trae en
una cabecera exactamente lo que se ha facturado.
Ver los planes →