Transcripción de llamadas del SAT: cómo adaptar la IA de voz al lenguaje técnico de cada empresa

No todas las conversaciones suenan igual. Y en un servicio técnico, entender bien una llamada no depende solo de reconocer palabras, sino de interpretar correctamente nombres de servicios, términos de red, equipos, tecnologías y expresiones propias del negocio.

Esta fue una de las líneas de trabajo explicadas por el equipo de I+D de Sarenet: el desarrollo y adaptación de un modelo de transcripción de audio a texto pensado para llamadas del Servicio de Asistencia Técnica (SAT). El objetivo es convertir el canal telefónico en información útil para alimentar otros sistemas internos de apoyo, como la identificación del cliente, del servicio afectado o del motivo de la consulta.

 

Descubre más en nuestro Academy

 

 

El teléfono sigue siendo un canal clave en soporte

 

En el SAT, no todas las consultas llegan por correo electrónico. Muchas se producen por teléfono, un canal especialmente importante cuando el cliente necesita explicar una incidencia, aportar contexto o recibir atención de forma directa.

El reto es que gran parte de la información valiosa de esas llamadas desaparece si no puede ser procesada por los sistemas internos. Para aprovecharla, el primer paso es convertir el audio en texto.

Según explicó el equipo de I+D de Sarenet, si una llamada puede transcribirse, ese texto puede conectarse después con los sistemas ya desarrollados para identificar quién llama, desde dónde llama, qué servicio está implicado o cuál puede ser el problema planteado.

 

Por qué no basta con un modelo generalista  

Existen modelos de transcripción muy conocidos, como Whisper, capaces de convertir audio en texto con buenos resultados. Sin embargo, el equipo de I+D señaló varias limitaciones cuando se piensa en un uso específico para soporte técnico.

La primera es el tamaño. Algunos modelos son muy grandes y requieren más recursos. La segunda es el tiempo de respuesta. Para una llamada del SAT, la transcripción debe funcionar en tiempo real o casi real, porque no tendría sentido esperar a que termine la conversación para aportar contexto al técnico.

La tercera limitación es el vocabulario. En Sarenet, las llamadas están relacionadas con telecomunicaciones, conectividad, seguridad, cloud, routers, VLAN, ONT, firewalls u otros conceptos técnicos. Un modelo generalista puede reconocer bien una conversación común, pero fallar en términos propios del dominio.

Por todo ello se optó por una solución que permitiera mantener el control sobre el propio modelo. Soluciones cerradas o modelos grandes de propósito general resultan opacos y difíciles de ajustar a las necesidades concretas del servicio. Disponer de un modelo trazable, interpretable y adaptable, permite entender su rendimiento y reentrenarlo o afinarlo cuando cambian los requisitos: incorporar nueva terminología o corregir errores recurrentes detectados en producción, sin depender de terceros.

Por eso, el equipo optó por trabajar con modelos más ligeros y adaptables, orientados al castellano (y otras lenguas cooficiales) y capaces de ajustarse al vocabulario técnico de Sarenet.

 
   

Cómo funciona un modelo de voz adaptado

 

El sistema explicado se apoya en tres componentes principales.

El primero es el modelo acústico, que recibe el audio en bruto y lo transforma en sonidos o fonemas. El segundo es el diccionario fonético, que indica cómo se pronuncian las palabras. El tercero es el modelo de lenguaje, que ayuda a decidir qué palabra es más probable en función de los sonidos reconocidos y del contexto.

El diccionario fonético es una pieza especialmente importante. No basta con incluir una palabra escrita correctamente; también hay que representar cómo se pronuncia. Esto es clave en términos técnicos, nombres de servicios, marcas, siglas o expresiones que pueden decirse de varias formas.

Por ejemplo, una misma palabra técnica puede pronunciarse de manera distinta según la persona. El sistema debe contemplar esas posibilidades para reconocerla correctamente durante una llamada.

 

Curar el diccionario para que el modelo entienda a Sarenet  

El equipo de I+D recibió un diccionario base con más de 425.000 términos. A partir de ahí realizó un trabajo de limpieza, adaptación e incorporación de términos del dominio.

El objetivo era eliminar palabras que no aportaban valor para el contexto de Sarenet, como términos médicos, palabras de otros idiomas o entradas mal representadas, e incorporar vocabulario técnico propio. También se revisaron pronunciaciones para ajustarlas a la forma en que realmente se utilizan esos términos en el entorno de soporte.

Este trabajo permite que el modelo reconozca con mayor precisión palabras relevantes para el SAT. Términos como Sarenet, ONT, VLAN o firewall mejoraban notablemente cuando el modelo se adaptaba con el diccionario adecuado. De igual manera, nombres de calles, personas o empresas en idiomas cooficiales fueron incluidos para ayudar a identificar la procedencia de la notificación.

La diferencia es importante: un error en una palabra técnica puede cambiar por completo el sentido de una incidencia. Reconocer correctamente esos términos ayuda a interpretar mejor el problema desde el primer momento.

 

Descubre más en nuestro Academy

 

 

Transcripción en tiempo real para ayudar durante la llamada

 

Uno de los requisitos principales del proyecto es que la transcripción sea útil mientras la llamada está en curso.

El equipo de I+D explicó que el sistema está pensado para que el audio pueda convertirse en texto de forma inmediata y ese texto pueda enviarse a otros modelos. A partir de ahí, esos modelos podrían intentar identificar el cliente, detectar el servicio afectado o extraer el motivo de la consulta.

El valor no está en que el técnico lea lo que ya está escuchando, sino en que el sistema pueda generar contexto automáticamente. Por ejemplo, si durante la conversación aparece una pista útil sobre el cliente o el servicio, esa información podría servir para agilizar la atención.

 
   

Un entorno de pruebas con centralita virtual  

Para probar este funcionamiento, el equipo creó una centralita virtual en un entorno experimental controlado. Esta centralita permite capturar y transmitir el audio a servidores donde se realizan las transcripciones.

También permite separar canales de audio. Es decir, puede distinguir entre el audio de la persona que llama y el de quien atiende la llamada. Esta separación facilita enviar al sistema únicamente la parte que interesa procesar en cada caso.

El entorno se diseñó sobre una centralita virtual con redundancia y con capacidad para probar diferentes modelos de transcripción. Gracias a ello, el equipo pudo comparar comportamientos y evaluar qué modelo respondía mejor a las necesidades reales del SAT.

 

Comparación con modelos más grandes

 

Durante las pruebas, el equipo comparó el modelo adaptado con modelos generalistas de mayor tamaño.

El resultado no se planteó únicamente en términos de precisión palabra a palabra, sino también de utilidad práctica. En algunos casos, modelos más grandes podían ofrecer buenos resultados, pero también introducían problemas no deseados, como caracteres o frases en otros idiomas durante silencios.

El modelo adaptado, al estar más controlado y orientado al contexto de Sarenet, evitaba parte de esos comportamientos. Además, tenía una ventaja relevante: era mucho más ligero, ocupaba bastante menos, lo que facilita su despliegue y uso en entornos propios.

 

Del audio al conocimiento operativo  

La transcripción de llamadas no es un fin en sí mismo. Es una primera capa para que la información hablada pueda integrarse en procesos internos de soporte.

Una vez convertida en texto, la conversación puede servir para alimentar sistemas de identificación, clasificación o generación de recomendaciones. Puede ayudar a detectar quién llama, qué necesita o qué documentación puede ser relevante para resolver una incidencia.

Este enfoque no sustituye la atención humana, sino que la refuerza. El equipo técnico sigue siendo quien escucha, interpreta y toma decisiones, pero puede apoyarse en sistemas que ordenan información y reducen tareas repetitivas.

 

Una IA más útil porque entiende el contexto

 

El trabajo presentado por el equipo de I+D de Sarenet muestra una idea esencial: para que la inteligencia artificial aporte valor en una empresa, debe adaptarse al contexto real en el que va a trabajar.

En soporte técnico, ese contexto incluye vocabulario especializado, llamadas en tiempo real, identificación de servicios y necesidad de respuestas ágiles. Un modelo generalista puede ser potente, pero un modelo ajustado al dominio puede resultar más útil para una tarea concreta.

Aplicada al SAT, la transcripción de llamadas con un modelo de voz adaptado permite aprovechar mejor la información que ya aparece en la conversación con el cliente. Y eso abre la puerta a una atención más ágil, más contextualizada y mejor alineada con las necesidades reales de cada empresa.

 

Descubre más en nuestro Academy

 

Sobre este Autor

Enviar una respuesta

Aviso de Privacidad.
Los datos facilitados en este formulario, quedarán registrados en un fichero titularidad de SARENET S.A.U., responsable del Fichero cuyos datos se detallan en el Aviso Legal, con la finalidad que los usuarios interesados contacten con los asesores y estos den respuesta a sus dudas e inquietudes en relación a los servicios ofrecidos. Podrás ejercer tus derechos de acceso, rectificación, supresión o limitación de la información personal, así como el de oposición a su tratamiento, mediante comunicación al e-mail: protecciondedatos@sarenet.es. Para más información sobre como tratamos tus datos, visita nuestra Política de privacidad.

No hay comentarios