OpenAI ha anunciado la incorporación de nuevas funciones de inteligencia vocal a su API con el objetivo de facilitar a desarrolladores y empresas la creación de aplicaciones capaces de hablar, transcribir y traducir conversaciones en tiempo real. La actualización refuerza la apuesta de la compañía por las interfaces conversacionales y amplía el papel del audio dentro de su ecosistema de modelos.
Entre las principales novedades destaca GPT-Realtime-2, un nuevo modelo de voz diseñado para ofrecer interacciones vocales más naturales y realistas con los usuarios. A diferencia de su predecesor, GPT-Realtime-1.5, esta nueva versión incorpora razonamiento de clase GPT-5, lo que, según la compañía, le permite gestionar solicitudes más complejas y sostener conversaciones con mayor capacidad contextual.
La compañía también ha presentado GPT-Realtime-Translate, una nueva función orientada a la traducción conversacional en tiempo real. El sistema está diseñado para traducir manteniendo el ritmo natural de la conversación, con capacidad para comprender más de 70 idiomas de entrada y generar respuestas en 13 idiomas de salida.
A estas novedades se suma GPT-Realtime-Whisper, una nueva herramienta de transcripción en directo que convierte voz en texto a medida que se producen las interacciones. La función permite capturar conversaciones en tiempo real, ampliando las posibilidades de uso en entornos donde la documentación instantánea del diálogo resulta relevante.
“En conjunto, los modelos que lanzamos llevan el audio en tiempo real de una simple dinámica de llamada y respuesta a interfaces de voz que realmente pueden funcionar: escuchar, razonar, traducir, transcribir y actuar a medida que se desarrolla una conversación”, señaló la compañía en el anuncio.
Nuevas aplicaciones en atención al cliente, educación y medios
Aunque uno de los usos más evidentes de estas capacidades se encuentra en el ámbito de la atención al cliente, OpenAI apunta a un abanico de aplicaciones más amplio. La empresa destaca su potencial en sectores como educación, medios de comunicación, eventos en directo y plataformas para creadores, donde las interacciones de voz en tiempo real pueden mejorar la experiencia de usuario y automatizar parte de los procesos operativos.
La evolución también refleja una tendencia creciente dentro del sector tecnológico: el paso de asistentes conversacionales basados en texto hacia interfaces multimodales capaces de procesar voz, lenguaje y contexto de forma simultánea.
Salvaguardas frente al uso indebido
Junto con el lanzamiento, OpenAI ha subrayado que estas capacidades incorporan mecanismos de protección diseñados para evitar usos abusivos, como spam, fraude u otras formas de manipulación en línea.
Según la compañía, el sistema integra desencadenantes de seguridad que permiten interrumpir conversaciones si se detectan interacciones que vulneren sus políticas sobre contenido dañino. La medida responde a una preocupación creciente en torno al uso de tecnologías de voz generativa, especialmente en escenarios donde la simulación conversacional puede emplearse con fines engañosos.
Todos los nuevos modelos de voz ya están disponibles dentro de la API en tiempo real de OpenAI. En cuanto al modelo de negocio, GPT-Realtime-Translate y GPT-Realtime-Whisper se facturan por minutos de uso, mientras que GPT-Realtime-2 mantiene un esquema de tarificación basado en consumo de tokens.
Con este lanzamiento, OpenAI refuerza su estrategia de llevar capacidades avanzadas de audio y conversación en tiempo real al terreno de los desarrolladores, un movimiento que anticipa una nueva etapa en la evolución de las interfaces de voz empresariales.


