OpenAI inició este 24 de septiembre de 2026 el despliegue a gran escala de su esperado Modo de Voz Avanzado (AVM) para todos los suscriptores de ChatGPT Plus y ChatGPT Team. Esta actualización representa un cambio cualitativo en la interacción por voz con la inteligencia artificial, eliminando la rigidez tradicional.
A diferencia de las arquitecturas anteriores que encadenaban el reconocimiento de voz, el procesamiento de texto y la síntesis vocal en pasos separados, el Modo de Voz Avanzado opera directamente sobre la red neuronal multimodal de GPT-4o. Esto permite captar modulaciones de tono, susurros y silencios sin pasar por intermediarios de texto.
Arquitectura de audio nativa y respuesta conversacional inmediata
La plataforma introduce nueve voces naturales exclusivas, bautizadas como Arbor, Maple, Sol y Spruce, optimizadas para mantener conversaciones informales o proporcionar asesoramiento técnico detallado. Una de las grandes novedades es la capacidad de interrumpir al asistente de forma espontánea mientras habla.
Además, la compañía ha integrado las instrucciones personalizadas en las sesiones de audio, garantizando que el modelo respete el estilo y las normas de conversación preferidas por el usuario.
“El Modo de Voz Avanzado ofrece una naturalidad conversacional inalcanzable hasta ahora. Al procesar el audio de forma nativa, GPT-4o capta matices, pausas y tonos con gran fluidez.”
Filtros de seguridad y disponibilidad global progresiva
En materia de seguridad, OpenAI ha reforzado los mecanismos de protección para impedir la clonación no autorizada de voces de personas reales y evitar la reproducción de material musical sujeto a derechos de autor.
El despliegue continuará de forma gradual en las aplicaciones móviles de iOS y Android durante esta semana, abriendo camino a futuras integraciones en entornos empresariales y educativos.




Comments (0)
Log in to join the discussion.