Consolidando um avanço expressivo na comunicação natural com inteligência artificial, a OpenAI iniciou a distribuição oficial do seu Modo de Voz Avançado (AVM) para usuários pagantes do ChatGPT Plus e ChatGPT Team nos sistemas iOS e Android. A ferramenta introduz a capacidade de voz com processamento multimodal nativo do modelo GPT-4o.
Diferente dos assistentes virtuais anteriores que combinavam três etapas separadas — transcrever o áudio para texto, gerar a resposta escrita e sintetizar nova voz —, o novo sistema opera de forma unificada diretamente sobre os dados sonoros da entrada até a saída.
Inteligência de áudio ponta a ponta e latência ultrarrápida
Esse design integrado reduz a latência a patamares de até 232 milissegundos, com média em torno de 320 milissegundos. A velocidade replica com precisão o ritmo de uma conversa entre duas pessoas, permitindo que o usuário interrompa a fala da IA a qualquer momento sem engasgos.
O modelo agora detecta nuances de dezenas de sotaques regionais, modula o volume até o sussurro quando solicitado e interpreta estados de ânimo como empolgação, dúvida ou sarcasmo a partir da cadência vocal do interlocutor.
“O Modo de Voz Avançado redefine o diálogo entre homem e computador. Operando diretamente sobre ondas sonoras, o sistema interpreta cadência, humor e sotaques instantaneamente.”
Inflexão expressiva, sotaques variados e filtros de segurança
A biblioteca inclui nove vozes sintetizadas criadas em estúdio com dubladores profissionais: Arbor, Breeze, Cove, Ember, Juniper, Maple, Sol, Spruce e Vale. Travas de segurança algorítmicas impedem a personificação de figuras públicas e o uso de áudio protegido.
Contudo, o lançamento tem restrições geográficas severas. A OpenAI esclareceu que a função não foi liberada nos países da União Europeia, no Espaço Econômico Europeu, na Suíça e no Reino Unido, onde a empresa aguarda avaliações de conformidade com o GDPR e a Lei de IA europeia.




Comments (0)
Log in to join the discussion.