OpenAI lança GPT-Live com novas funcionalidades de voz para o ChatGPT
OpenAI apresenta o GPT-Live, uma nova era para o ChatGPT com interações mais naturais.
Greg Brockman iniciou uma transmissão ao vivo da OpenAI, demonstrando uma interação com o ChatGPT que apresentou uma evolução significativa na forma como o sistema responde. Durante a demonstração, a voz do ChatGPT se ajustou de maneira mais fluida às interrupções, em contraste com experiências anteriores onde as respostas eram abruptas.
A demonstração destacou a promessa do GPT-Live, que visa melhorar não apenas a fluência da fala, mas também a capacidade do sistema de saber quando responder, quando esperar e quando permanecer em silêncio. Essa inovação representa um avanço importante na interação entre humanos e inteligência artificial.
O GPT-Live é mais do que uma simples atualização de áudio; trata-se de uma nova abordagem na arquitetura de modelos que permite uma interação mais contínua. A tecnologia “full-duplex” permite que a IA ouça e responda simultaneamente, o que, segundo a empresa, diminui a rigidez da alternância de turnos tradicional.
Desde 2022, a OpenAI tem promovido uma transformação na interação dos usuários com seus modelos, movendo-se em direção a formas mais naturais de comunicação. O ChatGPT já havia estabelecido um novo padrão de engajamento com modelos de texto, e os recursos de voz adicionaram uma camada mais intuitiva. O GPT-4o ampliou essa ambição, criando uma experiência mais expressiva, evocando comparações com o filme “Her”.
O anúncio do GPT-Live representa um passo adiante nessa evolução. Sua proposta não é apenas tornar a voz mais humana, mas também abordar um aspecto crucial: como manter uma conversa que não se resuma a uma sequência de comandos.
Para compreender essa mudança, é fundamental analisar o funcionamento das versões anteriores. O modo de voz inicial do ChatGPT operava em um sistema em “cascata”, onde diferentes modelos eram responsáveis por transcrever a fala, gerar respostas e converter o texto em áudio. O novo modo de voz unifica esse processo, permitindo uma interação contínua, onde a IA decide em tempo real se deve falar, ouvir ou pausar.
Com essa atualização, os usuários poderão interromper com perguntas, fazer pausas para pensar ou solicitar que o sistema fale em um ritmo mais lento. Além disso, a voz do ChatGPT pode emitir pequenos sinais, como “hum” ou “aham”, para indicar que continua ouvindo, e melhorias foram feitas para que a IA se concentre na voz do usuário mesmo em ambientes ruidosos.
O GPT-Live também apresenta nove vozes remasterizadas, respostas visuais em formato de cartões para informações rápidas, e suporte para pesquisas, memória, imagens e upload de arquivos. Outro aspecto importante é a capacidade de delegar tarefas mais complexas, como pesquisas na web ou raciocínio, aos modelos mais avançados, mantendo a conversa ativa.
No lançamento, o suporte será fornecido pelo GPT-5.5, com a promessa de atualizações contínuas conforme novas versões forem lançadas. O modo de voz permitirá que os usuários escolham entre diferentes níveis de raciocínio, adequando-se às necessidades de respostas rápidas ou mais elaboradas.
A OpenAI afirma que essa nova abordagem não é apenas uma mudança superficial. Avaliações internas mostraram que o GPT-Live-1 e o GPT-Live-1 mini superaram o modo de voz anterior em diversos critérios, como fluência e gestão de interrupções, durante conversas de cinco a dez minutos.
Embora esses resultados sejam promissores, é importante observar que eles são baseados em testes internos da OpenAI, e a eficácia no uso cotidiano ainda precisa ser verificada. O GPT-Live começou a ser disponibilizado para usuários do ChatGPT em plataformas iOS, Android e no site oficial, com um lançamento global sem exclusões específicas anunciadas para a União Europeia.
O GPT-Live-1 será o modelo padrão para usuários dos planos Go, Plus e Pro, enquanto as contas gratuitas utilizarão o GPT-Live-1 mini. A API será disponibilizada posteriormente, mas ainda não há uma data definida para isso.
Entretanto, há uma limitação relevante: o GPT-Live não suporta, por enquanto, a funcionalidade de voz com vídeo ou compartilhamento de tela dentro do ChatGPT, embora a OpenAI esteja trabalhando para implementar esses recursos futuramente.
