📸 Créditos da imagem: reprodução / Tecmundo
OpenAI Lança GPT-Live: Voz do ChatGPT Fica Mais Rápida, Natural e Inteligente
A OpenAI acaba de revolucionar a interação por voz no ChatGPT com a introdução dos novos modelos GPT-Live. Projetados para aprimorar o modo de conversação por voz do chatbot, esses modelos prometem uma experiência significativamente mais rápida, natural e útil, incluindo a inédita capacidade de o assistente permanecer em silêncio até ser novamente acionado.
A novidade foi apresentada nesta quarta-feira, dia 8 de maio, com o lançamento de dois modelos distintos: o GPT-Live-1 e o GPT-Live-1 mini. Ambos estão sendo liberados gradualmente para todos os usuários do ChatGPT a partir de hoje e há planos para que sejam integrados à API em um futuro próximo, expandindo ainda mais seu alcance.
Considerada pela OpenAI como a família de modelos de voz mais avançada até o momento, o GPT-Live se destaca por sua capacidade de delegar tarefas complexas a outras inteligências artificiais. Isso significa que, enquanto a conversa principal é mantida, o sistema pode invocar IAs para realizar buscas na web ou raciocínios elaborados, trazendo os resultados de volta ao diálogo assim que estiverem disponíveis, sem interrupções na fluidez da interação.
Atualmente, o GPT-Live opera nos bastidores com o suporte do GPT-5.5, uma base robusta que garante seu desempenho inicial. A OpenAI já sinalizou que a estrutura do modo de voz será atualizada com modelos ainda mais poderosos ao longo do tempo, indicando um compromisso contínuo com a evolução da tecnologia.
Novidades em Destaque do GPT-Live
Durante uma coletiva de imprensa, a OpenAI demonstrou o GPT-Live em ação, revelando interações que se mostraram rápidas, consistentes e notavelmente naturais, especialmente na voz feminina e em inglês. Três capacidades inovadoras foram particularmente destacadas:
- Tradução em tempo real: O assistente de IA demonstrou a habilidade de traduzir a fala do apresentador em tempo real (do inglês para o híndi), sem a necessidade de pausas para processar a resposta. A experiência foi comparável à tradução simultânea de transmissões ao vivo, eliminando barreiras linguísticas de forma instantânea.
- Modo de silêncio inteligente: Agora, o ChatGPT pode ser instruído a permanecer em silêncio, mas sempre atento à conversa em andamento. Ele só volta a interagir quando é explicitamente acionado pelos interlocutores, permitindo que a IA atue como um participante discreto que intervém apenas quando necessário.
- Respostas com informações visuais: Quando o ChatGPT identifica uma oportunidade, ele pode complementar suas respostas por voz com informações visuais na tela. Um exemplo prático disso é a previsão do tempo, onde ele pode exibir um relatório mais detalhado e robusto na tela enquanto verbaliza os dados.
O GPT-Live Tenta Resolver Limitações de Modelos de Voz Anteriores
A criação do GPT-Live representa um esforço da OpenAI para superar duas limitações significativas que afetavam as interações por voz com IA. As mudanças arquiteturais aplicadas visam aprimorar a fluidez e a coerência das conversas:
- Sistemas de cascata: Modelos de voz anteriores, como o ChatGPT Voice original, dependiam de múltiplos modelos para interagir com o usuário (um para transcrição de fala, outro para gerar a resposta e um terceiro para converter texto em voz). Embora essa abordagem tenha tornado o modo de voz possível, ela era suscetível a lentidão e perda de contexto em cada etapa do processo.
- Modelos de voz baseados em turnos: O ChatGPT Advanced Voice Mode unificou o processamento em um único modelo, mas ainda operava em um formato de turnos, onde a IA e o usuário se alternavam na fala, detectando momentos de silêncio. Isso ocasionalmente resultava em interrupções na fala do usuário, prejudicando a naturalidade da conversa.
Para resolver esses desafios, a OpenAI implementou duas mudanças arquiteturais cruciais no GPT-Live:
- O GPT-Live foi construído para proporcionar uma conversação contínua utilizando uma arquitetura full-duplex. Isso significa que ele começa a gerar a resposta enquanto ainda está escutando o usuário, permitindo que o modelo tome várias decisões em tempo real. O resultado são respostas mais rápidas e uma interação muito mais natural e fluida.
- A delegação de tarefas é um pilar fundamental. O GPT-Live não foi projetado para lidar com todas as demandas do usuário sozinho. Quando necessário, ele invoca modelos alternativos da OpenAI para gerenciar tarefas mais complexas, como buscas na web, raciocínio avançado ou funções agênticas, otimizando o desempenho geral.
Disponibilidade para Todos
O GPT-Live está sendo liberado para todos os usuários do ChatGPT a partir desta quarta-feira, 8 de maio. A disponibilidade dos modelos varia conforme o plano de assinatura:
- GPT-Live-1: Será o modelo de voz padrão para assinantes dos planos ChatGPT Go, Plus e Pro.
- GPT-Live-1 mini: Será o modelo padrão para usuários da versão gratuita.
A OpenAI informou que o GPT-Live foi otimizado para os idiomas “mais populares”, embora ressalte que o modelo pode não soar como um falante nativo em todas as línguas. É importante notar que o português é um dos idiomas mais falados pelos usuários da IA, o que sugere uma boa otimização para o público brasileiro.
Neste primeiro momento, o GPT-Live não oferece suporte para o modo de voz e vídeo ou compartilhamento de tela no ChatGPT. No entanto, a empresa prometeu adicionar essas funcionalidades no futuro. Enquanto isso, os modelos anteriores do ChatGPT Voice (Standard e Advanced Voice Mode) continuarão disponíveis e com suporte a essas capacidades, garantindo que os usuários não percam acesso a recursos já existentes.
📰 Leia a notícia completa em: Tecmundo »