📸 Créditos da imagem: Unsplash
Inteligência artificialOpenAI lança GPT-Live, novos modelos de voz com foco na fala simultâneaA OpenAI lançou o GPT-Live, uma nova família de modelos de voz que consegue ouvir e falar ao mesmo tempo, em tempo real. O que aconteceuEmpresa disse que vai liberar duas versões do GPT-Live para usuários no mundo todo. Os modelos se chamam GPT-Live-1 e GPT-Live-1 mini e começaram a ser distribuídos nesta quarta-feira, de acordo com a OpenAI. Novos modelos são do tipo full-duplex, o que permite interrupções naturais durante a conversa. A OpenAI afirma que eles soam mais naturais e lidam melhor com a alternância de fala, além de habilitar recursos como tradução ao vivo. ChatGPT vai trocar o Advanced Voice Mode pelo GPT-Live-1 mini como padrão.
Usuários de planos pagos poderão acessar o modelo maior, o GPT-Live-1, segundo a empresa. OpenAI diz que a nova arquitetura corrige limitações do modo anterior de voz. O sistema antigo combinava um modelo de reconhecimento de fala, um modelo de linguagem para gerar respostas e um modelo de síntese de voz para entregar o áudio final. Modelos de voz passam a acionar os modelos de texto mais recentes da OpenAI para tarefas específicas. A empresa afirmou que o GPT-Live pode enviar a consulta para modelos como o GPT-5.5 quando precisar de busca, raciocínio ou capacidades de agente, sem interromper a conversa. O que a OpenAI quer com a nova vozOpenAI aposta que voz pode virar a principal interface para trabalho mais complexo no computador.
Em briefing, a empresa disse que o objetivo é permitir conversas mais longas e uso mais “mãos livres” do assistente. Líder de produto do ChatGPT Voice relatou que já usou o recurso por longos períodos. Atty Eleti afirmou que já fez conversas de 30 a 40 minutos com a função durante caminhadas. Eleti disse que a empresa vê a voz como caminho para tarefas de agente mais duradouras. “Com o tempo, achamos que isso também vai liberar a capacidade de usar a voz como uma espécie de interface principal para a computação e para gerenciar trabalhos de agente cada vez mais complexos e de longa duração.
Os casos de uso incríveis que vemos as pessoas usando o Codex e o ChatGPT para realizar, achamos que a voz pode ser a interface do futuro para todo tipo de trabalho”, disse Eleti, em briefing de imprensa. Limites, concorrência e salvaguardasOpenAI diz que mais de 150 milhões de pessoas usam recursos como Voice e Dictation para falar com o ChatGPT. Rivais como Apple e Amazon também têm atualizado seus assistentes para melhorar conversas e o entendimento de contexto, enquanto startups tentam deixar a interação mais expressiva. Empresa afirma que não quer transformar o recurso em um “companheiro” de IA. A OpenAI diz que os modelos têm salvaguardas para respostas adequadas por idade para adolescentes e para oferecer recursos se a conversa entrar em temas como automutilação. Demonstração mostrou que a tradução ao vivo ainda tem limitações em alguns idiomas.
Em um teste em hindi, o assistente apresentou forte sotaque americano e um tom considerado pouco natural; a OpenAI disse que o modo é otimizado para “a maioria das línguas faladas”, sem detalhar quais. O autor da mensagem, e não o, é o responsável pelo comentário. Leia as Regras de Uso do.
📰 Leia a notícia completa em: UOL »