Início Tecnologia OpenAI lança novos modelos de voz para conversas ao vivo mais naturais
Tecnologia

OpenAI lança novos modelos de voz para conversas ao vivo mais naturais

Share
Image Credits:OpenAI — Fonte: TechCrunch
Share

A OpenAI revelou nesta terça-feira seus mais recentes modelos conversacionais, denominados GPT-Live-1 e GPT-Live-1 mini, desenvolvidos para oferecer interações por voz significativamente mais naturais e capazes de gerenciar melhor a alternância de turnos durante conversas.

Esses novos modelos operam em modo bidirecional, o que significa que podem ouvir e falar simultaneamente. Esta característica permite que os usuários interrompam o assistente de forma natural durante a conversa, além de possibilitar funcionalidades como tradução em tempo real. A empresa substituirá o Modo de Voz Avançado atual no ChatGPT pelo modelo GPT-Live-1 mini como configuração padrão. Usuários das versões pagas terão acesso ao modelo completo GPT-Live-1.

O modelo anterior combinava três componentes distintos: um modelo de reconhecimento de fala para transcrever a fala do usuário, um modelo de linguagem de grande porte para gerar respostas e um modelo de síntese de voz para entregar a resposta final. Segundo a empresa, os novos modelos resolvem problemas como interromper o usuário enquanto ele ainda está falando e a falta de inteligência suficiente para responder perguntas complexas.

Os novos modelos de voz da OpenAI enviarão consultas para os mais recentes modelos de texto da empresa, como o GPT-5.5, para realizar buscas, raciocínios ou capacidades agentic, enquanto continuam a conversa simultaneamente. A empresa também demonstrou que o modelo pode permanecer em silêncio por longos períodos, absorvendo o contexto da conversa até ser acionado.

Além disso, como o novo modo de voz tem acesso aos modelos GPT mais recentes, também pode apresentar informações em formato visual. Outras startups, como a Monogram, que levantou 40 milhões de dólares em investimento inicial de fundos como DST e Lux Capital, também estão investindo em respostas visuais para tornar os assistentes mais interativos.

A empresa afirmou que o novo modo de voz no ChatGPT foi projetado para permitir conversas mais longas. Durante a coletiva de imprensa, o líder de produto do ChatGPT Voz, Atty Eleti, revelou que já manteve conversas de 30 a 40 minutos com o recurso de voz durante caminhadas.

A OpenAI acredita que a voz pode se tornar a interface principal para computação em trabalhos complexos. Relatórios recentes sugerem que a empresa pode lançar um par de fones de ouvido com capacidades de inteligência artificial ainda este ano, embora a empresa não tenha fornecido informações sobre produtos de hardware.

"Ao longo do tempo, acreditamos que isso também desbloqueará a capacidade de usar a voz como uma espécie de interface principal para computação e para gerenciar trabalhos agentic de longa duração cada vez mais complexos. Os casos de uso surpreendentes que vemos pessoas realizarem com Codex e ChatGPT, acreditamos que a voz pode ser a interface futura para todos os tipos de trabalho", declarou Eleti.

A OpenAI tem trabalhado nos últimos anos para aprimorar os recursos baseados em voz do ChatGPT, tornando o modo de voz mais natural. A empresa afirmou que mais de 150 milhões de pessoas conversam com o ChatGPT usando recursos como Voz e Ditado.

Competidores também estão tentando tornar seus assistentes mais expressivos. Tanto a Apple quanto a Amazon atualizaram seus assistentes para serem mais conversacionais, com melhor tratamento de contexto. Startups como a Sesame, fundada pelo co-fundador da Oculus, Brendan Iribe, e Ankit Kumar, também lançaram assistentes de inteligência artificial com conversas mais naturais enquanto completam tarefas em segundo plano.

A OpenAI está se movendo na mesma direção, visando permitir que os usuários conversem com o assistente sem usar as mãos por períodos mais longos. Apesar de afirmar que o novo modo de voz soa mais natural, a empresa enfatizou que não está tentando transformar isso em um companheiro de inteligência artificial. A empresa observou que os novos modelos possuem salvaguardas integradas para fornecer respostas apropriadas para a idade de adolescentes e disponibilizar recursos se a conversa abordar tópicos como automutilação.

O novo modo de voz ainda precisa de melhorias. Durante a demonstração, quando a empresa apresentou seu recurso de tradução ao vivo para hindi, o assistente tinha um forte sotaque americano e falava hindi de forma não natural, com um tom ligeiramente literário. A empresa afirmou que o novo modo está otimizado para "as línguas mais faladas", mas não especificou quais são elas.

Fonte: TechCrunch

Share
Artigos relacionados
Tecnologia

Calendário inteligente da Linkdaze é desenvolvido para gerenciar uma casa inteira, não apenas controlar uma agenda

Com o retorno às aulas se aproximando em muitas regiões, manter o...

Tecnologia

Autoridade holandesa multa Uber em quase 1 bilhão de euros por suspensões automatizadas de motoristas

A Autoridade de Proteção de Dados da Holanda anunciou uma multa bilionária...

Tecnologia

Modelo de inteligência artificial misterioso Ox Alpha intriga comunidade tecnológica

Um novo modelo de inteligência artificial denominado Ox Alpha tem provocado uma...

Tecnologia

Chip personalizado impulsiona ambições de robotáxis da Waymo

A Waymo tem conquistado grande atenção por sua rápida expansão e tudo...

VeloTV 728×90