Em quase duas horas de apresentação no Google I/O, a conferência de programadores anual da tecnológica, houve uma palavra usada 95 vezes: Gemini. Esta é a designação usada pela empresa para agrupar todos os esforços na área de investigação em inteligência artificial (IA).

Há vários anos que a IA tem destaque no negócio da gigante da internet, mas, tal como outras rivais, a Google aumentou os esforços nesta área nos últimos anos. Assim, esta é a segunda edição de I/O em que a IA tem um claro domínio.

Passaram vários executivos pelo palco do quartel-general em Mountain View para partilhar funcionalidades centradas em IA e fazer alguns pontos de situação sobre projetos ainda em desenvolvimento, como óculos com IA integrada.

Um modo de IA na pesquisa e a chegada do Gemini ao Chrome

Sundar Pichai, o CEO da Google, começou por explicar que as AI Overviews, ou seja, os resumos feitos por IA quando faz alguma pesquisa no Google, estão a gerar “aumentos de 10%” nas pesquisas em mercados como os EUA e a Índia. Como a informação é apresentada de forma resumida no topo do ecrã, em vez de abrir ligações para procurar uma resposta, a versão facilitada leva as pessoas a fazer pesquisas com mais frequência. Algo que é do claro interesse da Google, que tem na pesquisa e nos anúncios apresentados neste campo uma considerável fonte de receitas.

Google volta a mexer nos resultados da pesquisa e faz chegar os resumos de IA a Portugal

“Mudou completamente a forma como fazemos pesquisas”, disse Pichai sobre os AI Overview. A aposta na IA na pesquisa foi reforçada e, a começar pelos EUA algures no verão, haverá um novo campo de IA na pesquisa do Google, chamada AI Mode. Depois dos EUA, é expectável que seja alargada a mais mercados.

Liz Reid, diretora de pesquisa da Google, apresentou mais alguns detalhes sobre este novo modo. Para já, vai distinguir-se por ter uma lupa acompanhada por uma pequena estrela. O AI Mode vai permitir “mais contexto pessoal, pesquisa mais profunda, análise e visualização e multimodalidade em tempo real” (capacidade para alternar entre imagem, som e vídeo).

Por contexto e personalização, a Google quer dizer que a IA se vai lembrar das pesquisas que fez e conseguir relacioná-las com contextos que possam ser úteis. Por exemplo, marcou uma viagem para determinado destino e está à procura de atividades. Com o AI Mode poderão ser feitas sugestões de atividades ou eventos que acontecem na altura em que está no local — porque há uma integração com o Gmail, com o Calendário e vários outros serviços da Google.

“É uma personalização feita só para o utilizador”, explicou Liz Reid. Por privacidade e para quem não for particular fã de toda esta integração, o utilizador poderá desligar esta funcionalidade.

Mas haverá mais momentos para este AI Mode: por exemplo, ajudar a comprar bilhetes para um evento ou espetáculo. Mais uma vez, isto também vai começar a ser usado primeiro nos EUA. Se o utilizador quiser bilhetes para um determinado evento ou espetáculo pode fazer um pedido do estilo “encontra-me dois bilhetes baratos para este jogo de basebol, na zona x do estádio e apresenta opções”.

Em vez de abrir sites para perceber quais são as melhores opções, será a IA a fazer uma compilação da informação: quais são as opções mais baratas e em que sites e como é possível comprar. Servirá para comprar bilhetes para eventos, fazer reservas em restaurantes e serviços locais.

Ainda na pesquisa, a IA vai ser útil a dissipar algumas dúvidas de quem compra roupa online. Por exemplo, se não souber como assenta um vestido antes de o comprar, será possível carregar uma fotografia de corpo inteiro e a IA gera uma representação virtual do utilizador com a peça vestida. Na demonstração feita na apresentação, a possibilidade de experimentar roupas virtualmente demorou apenas alguns minutos.

Também a parte de checkout de uma compra foi acelerada com a integração de uma versão de agente — que consegue procurar o tamanho de uma peça, adicioná-lo ao carrinho e preencher informação de entrega. Em teoria, o processo é supervisionado pelo utilizador, que apenas entra em ação para a parte de conclusão do pagamento. Estas atualizações vão chegar também primeiro aos EUA, a partir do verão.

Além de ainda mais integração de IA na pesquisa, haverá outro ponto da experiência online a ganhar a companhia do Gemini: o Chrome. O navegador mais usado do mundo vai passar a ter um assistente de IA Gemini integrado, que ficará acessível num cantinho da barra de pesquisa. E vai conseguir sumarizar e interagir com informação que está no ecrã. Por agora, só vai conseguir aguentar pedidos em dois separadores do navegador, mas há planos para expandir o raio de ação.

A partir desta quarta-feira, os utilizadores dos planos de subscrição de IA da Google já vão ter acesso a esta funcionalidade. Ainda nos planos, a Google apresentou novas faixas de preços: uma subscrição chamada AI Ultra, que vai custar 250 dólares por mês. A diferença para esta fasquia de preços é que será mais completa — dará acesso às versões mais recentes dos modelos (de raciocínio, geração de imagem e de vídeo) e incluir uma subscrição do YouTube Premium e 30 TB de espaço cloud.

[A polícia é chamada a uma casa após uma queixa por ruído. Quando chegam, os agentes encontram uma festa de aniversário de arromba. Mas o aniversariante, José Valbom, desapareceu. “O Zé faz 25” é o primeiro podcast de ficção do Observador, co-produzido pela Coyote Vadio e com as vozes de Tiago Teotónio Pereira, Sara Matos, Madalena Almeida, Cristovão Campos, Vicente Wallenstein, Beatriz Godinho, José Raposo e Carla Maciel. Pode ouvir o 1.º episódio no site do Observador, na Apple Podcasts, no Spotify e no Youtube Music.]

Flow, um casamento entre o gerador de imagens e o gerador de vídeo

Josh Woodward, executivo da Google responsável pela área Labs, subiu ao palco para partilhar a atualização dos modelos de IA da empresa destinados à área multimédia: o Imagen 4 para as imagens estáticas e o Veo 3 para gerar animações ou até vídeo realista, que imita humanos. Estes modelos conseguem apresentar resultados a partir de texto — rivalizam, por exemplo, com opções como o Dall-E ou o Sora, desenvolvidos pela OpenAI.

“Democratização” ou “condicionamento da criatividade”? Os prós, os contras (e as limitações) do gerador de vídeo a partir de texto da OpenAI

“O Imagen 4 é dez mais rápido do que o modelo anterior”, explicou Woodward. Nesta atualização, ficou a promessa de imagens mais detalhadas e uma melhoria “na área de texto e tipografia”. O executivo Josh Woodward admitiu que o modelo anterior tinha algumas dificuldades em adicionar texto às imagens. “O Imagen 4 não só acerta no tipo de letra e espaçamento para criar um poster, também adequa ao tema [do pedido, por exemplo, um cartaz para um festival] e trabalha de forma mais rápida.”

Já na área de geração de vídeo, foi revelado o Veo 3, uma atualização ao modelo Veo 2, lançado no ano passado. Mais uma vez, basta escrever para ver as imagens a surgir no ecrã. Mas com uma diferença: até aqui, muitas das ferramentas para gerar vídeo não conseguem produzir som. O Veo 3 não vai conseguir só gerar imagens em movimento, também vai conseguir “acrescentar efeitos sonoros e até diálogo”. Um dos exemplos dados pelo Google foi uma conversa curta entre dois animais numa floresta. Além do diálogo, também havia sons de movimentos nas folhas e ramos. Noutro exemplo, de um homem num barco, eram apresentados os sons de movimentação do mar.

Também ficou a promessa de esta versão do Veo 3 ter “uma compreensão melhor de física”, uma dificuldade que os modelos deste género têm. Por exemplo, nas primeiras versões de modelos do género era frequente ver pessoas a correr em direções erradas ou movimentos que não pareciam lógicos, como um pássaro a voar para trás.

Com duas atualizações destes modelos, ficava a faltar uma opção que unisse as duas funcionalidades. Assim, foi revelado o Flow, uma ferramenta pensada em realizadores que junta o modelo de gerar imagens Imagen 4 e a geração de vídeo do Veo 3.

É possível gerar as imagens com IA ou submeter algumas referências de imagens autênticas. Depois, é pedir em texto como é que se pretende que seja apresentado: por exemplo, tipo de plano de gravação, cores, ambiente, ações, da forma mais detalhada possível. É possível alterar os exemplos obtidos, cortá-los ou mudá-los no sítio no projeto. Também será possível integrar a capacidade de gerar música de forma sintética através do modelo Lyria 2.

A Google explicou que está a trabalhar com realizadores e artistas para trabalhar neste Flow. Foi revelado que a empresa está a trabalhar com Darren Aronofsky, conhecido por filmes como Cisne Negro, Mãe! ou Requiem for a Dream. O realizador tem um projeto em que combina IA generativa e imagem real no estúdio Primordial Soup. A parceria vai ganhar forma através de um primeiro filme, chamado Ancestra, com realização de Eliza McNitt, que deverá estrear no festival de Tribeca.

Android XR, uma nova plataforma para headsets e óculos

A Google já tem o Android, o sistema operativo conhecido principalmente pelos smartphones. Agora, a empresa quer incluir a IA em mais produtos e vai lançar uma versão adaptada, o Android XR, a pensar na realidade mista — ou seja, a união entre realidade virtual e realidade aumentada.

Este trabalho é feito a pensar em equipamentos de realidade mista, como óculos e headsets imersivos. É um projeto que está a ser desenvolvido em parceria com a Samsung e a Qualcomm.

O Project Moohan junta a Google e a Samsung

A Google explica que todas as aplicações que desenvolve, como o Gmail, YouTube e o Maps, estão a ser redesenhadas para se adaptar a este novo formato.

O primeiro produto a ter esta plataforma vai ser o Project Moohan, um headset em que a empresa está a trabalhar com sul-coreana e que chegará ao mercado no fim do ano. Não há detalhes sobre funcionalidades destes óculos, mas é já conhecido que vão ter uma forte integração de IA.

O exemplo de óculos inteligentes da Google, por enquanto ainda em protótipo

O mesmo acontece com uns óculos aparentemente “normais”, não fosse a diferença nas lentes, que refletiram a luz de forma diferente durante a apresentação, e que também vão ter muita IA. Foi feita uma demonstração em tempo real dos óculos, aos quais não foi dado um nome, que colocam a IA “literalmente” à frente dos olhos, gracejou Sundar Pichai.

Por enquanto ainda são um protótipo, mas no palco da conferência conseguiram tirar fotografias, apresentar indicações de caminho de Google Maps de forma discreta, fazer tradução em tempo real e fazer pesquisas de voz. Esta não é a primeira vez em que a Google avança com óculos inteligentes: já o fez em 2014, mas a fasquia dos 1.500 dólares travou muitos potenciais interessados. Além disso, há uma década, a tecnologia possível de incluir nestes óculos era bastante diferente.

A visão de indicações do Maps no protótipo de óculos da Google

Mesmo que não haja qualquer indicação sobre quando é que poderão passar de estatuto de protótipo até produto real, a Google deixou o recado aos programadores: comecem já a pensar em desenvolver aplicações para esta nova plataforma.