A inteligência artificial do Google já é bastante avançada em se tratando de imagens. Ela é capaz de tirar fotos e editá-las sem a ajuda de ninguém. Agora, ela também está sendo treinada para esclarecer o que está sendo dito em um vídeo com muitas pessoas falando ao mesmo tempo.

O sistema é capaz de isolar diferentes vozes somente ao focar no rosto das pessoas. Para chegar a esse ponto, os pesquisadores fizeram a IA reconhecer falas individuais em cerca de 100 mil vídeos. O processo resultou em duas mil horas de falas sem a interferência de músicas, auditórios ou outros indivíduos.

Em seguida, houve a simulação de um cenário em que esses vídeos foram reproduzidos ao mesmo tempo. Para dificultar o trabalho, os pesquisadores também incluíram um ruído sem fala ao fundo. A tarefa era ensinar a inteligência artificial a isolar as vozes em diferentes faixas de áudio.

A técnica combina sinais sonoros e visuais para separar a fala. “Os movimentos da boca de uma pessoa, por exemplo, devem se correlacionar com os sons produzidos enquanto ela está falando”, explicam os pesquisadores.

O Google diz que está “explorando as oportunidades” para aplicar esta ferramenta. Ela poderá ser usada em serviços como Hangouts e Duo. O objetivo é permitir que os usuários escutem melhor uma pessoa que está em um local barulhento, como no vídeo abaixo:

Outro vídeo mostra que a ferramenta também consegue separar as vozes quando um auditório é responsável pelo barulho ao fundo:

Além do desenvolvimento, o Google também terá que lidar com questões relacionadas à privacidade. A depender do avanço, um sistema como esse poderia ser usado para espionar conversas de terceiros em um ambiente público, por exemplo.

Com informações: Google, Engadget, Android Police.

Leia | Como usar a função de texto falado no TikTok [Voz do Google]

Relacionados

Escrito por

Victor Hugo Silva

Victor Hugo Silva

Ex-autor

Victor Hugo Silva é formado em jornalismo, mas começou sua carreira em tecnologia como desenvolvedor front-end, fazendo programação de sites institucionais. Neste escopo, adquiriu conhecimento em HTML, CSS, PHP e MySQL. Como repórter, tem passagem pelo iG e pelo G1, o portal de notícias da Globo. No Tecnoblog, foi autor, escrevendo sobre eletrônicos, redes sociais e negócios, entre 2018 e 2021.