Inteligência artificial do Google consegue separar vozes em uma multidão

Name: Inteligência artificial do Google consegue separar vozes em uma multidão – Tecnoblog
Uploaded: 2018-04-13
Duration: 36 s
Description: A inteligência artificial do Google já é bastante avançada em se tratando de imagens. Ela é capaz de tirar fotos e editá-las sem a ajuda de

Por Victor Hugo Silva

há 6 anos • Atualizado há 2 semanas

A inteligência artificial do Google já é bastante avançada em se tratando de imagens. Ela é capaz de tirar fotos e editá-las sem a ajuda de ninguém. Agora, ela também está sendo treinada para esclarecer o que está sendo dito em um vídeo com muitas pessoas falando ao mesmo tempo.

O sistema é capaz de isolar diferentes vozes somente ao focar no rosto das pessoas. Para chegar a esse ponto, os pesquisadores fizeram a IA reconhecer falas individuais em cerca de 100 mil vídeos. O processo resultou em duas mil horas de falas sem a interferência de músicas, auditórios ou outros indivíduos.

Em seguida, houve a simulação de um cenário em que esses vídeos foram reproduzidos ao mesmo tempo. Para dificultar o trabalho, os pesquisadores também incluíram um ruído sem fala ao fundo. A tarefa era ensinar a inteligência artificial a isolar as vozes em diferentes faixas de áudio.

A técnica combina sinais sonoros e visuais para separar a fala. “Os movimentos da boca de uma pessoa, por exemplo, devem se correlacionar com os sons produzidos enquanto ela está falando”, explicam os pesquisadores.

O Google diz que está “explorando as oportunidades” para aplicar esta ferramenta. Ela poderá ser usada em serviços como Hangouts e Duo. O objetivo é permitir que os usuários escutem melhor uma pessoa que está em um local barulhento, como no vídeo abaixo:

Outro vídeo mostra que a ferramenta também consegue separar as vozes quando um auditório é responsável pelo barulho ao fundo:

Além do desenvolvimento, o Google também terá que lidar com questões relacionadas à privacidade. A depender do avanço, um sistema como esse poderia ser usado para espionar conversas de terceiros em um ambiente público, por exemplo.

Com informações: Google, Engadget, Android Police.

Relacionados