COMO FUNCIONA

Dos seus alto-falantes ao seu idioma em alguns segundos.

O VoxisLive captura o áudio do sistema diretamente via loopback WASAPI, detecta a fala no dispositivo, traduz com um modelo de IA em tempo real e fala o resultado — enquanto reduz automaticamente o áudio original.

Etapa 1 — Captura de áudio, sem drivers

O VoxisLive usa loopback WASAPI — a mesma API de baixo nível do Windows Audio Session que os gravadores de tela usam para capturar “o que está tocando”. É um recurso nativo do Windows: sem cabos de áudio virtuais, sem instalação de driver, sem mudanças no roteamento de áudio. A captura tem latência zero em relação à reprodução e não adiciona artefatos audíveis.

Ferramentas concorrentes costumam rotear o áudio por dispositivos virtuais como o VB-CABLE, que exigem instalação de drivers (muitas vezes com direitos de administrador e reinicialização) e podem entrar em conflito com áudio em modo exclusivo, drivers ASIO ou sistemas anti-cheat. O VoxisLive elimina essa classe de problemas por completo.

Etapa 2 — Detecção de fala no dispositivo

O app executa detecção de atividade de voz (VAD) no dispositivo para separar a fala do silêncio, do ruído de fundo e da música — localmente, na sua CPU, sem ida e volta pela rede. Apenas os trechos identificados como fala humana seguem para a tradução, o que reduz a latência e protege seu saldo de minutos. O VAD também acompanha a própria saída falada do VoxisLive, para que ele nunca retraduza a própria voz.

Etapa 3 — Tradução simultânea em uma única passagem

Os trechos de fala vão para um modelo multimodal em tempo real que faz reconhecimento, tradução e síntese de voz em uma única passagem de baixa latência — condensando em uma só as três chamadas de rede sequenciais de um pipeline tradicional (fala para texto → tradução → texto para fala). Como um intérprete humano em uma cabine, ele começa a traduzir enquanto a pessoa ainda está falando.

Etapa 4 — Reprodução falada com ducking

A voz traduzida toca no seu dispositivo de saída enquanto duas coisas acontecem em paralelo: o ducking psicoacústico reduz o áudio original enquanto a tradução fala (espelhando a interpretação simultânea profissional), e a sincronização de latência mantém cada tradução alinhada ao seu trecho de fala, para que sessões longas nunca fiquem defasadas.

Janela principal do VoxisLive traduzindo um vídeo, com a transcrição bilíngue ao vivo

Veja ao vivo — alternando entre cinco idiomas em uma única sessão

Esta gravação de tela mostra uma palestra real traduzida em tempo real, com o idioma de destino trocado ao vivo, no meio da palestra, entre espanhol, italiano, turco, chinês e coreano — o mesmo áudio de origem, cinco saídas faladas diferentes, sem reiniciar entre as trocas. É exatamente o pipeline de WASAPI loopback descrito acima: sem cabo de áudio virtual, sem legendas, a tradução falada com uma voz natural enquanto o original permanece audível ao fundo.

Quão rápido é, na prática?

O VoxisLive é quase simultâneo, não instantâneo: normalmente fica de alguns segundos atrás da fala original, dependendo do tamanho do enunciado e da latência da rede. Fragmentos muito curtos são agrupados para evitar traduções ruins de palavras isoladas.

Reuniões sem bot

O VoxisLive nunca entra em uma chamada como participante, nunca pede permissões de anfitrião e nunca toca no aplicativo de reunião. Ele lê o áudio que já está tocando nos seus alto-falantes, o que o torna invisível para os outros participantes e idêntico no Zoom, Teams, Google Meet, Webex e Discord. No modo bidirecional, ele também traduz a sua própria fala para o idioma da reunião por meio de um microfone virtual.

O que sai da sua máquina

Com o app gerenciado da Store, o áudio passa por proxy até o modelo e nenhum áudio é retido após o fim da sessão. O VAD no dispositivo separa a fala do silêncio, do ruído de fundo e da música; nos planos pagos o fluxo segue continuamente enquanto a sessão está ativa e, no plano gratuito, apenas a fala detectada é enviada.

PRIMEIROS PASSOS

Dois modos, configurados em menos de um minuto

Modo Vídeo e Jogo — traduza qualquer coisa que esteja tocando no seu PC

Use este modo para um filme, uma transmissão, um vídeo do YouTube ou um jogo com diálogo falado.

  1. Abra o VoxisLive e escolha Vídeo & Jogo no topo do painel esquerdo.
  2. Escolha o idioma que deseja ouvir em Eu ouço em. O idioma falado você não configura — ele é detectado automaticamente.
  3. Pressione Iniciar. Não há mais nada para configurar — o VoxisLive escuta o que já está tocando nas suas caixas de som e começa a falar a tradução em poucos segundos.

Não há nada para instalar nem nenhum dispositivo de áudio separado para escolher: o VoxisLive captura o áudio do sistema do seu PC diretamente (veja "Captura de áudio, sem drivers" acima).

Modo Reunião — seja ouvido e compreendido no Teams, Zoom ou Google Meet

O modo Reunião funciona nos dois sentidos: você ouve a fala da outra pessoa traduzida para o seu idioma e, se quiser que ela também ouça você traduzido, sua voz é traduzida para o idioma dela.

Os dois seletores são idiomas de destino, e nenhum deles é o idioma falado. “Eu ouço em” define o que chega aos seus ouvidos; “O outro ouve em” define o que chega aos dele. O idioma falado é detectado automaticamente, frase a frase, nos dois sentidos — fale o idioma que falar, chega do outro lado no idioma que você escolheu, e mesmo que o outro lado seja multilíngue ou que três idiomas sejam falados na mesma chamada, você continua ouvindo só o seu.

  1. Abra o VoxisLive e escolha Reunião no topo do painel esquerdo. Defina Eu ouço em (o idioma em que você quer ouvir) e O outro ouve em (o idioma em que o outro lado deve ouvir). Nenhum dos dois pergunta qual idioma é falado — isso é detectado automaticamente.
  2. Pressione Iniciar. Você ouvirá o outro participante traduzido alguns segundos depois.
  3. Para que você também seja compreendido, é necessária mais uma etapa, não no VoxisLive, mas no seu aplicativo de reunião: abra as próprias configurações de áudio do Teams (ou Zoom, ou Meet) e defina o microfone para o cabo virtual instalado no seu PC (chamado "CABLE Output" ou similar) — o VoxisLive não instala nenhum, ele usa o que já estiver presente. O VoxisLive troca automaticamente o microfone padrão do Windows, mas alguns aplicativos de reunião lembram o microfone selecionado anteriormente e não detectam a mudança sozinhos — por isso, confira uma vez, no início da chamada.

Se você pular essa última etapa, ainda ouvirá todos os outros traduzidos — eles só continuarão ouvindo a sua voz original. Já o cabo virtual em si não é opcional no Windows: sem nenhum instalado, o modo Reunião não inicia, e o aplicativo avisa você antes de a sessão começar. Instale um gratuito, como o VB-CABLE, e reinicie o VoxisLive. No Linux, o aplicativo cria o próprio microfone virtual. Se você só precisa entender o outro lado, o modo Vídeo e jogo faz isso sem nenhuma configuração extra.

Vai usar especificamente uma chamada do WhatsApp? Consulte o guia ilustrado de configuração de chamadas do WhatsApp para ver capturas de tela passo a passo de ambas as etapas.

FAQ

Perguntas frequentes

01Preciso de VB-CABLE ou de um driver de áudio virtual?
Não para a captura. O VoxisLive usa loopback WASAPI, uma API nativa do Windows disponível no Windows 10 e 11. Não há nada para instalar ou rotear, e nenhum dispositivo novo aparece nas suas configurações de áudio. A exceção é o modo Reunião bidirecional: no Windows, ele envia a sua voz traduzida por um cabo de áudio virtual como o VB-CABLE e não inicia sem um; no Linux, o aplicativo cria o próprio microfone virtual.
02O VoxisLive entra na minha reunião como bot?
Nunca. Ele captura o áudio do seu próprio sistema localmente, então nenhum terceiro participante aparece no Zoom, Teams ou Meet, nenhum aviso de permissão é disparado e nenhuma integração com a plataforma é necessária.
03Quanto atraso devo esperar?
Alguns segundos atrás da fala original, após a detecção de fala e o processamento de IA.
04A qualidade da tradução depende do tamanho do enunciado?
Sim — enunciados mais longos são traduzidos melhor. Fragmentos muito curtos são agrupados ou adiados para evitar traduções ruins de palavras isoladas.
05Posso escolher qual modelo de IA traduz minha fala?
Nenhuma seleção manual é necessária ou oferecida. O VoxisLive direciona automaticamente cada sessão para o mecanismo com melhor desempenho para o idioma escolhido — atualmente uma combinação do Google Gemini Live e do Alibaba Qwen Realtime, descritos acima — e alterna automaticamente para um mecanismo de backup se um deles ficar indisponível durante a sessão. A interface não mostra qual mecanismo processou determinada sessão.
06Funciona em uma reunião multilíngue, não importa o idioma que o outro lado fale?
Sim. Os dois seletores do modo Reunião são idiomas de destino, não de origem: um define o idioma em que você ouve e o outro o idioma em que o outro lado ouve. O idioma falado é detectado automaticamente, frase a frase, nos dois sentidos — você nunca precisa escolhê-lo. Ou seja, fale o idioma que falar, chega do outro lado no idioma que você escolheu; e mesmo que o outro lado seja multilíngue, ou que três idiomas sejam falados na mesma chamada, você continua ouvindo o único idioma que escolheu.
Grátis para começar · 10 minutos grátis por dia, para sempre

Ouça qualquer idioma, em tempo real.

Funciona no Windows 10 e 11 e no Linux — captura sem drivers, sem ritual de configuração, sem bot na sua chamada.