CÓMO FUNCIONA

De tus altavoces a tu idioma en unos pocos segundos.

VoxisLive captura el audio del sistema directamente mediante loopback WASAPI, detecta la voz en el dispositivo, la traduce con un modelo de IA en tiempo real y pronuncia el resultado, mientras baja automáticamente el audio original.

Paso 1 — Captura de audio, sin drivers

VoxisLive usa loopback WASAPI, la misma API de sesión de audio de Windows de bajo nivel que usan los grabadores de pantalla para capturar “lo que está sonando”. Es una capacidad nativa de Windows: sin cables de audio virtuales, sin instalación de drivers, sin cambios en el enrutamiento de audio. La captura tiene latencia cero respecto a la reproducción y no añade artefactos audibles.

Las herramientas de la competencia suelen enrutar el audio a través de dispositivos virtuales como VB-CABLE, que exigen instalar drivers (a menudo con permisos de administrador y un reinicio) y pueden entrar en conflicto con el audio en modo exclusivo, los drivers ASIO o los sistemas antitrampas. VoxisLive evita por completo esa clase de problemas.

Paso 2 — Detección de voz en el dispositivo

La app ejecuta detección de actividad de voz (VAD) en el dispositivo para separar la voz del silencio, el ruido de fondo y la música — localmente, en tu CPU, sin viajes de ida y vuelta por la red. En el plan gratuito, solo los segmentos identificados como voz humana pasan a traducción; en los planes de pago el flujo de audio va de forma continua durante toda la sesión. El VAD también sigue la propia salida hablada de VoxisLive para que nunca vuelva a traducir su propia voz.

Paso 3 — Traducción simultánea en una sola pasada

Los segmentos de voz van a un modelo multimodal en tiempo real que resuelve el reconocimiento, la traducción y la síntesis de voz en una sola pasada de baja latencia, condensando en una las tres llamadas de red secuenciales de un pipeline tradicional (voz a texto → traducción → texto a voz). Como un intérprete humano en cabina, empieza a traducir mientras el orador todavía está hablando.

Paso 4 — Reproducción hablada con atenuación

La voz traducida se reproduce por tu dispositivo de salida mientras ocurren dos cosas en paralelo: la atenuación psicoacústica baja el audio original mientras habla la traducción (igual que en la interpretación simultánea profesional), y la sincronización de latencia mantiene cada traducción alineada con su segmento de voz para que las sesiones largas nunca se desincronicen.

Ventana principal de VoxisLive traduciendo un video, con la transcripción bilingüe en vivo

Míralo en directo — cambiando entre cinco idiomas en una sola sesión

Esta grabación de pantalla muestra una charla real traducida en tiempo real, cambiando el idioma de destino en vivo, a mitad de la charla, entre español, italiano, turco, chino y coreano — el mismo audio de origen, cinco salidas habladas distintas, sin reiniciar entre cambios. Es exactamente el pipeline de WASAPI loopback descrito arriba: sin cable de audio virtual, sin subtítulos, la traducción hablada con una voz natural mientras el original sigue audible de fondo.

¿Qué tan rápido es, en realidad?

VoxisLive es casi simultáneo, no de retardo cero: normalmente va unos pocos segundos por detrás del habla original, según la longitud de la frase y la latencia de red. Los fragmentos muy cortos se agrupan para evitar malas traducciones de una sola palabra.

Reuniones sin bot

VoxisLive nunca se une a una llamada como participante, nunca solicita permisos de anfitrión y nunca toca la app de reuniones. Lee el audio que ya está sonando por tus altavoces, lo que lo hace invisible para el resto de participantes e idéntico en Zoom, Teams, Google Meet, Webex y Discord. En el modo bidireccional también traduce tu propia voz al idioma de la reunión a través de un micrófono virtual.

Qué sale de tu equipo

Con la app gestionada de la Store, el audio se envía al modelo a través de un proxy y no se conserva ningún audio cuando termina la sesión. El VAD en el dispositivo separa la voz del silencio, del ruido de fondo y de la música; en los planes de pago el flujo va de forma continua mientras la sesión está activa y, en el plan gratuito, solo se envía la voz detectada.

PRIMEROS PASOS

Dos modos, listos en menos de un minuto

Modo Vídeo y juego — traduce cualquier cosa que se reproduzca en tu PC

Utilízalo para una película, una emisión en directo, un vídeo de YouTube o un videojuego con diálogo hablado.

  1. Abre VoxisLive y elige Vídeo y juego en el panel izquierdo.
  2. Elige el idioma que quieres escuchar en Yo escucho en. El idioma hablado no lo configuras tú: se detecta automáticamente.
  3. Pulsa Iniciar. No hay nada más que configurar: VoxisLive escucha lo que ya se está reproduciendo por tus altavoces y empieza a hablar la traducción en un par de segundos.

No hay nada que instalar ni ningún dispositivo de audio adicional que elegir: VoxisLive captura directamente el audio del sistema de tu PC (consulta «Captura de audio, sin controladores» más arriba).

Modo Reunión — que te oigan y te entiendan en Teams, Zoom o Google Meet

El modo Reunión funciona en ambos sentidos: oyes lo que dice la otra persona traducido a tu idioma y, si quieres que ella también te oiga traducido, tu voz se traduce al idioma de esa persona.

Los dos selectores son idiomas de destino, y ninguno es el idioma que se habla. «Yo escucho en» fija lo que llega a tus oídos; «El otro escucha en» fija lo que llega a los suyos. El idioma hablado se detecta automáticamente, frase a frase, en ambos sentidos: hables el idioma que hables, llega al otro lado en el que elegiste, y aunque la otra parte sea multilingüe o se hablen tres idiomas en la misma llamada, tú sigues escuchando solo el tuyo.

  1. Abre VoxisLive y elige Reunión en el panel izquierdo. Configura Yo escucho en (el idioma en el que quieres oír) y El otro escucha en (el idioma que debe oír la otra parte). Ninguno pregunta qué idioma se habla: eso se detecta automáticamente.
  2. Pulsa Iniciar. Oirás a la otra persona traducida unos segundos después.
  3. Para que también te entiendan a ti, hace falta un paso más, no en VoxisLive sino en tu aplicación de reuniones: abre los propios ajustes de audio de Teams (o Zoom, o Meet) y configura el micrófono en el cable virtual instalado en tu PC (llamado «CABLE Output» o similar): VoxisLive no instala ninguno, usa el que ya esté presente. VoxisLive cambia automáticamente el micrófono predeterminado de Windows, pero algunas aplicaciones de reuniones recuerdan el micrófono que tenías seleccionado antes y no detectan el cambio por sí solas, así que compruébalo una vez al empezar la llamada.

Si te saltas este último paso, seguirás oyendo a todos los demás traducidos; ellos simplemente seguirán oyendo tu voz original. El cable virtual en sí no es opcional en Windows: si no hay ninguno instalado, el modo Reunión no se inicia, y la app te lo avisa antes de que empiece la sesión. Instala uno gratuito como VB-CABLE y reinicia VoxisLive. En Linux, la app crea su propio micrófono virtual. Si solo necesitas entender a la otra parte, el modo Vídeo y juego lo hace sin configuración adicional.

¿Vas a hacer una llamada de WhatsApp en concreto? Consulta la guía ilustrada de configuración de llamadas de WhatsApp para ver capturas de pantalla paso a paso de ambos pasos.

FAQ

Preguntas frecuentes

01¿Necesito VB-CABLE o un driver de audio virtual?
No para capturar. VoxisLive usa loopback WASAPI, una API nativa de Windows disponible en Windows 10 y 11. Para capturar el audio de tu PC no hay nada que instalar ni enrutar, y no aparece ningún dispositivo nuevo en tu configuración de audio. La excepción es el modo Reunión bidireccional: en Windows envía tu voz traducida a través de un cable de audio virtual como VB-CABLE y no se inicia sin uno; en Linux, la app crea su propio micrófono virtual.
02¿VoxisLive se une a mi reunión como un bot?
Nunca. Captura tu propio audio del sistema localmente, así que no aparece ningún tercer asistente en Zoom, Teams o Meet, no se dispara ningún aviso de permisos y no hace falta ninguna integración con la plataforma.
03¿Cuánto retardo debo esperar?
Unos pocos segundos por detrás del habla original tras la detección de voz y el procesamiento de IA.
04¿La calidad de la traducción depende de la longitud de la frase?
Sí: las frases más largas se traducen mejor. Los fragmentos muy cortos se agrupan o se aplazan para evitar malas traducciones de una sola palabra.
05¿Puedo elegir qué modelo de IA traduce mi voz?
No es necesario ni se ofrece una selección manual. VoxisLive dirige automáticamente cada sesión al motor con mejor rendimiento para el idioma elegido — actualmente una combinación de Google Gemini Live y Alibaba Qwen Realtime, descritos más arriba — y cambia automáticamente a un motor de respaldo si uno deja de estar disponible durante la sesión. La interfaz no muestra qué motor gestionó una sesión concreta.
06¿Funciona en una reunión multilingüe, hable el idioma que hable la otra parte?
Sí. Los dos selectores del modo Reunión son idiomas de destino, no de origen: uno fija el idioma que escuchas tú y el otro el que escucha la otra parte. El idioma hablado se detecta automáticamente, frase a frase, en ambos sentidos; no tienes que elegirlo. Así que hables el idioma que hables, llega al otro lado en el idioma que elegiste; y aunque la otra parte sea multilingüe, o se hablen tres idiomas en la misma llamada, tú sigues escuchando el único idioma que elegiste.
Pruébalo gratis · 10 minutos gratis cada día

Escucha todos los idiomas, en tiempo real.

Funciona en Windows 10 y 11 y en Linux: captura sin drivers, sin rituales de configuración y sin bots en tu llamada.