COMMENT ÇA MARCHE

De vos haut-parleurs à votre langue en quelques secondes.

VoxisLive capture l'audio système directement via WASAPI loopback, détecte la parole sur l'appareil, la traduit avec un modèle IA temps réel et énonce le résultat — tout en baissant automatiquement l'audio d'origine.

Étape 1 — La capture audio, sans pilotes

VoxisLive utilise WASAPI loopback — la même API Windows Audio Session de bas niveau que les enregistreurs d'écran utilisent pour capturer « ce qui est en cours de lecture ». C'est une capacité native de Windows : pas de câbles audio virtuels, pas d'installation de pilote, aucune modification du routage audio. La capture est à latence nulle par rapport à la lecture et n'ajoute aucun artefact audible.

Les outils concurrents font généralement transiter l'audio par des périphériques virtuels comme VB-CABLE, qui exigent l'installation de pilotes (souvent avec droits administrateur et redémarrage) et peuvent entrer en conflit avec l'audio en mode exclusif, les pilotes ASIO ou les systèmes anti-triche. VoxisLive élimine entièrement cette catégorie de problèmes.

Étape 2 — Détection vocale sur l'appareil

L'application exécute une détection d'activité vocale (VAD) sur l'appareil pour séparer la parole du silence, du bruit de fond et de la musique — localement, sur votre CPU, sans aller-retour réseau. Seuls les segments identifiés comme de la parole humaine passent à la traduction, ce qui réduit la latence et préserve votre solde de minutes. La VAD suit également la sortie vocale de VoxisLive afin qu'il ne retraduise jamais sa propre voix.

Étape 3 — Traduction simultanée en une seule passe

Les segments de parole sont transmis à un modèle temps réel multimodal qui gère la reconnaissance, la traduction et la synthèse vocale en une seule passe à faible latence — condensant les trois appels réseau séquentiels d'un pipeline traditionnel (parole vers texte → traduction → texte vers parole) en un seul. Comme un interprète humain en cabine, il commence à traduire pendant que l'orateur parle encore.

Étape 4 — Restitution parlée avec ducking

La voix traduite est diffusée sur votre périphérique de sortie pendant que deux choses se produisent en parallèle : le ducking psychoacoustique baisse l'audio d'origine pendant que la traduction parle (à l'image de l'interprétation simultanée professionnelle), et la synchronisation de latence maintient chaque traduction alignée sur son segment de parole, pour que les longues sessions ne dérivent jamais.

Fenêtre principale de VoxisLive traduisant une vidéo, avec la transcription bilingue en direct

Regardez-le en direct — changement entre cinq langues en une seule session

Cet enregistrement d'écran montre une véritable conférence traduite en temps réel, avec la langue cible changée en direct, en plein milieu de la conférence, entre l'espagnol, l'italien, le turc, le chinois et le coréen — le même audio source, cinq sorties vocales différentes, sans redémarrage entre les changements. C'est exactement le pipeline WASAPI loopback décrit ci-dessus : pas de câble audio virtuel, pas de sous-titres, la traduction est prononcée avec une voix naturelle pendant que l'original reste audible en arrière-plan.

Quelle est sa vitesse, réellement ?

VoxisLive est quasi simultané, pas à délai nul : généralement quelques secondes derrière la parole d'origine, selon la longueur des énoncés et la latence réseau. Les fragments très courts sont regroupés pour éviter les mauvaises traductions mot à mot.

Des réunions sans bot

VoxisLive ne rejoint jamais un appel en tant que participant, ne demande jamais de permissions à l'hôte et ne touche jamais à l'application de réunion. Il lit l'audio déjà diffusé sur vos haut-parleurs, ce qui le rend invisible pour les autres participants et identique sur Zoom, Teams, Google Meet, Webex et Discord. En mode bidirectionnel, il traduit aussi votre propre parole dans la langue de la réunion via un microphone virtuel.

Ce qui quitte votre machine

Avec l'application gérée du Store, les segments de parole détectés sont relayés vers le modèle et aucun audio n'est conservé après la fin de la session. Le silence et l'audio non vocal ne quittent d'ailleurs jamais votre machine, grâce à la VAD sur l'appareil.

POUR COMMENCER

Deux modes, prêts en moins d'une minute

Mode Vidéo & Jeu — traduisez tout ce qui se joue sur votre PC

Utilisez ce mode pour un film, un stream, une vidéo YouTube ou un jeu avec des dialogues parlés.

  1. Ouvrez VoxisLive et choisissez Vidéo & Jeu dans le panneau de gauche.
  2. Choisissez la langue que vous souhaitez entendre sous J'entends en. Vous ne réglez jamais la langue parlée : elle est détectée automatiquement.
  3. Appuyez sur Démarrer. Rien d'autre à configurer — VoxisLive écoute ce qui joue déjà sur vos haut-parleurs et commence à parler la traduction en quelques secondes.

Il n'y a rien à installer ni aucun périphérique audio séparé à choisir : VoxisLive capture directement l'audio système de votre PC (voir « Capture audio, sans pilote » ci-dessus).

Mode Réunion — soyez entendu et compris sur Teams, Zoom ou Google Meet

Le mode Réunion fonctionne dans les deux sens : vous entendez la parole de l'autre personne traduite dans votre langue et, si vous voulez qu'elle vous entende traduit aussi, votre voix est traduite dans sa langue.

Les deux sélecteurs sont des langues cibles, et aucun des deux n'est la langue parlée. « J'entends en » fixe ce qui arrive à vos oreilles ; « L'autre entend en » fixe ce qui arrive aux siennes. La langue parlée est détectée automatiquement, phrase après phrase, dans les deux sens — quelle que soit la langue dans laquelle vous parlez, elle arrive en face dans celle que vous avez choisie, et même si votre interlocuteur est multilingue ou si trois langues circulent dans le même appel, vous n'entendez toujours que la vôtre.

  1. Ouvrez VoxisLive et choisissez Réunion dans le panneau de gauche. Réglez J'entends en (la langue dans laquelle vous voulez entendre) et L'autre entend en (la langue dans laquelle votre interlocuteur doit entendre). Aucun des deux ne demande la langue parlée : elle est détectée automatiquement.
  2. Appuyez sur Démarrer. Vous entendrez l'autre participant traduit quelques secondes plus tard.
  3. Pour être compris en retour, une étape supplémentaire est nécessaire, pas dans VoxisLive mais dans votre application de réunion : ouvrez les paramètres audio propres à Teams (ou Zoom, ou Meet) et réglez le microphone sur le câble virtuel installé sur votre PC (nommé « CABLE Output » ou similaire) — VoxisLive n'en installe aucun, il utilise celui qui est déjà présent. VoxisLive change automatiquement le microphone par défaut de Windows, mais certaines applications de réunion se souviennent du microphone précédemment sélectionné et ne détectent pas le changement d'elles-mêmes — vérifiez-le donc une fois, au début de l'appel.

Si vous sautez cette dernière étape, vous entendrez quand même tout le monde traduit — les autres continueront simplement d'entendre votre voix d'origine. Le câble virtuel lui-même n'est pas facultatif sous Windows : s'il n'y en a aucun d'installé, le mode Réunion ne démarre pas, et l'application vous le signale avant le début de la session. Installez-en un gratuit comme VB-CABLE, puis redémarrez VoxisLive. Sous Linux, l'application crée son propre microphone virtuel. Si vous avez seulement besoin de comprendre l'autre côté, le mode Vidéo / Jeu le fait sans configuration supplémentaire.

Vous utilisez spécifiquement un appel WhatsApp ? Consultez le guide illustré de configuration des appels WhatsApp pour des captures d'écran détaillées des deux étapes.

FAQ

Questions fréquentes

01Ai-je besoin de VB-CABLE ou d'un pilote audio virtuel ?
Pas pour la capture. VoxisLive utilise WASAPI loopback, une API Windows native disponible sous Windows 10 et 11. Pour capturer l'audio de votre PC, il n'y a rien à installer ni à router, et aucun nouveau périphérique n'apparaît dans vos paramètres audio. Le mode Réunion bidirectionnel fait exception : sous Windows, il envoie votre voix traduite par un câble audio virtuel comme VB-CABLE et ne démarre pas sans lui ; sous Linux, l'application crée son propre microphone virtuel.
02VoxisLive rejoint-il ma réunion comme un bot ?
Jamais. Il capture votre propre audio système localement : aucun troisième participant n'apparaît dans Zoom, Teams ou Meet, aucune demande d'autorisation ne se déclenche et aucune intégration à la plateforme n'est nécessaire.
03Quel délai dois-je prévoir ?
Quelques secondes derrière la parole d'origine, après détection vocale et traitement par l'IA.
04La qualité de la traduction dépend-elle de la longueur des énoncés ?
Oui — les énoncés plus longs se traduisent mieux. Les fragments très courts sont regroupés ou différés pour éviter les mauvaises traductions mot à mot.
05Puis-je choisir quel modèle d'IA traduit ma voix ?
Aucune sélection manuelle n'est nécessaire ni proposée. VoxisLive dirige automatiquement chaque session vers le moteur le plus performant pour la langue choisie — actuellement un mélange de Google Gemini Live et d'Alibaba Qwen Realtime, décrits ci-dessus — et bascule automatiquement vers un moteur de secours si l'un d'eux devient indisponible en cours de session. L'interface n'indique pas quel moteur a traité une session donnée.
06Est-ce que cela marche dans une réunion multilingue, quelle que soit la langue parlée en face ?
Oui. Les deux sélecteurs du mode Réunion sont des langues cibles, pas des langues sources : l'un fixe la langue dans laquelle vous entendez, l'autre celle dans laquelle votre interlocuteur entend. La langue parlée est détectée automatiquement, phrase après phrase, dans les deux sens — vous n'avez jamais à la choisir. Quelle que soit la langue dans laquelle vous parlez, elle arrive en face dans la langue que vous avez choisie ; et même si votre interlocuteur est multilingue, ou si trois langues circulent dans le même appel, vous continuez d'entendre la seule langue que vous avez choisie.
15 min offertes · puis 10 min gratuites par jour

Entendez toutes les langues, en temps réel.

Fonctionne sous Windows 10 et 11 et sous Linux — capture sans pilote, pas de rituel de configuration, pas de bot dans votre appel.