SO FUNKTIONIERT ES

Von Ihren Lautsprechern in Ihre Sprache — in etwa zwei Sekunden.

VoxisLive erfasst Systemaudio direkt über WASAPI-Loopback, erkennt Sprache auf dem Gerät, übersetzt sie mit einem Echtzeit-KI-Modell und spricht das Ergebnis laut aus — während das Originalaudio automatisch abgesenkt wird.

Schritt 1 — Audioerfassung, ganz ohne Treiber

VoxisLive nutzt WASAPI-Loopback — dieselbe systemnahe Windows Audio Session API, mit der Bildschirmrekorder „das, was gerade läuft“ aufzeichnen. Das ist native Windows-Funktionalität: keine virtuellen Audiokabel, keine Treiberinstallation, keine Änderungen am Audio-Routing. Die Erfassung erfolgt latenzfrei relativ zur Wiedergabe und erzeugt keine hörbaren Artefakte.

Konkurrenzprodukte leiten Audio üblicherweise über virtuelle Geräte wie VB-CABLE, die Treiberinstallationen erfordern (oft Administratorrechte und einen Neustart) und mit Exklusivmodus-Audio, ASIO-Treibern oder Anti-Cheat-Systemen kollidieren können. VoxisLive umgeht diese Problemklasse vollständig.

Schritt 2 — Spracherkennung auf dem Gerät

Die App führt eine Sprachaktivitätserkennung (VAD) direkt auf dem Gerät aus, um Sprache von Stille, Hintergrundgeräuschen und Musik zu trennen — lokal, auf Ihrer CPU, ohne Netzwerk-Roundtrip. Nur Segmente, die als menschliche Sprache erkannt werden, gelangen in die Übersetzung; das senkt die Latenz und schont Ihr Minutenguthaben. Die VAD verfolgt außerdem die eigene Sprachausgabe von VoxisLive, damit die App nie ihre eigene Stimme erneut übersetzt.

Schritt 3 — Simultanübersetzung in einem Durchgang

Sprachsegmente gehen an ein multimodales Echtzeitmodell, das Erkennung, Übersetzung und Sprachsynthese in einem einzigen Durchgang mit niedriger Latenz erledigt — und damit die drei sequenziellen Netzwerkaufrufe einer klassischen Pipeline (Sprache-zu-Text → Übersetzung → Text-zu-Sprache) zu einem zusammenfasst. Wie ein menschlicher Dolmetscher in der Kabine beginnt es zu übersetzen, während der Sprecher noch spricht.

Schritt 4 — Gesprochene Wiedergabe mit Ducking

Die übersetzte Stimme wird über Ihr Ausgabegerät wiedergegeben, während zwei Dinge parallel geschehen: Psychoakustisches Ducking senkt das Originalaudio ab, solange die Übersetzung spricht (analog zum professionellen Simultandolmetschen), und die Latenzsynchronisierung hält jede Übersetzung an ihrem Sprachsegment ausgerichtet, damit auch lange Sitzungen nie auseinanderlaufen.

Hauptfenster von VoxisLive beim Übersetzen eines Videos mit dem zweisprachigen Live-Transkript

Live ansehen — fünf Sprachen in einer einzigen Sitzung wechseln

Diese Bildschirmaufnahme zeigt einen echten Vortrag, der in Echtzeit übersetzt wird, wobei die Zielsprache live, mitten im Vortrag, zwischen Spanisch, Italienisch, Türkisch, Chinesisch und Koreanisch gewechselt wird — dasselbe Ausgangsaudio, fünf verschiedene gesprochene Ausgaben, ohne Neustart zwischen den Wechseln. Es ist genau die oben beschriebene WASAPI-Loopback-Pipeline: kein virtuelles Audiokabel, keine Untertitel, die Übersetzung wird mit einer natürlichen Stimme gesprochen, während das Original im Hintergrund hörbar bleibt.

Wie schnell ist es wirklich?

VoxisLive arbeitet nahezu simultan, nicht verzögerungsfrei: typischerweise ein bis zwei Sekunden hinter der Originalsprache, abhängig von Äußerungslänge und Netzwerklatenz. Zum Vergleich: Professionelle menschliche Simultandolmetscher arbeiten zwei bis vier Sekunden hinter dem Sprecher — VoxisLive bewegt sich in diesem Bereich oder ist schneller. Sehr kurze Fragmente werden gebündelt, um schlechte Einzelwortübersetzungen zu vermeiden.

Meetings ohne Bot

VoxisLive tritt einem Anruf nie als Teilnehmer bei, fordert nie Host-Berechtigungen an und greift nie in die Meeting-App ein. Es liest das Audio, das ohnehin über Ihre Lautsprecher wiedergegeben wird — dadurch ist es für andere Teilnehmer unsichtbar und verhält sich in Zoom, Teams, Google Meet, Webex und Discord identisch. Im Zwei-Wege-Modus übersetzt es zusätzlich Ihre eigene Sprache über ein virtuelles Mikrofon in die Meeting-Sprache.

Was Ihren Rechner verlässt

Mit dem quelloffenen BYOK-Build geht das Audio unter Ihrem eigenen Schlüssel direkt an die API von Google — die Server von VoxisLive sind nie beteiligt. Bei der verwalteten Store-App werden erkannte Sprachsegmente an das Modell weitergeleitet, und nach Sitzungsende wird kein Audio aufbewahrt. Stille und Nicht-Sprach-Audio verlassen Ihren Rechner dank der VAD auf dem Gerät gar nicht erst.

ERSTE SCHRITTE

Zwei Modi, in weniger als einer Minute eingerichtet

Video & Spiel-Modus — übersetzen Sie alles, was auf Ihrem PC läuft

Nutzen Sie diesen Modus für einen Film, einen Stream, ein YouTube-Video oder ein Spiel mit gesprochenem Dialog.

  1. Öffnen Sie VoxisLive und wählen Sie im linken Bereich Video & Spiel.
  2. Wählen Sie unter Meine Sprache die Sprache, die Sie hören möchten.
  3. Klicken Sie auf Start. Es ist nichts weiter einzustellen — VoxisLive hört sich an, was bereits über Ihre Lautsprecher läuft, und beginnt innerhalb weniger Sekunden, die Übersetzung zu sprechen.

Es gibt nichts zu installieren und kein separates Audiogerät auszuwählen: VoxisLive erfasst den Systemton Ihres PCs direkt (siehe „Audioerfassung ohne Treiber" weiter oben).

Meeting-Modus — in Teams, Zoom oder Google Meet gehört und verstanden werden

Der Meeting-Modus funktioniert in beide Richtungen: Sie hören die Sprache der anderen Person in Ihre Sprache übersetzt, und wenn diese Sie ebenfalls übersetzt hören soll, wird Ihre Stimme in ihre Sprache übersetzt.

  1. Öffnen Sie VoxisLive und wählen Sie im linken Bereich Meeting. Stellen Sie Meine Sprache (was Sie hören möchten) und Sprache des Partners (was die Gegenseite von Ihnen hören soll) ein.
  2. Klicken Sie auf Start. Sie hören die andere Person sofort übersetzt — für diese Hälfte ist keine zusätzliche Einrichtung nötig.
  3. Damit Sie ebenfalls verstanden werden, ist ein zusätzlicher Schritt erforderlich — nicht in VoxisLive, sondern in Ihrer Meeting-App: Öffnen Sie die eigenen Audioeinstellungen von Teams (oder Zoom, oder Meet) und stellen Sie als Mikrofon das von VoxisLive installierte virtuelle Kabel ein (benannt „CABLE Output" oder ähnlich). VoxisLive wechselt das Windows-Standardmikrofon automatisch, aber manche Meeting-Apps merken sich das zuvor ausgewählte Mikrofon und übernehmen die Änderung nicht von selbst — prüfen Sie es daher einmal zu Beginn des Anrufs.

Überspringen Sie den letzten Schritt, funktioniert der Meeting-Modus trotzdem — Sie hören alle anderen übersetzt, nur werden Sie selbst nicht übersetzt zurückgegeben (VoxisLive nennt dies „Nur zuhören" und zeigt dies auch auf dem Bildschirm an). Ist gar kein virtuelles Kabel installiert, wechselt die App ebenfalls sauber in „Nur zuhören", nie in einen Fehler.

FAQ

Häufige Fragen

01Brauche ich VB-CABLE oder einen virtuellen Audiotreiber?
Nicht zum Zuhören. Für die Erfassung nutzt VoxisLive WASAPI-Loopback, eine native Windows-API, die unter Windows 10 und 11 verfügbar ist: Es gibt nichts zu installieren oder zu routen, und in Ihren Audioeinstellungen erscheint kein neues Gerät. Ein virtuelles Mikrofon ist nur optional, um Ihre übersetzte Stimme in ein Zwei-Wege-Meeting zurückzusenden; ohne eines läuft der Meeting-Modus im Nur-Hören-Betrieb.
02Tritt VoxisLive meinem Meeting als Bot bei?
Niemals. Es erfasst Ihr eigenes Systemaudio lokal, sodass in Zoom, Teams oder Meet kein dritter Teilnehmer erscheint, keine Berechtigungsabfrage ausgelöst wird und keine Plattform-Integration nötig ist.
03Mit wie viel Verzögerung muss ich rechnen?
Etwa ein bis zwei Sekunden hinter der Originalsprache, nach Spracherkennung und KI-Verarbeitung — derselbe Bereich wie bei professionellen menschlichen Simultandolmetschern, oder schneller.
04Hängt die Übersetzungsqualität von der Äußerungslänge ab?
Ja — längere Äußerungen werden besser übersetzt. Sehr kurze Fragmente werden gebündelt oder zurückgestellt, um schlechte Einzelwortübersetzungen zu vermeiden.
05Kann ich auswählen, welches KI-Modell meine Sprache übersetzt?
Eine manuelle Auswahl ist weder nötig noch verfügbar. VoxisLive leitet jede Sitzung automatisch an die für Ihre gewählte Sprache leistungsstärkste Engine weiter — derzeit eine Mischung aus Googles Gemini Live und Alibabas Qwen Realtime, wie oben beschrieben — und wechselt automatisch zu einer Ausweich-Engine, falls eine davon während der Sitzung nicht verfügbar wird. Die Oberfläche zeigt nicht an, welche Engine eine bestimmte Sitzung verarbeitet hat.
Kostenlos testen · jeden Tag 10 Gratis-Minuten

Hören Sie jede Sprache, in Echtzeit.

Läuft auf Windows 10 und 11 — keine Treiber, kein Einrichtungsritual, kein Bot in Ihrem Anruf.