---
title: "So funktioniert VoxisLive — Treiberlose Übersetzung"
description: "Die Pipeline Schritt für Schritt: WASAPI-Loopback, Sprachaktivitätserkennung auf dem Gerät, ein Simultandolmetscher-Modell und Ducking des Originaltons."
url: https://voxislive.com/de/how-it-works
language: "de"
source_html: https://voxislive.com/de/how-it-works
site: "Voxis — real-time voice translation"
og_image: https://voxislive.com/assets/og.png
generated_by: voxislive-markdown-pipeline
---

[Startseite](https://voxislive.com/de/) · / · So funktioniert es

SO FUNKTIONIERT ES

# Von Ihren Lautsprechern in Ihre Sprache — in wenigen Sekunden.

VoxisLive erfasst Systemaudio direkt über WASAPI-Loopback, erkennt Sprache auf dem Gerät, übersetzt sie mit einem Echtzeit-KI-Modell und spricht das Ergebnis laut aus — während das Originalaudio automatisch abgesenkt wird.

## Schritt 1 — Audioerfassung, ganz ohne Treiber

VoxisLive nutzt **WASAPI-Loopback** — dieselbe systemnahe Windows Audio Session API, mit der Bildschirmrekorder „das, was gerade läuft“ aufzeichnen. Das ist native Windows-Funktionalität: keine virtuellen Audiokabel, keine Treiberinstallation, keine Änderungen am Audio-Routing. Die Erfassung erfolgt latenzfrei relativ zur Wiedergabe und erzeugt keine hörbaren Artefakte.

Konkurrenzprodukte leiten Audio üblicherweise über virtuelle Geräte wie VB-CABLE, die Treiberinstallationen erfordern (oft Administratorrechte und einen Neustart) und mit Exklusivmodus-Audio, ASIO-Treibern oder Anti-Cheat-Systemen kollidieren können. VoxisLive umgeht diese Problemklasse vollständig.

## Schritt 2 — Sprachaktivitätserkennung auf dem Gerät

Die App führt eine **Sprachaktivitätserkennung (VAD) direkt auf dem Gerät** aus, um Sprache von Stille, Hintergrundgeräuschen und Musik zu trennen — lokal, auf Ihrer CPU, ohne Netzwerk-Roundtrip. Nur Segmente, die als menschliche Sprache erkannt werden, gelangen in die Übersetzung; das senkt die Latenz und schont Ihr Minutenguthaben. Die VAD verfolgt außerdem die eigene Sprachausgabe von VoxisLive, damit die App nie ihre eigene Stimme erneut übersetzt.

## Schritt 3 — Simultanübersetzung in einem Durchgang

Sprachsegmente gehen an ein **multimodales Echtzeitmodell**, das Erkennung, Übersetzung und Sprachsynthese in einem einzigen Durchgang mit niedriger Latenz erledigt — und damit die drei sequenziellen Netzwerkaufrufe einer klassischen Pipeline (Sprache-zu-Text → Übersetzung → Text-zu-Sprache) zu einem zusammenfasst. Wie ein menschlicher Dolmetscher in der Kabine beginnt es zu übersetzen, während der Sprecher noch spricht.

## Schritt 4 — Gesprochene Wiedergabe mit Ducking

Die übersetzte Stimme wird über Ihr Ausgabegerät wiedergegeben, während zwei Dinge parallel geschehen: **Psychoakustisches Ducking** senkt das Originalaudio ab, solange die Übersetzung spricht (analog zum professionellen Simultandolmetschen), und die **Latenzsynchronisierung** hält jede Übersetzung an ihrem Sprachsegment ausgerichtet, damit auch lange Sitzungen nie auseinanderlaufen.

![Hauptfenster von VoxisLive beim Übersetzen eines Videos mit dem zweisprachigen Live-Transkript](https://voxislive.com/assets/shot-app-dark-de.png?v=1081)

## Live ansehen — fünf Sprachen in einer einzigen Sitzung wechseln

Diese Bildschirmaufnahme zeigt einen echten Vortrag, der in Echtzeit übersetzt wird, wobei die Zielsprache live, mitten im Vortrag, zwischen Spanisch, Italienisch, Türkisch, Chinesisch und Koreanisch gewechselt wird — dasselbe Ausgangsaudio, fünf verschiedene gesprochene Ausgaben, ohne Neustart zwischen den Wechseln. Es ist genau die oben beschriebene WASAPI-Loopback-Pipeline: kein virtuelles Audiokabel, keine Untertitel, die Übersetzung wird mit einer natürlichen Stimme gesprochen, während das Original im Hintergrund hörbar bleibt.

## Wie schnell ist es wirklich?

VoxisLive arbeitet **nahezu simultan, nicht verzögerungsfrei**: typischerweise wenige Sekunden hinter der Originalsprache, abhängig von Äußerungslänge und Netzwerklatenz. Sehr kurze Fragmente werden gebündelt, um schlechte Einzelwortübersetzungen zu vermeiden.

## Meetings ohne Bot

VoxisLive tritt einem Anruf nie als Teilnehmer bei, fordert nie Host-Berechtigungen an und greift nie in die Meeting-App ein. Es liest das Audio, das ohnehin über Ihre Lautsprecher wiedergegeben wird — dadurch ist es für andere Teilnehmer unsichtbar und verhält sich in Zoom, Teams, Google Meet, Webex und Discord identisch. Im Zwei-Wege-Modus übersetzt es zusätzlich Ihre eigene Sprache über ein virtuelles Mikrofon in die Meeting-Sprache.

## Was Ihren Rechner verlässt

Bei der verwalteten Store-App werden erkannte Sprachsegmente an das Modell weitergeleitet, und **nach Sitzungsende wird kein Audio aufbewahrt**. Stille und Nicht-Sprach-Audio verlassen Ihren Rechner dank der VAD auf dem Gerät gar nicht erst.

ERSTE SCHRITTE

## Zwei Modi, in weniger als einer Minute eingerichtet

## Video & Spiel-Modus — übersetzen Sie alles, was auf Ihrem PC läuft

Nutzen Sie diesen Modus für einen Film, einen Stream, ein YouTube-Video oder ein Spiel mit gesprochenem Dialog.

1. Öffnen Sie VoxisLive und wählen Sie im linken Bereich **Video & Spiel**.
2. Wählen Sie unter **Ich höre auf** die Sprache, die Sie hören möchten. Die gesprochene Sprache stellen Sie nicht ein — sie wird automatisch erkannt.
3. Klicken Sie auf **Starten**. Es ist nichts weiter einzustellen — VoxisLive hört sich an, was bereits über Ihre Lautsprecher läuft, und beginnt innerhalb weniger Sekunden, die Übersetzung zu sprechen.

Es gibt nichts zu installieren und kein separates Audiogerät auszuwählen: VoxisLive erfasst den Systemton Ihres PCs direkt (siehe „Audioerfassung ohne Treiber" weiter oben).

## Meeting-Modus — in Teams, Zoom oder Google Meet gehört und verstanden werden

Der Meeting-Modus funktioniert in beide Richtungen: Sie hören die Sprache der anderen Person in Ihre Sprache übersetzt, und wenn diese Sie ebenfalls übersetzt hören soll, wird Ihre Stimme in ihre Sprache übersetzt.

**Beide Auswahlfelder sind Zielsprachen, und keines davon ist die gesprochene Sprache.** „Ich höre auf“ legt fest, was bei Ihnen ankommt; „Gegenüber hört auf“ legt fest, was bei der Gegenseite ankommt. Die gesprochene Sprache wird Satz für Satz automatisch erkannt, in beide Richtungen — welche Sprache Sie also auch sprechen, sie kommt drüben in der gewählten Sprache an, und selbst wenn Ihr Gegenüber mehrsprachig ist oder drei Sprachen im selben Gespräch fallen, hören Sie weiterhin nur Ihre.

1. Öffnen Sie VoxisLive und wählen Sie im linken Bereich **Meeting**. Stellen Sie **Ich höre auf** (die Sprache, in der Sie hören möchten) und **Gegenüber hört auf** (die Sprache, in der die Gegenseite hören soll) ein. Keines der beiden Felder fragt nach der gesprochenen Sprache — die wird automatisch erkannt.
2. Klicken Sie auf **Starten**. Sie hören die andere Person wenige Sekunden später übersetzt.
3. **Damit Sie ebenfalls verstanden werden, ist ein zusätzlicher Schritt erforderlich — nicht in VoxisLive, sondern in Ihrer Meeting-App:** Öffnen Sie die eigenen Audioeinstellungen von Teams (oder Zoom, oder Meet) und stellen Sie als Mikrofon das auf Ihrem PC installierte virtuelle Kabel ein (benannt „CABLE Output" oder ähnlich) — VoxisLive installiert keines, sondern nutzt ein bereits vorhandenes. VoxisLive wechselt das Windows-Standardmikrofon automatisch, aber manche Meeting-Apps merken sich das zuvor ausgewählte Mikrofon und übernehmen die Änderung nicht von selbst — prüfen Sie es daher einmal zu Beginn des Anrufs.

Wenn Sie den letzten Schritt überspringen, hören Sie alle anderen trotzdem übersetzt — die anderen hören dann weiterhin Ihre eigene Stimme. Das virtuelle Kabel selbst ist unter Windows nicht optional: Ist keines installiert, startet der Meeting-Modus nicht, und die App sagt Ihnen das, bevor die Sitzung beginnt. Installieren Sie ein kostenloses wie VB-CABLE und starten Sie VoxisLive neu. Unter Linux legt die App ihr eigenes virtuelles Mikrofon an. Wenn Sie die Gegenseite nur verstehen müssen, erledigt das der Modus Video / Spiel ohne zusätzliche Einrichtung.

Nutzen Sie speziell einen WhatsApp-Anruf? In der [bebilderten Anleitung für WhatsApp-Anrufe](https://voxislive.com/de/use-cases/whatsapp-translation) finden Sie Schritt-für-Schritt-Screenshots zu beiden Schritten.

FAQ

## Häufige Fragen

### Brauche ich VB-CABLE oder einen virtuellen Audiotreiber?

Nicht zum Zuhören. Für die Erfassung nutzt VoxisLive WASAPI-Loopback, eine native Windows-API, die unter Windows 10 und 11 verfügbar ist: Es gibt nichts zu installieren oder zu routen, und in Ihren Audioeinstellungen erscheint kein neues Gerät. Die Ausnahme ist der Zwei-Wege-Meeting-Modus: Unter Windows sendet er Ihre übersetzte Stimme über ein virtuelles Audiokabel wie VB-CABLE und startet ohne ein solches nicht; unter Linux legt die App ihr eigenes virtuelles Mikrofon an.

### Tritt VoxisLive meinem Meeting als Bot bei?

Niemals. Es erfasst Ihr eigenes Systemaudio lokal, sodass in Zoom, Teams oder Meet kein dritter Teilnehmer erscheint, keine Berechtigungsabfrage ausgelöst wird und keine Plattform-Integration nötig ist.

### Mit wie viel Verzögerung muss ich rechnen?

Wenige Sekunden hinter der Originalsprache, nach Sprachaktivitätserkennung und KI-Verarbeitung.

### Hängt die Übersetzungsqualität von der Äußerungslänge ab?

Ja — längere Äußerungen werden besser übersetzt. Sehr kurze Fragmente werden gebündelt oder zurückgestellt, um schlechte Einzelwortübersetzungen zu vermeiden.

### Kann ich auswählen, welches KI-Modell meine Sprache übersetzt?

Eine manuelle Auswahl ist weder nötig noch verfügbar. VoxisLive leitet jede Sitzung automatisch an die für Ihre gewählte Sprache leistungsstärkste Engine weiter — derzeit eine Mischung aus Googles Gemini Live und Alibabas Qwen Realtime, wie oben beschrieben — und wechselt automatisch zu einer Ausweich-Engine, falls eine davon während der Sitzung nicht verfügbar wird. Die Oberfläche zeigt nicht an, welche Engine eine bestimmte Sitzung verarbeitet hat.

### Funktioniert es in einem mehrsprachigen Meeting, egal welche Sprache die Gegenseite spricht?

Ja. Beide Auswahlfelder im Meeting-Modus sind Zielsprachen, keine Ausgangssprachen: Das eine legt fest, in welcher Sprache Sie hören, das andere, in welcher die Gegenseite hört. Die gesprochene Sprache wird Satz für Satz automatisch erkannt, in beide Richtungen — Sie wählen sie nie aus. Welche Sprache Sie also auch sprechen, sie kommt bei der Gegenseite in der von Ihnen gewählten Sprache an; und selbst wenn Ihr Gegenüber mehrsprachig ist oder in derselben Besprechung drei Sprachen gesprochen werden, hören Sie weiterhin nur die eine Sprache, die Sie gewählt haben.

## Weiterlesen

[Systemaudio übersetzen · VoxisLive erfasst den gesamten Windows-Audiomix und spricht eine Live-Übersetzung — Browser, Player, Spiele, Anrufe.](https://voxislive.com/de/translate-system-audio-windows) · [Übersetzungs-Apps im Vergleich · Neun Echtzeit-Sprachübersetzungs-Apps nach Plattform, Ausgabe und Preis — auch dort, wo ein anderes Tool die bessere Wahl ist.](https://voxislive.com/de/best-real-time-voice-translation-apps) · [Anwendungsfälle · Eine treiberlose Pipeline für jede Quelle: Übersetzen Sie Spielaudio, Zoom/Teams/Meet-Anrufe, Netflix- und…](https://voxislive.com/de/use-cases)

Kostenlos testen · jeden Tag 10 Gratis-Minuten

## Hören Sie jede Sprache, in Echtzeit.

Läuft auf Windows 10 und 11 sowie unter Linux — treiberlose Aufnahme, kein Einrichtungsritual, kein Bot in Ihrem Anruf.

[Jetzt im Microsoft Store](https://apps.microsoft.com/store/detail/9P5Z0KVS58RS?cid=DevShareMCLPCB)
[Linux · Snap Store](https://snapcraft.io/voxis)
[Auf GitHub ansehen](https://github.com/VoxisLive/voxislive)


## Structured data (JSON-LD)

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "BreadcrumbList",
      "itemListElement": [
        {
          "@type": "ListItem",
          "position": 1,
          "name": "Startseite",
          "item": "https://voxislive.com/de/"
        },
        {
          "@type": "ListItem",
          "position": 2,
          "name": "So funktioniert es",
          "item": "https://voxislive.com/de/how-it-works"
        }
      ]
    },
    {
      "@type": "WebPage",
      "name": "So funktioniert VoxisLive — Treiberlose Übersetzung",
      "url": "https://voxislive.com/de/how-it-works",
      "description": "Die Pipeline Schritt für Schritt: WASAPI-Loopback, Sprachaktivitätserkennung auf dem Gerät, ein Simultandolmetscher-Modell und Ducking des Originaltons.",
      "inLanguage": "de",
      "dateModified": "2026-07-15",
      "isPartOf": {
        "@type": "WebSite",
        "name": "VoxisLive",
        "url": "https://voxislive.com/"
      }
    },
    {
      "@type": "VideoObject",
      "name": "Windows-Systemton in Echtzeit übersetzen — gesprochen, nicht als Untertitel",
      "description": "VoxisLive übersetzt jedes auf einem Windows-PC abgespielte Audio in Echtzeit und spricht die Übersetzung laut aus, in jeder der 79 Sprachen, live zwischen Zielen wechselbar — ohne virtuelles Audiokabel.",
      "thumbnailUrl": "https://voxislive.com/assets/video-thumb-1280x720.jpg",
      "uploadDate": "2026-07-15",
      "duration": "PT5M0S",
      "contentUrl": "https://www.youtube.com/watch?v=F-wItuPKNYI",
      "embedUrl": "https://www.youtube.com/embed/F-wItuPKNYI",
      "publisher": {
        "@type": "Organization",
        "name": "VoxisLive",
        "url": "https://voxislive.com/"
      }
    },
    {
      "@type": "FAQPage",
      "mainEntity": [
        {
          "@type": "Question",
          "name": "Brauche ich VB-CABLE oder einen virtuellen Audiotreiber?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Nicht zum Zuhören. Für die Erfassung nutzt VoxisLive WASAPI-Loopback, eine native Windows-API, die unter Windows 10 und 11 verfügbar ist: Es gibt nichts zu installieren oder zu routen, und in Ihren Audioeinstellungen erscheint kein neues Gerät. Die Ausnahme ist der Zwei-Wege-Meeting-Modus: Unter Windows sendet er Ihre übersetzte Stimme über ein virtuelles Audiokabel wie VB-CABLE und startet ohne ein solches nicht; unter Linux legt die App ihr eigenes virtuelles Mikrofon an."
          }
        },
        {
          "@type": "Question",
          "name": "Tritt VoxisLive meinem Meeting als Bot bei?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Niemals. Es erfasst Ihr eigenes Systemaudio lokal, sodass in Zoom, Teams oder Meet kein dritter Teilnehmer erscheint, keine Berechtigungsabfrage ausgelöst wird und keine Plattform-Integration nötig ist."
          }
        },
        {
          "@type": "Question",
          "name": "Mit wie viel Verzögerung muss ich rechnen?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Wenige Sekunden hinter der Originalsprache, nach Sprachaktivitätserkennung und KI-Verarbeitung."
          }
        },
        {
          "@type": "Question",
          "name": "Hängt die Übersetzungsqualität von der Äußerungslänge ab?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Ja — längere Äußerungen werden besser übersetzt. Sehr kurze Fragmente werden gebündelt oder zurückgestellt, um schlechte Einzelwortübersetzungen zu vermeiden."
          }
        },
        {
          "@type": "Question",
          "name": "Kann ich auswählen, welches KI-Modell meine Sprache übersetzt?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Eine manuelle Auswahl ist weder nötig noch verfügbar. VoxisLive leitet jede Sitzung automatisch an die für Ihre gewählte Sprache leistungsstärkste Engine weiter und wechselt automatisch zu einer Ausweich-Engine, falls eine davon während der Sitzung nicht verfügbar wird. Die Oberfläche zeigt nicht an, welche Engine eine bestimmte Sitzung verarbeitet hat."
          }
        },
        {
          "@type": "Question",
          "name": "Funktioniert es in einem mehrsprachigen Meeting, egal welche Sprache die Gegenseite spricht?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Ja. Beide Auswahlfelder im Meeting-Modus sind Zielsprachen, keine Ausgangssprachen: Das eine legt fest, in welcher Sprache Sie hören, das andere, in welcher die Gegenseite hört. Die gesprochene Sprache wird Satz für Satz automatisch erkannt, in beide Richtungen — Sie wählen sie nie aus. Welche Sprache Sie also auch sprechen, sie kommt bei der Gegenseite in der von Ihnen gewählten Sprache an; und selbst wenn Ihr Gegenüber mehrsprachig ist oder in derselben Besprechung drei Sprachen gesprochen werden, hören Sie weiterhin nur die eine Sprache, die Sie gewählt haben."
          }
        }
      ]
    }
  ]
}
```
