---
title: "VoxisLive 작동 방식 — 드라이버 없는 음성 번역 (Windows)"
description: "전체 파이프라인: WASAPI 루프백 캡처, 기기 내 음성 감지, 네이티브 동시통역 AI 모델, 심리음향 더킹, 몇 초의 지연 시간."
url: https://voxislive.com/ko/how-it-works
language: "ko"
source_html: https://voxislive.com/ko/how-it-works
site: "Voxis — real-time voice translation"
og_image: https://voxislive.com/assets/og.png
generated_by: voxislive-markdown-pipeline
---

[홈](https://voxislive.com/ko/) · / · 작동 방식

작동 방식

# 스피커에서 흘러나오는 소리가 몇 초 만에 당신의 언어로.

VoxisLive는 WASAPI 루프백을 통해 시스템 오디오를 직접 캡처하고, 기기에서 음성을 감지한 뒤, 실시간 AI 모델로 번역하여 결과를 음성으로 들려줍니다 — 이 과정에서 원본 오디오는 자동으로 낮아집니다.

## 1단계 — 드라이버 없는 오디오 캡처

VoxisLive는 **WASAPI 루프백**을 사용합니다 — 화면 녹화 프로그램이 “현재 재생 중인 소리”를 캡처할 때 쓰는 것과 동일한 저수준 Windows Audio Session API입니다. 이는 Windows 자체 기능이므로 가상 오디오 케이블도, 드라이버 설치도, 오디오 라우팅 변경도 필요 없습니다. 캡처 과정에서 재생 대비 지연이 발생하지 않으며, 귀에 들리는 잡음(아티팩트)도 전혀 추가되지 않습니다.

경쟁 도구는 대개 VB-CABLE 같은 가상 장치를 통해 오디오를 우회시키는데, 이는 드라이버 설치(대개 관리자 권한과 재부팅 필요)가 필요하며 독점 모드 오디오, ASIO 드라이버, 안티치트 시스템과 충돌할 수 있습니다. VoxisLive는 이런 문제를 애초에 겪지 않습니다.

## 2단계 — 기기 내 음성 감지

앱은 **기기 내 음성 활동 감지(VAD)**를 실행하여 음성을 무음, 배경 소음, 음악과 구분합니다 — 네트워크 왕복 없이 사용자의 CPU에서 로컬로 처리됩니다. 사람의 음성으로 식별된 구간만 번역 단계로 넘어가며, 이는 지연 시간을 줄여주고, 결제된 사용 시간이 낭비되지 않도록 보호합니다. VAD는 VoxisLive 자신이 출력하는 음성도 추적하여 자기 목소리를 다시 번역하는 일이 없도록 합니다.

## 3단계 — 단일 패스 동시 번역

음성 구간은 인식, 번역, 음성 합성을 단일한 저지연 패스로 처리하는 **멀티모달 실시간 모델**로 전달됩니다 — 기존 파이프라인의 세 단계 순차 네트워크 호출(음성 인식 → 번역 → 음성 합성)을 하나로 압축한 것입니다. 부스 안의 인간 통역사처럼, 화자가 아직 말하고 있는 동안 번역을 시작합니다.

## 4단계 — 더킹을 적용한 음성 재생

번역된 음성은 사용자의 출력 장치를 통해 재생되며, 이와 동시에 두 가지가 병행됩니다: **심리음향 더킹**은 번역이 재생되는 동안 원본 오디오를 낮추고(전문 동시통역을 그대로 재현), **지연 동기화**는 각 번역을 해당 음성 구간에 맞춰 정렬해 긴 세션에서도 어긋나지 않도록 합니다.

![동영상을 번역 중인 VoxisLive 메인 창, 실시간 이중 언어 자막 표시](https://voxislive.com/assets/shot-app-dark-ko.png)

## 실시간으로 확인하기 — 한 세션에서 5개 언어 전환

이 화면 녹화는 실제 콘퍼런스 강연을 실시간으로 번역하는 모습을 보여줍니다. 대상 언어는 강연 도중 스페인어, 이탈리아어, 터키어, 중국어, 한국어로 실시간 전환됩니다 — 동일한 원본 오디오에서 다섯 가지 다른 음성 출력이 나오며, 전환 사이에 재시작이 없습니다. 이는 위에서 설명한 WASAPI 루프백 파이프라인 그대로입니다: 가상 오디오 케이블도, 자막도 없이, 원본이 아래에서 계속 들리는 가운데 번역이 자연스러운 목소리로 재생됩니다.

## 실제로 얼마나 빠를까요?

VoxisLive는 **지연이 전혀 없는 것이 아니라 거의 동시적**입니다: 발화 길이와 네트워크 지연에 따라 보통 원본 발화보다 몇 초 늦습니다. 참고로 전문 인간 동시통역사는 화자보다 2~4초 늦게 통역합니다 — VoxisLive는 이와 비슷하거나 더 빠른 속도로 동작합니다. 아주 짧은 발화 조각은 단어 단위의 부정확한 번역을 피하기 위해 묶어서 처리됩니다.

## 봇 없는 회의

VoxisLive는 참가자로 통화에 들어가지 않으며, 호스트 권한을 요청하지 않고, 회의 앱을 건드리지도 않습니다. 이미 스피커에서 재생 중인 오디오를 읽어들이기 때문에 다른 참가자에게는 보이지 않으며, Zoom, Teams, Meet, Webex, Discord 어디서나 동일하게 작동합니다. 양방향 모드에서는 가상 마이크를 통해 사용자 자신의 발화도 회의 언어로 번역합니다.

## 기기 밖으로 나가는 데이터

관리형 스토어 앱에서는 오디오가 모델로 프록시되며, **세션 종료 후 오디오는 보관되지 않습니다**. 기기 내 VAD가 음성을 무음, 배경 소음, 음악과 구분합니다. 유료 요금제에서는 세션이 실행되는 동안 스트림이 계속 전송되고, 무료 요금제에서는 감지된 음성만 전송됩니다.

시작하기

## 1분 안에 설정하는 두 가지 모드

## 동영상 및 게임 모드 — PC에서 재생되는 모든 것을 번역

영화, 스트리밍, 유튜브 영상, 대사가 있는 게임 등에 사용하세요.

1. VoxisLive를 열고 왼쪽 패널에서 **동영상 및 게임**을 선택하세요.
2. **내 언어**에서 듣고 싶은 언어를 선택하세요.
3. **시작**을 누르세요. 다른 설정은 필요 없습니다 — VoxisLive는 스피커에서 이미 재생 중인 소리를 듣고 몇 초 안에 번역을 음성으로 말하기 시작합니다.

설치할 것도, 따로 선택할 오디오 장치도 없습니다: VoxisLive는 PC의 시스템 오디오를 직접 캡처합니다(위의 "드라이버 없는 오디오 캡처" 참고).

## 미팅 모드 — Teams, Zoom, Google Meet에서 상대방에게 들리고 이해받기

미팅 모드는 양방향입니다: 상대방의 말이 여러분의 언어로 번역되어 들리고, 상대방도 번역된 여러분의 목소리를 듣기를 원한다면 여러분의 목소리도 상대방의 언어로 번역됩니다.

1. VoxisLive를 열고 왼쪽 패널에서 **미팅**을 선택하세요. **내 언어**(듣고 싶은 언어)와 **상대방 언어**(상대방이 여러분에게서 들어야 할 언어)를 설정하세요.
2. **시작**을 누르세요. 상대방의 말이 몇 초 뒤에 번역되어 들립니다 — 이 부분은 별도의 설정이 필요 없습니다.
3. **여러분도 상대방에게 이해받으려면 VoxisLive가 아니라 사용 중인 미팅 앱에서 한 단계가 더 필요합니다:** Teams(또는 Zoom, Meet)의 자체 오디오 설정을 열고 마이크를 PC에 설치되어 있는 가상 케이블("CABLE Output" 또는 이와 비슷한 이름)로 설정하세요. VoxisLive는 가상 케이블을 설치하지 않고, 이미 설치된 것을 사용합니다. VoxisLive는 Windows의 기본 마이크를 자동으로 전환하지만, 일부 미팅 앱은 이전에 선택했던 마이크를 그대로 기억하고 변경 사항을 스스로 인식하지 못하는 경우가 있으므로 통화 시작 시 한 번 확인하세요.

마지막 단계를 건너뛰어도 미팅 모드는 정상적으로 작동합니다 — 다른 사람의 말은 번역되어 들리지만, 여러분의 말은 상대방에게 번역되어 전달되지 않을 뿐입니다(VoxisLive는 이를 "듣기 전용"이라고 부르며 화면에 표시합니다). 가상 케이블이 전혀 설치되어 있지 않아도 오류 없이 자연스럽게 듣기 전용으로 전환됩니다.

특히 WhatsApp 통화를 사용하시나요? 두 단계 모두를 화면 캡처로 자세히 안내하는 [삽화로 보는 WhatsApp 통화 설정 가이드](https://voxislive.com/ko/use-cases/whatsapp-translation)를 확인하세요.

FAQ

## 자주 묻는 질문

### VB-CABLE이나 가상 오디오 드라이버가 필요한가요?

아니요 — PC 오디오를 캡처하는 데는 필요하지 않습니다. VoxisLive는 Windows 10과 11에서 사용할 수 있는 네이티브 Windows API인 WASAPI 루프백을 사용하므로, 설치하거나 라우팅할 것이 없고 오디오 설정에 새 장치도 나타나지 않습니다. 가상 마이크는 번역된 음성을 양방향 회의로 다시 보낼 때만 필요한 선택 사항이며, 없어도 회의 모드는 듣기 전용으로 동작합니다.

### VoxisLive가 봇으로 회의에 참가하나요?

아니요, 절대 그렇지 않습니다. 사용자 자신의 시스템 오디오를 로컬에서 캡처하므로 Zoom, Teams, Meet에 제3의 참가자가 나타나지 않고, 권한 요청 창도 뜨지 않으며, 플랫폼 연동도 필요 없습니다.

### 지연 시간은 어느 정도인가요?

음성 감지와 AI 처리를 거친 뒤 원본 발화보다 대략 몇 초 늦습니다 — 전문 인간 동시통역사와 비슷하거나 더 빠른 수준입니다.

### 번역 품질이 발화 길이에 따라 달라지나요?

네 — 발화가 길수록 번역 품질이 좋아집니다. 아주 짧은 조각은 단어 단위의 부정확한 번역을 피하기 위해 묶거나 지연 처리합니다.

### 내 말을 번역하는 AI 모델을 직접 선택할 수 있나요?

수동 선택은 필요하지 않으며 제공되지도 않습니다. VoxisLive는 선택한 언어에 가장 적합한 엔진으로 각 세션을 자동으로 연결합니다 — 현재는 위에서 설명한 Google Gemini Live와 Alibaba Qwen Realtime를 함께 사용합니다 — 그리고 세션 도중 하나를 사용할 수 없게 되면 자동으로 예비 엔진으로 전환합니다. 인터페이스에는 특정 세션을 어떤 엔진이 처리했는지 표시되지 않습니다.

## 이어서 읽기

[시스템 오디오 번역 · VoxisLive는 Windows 오디오 믹스 전체를 캡처해 실시간 번역을 소리 내어 말합니다 — 브라우저, 플레이어, 게임, 통화까지. 드라이버 불필요 WASAPI 루프백, 79개 언어.](https://voxislive.com/ko/translate-system-audio-windows) · [기능 · VoxisLive의 모든 기능을 자세히 알아보세요: 드라이버 없는 WASAPI 캡처, 79개 언어, 양방향 회의 모드, 실시간 이중 언어 자막, 화면 자막 등.](https://voxislive.com/ko/features) · [사용 사례 · 모든 소스에 적용되는 단 하나의 드라이버 없는 파이프라인: 게임 오디오, Zoom/Teams/Meet 통화, Netflix와 YouTube 영상, 실시간 스트림과 팟캐스트를 Windows에서 실시간으로…](https://voxislive.com/ko/use-cases)

15분 무료 체험 · 이후 매일 10분 무료

## 모든 언어를, 실시간으로 들어보세요.

Windows 10과 11에서 작동합니다 — 드라이버도, 번거로운 설정도, 통화 속 봇도 없습니다.

[Microsoft Store에서 받기](https://apps.microsoft.com/store/detail/9P5Z0KVS58RS?cid=DevShareMCLPCB)
[GitHub에서 보기](https://github.com/VoxisLive/voxislive)


## Structured data (JSON-LD)

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "BreadcrumbList",
      "itemListElement": [
        {
          "@type": "ListItem",
          "position": 1,
          "name": "홈",
          "item": "https://voxislive.com/ko/"
        },
        {
          "@type": "ListItem",
          "position": 2,
          "name": "작동 방식",
          "item": "https://voxislive.com/ko/how-it-works"
        }
      ]
    },
    {
      "@type": "WebPage",
      "name": "VoxisLive 작동 방식 — 드라이버 없는 음성 번역 (Windows)",
      "url": "https://voxislive.com/ko/how-it-works",
      "description": "전체 파이프라인: WASAPI 루프백 캡처, 기기 내 음성 감지, 네이티브 동시통역 AI 모델, 심리음향 더킹, 몇 초의 지연 시간.",
      "inLanguage": "ko",
      "dateModified": "2026-07-15",
      "isPartOf": {
        "@type": "WebSite",
        "name": "VoxisLive",
        "url": "https://voxislive.com/"
      }
    },
    {
      "@type": "VideoObject",
      "name": "Windows 시스템 오디오를 실시간으로 번역 — 자막이 아닌 음성으로",
      "description": "VoxisLive는 Windows PC에서 재생되는 모든 오디오를 실시간으로 번역하고, 79개 언어 중 어떤 언어로도 번역된 음성을 소리 내어 들려줍니다. 대상 언어는 실시간으로 전환할 수 있으며, 가상 오디오 케이블은 필요하지 않습니다.",
      "thumbnailUrl": "https://voxislive.com/assets/video-thumb-1280x720.jpg",
      "uploadDate": "2026-07-15",
      "duration": "PT5M0S",
      "contentUrl": "https://www.youtube.com/watch?v=F-wItuPKNYI",
      "embedUrl": "https://www.youtube.com/embed/F-wItuPKNYI",
      "publisher": {
        "@type": "Organization",
        "name": "VoxisLive",
        "url": "https://voxislive.com/"
      }
    },
    {
      "@type": "FAQPage",
      "mainEntity": [
        {
          "@type": "Question",
          "name": "VB-CABLE이나 가상 오디오 드라이버가 필요한가요?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "아니요 — PC 오디오를 캡처하는 데는 필요하지 않습니다. VoxisLive는 Windows 10과 11에서 사용할 수 있는 네이티브 Windows API인 WASAPI 루프백을 사용하므로, 설치하거나 라우팅할 것이 없고 오디오 설정에 새 장치도 나타나지 않습니다. 가상 마이크는 번역된 음성을 양방향 회의로 다시 보낼 때만 필요한 선택 사항이며, 없어도 회의 모드는 듣기 전용으로 동작합니다."
          }
        },
        {
          "@type": "Question",
          "name": "VoxisLive가 봇으로 회의에 참가하나요?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "아니요, 절대 그렇지 않습니다. 사용자 자신의 시스템 오디오를 로컬에서 캡처하므로 Zoom, Teams, Meet에 제3의 참가자가 나타나지 않고, 권한 요청 창도 뜨지 않으며, 플랫폼 연동도 필요 없습니다."
          }
        },
        {
          "@type": "Question",
          "name": "지연 시간은 어느 정도인가요?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "음성 감지와 AI 처리를 거친 뒤 원본 발화보다 대략 몇 초 늦습니다 — 전문 인간 동시통역사와 비슷하거나 더 빠른 수준입니다."
          }
        },
        {
          "@type": "Question",
          "name": "번역 품질이 발화 길이에 따라 달라지나요?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "네 — 발화가 길수록 번역 품질이 좋아집니다. 아주 짧은 조각은 단어 단위의 부정확한 번역을 피하기 위해 묶거나 지연 처리합니다."
          }
        },
        {
          "@type": "Question",
          "name": "내 말을 번역하는 AI 모델을 직접 선택할 수 있나요?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "수동 선택은 필요하지 않으며 제공되지도 않습니다. VoxisLive는 선택한 언어에 가장 적합한 엔진으로 각 세션을 자동으로 연결하며, 세션 도중 하나를 사용할 수 없게 되면 자동으로 예비 엔진으로 전환합니다. 인터페이스에는 특정 세션을 어떤 엔진이 처리했는지 표시되지 않습니다."
          }
        }
      ]
    }
  ]
}
```
