仕組み

スピーカーから、数秒で自分の言語へ。

VoxisLive は WASAPI ループバックでシステム音声を直接取り込み、端末内で発話を検出し、リアルタイム AI モデルで翻訳して、その結果を音声で再生します。その間、元の音声は自動的に小さくなります。

ステップ1 — ドライバー不要の音声キャプチャ

VoxisLive は WASAPI ループバックを使います。画面録画ソフトが「再生中の音」を取り込むのに使うのと同じ、Windows の低レベルなオーディオセッション API です。Windows 標準の機能なので、仮想オーディオケーブルもドライバーのインストールも、オーディオ経路の変更も必要ありません。キャプチャは再生に対する遅延がなく、耳につくノイズも加えません。

他のツールの多くは VB-CABLE のような仮想デバイス経由で音声を流します。そのためドライバーのインストール(管理者権限や再起動が必要なことも多い)が要り、排他モードのオーディオ、ASIO ドライバー、アンチチートと衝突することもあります。VoxisLive は、この種の問題そのものを避けています。

ステップ2 — 端末内での発話検出

アプリは端末内の音声区間検出(VAD)で、発話と無音、環境ノイズ、音楽を分けます。処理はお使いの CPU 上でローカルに行われ、ネットワークを往復しません。人の声と判定された区間だけが翻訳に進むので、遅延が減り、分数の残りも守られます。VAD は VoxisLive 自身が再生する音声も追跡するため、自分の声を再び翻訳してしまうことはありません。

ステップ3 — 1回の処理で行う同時翻訳

発話区間はマルチモーダルなリアルタイムモデルに送られ、認識、翻訳、音声合成が低遅延の1回の処理で行われます。従来のパイプラインの3つの通信(音声認識 → 翻訳 → 音声合成)が1つにまとまります。ブースにいる人間の通訳者のように、話し手がまだ話している間から翻訳を始めます。

ステップ4 — ダッキングしながら音声で再生

翻訳された音声はお使いの出力デバイスから再生され、同時に2つのことが起きます。聴覚心理に基づくダッキングが、翻訳が話している間は元の音声を小さくし(プロの同時通訳と同じ考え方です)、遅延の同期が各翻訳をその発話区間に合わせ続けるので、長いセッションでもずれません。

技術リファレンスと出典

アーキテクチャと標準のドキュメント

VoxisLive のエンジンは、オープンな標準とエンタープライズ向け AI の仕様に基づいて作られています。元になるドキュメントはこちらです。

  • WASAPI ループバックキャプチャ: ドライバー不要のシステム音声キャプチャに、Microsoft Core Audio API(WASAPI)を使用しています。
  • Google Gemini Live API: リアルタイムの WebSocket 翻訳は、Google AI Studio の Gemini Live API で動いています。
  • Alibaba Qwen Realtime API: リアルタイムのストリーミング翻訳は、Alibaba Cloud DashScope の Qwen Realtime API で動いています。
  • 端末内の VAD と話者交代の検出: 発話検出と話者交代のラベル付けは、sherpa-onnx の C++ CPU モデルでローカルに実行されます。ラベルは声が切り替わったことを示すだけで、誰が話しているかを特定するものではなく、名前を付けることもできません。
VoxisLive のメインウィンドウ。動画を翻訳し、二言語のライブ文字起こしを表示している様子

概要動画を見る — Voxis ができることを8分足らずで

この7:48の概要動画では、Microsoft Store で現在配布されているアプリ全体を紹介します。Voxis が解決する課題、ドライバー不要のキャプチャと同時通訳がどう連携するか、動画・ゲームモード、双方向のミーティングモード、音声と字幕のオプション、履歴と文字起こしのエクスポート、バージョン1.0.93の新機能、無料プランと買い切りの分数パックの仕組みまでを扱います。字幕は23言語で利用できます。

実際のところ、どれくらい速いのですか?

VoxisLive はほぼ同時であって、遅延ゼロではありません。発話の長さやネットワークの遅延によって、元の発話から通常は数秒遅れます。ごく短い断片は、単語単位の粗い翻訳を避けるためにまとめて処理されます。

ボットなしのミーティング

VoxisLive が参加者として通話に入ることはなく、ホスト権限を求めることも、会議アプリに触れることもありません。すでにスピーカーで再生されている音声を読み取るだけなので、他の参加者からは見えず、Zoom、Teams、Google Meet、Webex、Discord のどれでも同じように動作します。双方向モードでは、仮想マイクを通じて自分の発話も会議の言語に翻訳します。

お使いのパソコンから外に出るもの

Store 版アプリでは、音声はモデルへ中継され、セッション終了後に音声が保存されることはありません。端末内の VAD が発話と無音、環境ノイズ、音楽を分けます。有料プランではセッション中ずっと音声が連続して送られ、無料プランでは検出された発話だけが送られます。

はじめに

2つのモード、1分以内で設定完了

動画・ゲームモード — パソコンで流れているものをすべて翻訳

映画、配信、YouTube の動画、セリフのあるゲームに使います。

  1. VoxisLive を開き、左のパネルで動画・ゲームを選びます。
  2. 自分が聞く言語の欄で、聞きたい言語を選びます。話されている言語を設定する必要はありません。自動で判定されます。
  3. 開始を押します。ほかに設定するものはありません。スピーカーからすでに流れている音声を VoxisLive が聞き取り、数秒ほどで翻訳の音声を再生し始めます。

インストールするものも、選ぶ別のオーディオデバイスもありません。VoxisLive はパソコンのシステム音声を直接取り込みます(上の「ドライバー不要の音声キャプチャ」を参照)。

ミーティングモード — Teams、Zoom、Google Meet で伝わり、理解される

ミーティングモードは双方向です。相手の発話はあなたの言語に翻訳されて聞こえ、あなたの声も相手に翻訳して届けたい場合は、相手の言語に翻訳されます。

2つの選択欄はどちらも翻訳先の言語で、話されている言語ではありません。「自分が聞く言語」はあなたの耳に届く言語、「相手が聞く言語」は相手の耳に届く言語を決めます。話されている言語は、双方向とも1文ごとに自動で判定されます。そのため、どの言語に切り替えても、あなたが選んだ言語で相手に届きます。相手が複数の言語を使う場合や、同じ通話で3つの言語が飛び交う場合でも、あなたには自分の言語だけが聞こえます。

  1. VoxisLive を開き、左のパネルでミーティングを選びます。自分が聞く言語(聞きたい言語)と相手が聞く言語(相手に聞かせたい言語)を設定します。どちらも、話されている言語を尋ねるものではありません。話されている言語は自動で判定されます。
  2. 開始を押します。相手の参加者の発話が、すぐに翻訳されて聞こえます。
  3. こちらの声も伝えるには、VoxisLive ではなく会議アプリ側でもう1つ設定が必要です。Teams(または Zoom、Meet)のオーディオ設定を開き、マイクをパソコンにインストール済みの仮想ケーブル(「CABLE Output」などの名前)に設定してください。VoxisLive が仮想ケーブルをインストールすることはなく、すでにあるものを使います。VoxisLive は Windows の既定のマイクを自動で切り替えますが、会議アプリによっては以前に選んだマイクを覚えていて、変更を自動では反映しないものがあります。通話の開始時に一度確認しておいてください。

この最後の手順を省くと、相手の発話は翻訳されて聞こえますが、相手にはあなたの元の声がそのまま届きます。仮想ケーブル自体は Windows では必須です。インストールされていないとミーティングモードは開始せず、セッションを始める前にアプリがそのことをお知らせします。VB-CABLE などの無料のものをインストールして、VoxisLive を再起動してください。Linux ではアプリが独自の仮想マイクを作成します。相手の言葉を理解するだけでよいなら、動画・ゲームモードで追加の設定なしに使えます。

WhatsApp 通話をお使いですか?両方の手順をクリックごとのスクリーンショットで示したWhatsApp 通話のセットアップガイド(図解)をご覧ください。

よくある質問

よくある質問

01VB-CABLE や仮想オーディオドライバーは必要ですか?
いいえ。パソコンの音声を取り込むためには必要ありません。VoxisLive は Windows 10・11 で使える標準 API の WASAPI ループバックを使うので、インストールするものも、経路を設定するものもなく、オーディオ設定に新しいデバイスが増えることもありません。双方向のミーティングモードは例外です。Windows では翻訳した声を VB-CABLE などの仮想オーディオケーブル経由で送り、それがないと開始しません。Linux ではアプリが独自の仮想マイクを作成します。
02VoxisLive はボットとして会議に参加しますか?
いいえ、参加しません。お使いのシステム音声をローカルで取り込むだけなので、Zoom、Teams、Meet に3人目の参加者は現れず、許可の確認も表示されず、プラットフォームとの連携も不要です。
03どれくらいの遅延がありますか?
発話検出と AI 処理を経て、元の発話から数秒遅れます。
04発話の長さで翻訳の質は変わりますか?
はい。発話が長いほど、翻訳の質は上がります。ごく短い断片は、単語単位の粗い翻訳を避けるために、まとめて処理するか後回しにします。
05発話を翻訳する AI モデルを選べますか?
手動での選択は必要なく、用意もされていません。VoxisLive は、選んだ言語に最も適したエンジンへ各セッションを自動で振り分けます。現在は、上で説明した Google の Gemini Live と Alibaba の Qwen Realtime を組み合わせて使っています。セッション中にどちらかが使えなくなった場合は、自動的にバックアップのエンジンに切り替わります。どのエンジンがそのセッションを処理したかは、画面には表示されません。
06多言語が飛び交う会議でも、相手がどの言語で話しても使えますか?
はい。ミーティングモードの2つの選択欄はどちらも翻訳先の言語で、元の言語ではありません。一方は自分が聞く言語、もう一方は相手が聞く言語を決めます。話されている言語は、双方向とも1文ごとに自動で判定されるので、選ぶ必要はありません。そのため、どの言語に切り替えても、あなたが選んだ言語で相手に届きます。相手が複数の言語を混ぜて話す場合や、同じ通話で3つの言語が使われる場合でも、あなたには自分で選んだ1つの言語だけが聞こえます。
無料で始められます · 毎日10分無料

あらゆる言語を、リアルタイムで耳で聞く。

Windows 10・11 と Linux で動作。ドライバー不要のキャプチャ、面倒な設定なし、通話にボットは入りません。