ステップ1 — ドライバー不要の音声キャプチャ
VoxisLive は WASAPI ループバックを使います。画面録画ソフトが「再生中の音」を取り込むのに使うのと同じ、Windows の低レベルなオーディオセッション API です。Windows 標準の機能なので、仮想オーディオケーブルもドライバーのインストールも、オーディオ経路の変更も必要ありません。キャプチャは再生に対する遅延がなく、耳につくノイズも加えません。
他のツールの多くは VB-CABLE のような仮想デバイス経由で音声を流します。そのためドライバーのインストール(管理者権限や再起動が必要なことも多い)が要り、排他モードのオーディオ、ASIO ドライバー、アンチチートと衝突することもあります。VoxisLive は、この種の問題そのものを避けています。
ステップ2 — 端末内での発話検出
アプリは端末内の音声区間検出(VAD)で、発話と無音、環境ノイズ、音楽を分けます。処理はお使いの CPU 上でローカルに行われ、ネットワークを往復しません。人の声と判定された区間だけが翻訳に進むので、遅延が減り、分数の残りも守られます。VAD は VoxisLive 自身が再生する音声も追跡するため、自分の声を再び翻訳してしまうことはありません。
ステップ3 — 1回の処理で行う同時翻訳
発話区間はマルチモーダルなリアルタイムモデルに送られ、認識、翻訳、音声合成が低遅延の1回の処理で行われます。従来のパイプラインの3つの通信(音声認識 → 翻訳 → 音声合成)が1つにまとまります。ブースにいる人間の通訳者のように、話し手がまだ話している間から翻訳を始めます。
ステップ4 — ダッキングしながら音声で再生
翻訳された音声はお使いの出力デバイスから再生され、同時に2つのことが起きます。聴覚心理に基づくダッキングが、翻訳が話している間は元の音声を小さくし(プロの同時通訳と同じ考え方です)、遅延の同期が各翻訳をその発話区間に合わせ続けるので、長いセッションでもずれません。
アーキテクチャと標準のドキュメント
VoxisLive のエンジンは、オープンな標準とエンタープライズ向け AI の仕様に基づいて作られています。元になるドキュメントはこちらです。
- WASAPI ループバックキャプチャ: ドライバー不要のシステム音声キャプチャに、Microsoft Core Audio API(WASAPI)を使用しています。
- Google Gemini Live API: リアルタイムの WebSocket 翻訳は、Google AI Studio の Gemini Live API で動いています。
- Alibaba Qwen Realtime API: リアルタイムのストリーミング翻訳は、Alibaba Cloud DashScope の Qwen Realtime API で動いています。
- 端末内の VAD と話者交代の検出: 発話検出と話者交代のラベル付けは、sherpa-onnx の C++ CPU モデルでローカルに実行されます。ラベルは声が切り替わったことを示すだけで、誰が話しているかを特定するものではなく、名前を付けることもできません。
