仕組み

ライブ音声から 翻訳された声へ

TolkTimeは、ライブ音声をサーバー側のリアルタイム翻訳経路に流し、66言語で自動字幕付きの翻訳音声を返します。

Live call screen with controls, participants, captions, multiplier, and balance
In-Person mode live translation screen with turn controls, captions, and translated voice
Listener mode with live translated subtitles and optional translated voice

4つのステップで見る 仕組み

モードを選び、言語を選び、理解できる言語で翻訳された音声を聞きます。

TolkTime call setup screen showing mode and language controls

音声対音声とは どういう意味か

この体験は話し声の音声から始まり、翻訳された話し声として返ってきます。自動字幕は翻訳音声と一緒に生成されますが、テキストを入力したり、コピーしたり、ツールを行き来したりする必要はありません。

従来のテキスト中心の流れ

多くのツールは、まず音声をテキストにし、そのテキストを翻訳し、最後に音声を生成します。各ステップが分かれていることで遅延が増え、会話が不自然になることがあります。

音声テキスト翻訳テキスト生成音声

TolkTimeの音声対音声

TolkTimeは、聞き取り、翻訳、字幕生成、音声出力を1つのライブセッションの中で処理します。ユーザー体験はシンプルで、ライブ音声が入り、翻訳音声が返るだけです。

ライブ音声翻訳音声と字幕

話すときに 何が起きるか

ブラウザとサーバーは、アクティブなセッション中、ライブ経路を開いたままにし、音声、字幕、翻訳音声が継続的に流れるようにします。

ブラウザが音声を取り込む

マイク許可が与えられると、ブラウザはライブ音声を取り込み、安全な接続で小さな音声片をTolkTimeに送ります。

翻訳はサーバー側で行われる

TolkTimeのサーバーがリアルタイム翻訳プロバイダーを管理します。プロバイダーの認証情報がブラウザに届くことはありません。

字幕は自動で表示される

翻訳字幕のテキストは音声と一緒に返され、発話が続いている間も更新されます。

翻訳音声が再生される

翻訳結果は選択した合成音声で再生されます。モードによって、双方が聞く場合も、1台のデバイスだけで聞く場合も、リスナーモードでオフにする場合もあります.

ライブ理解のために 作られています

同じリアルタイム翻訳基盤が、通話、対面、リスナーの各モードを支えています。

66言語に対応

3つのモードすべてで同じ言語一覧から選べます。ただし、すべてのアクセント、方言、言語ペアが同じ精度になるとは限りません。

自動翻訳字幕

ライブセッション中に字幕が生成されるため、翻訳を読みながら聞くことができます。

トーンや感情も重視

翻訳は、意味、トーン、感情、丁寧さ、緊急性、強さを保つように導かれ、対象言語でも自然に聞こえることを目指します。

低遅延を意識した設計

TolkTimeは音声全体の終了を待たず、話し声の処理中から結果の返却を始めます。ただし、接続品質や文の複雑さは遅延に影響します。

期待できること 知っておくこと

リアルタイム音声翻訳は会話のように感じられるはずですが、それでも生成された翻訳であり、元の話者の完全なコピーではありません。

生成された翻訳音声

TolkTimeは元の話者の声を正確にコピーするわけではありません。選ばれた合成音声を使い、意味、トーン、感情的なニュアンスを翻訳結果に反映しようとします。

低遅延でも無遅延ではない

システムが話し声を理解し翻訳している間の短い間は自然なものです。ネットワーク状況、サービスの準備状態、長い文、デバイス性能が遅延に影響します。

翻訳は完璧ではないことがあります

名前、技術用語、アクセント、不明瞭な話し方、周囲の雑音、複数人の同時発話は、誤りや抜け、字幕更新の遅れを生むことがあります。

1つの翻訳システムで 3つの場面に対応

理解したい会話に合わせて、適切なやり取りの形を選んでください。

ライブ音声翻訳を自分で試す

モードと言語ペアを選び、無料残高を使ってブラウザで翻訳音声と字幕の動きを体験してください。