従来のテキスト中心の流れ
多くのツールは、まず音声をテキストにし、そのテキストを翻訳し、最後に音声を生成します。各ステップが分かれていることで遅延が増え、会話が不自然になることがあります。
仕組み
TolkTimeは、ライブ音声をサーバー側のリアルタイム翻訳経路に流し、66言語で自動字幕付きの翻訳音声を返します。



モードを選び、言語を選び、理解できる言語で翻訳された音声を聞きます。

この体験は話し声の音声から始まり、翻訳された話し声として返ってきます。自動字幕は翻訳音声と一緒に生成されますが、テキストを入力したり、コピーしたり、ツールを行き来したりする必要はありません。
多くのツールは、まず音声をテキストにし、そのテキストを翻訳し、最後に音声を生成します。各ステップが分かれていることで遅延が増え、会話が不自然になることがあります。
TolkTimeは、聞き取り、翻訳、字幕生成、音声出力を1つのライブセッションの中で処理します。ユーザー体験はシンプルで、ライブ音声が入り、翻訳音声が返るだけです。
ブラウザとサーバーは、アクティブなセッション中、ライブ経路を開いたままにし、音声、字幕、翻訳音声が継続的に流れるようにします。
マイク許可が与えられると、ブラウザはライブ音声を取り込み、安全な接続で小さな音声片をTolkTimeに送ります。
TolkTimeのサーバーがリアルタイム翻訳プロバイダーを管理します。プロバイダーの認証情報がブラウザに届くことはありません。
翻訳字幕のテキストは音声と一緒に返され、発話が続いている間も更新されます。
翻訳結果は選択した合成音声で再生されます。モードによって、双方が聞く場合も、1台のデバイスだけで聞く場合も、リスナーモードでオフにする場合もあります.
同じリアルタイム翻訳基盤が、通話、対面、リスナーの各モードを支えています。
3つのモードすべてで同じ言語一覧から選べます。ただし、すべてのアクセント、方言、言語ペアが同じ精度になるとは限りません。
ライブセッション中に字幕が生成されるため、翻訳を読みながら聞くことができます。
翻訳は、意味、トーン、感情、丁寧さ、緊急性、強さを保つように導かれ、対象言語でも自然に聞こえることを目指します。
TolkTimeは音声全体の終了を待たず、話し声の処理中から結果の返却を始めます。ただし、接続品質や文の複雑さは遅延に影響します。
リアルタイム音声翻訳は会話のように感じられるはずですが、それでも生成された翻訳であり、元の話者の完全なコピーではありません。
TolkTimeは元の話者の声を正確にコピーするわけではありません。選ばれた合成音声を使い、意味、トーン、感情的なニュアンスを翻訳結果に反映しようとします。
システムが話し声を理解し翻訳している間の短い間は自然なものです。ネットワーク状況、サービスの準備状態、長い文、デバイス性能が遅延に影響します。
名前、技術用語、アクセント、不明瞭な話し方、周囲の雑音、複数人の同時発話は、誤りや抜け、字幕更新の遅れを生むことがあります。
理解したい会話に合わせて、適切なやり取りの形を選んでください。
ブラウザ内で翻訳付きの通話を主催できます。ゲストはリンクで参加します。
多言語通話について詳しく見る1台のデバイスで対面の会話ができます。交互に話してください。
対面モードを見る周囲の音声をライブ字幕と、必要なら翻訳音声で理解できます。
リスナーモードを見るモードと言語ペアを選び、無料残高を使ってブラウザで翻訳音声と字幕の動きを体験してください。