传统的文本式流程
许多工具会先把语音转成文本,再翻译文本,最后生成语音。每一个独立步骤都可能增加延迟,使对话不够自然。
工作原理
TolkTime 通过服务器端实时翻译链路传输实时语音,并返回带自动字幕的生成语音,覆盖 66 种语言。



选择模式,选择语言,然后听到被翻译成您所理解语言的语音。

体验从口语音频开始,以口语翻译结束。自动字幕会与翻译语音同时生成,但您无需打字、复制文本或在多个工具之间切换。
许多工具会先把语音转成文本,再翻译文本,最后生成语音。每一个独立步骤都可能增加延迟,使对话不够自然。
TolkTime 在一个实时会话中完成聆听、翻译、字幕和语音输出。用户体验保持简单:实时语音输入,翻译语音输出。
浏览器和服务器会为当前活动会话保持一条实时链路,让音频、字幕和翻译语音持续流动。
当您授予麦克风权限后,浏览器会采集实时音频,并通过加密连接将小块音频发送到 TolkTime。
TolkTime 的服务器负责协调实时翻译服务提供商。提供商凭证绝不会下发到浏览器。
翻译字幕文本会与音频一起返回,并在所说短语被处理时持续更新。
翻译结果会以所选的生成语音说出。根据模式不同,双方都可能听到、一台设备播放,或在聆听模式中关闭语音播报。
同一套实时翻译基础能力驱动通话、面对面对话和聆听模式。
三种模式都使用同一套语言列表。可用并不意味着每种口音、方言或语言对都具有相同准确率。
字幕会在实时会话中生成,让您既能听到翻译,也能看到翻译。
翻译会尽量保留原意、语气、情感、礼貌程度、紧迫感和强度,同时让目标语言听起来自然。
TolkTime 会持续传输音频,并在语音被处理时开始返回结果,而不是等待完整录音结束。连接质量和语句复杂度仍会影响延迟。
实时语音翻译应当尽量接近自然对话,但它是生成式翻译,而不是原说话者的完美复制。
TolkTime 不会克隆说话者的真实声音。它会使用所选生成语音,并尽量把原始含义、语气和情感力度带入翻译。
在语音被理解和翻译时,短暂停顿是正常的。网络条件、服务商就绪状态、长句和设备性能都可能影响延迟。
人名、技术术语、口音、发音不清、背景噪音和多人同时讲话都可能导致错误、遗漏,或让字幕在获得更多上下文后继续更新。
选择一种模式和语言对,然后使用免费余额,在浏览器中体验翻译语音和字幕的效果。