工作原理

从实时语音 到翻译后的语音

TolkTime 通过服务器端实时翻译链路传输实时语音,并返回带自动字幕的生成语音,覆盖 66 种语言。

Live call screen with controls, participants, captions, multiplier, and balance
In-Person mode live translation screen with turn controls, captions, and translated voice
Listener mode with live translated subtitles and optional translated voice

TolkTime 如何 通过四步工作

选择模式,选择语言,然后听到被翻译成您所理解语言的语音。

TolkTime call setup screen showing mode and language controls

语音到语音 意味着什么

体验从口语音频开始,以口语翻译结束。自动字幕会与翻译语音同时生成,但您无需打字、复制文本或在多个工具之间切换。

传统的文本式流程

许多工具会先把语音转成文本,再翻译文本,最后生成语音。每一个独立步骤都可能增加延迟,使对话不够自然。

语音文本翻译文本生成语音

TolkTime 语音到语音

TolkTime 在一个实时会话中完成聆听、翻译、字幕和语音输出。用户体验保持简单:实时语音输入,翻译语音输出。

实时语音翻译语音

当您说话时 会发生什么

浏览器和服务器会为当前活动会话保持一条实时链路,让音频、字幕和翻译语音持续流动。

您的浏览器捕获语音

当您授予麦克风权限后,浏览器会采集实时音频,并通过加密连接将小块音频发送到 TolkTime。

翻译始终留在服务器端

TolkTime 的服务器负责协调实时翻译服务提供商。提供商凭证绝不会下发到浏览器。

字幕会自动出现

翻译字幕文本会与音频一起返回,并在所说短语被处理时持续更新。

翻译语音会被播放

翻译结果会以所选的生成语音说出。根据模式不同,双方都可能听到、一台设备播放,或在聆听模式中关闭语音播报。

为实时理解 而打造

同一套实时翻译基础能力驱动通话、面对面对话和聆听模式。

支持 66 种语言

三种模式都使用同一套语言列表。可用并不意味着每种口音、方言或语言对都具有相同准确率。

自动翻译字幕

字幕会在实时会话中生成,让您既能听到翻译,也能看到翻译。

语气与情感同样重要

翻译会尽量保留原意、语气、情感、礼貌程度、紧迫感和强度,同时让目标语言听起来自然。

为低延迟而设计

TolkTime 会持续传输音频,并在语音被处理时开始返回结果,而不是等待完整录音结束。连接质量和语句复杂度仍会影响延迟。

您可以 期待什么

实时语音翻译应当尽量接近自然对话,但它是生成式翻译,而不是原说话者的完美复制。

一段生成的翻译语音

TolkTime 不会克隆说话者的真实声音。它会使用所选生成语音,并尽量把原始含义、语气和情感力度带入翻译。

低延迟不等于零延迟

在语音被理解和翻译时,短暂停顿是正常的。网络条件、服务商就绪状态、长句和设备性能都可能影响延迟。

翻译可能并不完美

人名、技术术语、口音、发音不清、背景噪音和多人同时讲话都可能导致错误、遗漏,或让字幕在获得更多上下文后继续更新。

一套翻译系统 三种场景

选择最适合您当前交流需求的互动模式。

聆听

通过实时字幕和可选语音播报来理解您周围的讲话。

探索聆听模式

亲自体验实时语音翻译

选择一种模式和语言对,然后使用免费余额,在浏览器中体验翻译语音和字幕的效果。