千谲

Capability

AI 视频翻译

一条中文视频,出 15 种语言版本

AI 视频翻译是把已有视频转成其它语种版本的能力,支持 15 种目标语言与三种翻译方式:只翻字幕、用原说话人音色配音、以及让口型跟翻译后语音同步。

翻译目标语言
15 种

中文、英语、日语、韩语、德语、法语、俄语、西班牙语、葡萄牙语、意大利语、印尼语、越南语、泰语、阿拉伯语、土耳其语。

单个视频时长上限
60 分钟

平台视频上传校验的时长上限,支持 MP4 与 MOV。

立即使用AI 视频翻译

三种翻译方式该选哪一种?

字幕翻译只处理文字层,画面与原声都不动,成本最低、出错风险最小,适合本身就靠画面表达的商品展示类视频。语音翻译会用原说话人的音色把译文念出来,观感上像本人在说外语,适合有讲解、需要建立信任感的口播内容。面容翻译在语音翻译之上再让口型对上,目前是 beta 状态。

选择逻辑不复杂:画面能自解释的选字幕翻译,需要人格化表达的选语音翻译。面容翻译观感最好但也最容易露馅,建议先小批量验证效果,不要一上来就整批投放。

  • 字幕翻译:只翻文字层,画面与原声不变
  • 语音翻译:保留原说话人音色,用目标语言播报
  • 面容翻译(beta):口型与翻译后语音同步

支持哪些语言?够跨境用吗?

目标语言覆盖 15 种:中文、英语、日语、韩语、德语、法语、俄语、西班牙语、葡萄牙语、意大利语、印尼语、越南语、泰语、阿拉伯语、土耳其语。东南亚、欧洲主流市场与中东的主要语种都在里面。

对跨境卖家来说,这个覆盖面的意义在于同一条素材可以摊到多个站点:拍一次、翻多语、各站点分别投放,边际成本只剩翻译本身。相比之下,为每个市场单独找本地达人拍摄的成本是线性叠加的。

字幕从哪里来?画面上原来的字怎么办?

字幕来源有两种:OCR 识别画面上已有的硬字幕,或者 ASR 识别语音后转写。原视频有烧录字幕的走 OCR,只有口播没有字幕的走 ASR。译出的字幕字号可选 18 / 24 / 30 / 36,按投放渠道的观看尺寸调。

需要注意的是,原视频画面上的中文硬字幕不会自己消失——翻译只是叠加新字幕。要得到干净的多语版本,正确顺序是先用字幕擦除去掉原字幕,再做翻译,否则画面上会同时出现两种语言的字。

如果手上根本没有原始口播视频,也可以反过来走:先用数字人口播直接生成目标语言的讲解视频,省掉翻译环节。

使用步骤

  1. 1

    上传源视频

    支持 MP4 与 MOV,单个视频最长 60 分钟。有硬字幕的建议先做字幕擦除。

  2. 2

    选择语言与方式

    选源语言、目标语言与翻译方式(字幕 / 语音 / 面容),并按投放渠道设定字幕字号。

  3. 3

    选择字幕来源

    原视频有硬字幕选 OCR,只有口播语音选 ASR。

  4. 4

    生成后核对

    重点核对商品名称、规格与合规用语的译法,专有名词的机器翻译需要人工确认。

常见问题

支持多少种语言?
目标语言 15 种:中文、英语、日语、韩语、德语、法语、俄语、西班牙语、葡萄牙语、意大利语、印尼语、越南语、泰语、阿拉伯语、土耳其语。
翻译后还是原来那个人的声音吗?
选语音翻译时会保留原说话人的音色,用目标语言播报。选字幕翻译则不改动音轨。
视频有时长限制吗?
单个视频最长 60 分钟,支持 MP4 与 MOV 格式。
画面上原来的中文字幕会被翻译掉吗?
不会。翻译是叠加新字幕,原有硬字幕仍在画面上。需要干净的多语版本时,先用字幕擦除处理再翻译。

术语

OCR
光学字符识别,从视频画面中读取已经烧录进去的字幕文字。
ASR
自动语音识别,把视频里的说话内容转写成文字,用于原视频没有字幕的情况。
硬字幕
已经烧录进视频画面、无法单独关闭的字幕。与之相对的是可开关的软字幕轨道。

相关能力