千问3-LiveTranslate-Flash 是音视频翻译模型,支持 18 种语言(包括中文、英文、俄文、法文等)互译,可结合视觉上下文提升翻译准确性,并输出文本与语音。
工作方式
-
设置语种:参考支持的语种,在
translation_options参数中设置源语种 (source_lang) 和目标语种 (target_lang)。省略
source_lang将启用自动检测,但指定语种能提升翻译准确率。 -
输入待翻译文件:
messages数组中有且仅有一条role为user的消息,content字段需传入待翻译音频/视频的 URL 或 Base64 数据。 -
控制输出模态:通过
modalities参数控制输出模态:-
["text"]:仅输出文本; -
["text","audio"]:输出文本和 Base64 编码的音频。若输出音频,需在
audio参数中设置音色(voice)。参考支持的音色。
-
- 单轮翻译:模型专为翻译任务设计,不支持多轮对话。
- 无 System Message:不支持通过
system角色设定全局行为。 - 调用方式:仅支持兼容 OpenAI 协议的流式输出。
chunk为流式响应对象:
- 文本:读取
chunk.choices[0].delta.content。 - 音频:读取
chunk.choices[0].delta.audio["data"],模型输出音频的采样率是 24kHz。
支持的模型
| 模型名称 | 版本 | 上下文长度 | 最大输入 | 最大输出 |
|---|---|---|---|---|
| (Token数) | ||||
qwen3-livetranslate-flash当前能力等同于qwen3-livetranslate-flash-2025-12-01 | 稳定版 | 53,248 | 49,152 | 4,096 |
| qwen3-livetranslate-flash-2025-12-01 | 快照版 | |||
如何使用
qwen3-livetranslate-flash 模型支持音频或视频输入,并输出文本与音频。
请确保已获取与配置 API Key并配置API Key到环境变量。若通过OpenAI SDK调用,需安装SDK。
以下示例使用音频输入。如需输入视频,请取消对应代码的注释。
解析 Base64 音频数据
模型以流式 Base64 编码格式输出音频。可采用以下两种方式处理数据:
- 拼接解码:拼接所有返回的 Base64 片段,待生成结束后统一解码,保存为音频文件。
- 实时播放:实时解码每个 Base64 片段并直接播放。
计费说明
- 音频
- 视频
输入或输出每秒音频均消耗 12.5 Token。
API 参考
qwen3-livetranslate-flash 模型的输入输出参数请参见音视频翻译-通义千问。
支持的语种
下表中的语种代码可用于指定源语种与目标语种。
部分目标语种仅支持输出文本,不支持输出音频。
语种代码 | 语种 | 支持的输出模态 |
|---|---|---|
en | 英语 | 音频、文本 |
zh | 中文 | 音频、文本 |
ru | 俄语 | 音频、文本 |
fr | 法语 | 音频、文本 |
de | 德语 | 音频、文本 |
pt | 葡萄牙语 | 音频、文本 |
es | 西班牙语 | 音频、文本 |
it | 意大利语 | 音频、文本 |
id | 印尼语 | 文本 |
ko | 韩语 | 音频、文本 |
ja | 日语 | 音频、文本 |
vi | 越南语 | 文本 |
th | 泰语 | 文本 |
ar | 阿拉伯语 | 文本 |
yue | 粤语 | 音频、文本 |
hi | 印地语 | 文本 |
el | 希腊语 | 文本 |
tr | 土耳其语 | 文本 |
支持的音色
| 音色名 | voice参数 | 音色效果 | 描述 | 支持的语种 |
|---|---|---|---|---|
| 芊悦 | Cherry | 阳光积极、亲切自然小姐姐。 | 中文、英语、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语 | |
| 不吃鱼 | Nofish | 不会翘舌音的设计师。 | 中文、英语、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语 | |
| 上海-阿珍 | Jada | 风风火火的沪上阿姐。 | 中文 | |
| 北京-晓东 | Dylan | 北京胡同里长大的少年。 | 中文 | |
| 四川-晴儿 | Sunny | 甜到你心里的川妹子。 | 中文 | |
| 天津-李彼得 | Peter | 天津相声,专业捧人。 | 中文 | |
| 粤语-阿清 | Kiki | 甜美的港妹闺蜜。 | 粤语 | |
| 四川-程川 | Eric | 一个跳脱市井的四川成都男子。 | 中文 |
常见问题
Q:传入视频文件时,翻译的是什么内容?
A:翻译视频中的音频内容,视觉信息用于辅助上下文理解,以提升准确率。
示例:
当音频内容为This is a mask时:
- 若画面显示口罩,会翻译为“这是一个口罩”;
- 若画面显示面具,会翻译为“这是一个面具”。