Skip to main content
开始翻译

开始翻译

通过上传视频或音频文件创建新的翻译项目。翻译过程在后台异步运行。使用 状态端点 跟踪进度并检索结果。当您需要翻译版本历史记录或口型同步历史记录时,请使用 获取项目详情

并发限制

每个帐户最多可同时运行 10 个翻译。如果已有 10 个翻译正在进行中,新请求将返回 CONCURRENT_TRANSLATION_LIMIT_REACHED (HTTP 429)。

请求

此端点接受带有文件上传的 multipart/form-data

标头

string
必填
您的 VoiceCheap API 密钥。请从 app.voicecheap.ai/page-api 获取。

正文参数

file
必填
要翻译的视频或音频文件。支持的视频格式: video/mp4, video/quicktime, video/x-matroska, video/webm, video/mpeg支持的音频格式: audio/mpeg, audio/wav, audio/mp4, audio/x-m4a, audio/flac, audio/ogg, audio/aac, audio/webm各套餐最大文件大小: Beginner 5 GB, Starter 10 GB, Creator 20 GB, Pro 30 GB, Scale 40 GB, 以及 Enterprise 60 GB。
string
必填
内容翻译的目标语言。必须为小写。允许的值 (70+ 个): afrikaans, albanian, amharic, arabic, armenian, assamese, azerbaijani, basque, belarusian, bengali, bosnian, bulgarian, catalan, croatian, czech, danish, dutch, english, british english, estonian, finnish, french, french canadian, galician, german, greek, gujarati, hebrew, hindi, hungarian, icelandic, indonesian, irish, italian, japanese, kannada, kazakh, khmer, korean, lao, latvian, lithuanian, macedonian, malay, malayalam, mandarin, marathi, mongolian, nepali, norwegian, persian, polish, portuguese, brazilian portuguese, punjabi, romanian, russian, serbian, slovak, slovenian, spanish, swahili, swedish, tagalog, tamil, telugu, thai, turkish, ukrainian, urdu, vietnamese, welsh, yoruba, zulu
string
使用 ISO 语言代码(例如 en, es, fr, de, ja, zh)表示的内容源语言。
强烈建议:留空以进行自动检测。仅当您 100% 确定语言代码正确且符合有效 ISO 格式时,才提供此参数。错误的语言代码会导致转录失败。我们的自动检测功能支持 80 多种语言,且准确度极高。
默认值: auto-detect
string
项目的自定义名称。有助于在您的仪表板中识别项目。默认值: 如果未提供,将使用项目 ID。
string
一个用于接收此项目 webhook 事件 的 https 端点, 它将覆盖您账户上配置的端点。默认值: 配置后的账户 webhook 端点。
string
auto-detect 或从 132 的整数。已知的说话人数量可以改善说话人日志记录(diarization)。默认值: auto-detect
string
一个包含特定于请求的名称、品牌、首字母缩略词或专业术语的 JSON 字符串数组。这些术语将与保存的账户或团队词汇表合并。
boolean
在翻译前从源转录文本中删除常见的填充词。默认值: true
string
现有的源语言 SRT 转录文件。提供此字段时,必须明确指定 originalLanguage
boolean
是否在输出中保留背景音频。启用后,将保留背景音乐、环境音、笑声、掌声和人群声音,同时仅移除原始人声(音轨分离)。如果您的源文件没有背景音频,请关闭此项。默认值: true
boolean
在翻译后的语音下方保留原始说话人的声音,并调低音量。默认值: false
number
当启用 keepOriginalVoice 时,原始语音的音量范围从 170默认值: 30
string
当启用 keepBackgroundMusic 时的语音隔离模式。控制语音分离的质量和特性。
我们默认的语音处理方式,专为专业音频质量设计:
  • 消除回声和混响
  • 清除技术瑕疵
  • 产生清晰、干脆的语音
推荐用于: 大多数对音频质量要求极高的项目。非常适合教程、教育内容、营销视频以及任何需要最佳语音清晰度的内容。
保留录音环境的自然特征:
  • 保持更接近原始录音的声音
  • 保留环境特征
推荐用于: 环境真实感很重要的内容,例如户外 Vlog、纪录片或声音氛围是体验不可或缺一部分的内容。
由于保留了背景元素,此选项在某些情况下可能会产生伪影或意外效果。
允许的值: studio, realistic默认值: studio
boolean
是否为翻译后的视频生成字幕。启用后,将添加简洁的 Netflix 风格黑白字幕。使用 subtitlesSource 选择原始(源语言)或翻译(目标语言)文本。字幕会自动同步以获得最佳可读性。注意: 硬编码字幕需要 FFmpeg 和 subtitles 滤镜 (libass)。如果不可用,API 将回退到嵌入字幕轨道,而不是使用硬编码样式。默认值: false
string
subtitles 启用时,选择字幕文本来源。允许的值: translated, original默认值: translated注意: 如果选择了 original 但原始转录不可用,字幕将回退到 translated
string
在翻译完成后触发口型同步处理。
  • standard = Lip Sync
  • pro = Lip Sync Pro
  • studio = Lip Sync Studio
高级模式强制执行其正常的套餐、时长和点数要求。默认值: 省略该字段以跳过口型同步。
boolean
为请求的口型同步运行启用活跃发言者检测。默认值: false
boolean
保留旧版口型同步选择器以实现向后兼容。
  • false = 标准口型同步(每 1 分钟视频消耗 4 分钟点数
  • true = Lip Sync Pro(每 1 分钟视频消耗 9 分钟点数
Lip Sync Pro 从 Creator 套餐开始提供。
最大时长: 每个视频 30 分钟。延迟: 口型同步处理通常会增加原始视频时长 2 倍至 4 倍的时间。
API 触发的请求不会发送口型同步完成和失败的电子邮件。请使用 状态端点 来 跟踪进度。
默认值: 未启用(省略该字段以跳过口型同步)表单数据: 将布尔值作为 truefalse 字符串发送(例如,-F "lipsyncPro=false")。
不要将 lipsyncPro 与冲突的 lipSyncMode 结合使用。
string
语音策略:cloningcustom默认值: cloning
string
voiceModecustom 时必填。该语音必须属于有效的项目所有者。任意或无主的语音 ID 将被拒绝。
object
微调语音克隆参数,以实现对生成语音的高级控制。使用表单数据时,请作为 JSON 字符串传递。所有值必须介于 0 和 1 之间(步长为 0.01)。
这些设置仅在 voiceModecloning 时适用。
默认值(平衡):
建议用于避免重现口音:
string
一个应保持原始语言的源时间范围的 JSON 数组。
时间跳过需要视频输入和 keepBackgroundMusic=true。它们不能与 keepOriginalVoice 结合使用,也不能与转录片段重叠。

响应

boolean
必填
成功请求始终为 true
string
必填
描述结果的人类可读消息
string
必填
已创建翻译项目的唯一标识符。使用此 ID 检查状态。
number
必填
粗略的处理时间估算(以分钟为单位)。目前的估算标准是每 1 分钟源媒体处理需要 5 分钟。

示例

来自有效账户或团队的已保存术语表规则和自定义翻译指令将自动应用。

响应示例

错误