跳至内容

AI 配音 API:如何大规模为音频和视频配音

发布时间

收听收听本文

几十年前,视频配音需要预订录音棚、为目标语言雇佣配音演员、反复录制每一句台词,然后等待数周才能拿到成品。

AI 配音 API 将整个流程简化为几次 REST 调用。上传音频或视频,即可获得保留原始时长和情感的新语言配音结果。

本指南将介绍 AI 配音 API 的工作原理,以及专业级配音 API 与拼凑式流程的区别。还会讲解如何集成 ElevenLabs 的全新配音 API,现已支持 Dubbing v2,可适配各种工作流程。

摘要

  • AI 配音 API 可将源音频或视频转换为新语言的配音输出。
  • Dubbing v2 是音频转音频模型,基于原始表演生成配音,情感、语气和表达方式都能完整保留。
  • ElevenLabs 配音 API 支持 90 多种语言,具备同步感知翻译能力。
  • 开发者只需创建配音项目、添加目标语言,通过几次 REST 调用即可下载成品配音。
  • 企业客户可编辑源转录和翻译,只需重新生成修改过的片段。

什么是 AI 配音 API?

AI 配音 API 是一种编程接口,支持输入一种语言的音频或视频,输出目标语言的配音音频。它自动化整个本地化流程:转录源内容、翻译对话、克隆每位说话人的声音、用目标语言生成语音,并对齐原始时长。

虽然开发者可以将 语音转文本、机器翻译和 文本转语音 等服务串联成配音流程,但这种方式难以满足大规模需求。

说话人身份在各环节容易丢失,时长可能偏移,原本富有情感的内容也会变得单调。

专为配音设计的 API 提供了更多功能,解决上述问题。从说话人分离、声音还原到内部同步和语音克隆,高质量 AI 配音 API 能让配音效果更接近原声,而不是简单翻译。

Dubbing v2 API logo on a gray textured background.

AI 配音原理:音频转音频 vs. 串联流程

大多数自动配音系统采用串联流程:先翻译源音频,再翻译转录文本,最后用文本合成新语音。转录之外的内容,如停顿、紧张、讽刺或低语等细节,在合成前就已丢失。

ElevenLabs 的 Dubbing v2 采用了不同的方法。

Dubbing v2 采用音频转音频模型,直接基于原始录音生成配音,而不是仅依赖转录文本。模型“听”到表演本身,因此语气、情感和表达方式都能传递到配音中。

Comparison of audio-to-audio dubbing vs. cascaded dubbing, highlighting benefits of emotional tone, voice cloning, and timing in Dubbing v2, leading to dubs at 80-90% of human quality. AI Dubbing API

我们估算 Dubbing v2 的配音质量可达真人的 80-90%,这意味着 AI 配音已能胜任影视级内容。

Dubbing v2 还具备三项核心能力:

  • 同步感知翻译:模型翻译时会考虑时长,配音音频的起止点与原音自动对齐,无需视频处理或口型同步,音频与原始对话完全一致。
  • 自动 语音克隆每种语言的配音都自动克隆原说话人,无需手动操作。说话人身份、音高和音色在所有支持语言中都能保留,支持多人说话。
  • 地区级准确性:Dubbing v2 能区分地区变体,如拉美西班牙语或西班牙西班牙语,并可通过语言代码(如 pt-BR 表示巴西葡萄牙语)进行控制。

如何选择 AI 配音 API

为开发者流程选择 AI 配音 API 时,有几个核心标准需要关注。

优秀 AI 配音 API 的主要特性包括:

  • 丰富的语言和地区覆盖: 需支持 90 多种语言,并能细致区分地区变体等细节。
  • 表演还原能力: 需确认系统是基于源音频还是转录文本生成。音频转音频架构决定了情感能否保留。
  • 同步质量:配音音频如果与原始时长偏移,会带来大量人工修正工作。同步应默认生效,避免后期处理。
  • 多说话人和背景处理能力: AI 配音 API 应能轻松处理重叠说话人或 音效,同时还要保留背景 音乐 或混音内容。
  • 编辑与再生成: 支持纠正转录、优化翻译,并只需重新生成受影响片段,无需整段重配音。
  • 合规性: 企业级需求需满足 SOC 2、GDPR 和 ISO 27001 等合规要求,内容才能流转。

本指南后续将详细介绍 ElevenLabs 配音 API,涵盖上述全部功能。

Key criteria for choosing an AI dubbing API, highlighting ElevenAPI's features.

如何用 ElevenLabs 配音 API 为音频和视频配音

配音 API 以项目为核心。每个项目包含一个源文件及其转录文本。每添加一种目标语言,就会生成对应的翻译和配音输出。

所有用户都可在 ElevenAPI 平台 使用以下基础创建与获取流程。

The dubbing process on ElevenAPI in four REST calls: create, poll, add languages, download.

1)创建配音项目

可通过文件上传或公开 URL 提交源媒体。认证方式为在 xi-api-key header 中传入 API 密钥。可选传递 reference label 便于项目识别,以及 keyterms 优化转录和翻译中的产品或品牌名称。

通过 URL 创建

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "source_url=https://example.com/promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

通过文件上传创建

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "file=@promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

响应会返回带有 queued 状态的 project_id。若不指定 source_language,模型会在转录时自动检测。

2)轮询项目状态直至就绪

源内容会异步转录,请轮询项目状态,直到变为 ready。

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

项目就绪后,源转录已生成,可添加目标语言。每种语言的进度单独记录,项目状态保持 ready。

3)添加目标语言

每次添加一种目标语言。cloning_strength(0 到 10,默认 7)可调节原声相似度与目标语言自然度的平衡。

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"target_language": "es", "voice_settings": {"cloning_strength": 7}}'

每种语言会经历 queued、processing 到 completed 状态。

如需配音五种语言,对同一项目调用五次即可。源内容只转录一次,所有语言均基于该转录翻译。

4)下载配音结果

当语言状态为 completed 时即可获取。响应中包含带签名的配音音频下载链接。

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

请注意,下载链接有时效,需新链接时重新获取即可。

完成以上四步,即可实现全自动配音流程:创建、轮询、添加语言、下载。

通过 API 编辑和再生成配音

自动配音可满足大多数场景,但高质量本地化通常需要人工校对文本。配音 API 为企业客户提供翻译两端的片段级编辑能力。

源转录是所有语言翻译的唯一依据,且可完全编辑。可修正听错的台词、调整说话人归属或修改任意片段的时长:

curl -X PATCH https://api.elevenlabs.io/v1/dubbing/project/{project_id}/transcript/segment/{segment_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Welcome to our latest product demo."}'

每个目标语言都有独立转录,源片段与翻译一一对应,翻译内容同样可编辑。

也可上传自有转录和翻译,将现有本地化流程与模型配合,模型负责配音。

配音完成后如转录有变,该语言会标记为过期,只需一次调用即可用最新文本再生成。

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id}/transcript/regenerate \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

再生成时,源媒体时长 1 倍内免费,反复优化翻译不会增加配音费用。超出 1 倍配额后,按标准配音费计费。

AI 配音 API 应用场景

当需要大批量本地化音频时,视频配音 API 非常实用。人工配音耗时费力,AI 配音 API 可大幅加快流程。

AI 配音 API 的常见应用包括:

  • 媒体创作平台: 直接将配音集成到创作流程,用户可在应用内自由尝试。
  • 培训与支持内容: 跨国企业可将内容本地化为多种语言,支持所有用户的入职培训视频。
  • 流媒体与媒体内容:本地化流程可自动为长剧集或其他媒体配音,支持多地区上线。
  • 市场营销素材: 多语言视频推广无需为每种语言反复录制配音。
  • 教育科技: 课程平台可为各市场配音讲师视频,同时保留讲师原声。

无论哪种场景,配音 API 都让高质量本地化内容的大规模生产变得简单可行。

Dubbing v2 已上线 ElevenAPI

配音 API 已对自助和企业开发者开放,Dubbing v2 面向所有用户,企业工作区还支持编辑接口。

前往 配音 API 查看全部功能,或 注册并创建 API 密钥,几分钟内即可体验首次配音。

配音 API 常见问题

相关内容

用高质量 AI 音频创作