콘텐츠로 건너뛰기

AI 더빙 API: 오디오와 비디오 대량 더빙 방법

작성자
Jack Limebear
게시일

듣기이 글 오디오로 듣기

몇십 년 전만 해도 비디오를 더빙하려면 스튜디오를 예약하고, 목표 언어의 성우를 섭외해 모든 대사를 녹음(또는 재녹음)한 뒤, 최종 결과물을 받기까지 몇 주를 기다려야 했습니다.

AI 더빙 API는 이 과정을 몇 번의 REST 호출로 단축합니다. 오디오나 비디오를 보내면, 원본의 타이밍과 감정 표현을 그대로 유지한 채 새로운 언어로 더빙된 결과물을 받을 수 있습니다.

이 가이드에서는 AI 더빙 API가 어떻게 작동하는지, 그리고 실제 서비스 수준의 API와 임시로 연결한 파이프라인의 차이점을 설명합니다. 또한 ElevenLabs의 새로운 더빙 API를 어떻게 연동하는지도 살펴봅니다. 이 API는 이제 Dubbing v2라는 최신 더빙 모델을 모든 워크플로우에 제공합니다.

요약

  • AI 더빙 API는 원본 오디오나 비디오를 받아 새로운 언어로 더빙된 결과물을 제공합니다.
  • Dubbing v2는 오디오 투 오디오 모델로, 원본의 감정, 톤, 전달 방식을 그대로 더빙에 반영합니다.
  • ElevenLabs 더빙 API는 90개 이상의 언어를 동기화 번역과 함께 지원합니다.
  • 개발자는 더빙 프로젝트를 생성하고, 목표 언어를 추가한 뒤, 몇 번의 REST 호출만으로 완성된 더빙 파일을 다운로드할 수 있습니다.
  • 엔터프라이즈 고객은 원본 스크립트와 번역을 편집한 후, 변경된 부분만 다시 생성할 수 있습니다.

AI 더빙 API란?

AI 더빙 API는 한 언어의 오디오나 비디오를 받아 목표 언어로 더빙된 오디오를 반환하는 프로그래밍 인터페이스입니다. 원본을 받아서 대사를 전사하고, 번역하고, 각 화자의 목소리를 복제해 목표 언어로 음성을 생성한 뒤, 원본 타이밍에 맞춰 결과물을 자동으로 정렬합니다.

개발자들은 음성 인식(Speech to Text), 기계 번역, 그리고 텍스트 음성 변환(Text to Speech) 서비스를 연결해 임시 더빙 파이프라인을 만들기도 했지만, 대규모 작업에는 신뢰성이 떨어집니다.

단계마다 화자 정보가 손실되고, 타이밍이 어긋나며, 감정이 풍부했던 대본도 단조롭게 변할 수 있습니다.

전용 더빙 API는 이러한 문제를 해결하는 다양한 기능을 포함합니다. 화자 분리, 목소리 보존, 내부 동기화, 음성 복제 등 고품질 AI 더빙 API는 단순 번역이 아닌, 원래 화자의 목소리와 유사한 결과물을 제공합니다.

Dubbing v2 API logo on a gray textured background.

AI 더빙 방식: 오디오 투 오디오 vs. 계단식 파이프라인

대부분의 자동 더빙 시스템은 계단식 파이프라인입니다. 원본 오디오를 번역하고, 스크립트를 번역한 뒤, 그 텍스트로 새로운 음성을 합성합니다. 망설임, 긴장감, 풍자, 속삭임 등 원본 대본 외의 모든 요소는 합성 전에 사라집니다.

ElevenLabs Dubbing v2는 다른 방식을 사용합니다.

Dubbing v2는 스크립트가 아닌 원본 녹음을 직접 반영하는 오디오 투 오디오 모델을 제공합니다. 모델이 실제 연기를 듣고 결과를 생성하기 때문에, 톤과 감정, 감정의 뉘앙스가 더빙에 그대로 전달됩니다.

Comparison of audio-to-audio dubbing vs. cascaded dubbing, highlighting benefits of emotional tone, voice cloning, and timing in Dubbing v2, leading to dubs at 80-90% of human quality. AI Dubbing API

Dubbing v2는 인간 수준의 80~90% 품질로 더빙을 제공한다고 추정하며, 이제 AI 더빙이 영화 같은 콘텐츠에도 적용될 수 있습니다.

Dubbing v2의 세 가지 핵심 기능:

  • 동기화 인식 번역: 모델이 타이밍을 고려해 번역하므로, 더빙 오디오의 시작과 끝이 원본과 자동으로 맞춰집니다. 별도의 비디오 조작이나 립싱크가 필요 없습니다. 오디오가 원본 대사와 정확히 일치합니다.
  • 자동 음성 복제: 모든 번역이 원본 화자의 음성 복제로 제공되며, 별도의 수동 복제 과정이 필요 없습니다. 화자 정보, 음높이, 음색이 여러 언어와 다수 화자 상황에서도 유지됩니다.
  • 로케일 수준의 정확도: Dubbing v2는 라틴 아메리카 스페인어, 카스티야 스페인어 등 지역별 변형을 언어 코드(예: pt-BR)로 구분할 수 있습니다.

AI 더빙 API 선택 시 확인할 점

개발자 파이프라인에 사용할 AI 더빙 API를 평가할 때는 몇 가지 핵심 기준이 있습니다.

최고의 AI 더빙 API 주요 기능:

  • 광범위한 언어 및 로케일 지원: 90개 이상의 언어 지원과 지역별 변형 등 세밀한 타겟팅이 가능한지 확인하세요.
  • 연기(퍼포먼스) 보존: 시스템이 원본 오디오를 반영하는지, 아니면 스크립트만 사용하는지 확인하세요. 오디오 투 오디오 구조여야 감정이 더빙에 살아남습니다.
  • 완벽한 동기화 품질: 더빙 오디오가 원본 타이밍에서 벗어나면 수작업 정리가 필요해집니다. 동기화가 기본적으로 잘 되어야 후처리 부담이 없습니다.
  • 다중 화자 및 배경 지원: AI 더빙 API는 겹치는 화자나 음향 효과도 자연스럽게 처리해야 합니다. 또한 배경 음악이나 클립 내 믹스도 보존해야 합니다.
  • 편집 및 재생성: 스크립트 수정, 번역 다듬기, 변경된 부분만 재생성할 수 있는 더빙 API라면 전체 파일을 다시 더빙하지 않아도 됩니다.
  • 컴플라이언스: 엔터프라이즈 작업에는 SOC2, GDPR, ISO 27001 등 컴플라이언스가 필요합니다.

이후 가이드에서는 위의 모든 기능을 갖춘 ElevenLabs의 Dubbing API 사용법을 안내합니다.

Key criteria for choosing an AI dubbing API, highlighting ElevenAPI's features.

ElevenLabs Dubbing API로 오디오와 비디오 더빙하는 방법

Dubbing API는 프로젝트 단위로 구성됩니다. 각 프로젝트는 하나의 원본 파일과 그 스크립트를 포함합니다. 더빙하고 싶은 언어마다 목표 언어를 추가할 수 있고, 각 언어별로 번역과 결과물이 생성됩니다.

아래의 기본 생성-조회 워크플로우는 ElevenAPI 플랫폼에서 모든 사용자에게 제공됩니다.

The dubbing process on ElevenAPI in four REST calls: create, poll, add languages, download.

1) 더빙 프로젝트 생성

원본 미디어를 파일 업로드 또는 공개 URL로 전송하세요. 인증은 xi-api-key 헤더에 API 키를 사용합니다. 프로젝트 식별을 위한 참조 라벨과, 제품명이나 브랜드명을 우선 반영하도록 하는 키워드도 선택적으로 전달할 수 있습니다.

URL로 생성

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "source_url=https://example.com/promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

파일 업로드로 생성

curl -X POST https://api.elevenlabs.io/v1/dubbing/project \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F "file=@promo.mp4" \
  -F "source_language=en" \
  -F "reference=Q3 marketing video"

응답에는 대기(queued) 상태의 project_id가 반환됩니다. source_language를 생략하면 모델이 전사 과정에서 자동으로 언어를 감지합니다.

2) 프로젝트 준비 완료까지 폴링

원본은 비동기로 전사되므로, 프로젝트 상태가 ready가 될 때까지 폴링하세요.

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

준비된 프로젝트는 원본 스크립트가 생성되어 목표 언어 추가를 기다리는 상태입니다. 언어별 진행 상황은 각 언어에 저장되며, 이 시점부터 프로젝트는 계속 ready 상태를 유지합니다.

3) 목표 언어 추가

목표마다 언어를 하나씩 추가하세요. cloning_strength(0~10, 기본값 7) 설정으로 원본 음성과 목표 언어의 자연스러운 전달 사이의 균형을 조절할 수 있습니다.

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"target_language": "es", "voice_settings": {"cloning_strength": 7}}'

각 언어는 queued, processing, completed 단계를 거칩니다.

5개 언어로 더빙하려면 같은 프로젝트에 5번 호출하면 됩니다. 원본은 한 번만 전사되고, 모든 언어가 이를 번역합니다.

4) 더빙 결과 다운로드

언어 상태가 completed가 되면 해당 언어를 조회하세요. 응답에는 더빙 오디오를 다운로드할 수 있는 서명된 URL이 포함됩니다.

curl https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

다운로드 URL은 유효기간이 있으니, 새로운 링크가 필요할 때마다 언어를 다시 조회하세요.

이 네 단계만으로 완전 자동화된 더빙 루프가 완성됩니다: 생성, 폴링, 언어 추가, 다운로드.

API로 더빙 편집 및 재생성

자동화된 결과가 대부분의 상황을 커버하지만, 프리미엄 현지화에는 사람이 직접 단어를 다듬어야 완벽한 결과가 나올 수 있습니다. Dubbing API는 엔터프라이즈 고객에게 번역 양쪽 모두에 대해 세그먼트 단위의 제어권을 제공합니다.

원본 스크립트는 모든 언어 번역의 기준이 되며, 완전히 편집할 수 있습니다. 잘못 인식된 대사를 수정하거나, 화자 지정, 세그먼트 타이밍 조정도 가능합니다:

curl -X PATCH https://api.elevenlabs.io/v1/dubbing/project/{project_id}/transcript/segment/{segment_id} \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Welcome to our latest product demo."}'

각 목표 언어는 자체 스크립트를 제공하며, 원본 세그먼트와 번역이 쌍으로 연결됩니다. 번역도 동일하게 편집할 수 있습니다.

직접 준비한 원본 스크립트와 번역을 사용할 수도 있어, 기존 현지화 워크플로우로 단어를 관리하고 모델이 목소리만 처리하도록 할 수 있습니다.

더빙 완료 후 스크립트가 변경되면 해당 언어는 stale로 표시되고, 한 번의 호출로 현재 텍스트 기준으로 재생성할 수 있습니다.

curl -X POST https://api.elevenlabs.io/v1/dubbing/project/{project_id}/language/{language_id}/transcript/regenerate \
  -H "xi-api-key: $ELEVENLABS_API_KEY"

재생성은 원본 미디어 길이의 1배까지 무료이며, 번역을 반복해도 더빙 비용이 늘어나지 않습니다. 1배 초과 시에는 표준 더빙 요금이 적용됩니다.

AI 더빙 API 활용 사례

비디오 더빙 API는 대량 오디오 현지화가 필요할 때 유용합니다. 수동 더빙은 시간과 노력이 많이 들지만, AI 더빙 API를 사용하면 과정을 크게 단축할 수 있습니다.

AI 더빙 API 활용 예시:

  • 미디어 제작 플랫폼: 크리에이터 제작 워크플로우에 더빙을 직접 통합해, 사용자가 앱을 벗어나지 않고도 다양한 실험을 할 수 있습니다.
  • 교육 및 지원 콘텐츠: 전 세계 인재를 채용하는 기업은 다양한 언어로 콘텐츠를 현지화해, 모든 사용자를 위한 온보딩 교육 영상을 지원할 수 있습니다.
  • 스트리밍 및 미디어: 현지화 파이프라인으로 장편 시리즈나 기타 미디어를 자동으로 더빙해 여러 지역에 동시에 출시할 수 있습니다.
  • 마케팅 자료: 수십 개 언어로 성우 대사를 다시 녹음하지 않고도 다국어 비디오 캠페인을 진행할 수 있습니다.
  • 에듀테크: 강사 영상을 각 시장에 맞게 더빙하면서도 강사의 목소리를 그대로 유지할 수 있습니다.

이처럼 더빙 API를 활용하면 고품질 현지화 콘텐츠를 대규모로 손쉽게 제작할 수 있습니다.

Dubbing v2, 이제 ElevenAPI에서 사용 가능

Dubbing API는 셀프 서비스 및 엔터프라이즈 개발자 모두 사용할 수 있으며, Dubbing v2는 모든 사용자에게 제공되고, 엔터프라이즈 워크스페이스에는 편집 엔드포인트도 지원됩니다.

자세한 기능은 Dubbing API에서 확인하거나, 회원가입 후 API 키 생성으로 몇 분 만에 첫 더빙을 실행해보세요.

더빙 API 관련 FAQ

유사한 기사

최고 품질의 AI 오디오로 창작하세요