Tencent Cloud WAND-Vega 분석
영상 생성 모델을 실제 제작에 붙이려고 하면 항상 같은 고민에 부딪힙니다. 화질과 움직임의 자연스러움을 올릴수록 초당 생성 비용도 함께 뜁니다. 그래서 시안 단계에서 여러 버전을 빠르게 뽑아보는 일과 최종 납품용 고품질 영상을 만드는 일을 모델 하나로 다 감당하기가 쉽지 않습니다. 텐센트가 자체 개발한 영상 생성 모델 WAND-Vega는 이 문제를 모델 하나로 버티는 대신, 등급이 다른 여러 모델을 한 브랜드 아래 묶어 풀었습니다.
세 가지 생성 방식
입력에 무엇을 넣는지에 따라 호출 방식이 갈립니다.
T2V는 참고 자료 없이 텍스트 설명만으로 4초에서 30초 사이의 영상을 만듭니다. 가장 기본이 되는 방식입니다. FLF는 시작 프레임과 끝 프레임 이미지를 지정하면 그 사이를 채우는 움직임을 모델이 직접 만들어냅니다. REF는 이미지와 비디오, 오디오를 참조로 함께 넣어 특정 인물이나 스타일의 일관성을 유지한 채 영상을 뽑습니다. 셋 다 같은 API로 호출하고, 요청에 어떤 참조 자료를 실어 보내는지에 따라 적용되는 쪽이 달라집니다.
세 등급으로 나뉜 모델
등급은 세 개입니다. 비용과 완성도 사이에서 어디에 무게를 둘지 사용자가 직접 고르라는 구성입니다.
| 항목 | 1.0 Lite | 1.0 Pro | 1.5 Pro |
|---|---|---|---|
| 참고 이미지 | 최대 9장 | 최대 9장 | 최대 30장 |
| 참고 비디오 | 최대 3개 | 최대 3개 | 최대 10개 |
| 영상 길이 | 4~15초 | 4~15초 | 4~30초 |
| 실존 인물 참조 | 미지원 | 지원 | 지원 |
| 오디오 생성 | 지원 | 지원 | 지원 |
Lite는 반복 제작과 비용 효율에 무게를 둔 등급입니다. Pro로 올라가면 실존 인물을 참조 소재로 등록해 여러 장면에 재사용할 수 있습니다. 1.5 Pro는 참고 이미지를 30장까지, 참고 비디오를 10개까지 한꺼번에 받고 영상 길이도 최대 30초까지 늘어나기 때문에, 장면 연출이 복합적인 작업이라면 이 등급이 맞습니다. 해상도는 등급과 무관하게 720P부터 4K까지, 종횡비는 21:9부터 9:16까지 지원합니다.
실제로 만들어본 장면들
어떤 장면까지 소화하는지는 예시 몇 개로 보는 게 빠릅니다.
교복을 입은 학생이 벚꽃 떨어지는 골목에서 탄산음료를 마시는 장면에는 손 떨림이 살아있는 핸드헬드 카메라 워크와 부드러운 슬로모션, 봄 특유의 화사한 빛이 한꺼번에 들어갑니다. 참고 이미지 없이 텍스트만으로 인물 안정성과 꽃잎의 흩날림, 빛의 결을 여기까지 잡아내는 대목에서 T2V 방식의 완성도가 드러납니다.
거대한 뿔 달린 악마가 핏빛 폭풍우 아래 등장하는 다크 판타지 게임 컷신은 REF 방식을 시험합니다. 참고 이미지로 인물의 형태를 붙잡아 두는 방식이라, 격렬한 움직임 속에서도 근육질 몸체와 번개 이펙트가 참고 이미지에서 크게 벗어나지 않느냐가 관건입니다.
자전거를 타고 시골 마을을 지나가는 손그림 애니메이션은 난이도가 또 다릅니다. 논밭과 목조 가옥, 바람에 흔들리는 해바라기까지 배경이 계속 움직이는데, 그 와중에도 손으로 그린 듯한 질감은 흐트러지지 않아야 합니다. 배경의 움직임과 스타일 유지를 동시에 요구하는 이런 장면들을 텐센트가 WAND-Vega 공식 예시로 공개했습니다.
가격 경쟁력
720P 기준 초당 생성 비용을 놓고 보면 가격 구조가 뚜렷합니다. 해외 벤더의 유사 등급 최신 영상 모델이 초당 0.2310달러인 데 비해, WAND-Vega 1.5-pro는 초당 0.1828달러로 약 20.9% 저렴하고, WAND-Vega 1.0-pro는 초당 0.1223달러로 약 47.0% 저렴합니다. 시안을 여러 버전 뽑아보는 초기 단계는 1.0 Pro로 비용을 아끼고, 최종 납품용 장면만 1.5 Pro로 완성하는 식입니다. 이렇게 단계를 나눠 쓰는 편이 비용 면에서 특히 유리합니다.
이미지부터 사운드까지 이어지는 파이프라인
WAND-Vega는 영상 모델 하나로 끝나지 않습니다. 여기가 진짜 강점입니다. 텐센트는 이번 미디어 AI 브랜드를 "미디어의 처음부터 끝까지"를 지원하는 것으로 포지셔닝했고, 실제로 크리에이티브 브리프에서 출발해 이미지 생성(Vega-Image), 영상 생성(Vega-Video), 사운드 후처리(WAND-Sonic)까지 이어지는 제작 파이프라인을 갖췄습니다. 초기 시안 이미지를 Vega-Image로 여러 장 뽑고, 마음에 드는 구도를 Vega-Video로 넘겨 움직임을 붙인 다음, WAND-Sonic으로 배경음과 효과음까지 입히는 흐름을 전부 같은 API 체계 안에서 처리합니다. 여러 벤더의 서로 다른 도구를 이어 붙이는 대신 한 곳에서 끝까지 완결한다는 것이 실무에서 가장 크게 와닿는 차이입니다.
호출 방법
WAND-Vega의 영상 생성은 VOD API의 CreateAigcVideoTask 액션으로 호출합니다. 생성은 비동기로 돌아갑니다. 태스크를 만들면 TaskId가 먼저 돌아오고, DescribeTaskDetail로 상태를 조회하다가 Status가 FINISH로 바뀌면 결과물을 받아오는 구조입니다.
POST https://vod.intl.tencentcloudapi.com
Action: CreateAigcVideoTask실존 인물을 반복해서 참조로 쓴다면 매번 이미지를 새로 올릴 필요가 없습니다. CreateAigcMaterial로 소재를 한 번만 등록해두고, 이후 생성 요청에서는 asset:// 형태의 URL로 재사용하면 되니 반복 작업의 번거로움이 줄어듭니다.
세 가지 생성 방식과 세 등급의 모델, 이미지부터 사운드까지 이어지는 파이프라인까지 놓고 보면 WAND-Vega는 영상 모델 하나가 아니라 영상 제작 전체 과정을 자체 기술로 커버하는 브랜드입니다.