Skip to content

WAND-Vega와 HY 3D로 영화 같은 원테이크 샷 구현하기 ​

카메라 한 대가 컷 없이 처음부터 끝까지 이어 찍는 촬영 방식을 원테이크(one-take)라고 부릅니다. 도박장 문을 열고 들어오는 인물 둘을 원테이크로 찍고 싶다고 해봅니다. 조명은 어떻고, 두 사람이 어느 방향에서 들어오는지, 카메라가 그 뒤를 따라가는지 아니면 고정된 자리에서 지켜보는지, 이 모든 걸 프롬프트 문장 하나에 눌러 담아야 합니다. 결과가 원하는 그림과 조금이라도 다르면 손댈 방법이 없어서 클립 전체를 처음부터 다시 뽑는 수밖에 없습니다.

AI 영상 제작 툴 Higgsfield는 이 문제를 다른 방식으로 풉니다. 영상을 생성하는 AI 앞에, 영상을 생성하지 않는 AI(GPT-6 Astra)를 하나 세워서 장면을 몇 개의 구역(zone)으로 나누고 인물이 그 구역을 지나가는 동선과 카메라 경로까지 먼저 설계도로 뽑아둡니다. 그다음에야 실제 렌더링 모델인 Seedance 2.5가 그 설계를 바탕으로 영상을 찍습니다. 프롬프트 한 줄이 아니라 도면 한 장에서 출발하는 셈입니다.

이번 글에서는 같은 아이디어를 Text LLM과 HY 3D, WAND-Vega로 직접 재현해봤습니다.

세 모델을 이어 붙이는 조합 ​

Higgsfield가 하는 역할을 그대로 대응시키면 아래처럼 정리됩니다.

Higgsfield 역할이번 실험 조합
GPT-6 Astra (그리지 않는 AI, 장면 설계)Text LLM — 장면을 JSON으로 구조화
Higgsfield MCP + Blender (3D 공간)HY 3D — 360° 파노라마로 공간 프리뷰
Seedance 2.5 (최종 렌더)WAND-Vega — 최종 시네마틱 렌더링

세 모델 모두 Tencent Cloud의 AIGC 모델입니다. 흐름을 그림으로 정리하면 아래와 같습니다.

프롬프트를 Text LLM이 장면 JSON으로 정리하면 HY 3D가 360도 파노라마로 공간을 미리 보여주고, WAND-Vega가 최종 시네마틱 영상을 렌더링한다

Step 1. Text LLM이 장면을 짠다 ​

카지노 장면 아이디어를 프롬프트로 던지면 Text LLM이 구역과 캐릭터, 카메라를 구조화된 JSON으로 돌려줍니다. 실제 출력을 발췌하면 이렇습니다.

json
{
  "title": "Smoke and Green Felt",
  "zones": [
    {"id": 1, "name": "Rain-Slicked Street Approach",
     "description": "A narrow, rain-slicked side street with flickering neon reflections..."},
    {"id": 2, "name": "Concrete Service Corridor",
     "description": "A tight concrete hallway with exposed pipes..."},
    {"id": 3, "name": "Dim Threshold Antechamber",
     "description": "A small, low-ceilinged threshold space with a heavy soundproof door..."},
    {"id": 4, "name": "Smoky Gaming Floor",
     "description": "A wide casino floor with rows of green-felt gaming tables..."}
  ],
  "characters": [
    {"name": "Man in Charcoal Overcoat",
     "look": "Mid-30s, sharp features, charcoal overcoat over a loosened tie...",
     "path": [1, 2, 3, 4]},
    {"name": "Woman in Red Dress",
     "look": "Late 20s, wavy dark hair, form-fitting red cocktail dress...",
     "path": [1, 2, 3, 4]}
  ],
  "camera": {"type": "Steadicam", "movement": "Begins with a low-angle tracking shot..."},
  "main_shot": {"zone_id": 4, "prompt": "A slow-rising 3/4 frontal shot on the smoky casino gaming floor..."}
}

거리, 통로, 대기 공간, 도박장까지 네 구역을 순서대로 지나가는 동선과 두 캐릭터의 생김새("charcoal overcoat over a loosened tie", "form-fitting red cocktail dress")를 한 번에 뽑아준 겁니다. 이 묘사는 아래 최종 영상에서 그대로 재현됩니다.

Step 2. HY 3D가 공간을 미리 보여준다 ​

main_shot이 가리키는 4번 구역, 도박장을 HY 3D로 먼저 만들어봤습니다.

  • 출력: 7680 × 3840 equirectangular 360° 파노라마 (약 38MB)
  • 뷰어로 열면 마우스 드래그로 공간을 둘러볼 수 있습니다.

실제 촬영이라면 로케이션 헌팅에 해당하는 단계입니다. 조명 톤과 테이블 배치, 공간감을 렌더링 전에 미리 확인할 수 있습니다.

Step 3. WAND-Vega가 찍는다 ​

main_shot.prompt를 WAND-Vega에 넘기면 최종 시네마틱이 나옵니다.

WAND-Vega가 렌더링한 도박장 원테이크 장면: 차콜 오버코트의 남자와 빨간 드레스의 여자가 도박장 문을 열고 들어오는 순간

전체 영상 보기 — 1344 × 768 (16:9), H.264 + AAC, 8.33초

도박장 문을 열고 들어오는 차콜 오버코트의 남자와 빨간 드레스의 여자, 따뜻한 텅스텐 펜던트 조명, 옅게 낀 담배 연기, 초록 펠트 테이블까지 Text LLM이 짠 묘사가 화면에 그대로 옮겨졌습니다.

걸린 시간 ​

전체 파이프라인 소요 시간을 재보면 Text LLM 약 10초, HY 3D 약 90초, WAND-Vega 약 120초로 합쳐서 4분 안팎입니다. 프롬프트를 던지고 커피 한 잔 내리는 사이에 장면 설계부터 완성 영상까지 나오는 셈입니다.

마치며 ​

"프롬프트를 그대로 던지는 것"과 "장면을 구조화하고 공간을 먼저 훑어본 다음 찍는 것" 사이에는 품질과 통제력 차이가 분명합니다. 이번 핸즈온에서 확인한 건 그 구조의 첫 단추인 장면 설계 레이어를 Text LLM만으로도 지금 당장 실현할 수 있다는 겁니다. Higgsfield가 GPT-6 Astra로 보여준 "찍기 전에 짓는다"는 방향을 HY 3D와 WAND-Vega를 이어 붙이는 것만으로 같은 카지노 장면에서 확인했습니다.

基于 VitePress 构建 · 部署于腾讯云 EdgeOne Pages