GPT-6 Astra는 왜 영상을 직접 만들지 않는가
AI로 짧은 영상 한 편을 뽑아본 적이 있다면 이 답답함을 압니다. 카지노 홀에서 대화하는 인물 둘을 찍고 싶다고 해봅니다. 조명은 어떻고, 두 사람이 어느 방향에서 걸어 들어오는지, 카메라가 그 뒤를 따라가는지 아니면 고정된 자리에서 지켜보는지, 이 모든 걸 프롬프트 문장 하나에 다 눌러 담아야 했습니다. 결과가 원하는 그림과 조금이라도 다르면 손댈 방법이 없어서 클립 전체를 처음부터 다시 뽑는 수밖에 없었습니다.
AI 영상 제작 툴 Higgsfield는 이 문제를 다른 방식으로 풉니다. 영상을 생성하는 AI 앞에, 영상을 생성하지 않는 AI를 하나 세워둔 겁니다.
픽셀을 책임지지 않는 AI
그 AI는 OpenAI가 최근 공개한 최신 플래그십 모델 GPT-6 Astra입니다. 복잡한 추론과 코딩, 리서치, 문서 작성에 특화된 모델로 ChatGPT Plus와 Pro, Business, Enterprise는 물론 API와 Microsoft Azure, Amazon Bedrock까지 순차적으로 열리고 있습니다.
Higgsfield는 이 Astra를 영상 제작 파이프라인의 기획 담당으로 붙였습니다. 사용자가 프롬프트로 창작 아이디어를 던지면, Astra는 그걸 영상으로 바로 옮기는 대신 장면 코드로 먼저 컴파일합니다. 공간을 몇 개의 구역으로 나눌지, 인물이 그 구역들을 어떤 순서로 지나갈지, 카메라가 어느 경로로 따라붙을지를 좌표와 치수로 정리하는 작업입니다. Astra는 이 설계도만 만들 뿐 마지막 프레임 한 장도 렌더링하지 않습니다.
Blender 안에 실제로 지어지는 공간
이 장면 코드를 받아서 실제 3D 공간으로 짓는 역할은 Higgsfield MCP가 맡습니다. MCP는 ChatGPT나 Claude 같은 AI 툴이 외부 서비스를 직접 호출할 수 있게 열어주는 연결 방식으로, Higgsfield는 이 연결로 Seedance 2.5를 비롯한 자사 모델들을 하나의 엔드포인트로 묶어 제공합니다.
Higgsfield의 Blender 플러그인은 Scene builder, 3D Model, Character animation, Image, Video, Camera, Asset 이렇게 일곱 개 탭으로 구성되어 있습니다. Astra가 짠 장면 코드가 이 플러그인을 거치면 테이블과 의자, 조명, 카메라 위치가 전부 Blender 안에서 실제로 만지고 옮길 수 있는 지오메트리로 들어옵니다. 화면 한쪽에는 실사에 가까운 프리뷰가, 다른 한쪽에는 같은 공간의 와이어프레임 뷰포트가 나란히 떠 있는 식입니다.
최종 영상은 이렇게 지어진 공간을 바탕으로 Seedance 2.5가 렌더링합니다. Seedance 2.5는 프롬프트 하나로 30초 분량의 시네마틱 장면을 여러 카메라 앵글로 뽑아내면서도 인물의 생김새를 컷마다 그대로 유지하는 것으로 알려진 Higgsfield의 영상 생성 모델입니다.
고치고 다시 쓰는 공간
이 구조가 주는 실질적인 차이는 두 가지입니다.
먼저 결과물을 고칠 수 있습니다. 이전 방식에서는 카메라 앵글 하나가 마음에 안 들면 클립 전체를 다시 뽑아야 했지만, 공간을 먼저 3D로 지어두면 문제가 되는 오브젝트나 카메라 위치만 옮기면 됩니다.
그리고 그 공간을 다시 쓸 수 있습니다. 같은 세트로 와이어프레임 프리비즈를 먼저 뽑아 동선을 확인하고, 확정되면 Seedance 2.5로 최종 렌더링을 뽑고, 필요하면 그 지오메트리를 게임 프로토타입에도 그대로 옮겨 쓸 수 있습니다. 한 번 쓰고 버리던 결과물이 재사용 가능한 애셋이 되는 셈입니다.
AI 모델이 강해질수록 잘 쓴 프롬프트 한 줄보다, 찍고 고치고 다시 쓸 수 있는 세계를 미리 설계해두는 쪽이 더 중요해지고 있습니다. 도구가 실행을 맡을수록, 창작자에게 남는 몫은 그 세계를 어떻게 짜느냐입니다.