VIBE 블로그9분 분량

일관된 캐릭터 AI 영상: 레퍼런스 이미지 방법

AI 영상 속 캐릭터가 클립마다 달라지는 이유와, 얼굴과 옷차림, 배경을 일관되게 유지하는 레퍼런스 이미지 워크플로우를 소개해요. 촬영 목록 작성부터 여러 장면 연결까지 단계별로 알아봐요.

Jiyeon Kim

Jiyeon Kim

VIBE AI 영상 에디터

일관된 캐릭터 AI 영상 화면, 네 장의 레퍼런스 사진으로 같은 인물의 영상 클립을 생성하는 모습
이 페이지 목차
  1. 일관된 캐릭터 AI 영상이란 무엇인가요?
  2. 클립마다 AI 생성 캐릭터의 모습이 달라지는 이유는 무엇인가요?
  3. 여러 장의 레퍼런스 이미지를 지원하는 AI 영상 모델은 무엇인가요?
  4. 레퍼런스 이미지로 촬영 목록을 만드는 방법을 단계별로 알려주세요
  5. 여러 클립을 하나의 일관된 장면으로 연결하는 방법은 무엇인가요?
  6. 캐릭터 일관성 측면에서 무료와 유료 AI 영상 생성기는 어떻게 다른가요?
  7. 자주 묻는 질문
  8. 마무리

일관된 캐릭터 AI 영상이란 매번 다른 사람처럼 보이는 결과물이 나오는 대신, 같은 얼굴과 같은 옷차림, 같은 배경을 보여주는 여러 개의 영상 클립을 생성하는 것을 말해요. 해결책은 더 좋은 프롬프트가 아니라, 시작 이미지 한 장만 쓰는 방식에서 모델이 각 클립을 만들기 전에 같은 캐릭터의 사진 두세 장에서 네 장을 먼저 받는 레퍼런스 이미지 워크플로우로 바꾸는 거예요. VIBE의 Seedance 2.5와 Veo 3.1 시리즈는 이미 이 모드를 지원하고 있어요.

VIBE는 텍스트 프롬프트나 이미지로 멋진 영상을 만들 수 있는 AI 영상 생성 앱으로, Kling, Sora, Veo 같은 최신 AI 모델을 사용해요. 레퍼런스 이미지 모델을 쓰면 짧은 영화나 광고, 얼굴 없는 채널 시리즈 전체에서 캐릭터를 알아볼 수 있게 유지할 수 있어요.

일관된 캐릭터 AI 영상이란 무엇인가요?

일관된 캐릭터 AI 영상은 같은 캐릭터가 — 같은 얼굴, 같은 옷차림, 같은 체형으로 — 장면을 다시 렌더링할 때마다 다른 사람처럼 바뀌는 게 아니라, 따로 생성된 여러 클립에서 정확하게 등장하는 영상을 말해요. 이는 클립 한 개로 끝나지 않는 모든 프로젝트에서 중요해요. 미니 시리즈, 제품 마스코트, 같은 내레이터가 반복해서 나오는 설명 영상, 같은 "얼굴"을 수십 개의 영상에서 재사용하는 얼굴 없는 채널 같은 경우예요.

효과가 있는 방법은 레퍼런스-투-비디오(reference-to-video)라고 불려요. 텍스트 프롬프트만 입력하거나 시작 이미지 한 장만 애니메이션으로 만드는 대신, 같은 인물의 사진 두 장 이상을 모델에 미리 주면 그 인물의 모습을 그대로 유지한 새로운 장면을 생성해줘요. 이는 사진 한 장만 보고 새로운 포즈나 각도를 비교할 방법이 없는 일반적인 이미지-투-비디오와는 달라요.

클립마다 AI 생성 캐릭터의 모습이 달라지는 이유는 무엇인가요?

AI 생성 캐릭터가 클립마다 달라지는 이유는, 대부분의 텍스트-투-비디오 모델과 단일 이미지 기반 이미지-투-비디오 모델이 이전 클립을 기억하지 않고 매번 처음부터 인물의 모습을 다시 만들어내기 때문이에요. "빨간 재킷을 입은 여성" 같은 프롬프트는 특정 개인이 아니라 하나의 범주를 설명해요. 그래서 같은 프롬프트를 써도 모델은 매번 얼굴, 머리카락, 체형을 다르게 채워 넣어요.

여러 샷에 걸친 텍스트-투-비디오 생성 연구에 따르면, 영상 디퓨전 모델이 움직임을 제어하는 데 쓰는 내부 특징이 캐릭터의 정체성도 함께 제어한다는 사실이 발견됐어요. 이는 프레이밍이나 포즈, 카메라 각도가 샷마다 바뀔 때 정체성도 함께 흔들리는 이유 중 하나예요. 실제로는 이런 모습으로 나타나요.

  • 정면에서는 비슷해 보이지만 45도 각도에서는 다르게 보이는 얼굴
  • 실내 장면과 실외 장면 사이에서 바뀌는 옷 색상이나 패턴
  • 몇 분 간격으로 생성된 클립 사이에서 초기화되는 머리 길이나 스타일
  • 이후 클립에서 사라지거나 모양이 바뀌는 조연 캐릭터나 소품

레퍼런스 이미지는 텍스트만으로 캐릭터를 다시 상상하는 대신, 매번 생성할 때마다 모델이 맞춰야 할 구체적인 기준을 줌으로써 이 문제를 해결해요.

두 클립 사이에서 모습이 달라지는 AI 생성 캐릭터와 레퍼런스 이미지를 사용한 일관된 버전을 나란히 보여주는 화면
두 클립 사이에서 모습이 달라지는 AI 생성 캐릭터와 레퍼런스 이미지를 사용한 일관된 버전을 나란히 보여주는 화면

여러 장의 레퍼런스 이미지를 지원하는 AI 영상 모델은 무엇인가요?

VIBE 안에서 현재 입력 사진 두 장 이상으로 레퍼런스-투-비디오를 지원하는 모델 시리즈는 두 가지예요. Seedance 2.5와 구글 Veo 3.1이에요.

  • Seedance 2.5(바이트댄스, 프리미엄)는 클립마다 캐릭터를 일관되게 유지하기 위해 최대 네 장의 레퍼런스 이미지를 받거나, 대신 첫 프레임과 마지막 프레임 조합을 사용할 수 있어요 — 두 모드는 동시에 쓸 수 없어요. 480p 또는 720p로 4~30초 클립을 생성하며, 매번 대화가 포함된 동기화 오디오가 함께 나와요.
  • Veo 3.1(구글 딥마인드, 프리미엄)는 주체 일관성을 위해 최대 세 장의 레퍼런스 이미지를 받고, 연결된 클립 사이의 부드러운 전환을 위한 별도의 마지막 프레임 입력도 지원해요. 720p 또는 1080p로 클립당 4~8초를 생성하며, 오디오는 선택 사항이에요.
  • Veo 3.1 Lite(프리미엄)도 레퍼런스 이미지 입력을 지원하며, Veo 3.1 라인업 중 토큰 비용이 가장 낮고 720p로 제한되며 오디오는 항상 켜져 있어요.
  • Sora 2와 Sora 2 Pro(OpenAI, 프리미엄)는 여러 장이 아니라 한 장의 레퍼런스 이미지를 받아요. 캐릭터의 모습을 고정하는 데는 유용하지만, Seedance 2.5나 Veo 3.1처럼 여러 레퍼런스 각도를 조합할 수는 없어요.

반면 WAN 2.6과 WAN 2.7은 한 번의 생성 안에서 멀티샷 장면 전환을 추가하지만, 둘 다 캐릭터 일관성을 위한 다중 레퍼런스 이미지는 아직 지원하지 않아요. 캐릭터가 다양한 각도와 길이에서 안정적으로 보여야 한다면 Seedance 2.5를, 클립 사이에 마지막 프레임 전달이 필요한 프로젝트라면 Veo 3.1을 선택하세요.

60초 만에 첫 AI 영상을 만들어보세요

Kling, Veo, Sora 등으로 AI 영상을 생성하세요 — iOS 및 Android에서 무료입니다.

App StoreGoogle Play

레퍼런스 이미지로 촬영 목록을 만드는 방법을 단계별로 알려주세요

레퍼런스 이미지 촬영 목록은 아무것도 생성하기 전에 미리 세워두는 짧은 계획이에요. 이렇게 하면 매번 새로운 모습을 즉석에서 만들어내는 대신, 모든 클립이 같은 원본 사진에서 시작할 수 있어요.

  1. 캐릭터의 선명한 사진 두세 장에서 네 장을 고르거나 생성하세요. 정면 사진 한 장, 45도 각도 사진 한 장, 그리고 캐릭터가 여러 장면에 등장한다면 전체 옷차림이 보이는 사진 한 장을 준비해요.
  2. 캐릭터가 등장해야 할 모든 장면을 순서대로 적고, 각 장면의 동작과 배경을 한 줄로 설명해요.
  3. VIBE에서 이미지-투-비디오를 열고 Seedance 2.5나 Veo 3.1을 선택한 다음, 목록의 첫 장면에 레퍼런스 사진 전체를 업로드해요.
  4. 프롬프트는 캐릭터의 모습이 아니라 동작과 배경에 집중해서 작성하세요 — 레퍼런스 이미지가 이미 그 정보를 전달하고 있기 때문에, 얼굴이나 옷차림을 텍스트로 다시 설명하면 보통 잡음만 늘어나요.
  5. 첫 클립을 생성한 뒤 다음 장면으로 넘어가기 전에 레퍼런스 사진과 비교해보세요. 얼굴이나 옷차림이 이미 어긋났다면, 클립 네 개를 더 생성하기 전에 레퍼런스 세트를 먼저 고치세요.
  6. 목록에 남은 모든 장면에서 정확히 같은 레퍼런스 이미지를 계속 사용하고, 프롬프트의 장면 설명만 바꿔주세요.
스마트폰 화면의 촬영 목록과 영상 생성에 사용되는 같은 AI 생성 캐릭터의 레퍼런스 사진 네 장
스마트폰 화면의 촬영 목록과 영상 생성에 사용되는 같은 AI 생성 캐릭터의 레퍼런스 사진 네 장

여러 클립을 하나의 일관된 장면으로 연결하는 방법은 무엇인가요?

클립을 연결한다는 것은 따로따로 생성된 영상들이 하나의 이어지는 장면처럼 보이도록 만드는 것이에요. 이는 같은 레퍼런스 이미지를 재사용하는 것만으로는 부족해요.

  • 시퀀스 안의 모든 클립에서 완전히 동일한 레퍼런스 이미지 세트를 재사용하세요 — 중간에 사진 한 장만 바꿔도 나머지 시퀀스 전체에서 다시 불일치가 생겨요.
  • 가능하다면 모델의 마지막 프레임 입력을 활용하세요. Veo 3.1의 마지막 프레임 모드처럼, 다음 클립이 새로운 각도로 넘어가는 대신 이전 클립이 끝난 지점에서 시각적으로 이어지게 할 수 있어요.
  • 시퀀스 전체에서 조명과 장소를 장면 설명에서 일관되게 유지하세요. 배경이 예상치 못하게 바뀌면 캐릭터는 알아볼 수 있어도 시청자에게는 여전히 오류처럼 보여요.
  • 클립을 등장할 순서대로 생성하고 순서를 뒤섞지 마세요. 그러면 불일치를 일찍 발견해서 나머지 시퀀스로 퍼지기 전에 레퍼런스 세트를 고칠 수 있어요.
  • 모든 클립을 같은 화면비와 해상도로 내보내서 최종 편집에서 샷 사이에 자르기나 재조정이 필요 없게 하세요.

이는 여러 옷차림이나 배경에 걸쳐 셀피를 영상으로 바꾸는 것과 같은 기술을, 클립 한 개가 아니라 여러 장면으로 이어지는 전체 시퀀스로 확장한 것이에요.

서로 다른 배경에서 같은 캐릭터를 보여주는 네 개의 연결된 AI 영상 클립을 순서대로 배열한 타임라인
서로 다른 배경에서 같은 캐릭터를 보여주는 네 개의 연결된 AI 영상 클립을 순서대로 배열한 타임라인

캐릭터 일관성 측면에서 무료와 유료 AI 영상 생성기는 어떻게 다른가요?

무료 AI 영상 생성기와 유료 버전의 가장 큰 차이는 몇 장의 레퍼런스 이미지를 받아들이느냐예요. VIBE의 무료 모델인 Seedance Pro Fast, LTX 2 Distilled, PRUNA V는 모두 단일 이미지 기반 이미지-투-비디오를 지원하지만, 캐릭터 일관성을 위한 다중 레퍼런스 이미지는 지원하지 않아요. 이 기능은 현재 프리미엄 모델로 제한돼 있어요. 최대 네 장을 지원하는 Seedance 2.5와 최대 세 장을 지원하는 Veo 3.1 시리즈예요.

이 차이를 실용적으로 활용하는 방법은, 다운로드 페이지에서 VIBE를 받아 먼저 무료 모델로 저렴하게 장면의 구성과 움직임을 시험해보고, 여러 클립에서 일치시켜야 하는 최종 버전을 생성할 준비가 되면 완성된 레퍼런스 사진으로 Seedance 2.5나 Veo 3.1로 전환하는 거예요. 무료로 테스트하고 레퍼런스 이미지 모델로 마무리하면, 정말로 일관성이 필요한 클립에만 토큰을 집중해서 쓸 수 있어요.

레퍼런스 이미지 지원 여부를 강조해 무료 모델과 프리미엄 AI 영상 모델을 나란히 비교하는 화면
레퍼런스 이미지 지원 여부를 강조해 무료 모델과 프리미엄 AI 영상 모델을 나란히 비교하는 화면

자주 묻는 질문

일관된 캐릭터 AI 영상이란 무엇인가요?

VIBE는 텍스트 프롬프트나 이미지로 멋진 영상을 만들 수 있는 AI 영상 생성 앱으로, Kling, Sora, Veo 같은 최신 AI 모델을 사용해요. 일관된 캐릭터 AI 영상은 Seedance 2.5나 Veo 3.1 같은 모델로 레퍼런스 이미지 워크플로우를 사용한 결과로, 같은 캐릭터가 클립마다 모습을 바꾸는 대신 모든 클립에서 정확하게 등장해요.

캐릭터를 일관되게 유지하려면 레퍼런스 이미지를 몇 장까지 쓸 수 있나요?

Seedance 2.5는 한 번 생성할 때 최대 네 장의 레퍼런스 이미지를 받고, Veo 3.1은 최대 세 장을 받아요. 둘 다 레퍼런스 세트를 애니메이션으로 만들 시작 프레임이 아니라, 맞춰야 할 고정된 정체성으로 다뤄요.

일관된 캐릭터로 AI 영상 생성 앱을 사용해 설명 영상을 만드는 방법은 무엇인가요?

먼저 내레이터나 마스코트 캐릭터를 위한 짧은 레퍼런스 이미지 세트를 만들고, 그다음 같은 레퍼런스 이미지와 새로운 동작이나 배경만 설명하는 장면별 프롬프트로 각 설명 영상 장면을 생성하세요. 캐릭터의 모습을 다시 설명하지는 않아요.

일관된 캐릭터가 필요한 교육자에게 가장 좋은 AI 영상 도구는 무엇인가요?

VIBE 안의 Seedance 2.5나 Veo 3.1처럼 레퍼런스 이미지를 지원하는 AI 영상 생성 앱을 쓰면, 교육자는 매 프롬프트마다 캐릭터의 모습을 다시 설명하지 않고도 전체 레슨 시리즈에서 같은 화면 속 진행자나 마스코트를 재사용할 수 있어요.

9:16 세로 영상에서도 같은 캐릭터를 일관되게 유지할 수 있나요?

네. 레퍼런스 이미지를 통한 일관성은 화면비와 무관하게 작동해요. 생성 전에 모델 선택 화면에서 9:16을 고르면, 결과물이 세로든 와이드스크린이든 같은 레퍼런스 사진이 캐릭터를 일관되게 유지해줘요.

일관된 캐릭터 AI 영상에서는 모든 클립의 오디오도 일치시켜야 하나요?

꼭 그럴 필요는 없지만 도움이 돼요. Seedance 2.5는 항상 동기화된 오디오를 생성하기 때문에, 시퀀스 전체에서 반복 등장하는 캐릭터의 목소리를 모습과 함께 일관되게 유지할 수 있어요. 반면 Veo 3.1은 같은 클립에서도 오디오를 선택 사항으로 둬요.

마무리

캐릭터가 흔들리는 현상은 대부분의 AI 영상 모델이 작동하는 방식에서 생기는 부작용이에요. 비교할 대상 없이 매 클립마다 텍스트 설명만으로 전체 인물을 다시 만들어내기 때문이에요. 레퍼런스-투-비디오는 대신 모델이 맞춰야 할 두세 장에서 네 장의 고정된 사진을 줌으로써 이 문제를 해결해요. 최대 네 장을 지원하는 Seedance 2.5와 최대 세 장을 지원하는 Veo 3.1은 바로 이 목적을 위해 만들어진 VIBE 안의 두 모델이에요. VIBE는 텍스트 프롬프트나 이미지로 멋진 영상을 만들 수 있는 AI 영상 생성 앱으로, Kling, Sora, Veo 같은 최신 AI 모델을 사용하며 iOS와 Android에서 모두 쓸 수 있어요. iOSAndroid에서 VIBE를 다운로드하고, 오늘 첫 일관된 캐릭터 촬영 목록을 만들어보세요.

이 글 공유하기

60초 만에 첫 AI 영상을 만들어보세요

Kling, Veo, Sora 등으로 AI 영상을 생성하세요 — iOS 및 Android에서 무료입니다.

App StoreGoogle Play