아이디어를 얻고 AI에게 정확히 설명해 원하는 영상을 만드는 법
AI 영상 제작을 하다 보면 가장 자주 생기는 문제가 두 가지다.
첫 번째는
“무슨 영상을 만들지 생각이 안 난다.”
두 번째는
“머릿속에는 장면이 있는데 AI가 엉뚱하게 만든다.”
이 두 문제는 따로 해결해야 한다.
아이디어를 얻는 방법과
AI에게 아이디어를 전달하는 방법은 전혀 다르기 때문이다.
⸻
1. 아이디어는 완전히 새로운 것에서 나오지 않는다
좋은 아이디어를 만들려고 하면 많은 사람이
“세상에 없는 걸 생각해야 한다.”
고 생각한다.
하지만 실제로는 대부분의 좋은 아이디어가
기존 요소 A + 기존 요소 B + 새로운 조건
으로 만들어진다.
예를 들어
편의점
두 친구의 내기
2000년대 캠코더
를 합치면
“두 친구가 일본 편의점에서 서로 몰래 간식을 골라 승부하는 MiniDV 홈비디오”
가 된다.
또는
커피 광고
초매크로 촬영
원재료 변환
을 결합하면
“커피 체리에서 생두, 로스팅, 분쇄, 에스프레소까지 한 번에 연결되는 10초 광고”
가 된다.
아이디어를 만들 때
새로운 세계를 처음부터 발명하려 하지 말고
이미 알고 있는 것들을 새로운 방식으로 연결하는 것
이 훨씬 효과적이다.
⸻
2. 아이디어를 만드는 가장 쉬운 공식
SUBJECT + SITUATION + TWIST
세 가지를 조합한다.
SUBJECT
누가 등장하는가?
예:
여성
할아버지
고양이
회사원
친구 두 명
배달기사
SITUATION
무엇을 하고 있는가?
예:
출근
간식 고르기
운동
쇼핑
비 피하기
사진 찍기
TWIST
무슨 예상 밖의 일이 발생하는가?
예:
시간이 멈춘다
물건이 거대해진다
반사가 다른 세계로 연결된다
사소한 행동이 경쟁으로 변한다
동물이 사람처럼 행동한다
예를 들어
고양이 + 편의점 쇼핑 + 사람처럼 가격 비교
만으로도 영상 아이디어가 된다.
⸻
3. 장소를 먼저 정하면 아이디어가 잘 나온다
아이디어가 막힐 때는 캐릭터보다 장소를 먼저 떠올리는 것도 좋다.
예:
편의점
지하철
세탁방
옥상
학교
시장
주차장
카페
놀이터
자판기 앞
엘리베이터
그리고 질문한다.
“여기에서 평범하지 않은 일이 하나 일어난다면?”
예:
세탁방에서 모든 세탁기가 동시에 돌아가면서 패션 런웨이가 된다.
자판기에서 음료를 뽑았는데 캔 표면의 반사 속에 작은 도시가 있다.
놀이터에서 성인이 미끄럼틀을 의자처럼 사용하며 하루 종일 쉬고 있다.
장소는 아이디어의 제약 조건이 되기 때문에 오히려 상상하기 쉬워진다.
⸻
4. 반대로 ‘행동’을 먼저 생각해도 된다
좋은 영상은 명사보다 동사가 중요하다.
예:
걷는다
찾는다
쫓는다
숨긴다
던진다
도망친다
비교한다
열어본다
먹는다
실수한다
놀란다
이 동사를 연결하면 작은 이야기가 된다.
예:
찾는다
→ 숨긴다
→ 발견한다
→ 서로 바꿔 먹는다
→ 예상 밖의 반응
이것만으로도 15초짜리 숏폼 구조가 만들어진다.
⸻
5. 영상 아이디어는 마지막 장면부터 생각하는 방법도 좋다
특히 Shorts나 Reels에서는 매우 효과적이다.
먼저
“마지막에 무엇을 보여줄 것인가?”
를 결정한다.
예:
주인공이 카메라 바로 앞까지 다가와 웃는다.
음료 캔 안에 도시가 있었다는 사실이 밝혀진다.
고양이가 계산대에서 카드를 내민다.
상대방을 쓰러뜨렸다고 생각했는데 뒤에서 다시 나타난다.
그리고 그 결말까지 가는 과정을 역으로 만든다.
이 방식은 영상이 중간에서 흐려지는 것을 줄여준다.
⸻
6. 좋은 아이디어는 ‘설명 가능한 아이디어’다
아이디어가 좋더라도 한 문장으로 설명할 수 없다면 AI 영상으로 만들기 어려울 가능성이 높다.
좋은 아이디어는 대체로 이렇게 말할 수 있어야 한다.
“누가 어디에서 무엇을 하다가 어떤 일이 일어나고 결국 어떻게 끝나는 영상.”
예:
“비 오는 도쿄 거리에서 여성이 자판기에서 음료를 뽑는데, 캔 표면의 반사 속으로 카메라가 들어가 작은 미래 도시를 보여준 뒤 다시 현실로 돌아오는 30초 광고.”
이 정도가 되면 AI도 이해하기 시작한다.
⸻
7. 이제 중요한 두 번째 문제
머릿속 아이디어를 AI에게 어떻게 설명할 것인가?
사람은 장면을 한 번에 상상한다.
AI는 그렇지 않다.
AI에게는
“멋진 액션 영상 만들어줘.”
보다
누가
어디에 있고
무엇을 하고
그 다음 무엇이 일어나며
카메라는 어디 있고
결과가 어떻게 되는지
순서대로 설명해야 한다.
⸻
8. 영상 설명의 기본 공식
제가 가장 추천하는 구조는
WHO
누가
WHERE
어디에서
ACTION
무엇을 하고
CAUSE
왜 다음 일이 발생하고
CONTACT
무엇과 실제로 접촉하며
RESULT
그 결과 무엇이 일어나고
CAMERA
카메라가 어떻게 보여주는지
CONTINUITY
앞 장면과 무엇이 이어지는지
다.
이 구조만 익혀도 영상 프롬프트가 훨씬 안정적이 된다.
⸻
2026년 영상 AI를
**“누가 1등인가?”**로 고르면 오히려 헷갈린다.
지금은 대부분의 모델이
실사
I2V
액션
광고
오디오
멀티샷
을 어느 정도 다 한다.
그래서 중요한 건 성능 순위가 아니라
내가 무엇을 가장 강하게 통제하고 싶은가
다.
현재 주요 영상 AI를 역할 기준으로 나누면 이렇게 보는 게 가장 이해하기 쉽다. 👇
⸻
1/ Veo 3.1
= 촬영감독형
핵심은
SHOT QUALITY
이다.
Google 공식 가이드는
Shot framing
Camera movement
Lighting
Character
Location
Action
Dialogue
Audio
를 구체적으로 설계하는 방식을 강조한다.
즉 Veo에서 중요한 질문은
“이 영상을 만들까?”
보다
“이 장면을 어떻게 촬영할까?”
다.
영화 같은 한 장면,
광고 Hero Shot,
감정 연기,
시네마틱 실사 영상에 특히 잘 맞는다.
한 줄 요약:
Veo = Shot을 완성한다
⸻
2/ Seedance 2.5
= 연출감독형
핵심은
STORY CONTINUITY
다.
ByteDance는 Seedance 2.5를
30-second storytelling with precise reference control
로 설명한다.
최대 30초 생성, extension, reference control, editing을 지원한다.
즉 중요한 질문은
“이 캐릭터와 이야기가 30초 동안 어떻게 이어질까?”
다.
예:
분장실
→ 복도
→ 무대 뒤
→ 무대
처럼 장면이 바뀌어도
캐릭터와 이야기 흐름을 유지해야 하는 영상.
한 줄 요약:
Seedance = Story를 이어간다
⸻
3/ Wan 3.0
= 스토리보드형
핵심은
TIMELINE CONTROL
이다.
Alibaba 공식 프롬프트 가이드는 아예
Overall Description
Shot Number
Timestamp
Shot Content
구조를 제공한다.
예:
Shot 1 [0–3s]
Shot 2 [3–7s]
Shot 3 [7–12s]
즉 Wan의 핵심 질문은
“몇 초에 어떤 Shot을 보여줄까?”
다.
Seedance와 비슷해 보여도 차이는 명확하다.
Seedance
→ 이야기를 이어가는 데 강함
Wan
→ 내가 정한 시간표와 컷 구조를 실행하는 데 강함
한 줄 요약:
Wan = Timeline을 설계한다
⸻
4/ Runway Gen-4.5
= 애니메이터형
핵심은
MOTION CONTROL
이다.
Runway 공식 I2V 가이드는
이미지가
subject
composition
lighting
style
을 정의하고,
프롬프트는
motion
camera work
temporal progression
을 설명한다고 안내한다.
즉 이미 좋은 이미지가 있다면
다시 외모와 배경을 길게 설명할 필요가 없다.
중요한 건
“이 프레임 안에서 무엇이 어떻게 움직일까?”
다.
예:
카메라는 오른쪽으로 천천히 이동
인물은 고개를 돌림
머리카락은 바람에 반응
커튼은 약하게 흔들림
한 줄 요약:
Runway = Frame을 움직인다
⸻
5/ Kling 3.0 Omni
= 배우 연출형
예전에는 Kling을
“액션에 강한 AI”
정도로 많이 설명했지만
최신 Kling 3.0은 범위가 훨씬 넓어졌다.
공식 발표 기준
multi-shot
native audio
reference-to-video
storyboard
in-video editing
stronger consistency
를 지원한다.
그리고 Kuaishou는
dynamic performances
multi-shot storytelling
character consistency
를 강조한다.
즉 핵심 질문은
“이 캐릭터가 화면 안에서 어떻게 행동하고 연기할까?”
다.
액션
댄스
패션 워킹
캐릭터 연기
두 사람의 대화
처럼 사람의 행동 자체가 중요한 영상에 잘 맞는다.
한 줄 요약:
Kling = Actor를 연출한다
⸻
6/ MiniMax H3
= 크리에이티브 조립형
H3의 핵심은 다른 모델과 꽤 다르다.
MiniMax 공식 예시는
Video 1의 카메라 움직임
Image 2의 캐릭터
Audio 3의 음악
을 서로 다른 역할로 사용한다.
즉
Image 1 = Identity
Video 1 = Motion
Video 2 = Camera
Audio 1 = Music
처럼 제작 자산을 따로 주고
“이 재료들을 어떤 관계로 조립할 것인가?”
를 설명하는 구조다.
그래서 광고, MV, 브랜딩, 제품 영상처럼
이미지·영상·오디오 자산이 여러 개 있을수록 장점이 커진다.
한 줄 요약:
H3 = Assets를 오케스트레이션한다
⸻
7/ Grok Imagine Video 1.5
= 빠른 제작 반복형
Grok도 단순히
“영상 잘 만드는 AI”
라고 보면 차별점이 약하다.
xAI는 Grok Imagine Video 1.5에서
better motion
better physics
better audio
faster speeds
를 강조한다.
T2V
I2V
Reference-to-video
1080p
native audio
를 지원한다.
여기서 가장 중요한 포인트는
빠른 iteration
이다.
즉 질문은
“이 아이디어를 얼마나 빨리 영상으로 시험하고 여러 버전을 비교할까?”
다.
SNS 숏폼
제품 데모
콘셉트 테스트
짧은 광고 초안
여러 버전 비교 생성
에 잘 맞는다.
한 줄 요약:
Grok = Idea를 빠르게 테스트한다
⸻
8/ 결국 차이는 이렇게 보면 된다
Veo
→ Shot
Seedance
→ Story
Wan
→ Timeline
Runway
→ Motion
Kling
→ Performance
H3
→ References
Grok
→ Iteration
이렇게 잡으면 겹치지 않는다.
⸻
영상 자막을 아직 손으로 달고계신가요?
그럼 당장 이거 받아가세요
클로드에게 자막이나 대사만 채팅으로 보내주면
오디오에서 실제 말소리를 직접 찾아서
대사가 시작되는 순간 자막이 나타나고,
끝나는 순간 자동으로 사라집니다.
기본값은 윗줄 영어, 아랫줄은 한국어로
두 줄 자막이 작게 들어가고
세로 영상인지 가로 영상인지 따로 말하지 않아도
영상 비율을 알아서 인식해 맞춰줍니다.
폰트는 장르별 프리셋이 22종이라
원하는 장르만 말하면 되고,
무료 폰트 73종도
첫 사용 때 자동으로 설치됩니다.
스킬 다운로드 링크는 댓글에
결론은 대략 18만원 들여서 1분 40초대 영상 4개 만들었다임. 그래도 무제한 덕분에 영상 생성은 많이 해봄. 저같은 초보님들 혹시나 폰으로 폴로앱에 돈지랄 하지 마세요(나말고 없을듯) 할거면 꼭 웹으로 지르세요. 아니 그냥 폰으로 뭘 하지마...이상 왕초보 ai영상 제작 도전:더 비기닝이었슴.
내가 무슨 짓을 하고있냐면(짓이라는걸 깨달음) 폰만 가지고 ai 영상 만들고 있었음. 아 물론 만들수 있지 만들수 있는데 사서 개고생이란거임. 물론 나는 사서 개고생 전문이긴 함.
처음엔 챗지피티로 예쁜 이미지 뽑아서 움직이는게 재밌었음. 근데 이제 그걸 어쩌다보니 폴로ai에서 시작함.
그렇게 만든 그 조잡한 영상을 봐주신 2만여분께 진심으로 감사하고..유료플랜에 미니맥스만큼은 계속 무제한으로 쓰게해줘서 다음 영상 계속 만들수 있게 해준 폴로도 고맙고..어 그동안 즐거웠고. 이제 지피티와 미니맥스와 폰만으로는 진짜 한계가 와버린거임. 인물 클로즈업만 할순 없잖아요 하