거실 팟캐스트 · 고양이를 인터뷰하다

Gemini Omni Flash리얼리즘코미디고양이댕냥이동물립싱크I2V구조화 프롬프트10초
먼저 레퍼런스 이미지 세 장으로 같은 팟캐스트 방의 투샷·리버스샷을 구성한 뒤, Shoot 1~5 순서대로 사람과 고양이가 한 마디씩 주고받는다. 투 카메라 대화형 숏필름의 완전한 워크플로우.
PROMPT · 영상 생성 프롬프트
AI로 창작 시작
샷 1 @Image 1 : 남자 카메라: (고정 샷, 카메라 무브먼트 없음) 사실적인 팔 동작과 미세한 잔동작. 마이크로 액션: [그가 오른쪽에 있는 고양이에게 휴대폰에 표시된 뉴스 기사를 읽어주고 있다. 다 읽은 후, 그는 고개를 들어 자연스럽고 진짜 같은 놀란 표정을 짓는다. 이 반응은 섬세하고 사실적이며 과장되지 않는다.] 대사: '와, 이거 완전 미쳤네 — 과학자들 말로는 고양이가 하루에 16시간을 잔대.' 보이스: 남성 목소리, 30대, 밝은 톤. 악센트: 중립적인 미국식 억양의 영어, 캐주얼하고 구어체로, 실제 영어 일상 잡담처럼. 샷 2 @Image 2 : 고양이 카메라: (고정 샷, 천천히 푸시인) 사실적인 동작과 미세한 잔동작. 마이크로 액션: [고양이가 방금 들은 말에 동의한다는 듯 고개를 끄덕이며 말한다:] 대사: '맞아, 나머지 8시간은 우리가 다 너 평가하는 데 쓰거든.' 보이스: 고양이가 남성 목소리로 말함, 30대, 낮고 굵은 톤. 악센트: 중립적인 미국식 억양의 영어, 캐주얼하고 구어체로, 실제 영어 일상 잡담처럼. 샷 3 @Image 1 : 남자 카메라: (고정 샷, 카메라 무브먼트 없음) 사실적인 팔 동작과 미세한 잔동작. 마이크로 액션: [그가 잠시 멈춰서 자신의 대답을 생각하는 듯하더니, 이렇게 말한다:] 대사: '잠깐 — 그럼 네가 새벽 3시에 날 빤히 쳐다보는 건 평가하는 거지, 사랑이 아니라는 거야?' 보이스: 남성 목소리, 30대, 밝은 톤. 악센트: 중립적인 미국식 억양의 영어, 캐주얼하고 구어체로, 실제 영어 일상 잡담처럼. 샷 4 @Image 2 : 고양이 카메라: (고정 샷, 천천히 푸시인) 사실적인 동작과 미세한 잔동작. 마이크로 액션: [고양이가 고개를 살짝 갸웃하며 무표정한 얼굴로, 이렇게 말한다:] 대사: '둘 다일 수는 없나?' 보이스: 고양이가 남성 목소리로 말함, 30대, 낮고 굵은 톤. 악센트: 중립적인 미국식 억양의 영어, 캐주얼하고 구어체로, 실제 영어 일상 잡담처럼. 샷 5 @Image 3 : 고양이 + 남자 마이크로 액션: [두 사람이 동시에 반응한다 — 남자는 크게 웃으며 고개를 젓고, 고양이의 수염은 재미있다는 듯 씰룩거린다 — 둘은 함께 웃음을 터뜨린다.] 카메라는 그들의 웃음소리에 맞춰 미세하게 흔들린다.
✍️ 편집자 해설

이건 대화 스크립트 형식이다. 다섯 개 샷이 대화 턴 단위로 나뉘고, 턴마다 카메라 세팅(정지냐 천천히 줌인이냐)을 명확히 표시했으며, 캐릭터의 미세 표정과 대사, 그리고 보이스 디렉션(억양·음색·나이)까지 요구한다. 거의 음성과 영상을 연동할 수 있는 Gemini Omni Flash 같은 모델을 위해 쓴 샷 단위 대본이나 다름없다. 언어는 극도로 압축돼서 한 비트당 동작 하나에 대사 한 줄만 남겼고, 정보 밀도는 한 문장에 형용사를 쌓는 방식이 아니라 턴을 쌓는 방식으로 만들어낸다.

AI로 창작 시작
이미지 프롬프트
PROMPT · 프롬프트 전문
AI로 창작 시작
이미지 1: 아이폰 사진, 화면 속 한 남성이 밝은 색 패브릭 소파에 편안하게 앉아 팟캐스트를 녹음하고 있으며, 한 손에 스마트폰을 들고 읽으면서 롱암 스탠드에 장착된 전문 블랙 팟캐스트 마이크에 대고 말하고 있음. 모던 스타일의 팟캐스트 녹음 스튜디오, 배경은 베이지색 커튼, 실내 인테리어는 아늑하고 미니멀하며, 녹음 장비는 사실적이고 신뢰감 있어, 자유분방한 크리에이터 분위기를 연출함. 아이폰 사진, 눈높이 구도, 즉흥적으로 찍은 듯한 느낌, 아이폰 플래시의 직사광이 만드는 강한 광 효과, 화면에 미세한 그레인감, 사실적인 피부 디테일, 진짜 결점 유지, 자연스럽고 균형 잡힌 조명, 다큐멘터리 같은 느낌, 연출되지 않은 순간, 생활 밀착형 크리에이터 미학. 텍스트 없음, 워터마크 없음, 왜곡 없음. 이미지 2: 이 이미지 @Image 1 을 오직 장면과 스타일의 레퍼런스로만 사용하여, 같은 방에서 같은 팟캐스트를 재현할 것 — 동일한 종류의 소파, 동일하게 스탠드에 장착된 롱암 팟캐스트 마이크, 동일하게 아늑한 홈 리빙룸 분위기, 그리고 비슷한 커튼 배경 — 단, 팟캐스트의 반대편에서 촬영한 구도로, 마치 테이블 맞은편에 앉은 두 번째 게스트를 찍는 것처럼. 배경이 레퍼런스 이미지와 완전히 동일할 필요는 없음: 화분 식물, 구체적인 조명, 쿠션과 소품들은 자연스럽게 달라져도 되며, 화면이 같은 방이라는 것이 분명히 드러나기만 하면 됨. 절대로 레퍼런스 이미지의 거울상(미러 이미지)으로 만들면 안 됨. 맞은편 좌석에서 보여줄 것: 마이크는 이제 화면 왼쪽에서 프레임 안으로 들어오고, 인물은 왼쪽/가운데를 향하고 있으며, 마치 맞은편에 앉은 게스트를 바라보는 듯함. 그곳에 고양이 한 마리를 배치할 것 @Image 2. 사실적이고 리얼함, 피부 질감과 조명이 자연스러움. 단일 이미지. 이미지 3: @Image 1 @Image 2 두 이미지를 결합할 것
✍️ 편집자 해설

사실 이건 영상 생성용이 아니라 이미지 생성의 사전 준비 작업이다. 먼저 Image1로 아이폰 스냅샷 질감의 팟캐스트 사진을 묘사해서 구도와 「candid dump vibe」라는 분위기 단어를 정해놓고, Image2에서는 같은 방을 다른 카메라 위치에서 찍어 대각선 좌석 배치를 만들어달라고 요구한다. 마지막 Image3에 가서야 비로소 사람과 고양이를 한 장의 이미지로 합성한다. 배경 세팅→대칭 카메라 위치 확보→합성이라는 3단계는 표준적인 이미지 엔지니어링 방식으로, 이후 영상 생성을 위한 레퍼런스 이미지를 미리 깔아두는 준비 작업이지 영상 프롬프트 자체는 아니다.

AI로 창작 시작
관련 작품
×