AI 영상은 시간 순서를 모른다 — Veo 3.1 Extension 실험 회고 (2편)
1편에서 AI 숏폼 자동화 파이프라인을 5일 만에 구축했다. 영상당 조회수는 700~900회였다. 제작 자동화는 구현했지만 조회수는 기대에 못 미쳤다. 이 글에서는 영상 길이와 품질을 개선하려던 실험, 그리고 업로드를 늘린 뒤 조회수가 줄어든 경험을 돌아본다.
1. 문제 정의
목표는 조회수를 올리는 것이었다. 가설은 세 갈래로 세웠다.
- 영상 품질 — 더 자연스러운 세척 영상이 시청 완료율을 높인다.
- 영상 길이 — 8초짜리 클립보다 긴 영상이 세척 과정을 충분히 보여 줘 시청 시간을 늘린다.
- 주제 다양성 — PC 부품 청소 외의 주제를 다루면 더 넓은 시청자층에 도달한다.
이 글에서는 길이 가설을 중심으로 다룬다. 영상을 늘리는 것부터 어려웠다. 연장 구간에서 세척 장면의 연속성이 깨졌기 때문이다.
2. 접근
길이 가설 — 왜 15초인가
당시 제작 목표는 60초였다. 15초짜리 클립 여러 개를 묶으면 목표 길이를 채울 수 있겠다고 생각했다. 60초는 이 프로젝트의 제작 목표이며 Shorts의 최대 길이는 아니다. YouTube는 2024년 10월 15일 이후 업로드한 정사각형·세로형 영상에 대해 최대 3분까지 Shorts로 분류한다고 안내한다. (YouTube 공식 안내)
실험에서는 Veo 3.1로 8초짜리 클립을 생성한 뒤 Extension API로 7초를 더 생성해 15초로 늘렸다. 연장은 기존 영상의 끝부분을 바탕으로 후속 영상을 생성하는 방식이다. (Google 공식 문서)
그런데 만들어 보니 8초 본편과 7초 연장분의 이음새가 부자연스러웠다. 연장 시점에서 물줄기 방향이 바뀌거나 세척 진행 상태가 되돌아가고, 카메라가 갑자기 이동했다. 1편에서 FFmpeg로 완성된 클립을 이어 붙일 때와 달리 생성 단계부터 장면의 연속성이 깨졌다.
가설 — 시간축 서사 프롬프트
이음새 문제를 프롬프트로 풀 수 있다고 봤다. 세척 과정을 5단계 시간축 서사(충격 → 박리 → 용해 → 복원 → 마무리)로 자세히 서술하면 모델이 순서대로 세척 영상을 생성할 것이라는 가설이었다. 프롬프트에 “먼저 고압수가 충격을 주고, 그다음 표면 오염이 벗겨지고…”처럼 단계별 진행을 명시했다.
검증 — BMAD 실험 게이트
1편에서 쓴 BMAD V6의 단계별 개발 흐름에 실험 게이트를 두었다. 채점 기준과 통과선을 먼저 정하고, 결과가 기준에 못 미치면 다음 구현 단계로 넘어가지 않는 방식이다. 첫 실험에서는 시간 순서 인식, 카메라 변화, 오염의 점진적 변화, 전체 품질을 각각 0~5점으로 평가했다. 통과선은 평균 3.0점이었다. 자동 측정값은 아니며, 생성된 영상을 직접 보고 매긴 점수다.
주제 다양화 — MCP 시장조사
주제를 늘릴 때는 MCP(Model Context Protocol) 검색 도구인 exa와 tavily로 후보를 조사했다. 시각적 만족감을 주는 satisfying 영상 중 어떤 소재를 다룰지 고른 뒤, Gemini 기반 PromptDiversifier로 프롬프트를 자동 변형해 투입했다. 검색 결과는 후보 선정에 활용했으며, 실제 채널에서의 수요까지 검증한 것은 아니었다.
3. 구현·실험
한 달간 생성한 영상은 50편 이상이었다. 테스트 영상과 실제 업로드 영상을 합친 수이며, 모두 같은 조건으로 시간축 서사 가설을 검증한 것은 아니다. 아래는 별도 실험 기록이 남아 있는 GPU 세척 영상의 첫 평가 결과다.
실험 결과 — 0.0/5
약 1,800자의 5단계 프롬프트로 생성하고 15초로 연장한 영상을 채점했다.
| 항목 | 점수 |
|---|---|
| 시간 순서 인식 | 0/5 |
| 카메라 변화 | 0/5 |
| 오염 변화 | 0/5 |
| 전체 품질 | 0/5 |
| 평균 | 0.0/5 |
모든 항목이 0점이었다. 예상보다 낮은 결과라 영상을 다시 보며 어떤 장면에서 기대와 어긋났는지 확인했다.
세척이 단계적으로 진행되지 않고, 오염된 상태에서 갑자기 깨끗한 상태로 바뀌었다.
이 실험에서는 프롬프트에 적은 시간 순서가 영상에 반영되지 않았다. 당시에는 모델이 여러 단계를 하나의 콘셉트로 받아들인다고 해석했다. 하지만 출력 영상만으로 모델 내부의 처리 방식을 확인할 수는 없다.
당시에는 이를 Veo의 한계로 결론지었다. 지금 돌아보면 한 번의 생성과 연장에 다섯 단계의 진행을 맡긴 프롬프트 설계도 돌아봐야 했다. 단계별 클립을 따로 생성해 편집하는 방법도 대안으로 생각할 수 있다. 다만 이 실험에서 실제로 시도한 방향은 세척 과정을 두 단계로 줄이는 것이었다.
피벗
5단계 서사를 2단계 과정으로 단순화했다. 첫 8초에는 세척 과정을 보여 주고, 연장 7초에는 남은 오염을 씻어 내도록 유도했다. 처음에는 8초 안에 세척이 끝나 연장 구간에서 깨끗한 곳에 물만 뿌리는 문제가 있었다. 그래서 프롬프트에 “표면의 때는 씻겨 나가지만 틈새에는 두꺼운 때가 남아 있다”는 상태를 명시했다. 연장 구간이 이어받을 세척 대상을 남긴 것이다.
이후 영상에서는 세척의 진행과 연장 구간의 연결이 나아졌다. 실험 기록의 최종 평가는 평균 5.0/5점이었다. 다만 피벗 후 평가 항목을 과정의 점진성, Extension 전환, 오염 변화, 전체 품질로 바꿨으므로 첫 실험의 0점과 같은 척도에서 비교할 수는 없다.
피벗 후 결과 영상(8초 + 연장 7초). 세척 과정을 단순화하고 남은 오염을 명시한 뒤 얻은 15초 영상이다.
4. 결과
개선 후에도 조회수가 비슷한 영상이 있었고, 일부는 약 1,200회까지 올랐다. 1편의 700~900회보다 높게 나온 사례는 있었지만 품질 개선이 조회수 상승으로 이어졌는지 판단할 비교 실험은 없었다.
한편 채널 두 개에서 업로드를 늘리던 중 조회수가 0인 신규 영상이 나오기 시작했다. 당시에는 추천이 끊겼다고 받아들였다. 다만 기록에 남은 것은 조회수이며, 추천 노출 수나 감소 원인은 확인하지 못했다. 업로드 증가와 조회수 감소가 함께 나타났다는 관찰만으로 플랫폼의 제재나 추천 정책을 단정하기는 어렵다.
5. 학습
이 시도에서 세 가지를 배웠다.
첫째, 생성 구간이 이어받을 상태를 설계해야 한다. 이번 실험에서는 다섯 단계를 자세히 서술해도 원하는 순서가 나오지 않았다. 세척 과정을 줄이고 첫 구간 끝에 틈새 오염을 남기자 연장 구간이 개선됐다. 이 결과에서는 앞 구간의 끝 상태가 뒷 구간의 세척을 이어 갈 단서가 됐다.
둘째, 평가 기준을 먼저 정하면 방향을 바꿀 근거가 생긴다. 첫 실험의 0.0/5점은 해당 결과가 기대에 못 미친다는 판단을 명확히 했다. 다만 직접 매긴 점수에는 평가자의 판단이 들어가며, 기준을 바꾸면 이전 점수와 단순 비교할 수 없다. 실험 간 개선 정도를 비교하려면 공통 평가 항목을 유지하고 변경한 항목을 따로 기록해야 한다.
셋째, 제작 자동화와 채널 성장은 별도로 검증해야 한다. 자동화로 수작업은 줄었지만 영상 생성에는 여전히 API 비용이 들었다. 더 많이 업로드한다고 조회수가 늘지도 않았다. 업로드 빈도가 미친 영향을 확인하려면 조회수뿐 아니라 추천 노출과 시청 지속 시간도 함께 살펴봐야 한다.
PC 부품 청소 주제는 여기서 마무리했다. 파이프라인은 유지했고, 다른 satisfying 주제로도 영상을 만들어 보고 싶었다. 3편에서는 주제를 확장한 과정을 다룬다.