11.6 Commercial Video Models & Future Directions
상용 비디오 생성은 미인 대회가 아니라 통합 문제입니다. 팀은 시간적 일관성, 프롬프트와 참조 이미지 준수, 오디오 타이밍, 편집 가능성, 지연 시간, 가격, 콘텐츠 권리, 안전 제어, 서빙 인터페이스의 안정성을 함께 평가해야 합니다. 멋진 데모는 가능성을 보여 주지만 신뢰할 수 있는 운영 시스템을 증명하지는 않습니다.
2026년 8월 16일 기준 으로 이 절의 제품과 접근 경로는 날짜가 고정된 스냅샷입니다. 이름, 한도, 가격, 가용성은 빠르게 바뀌므로 구매나 출시 전에 공식 문서를 다시 확인해야 합니다.
1. 공급자가 공개한 내용
Google Veo 3.1
Google의 공개 제품 자료는 네이티브 오디오, 참조 기반 제어, 세로형 출력, 해상도 선택, 크리에이터·개발자 제품을 통한 배포를 강조합니다 [1]. 이는 제품 기능입니다. 인코더의 상세 구조, 학습 데이터 혼합, 파라미터 수, 오디오와 비디오를 정렬하는 메커니즘은 인용한 제품 자료에 공개되지 않았습니다.
OpenAI Sora 2
OpenAI의 Sora 2 시스템 카드는 동기화된 오디오가 포함된 비디오 생성과 안전성 평가·완화 조치를 설명합니다 [2]. 이 스냅샷에서 OpenAI 모델 문서는 Sora 2 API 모델을 legacy로 표시합니다 [3]. 연구적 의미, 소비자 제품, API 수명주기는 서로 다른 사실이며 각기 다른 일정으로 변할 수 있다는 점이 중요한 엔지니어링 교훈입니다.
ByteDance Seedance 2.0
ByteDance는 Seedance 2.0이 통합 멀티모달 오디오·비디오 생성 접근을 통해 텍스트, 이미지, 오디오, 비디오 입력을 받는다고 설명합니다 [4]. 공식 발표는 일관성과 제어력을 강조하지만, 정확한 잠재 모듈, 아이덴티티 표현, 파라미터 수, 학습 레시피는 공개되지 않았습니다. 공급자 발표의 성능 주장은 방법론이 호환되는 독립 평가에서 재현되기 전까지 공급자 주장으로 취급해야 합니다.
| 질문 | Veo 3.1 | Sora 2 | Seedance 2.0 |
|---|---|---|---|
| 공개적으로 강조한 기능 | 네이티브 오디오와 크리에이터 제어 | 동기화된 오디오와 문서화된 안전 제어 | 멀티모달 입력과 오디오·비디오 생성 |
| 인용 출처의 아키텍처 상세 | 제품 수준 설명 외에는 미공개 | 일부 연구 프레이밍만 공개, 운영 레시피는 미공개 | 통합 접근은 명시, 내부 모듈은 미공개 |
| 운영상 의미 | 사용할 Google 제품과 quota를 정확히 검증 | API 수명주기와 소비자 가용성을 분리 | 지역별 접근, 약관, 독립 품질을 검증 |
이 표는 보편적인 승자를 선언하지 않습니다. 공급자 데모의 프롬프트, 편집 도구, 평가자는 서로 호환되지 않습니다.
2. 사내 비디오 평가셋 만들기
하이라이트 영상이 아니라 실제 워크플로의 작업에서 시작합니다. 프롬프트, 입력 자산, 지원되는 경우 seed, 생성 설정, 모델 버전, 원본 출력을 불변 평가 manifest에 기록합니다.
| slice | 측정 대상 | 대표 실패 |
|---|---|---|
| 인물·객체 | 컷 전환과 가림 이후의 참조 준수 | 얼굴, 의상, 글자, 객체의 변화 |
| 움직임·기하 | 시간적 일관성과 접촉의 개연성 | 팔다리 증가, 미끄러짐, 객체 소멸 |
| 오디오·대사 | 사건 타이밍, lip sync, 명료도 | 화면은 맞지만 소리가 늦거나 무관함 |
| 연출 가능성 | 카메라, 길이, 화면비, 편집 반응 | 지시 누락 또는 과도한 반영 |
| 운영 | queue 시간, 생성 시간, 재시도, 비용 | tail latency 급증 또는 조용한 작업 실패 |
| 안전·권리 | 정책 차단, 출처, 동의, 초상 | 위험한 출력 또는 불명확한 재사용 권리 |
좌우 위치를 무작위화한 blind pairwise review를 사용하고 동점과 판단 보류를 기록합니다. 하나의 종합 점수는 출시를 막아야 할 실패를 숨길 수 있으므로, 핵심 slice에는 최소 gate를 두고 신뢰구간을 보고합니다. 사람 평가는 일반 선호 평가자뿐 아니라 대상 편집 워크플로를 이해하는 담당자도 포함해야 합니다.
Artifact와 rollback 계약
공급자·모델 식별자, API 버전, 요청 schema, 생성 설정, 안전 설정, 프롬프트 템플릿 버전, 입력 자산 hash, 평가 manifest를 고정합니다. 모델 변경은 전체 배포 전에 canary로 검증합니다. 핵심 안전·권리 사례가 실패하거나, 오류율이 관측 구간의 임계값을 넘거나, 지연 시간·비용이 제품 예산을 벗어나면 중단합니다. 공급자나 모델 업데이트를 애플리케이션 재작성 없이 되돌릴 수 있도록 last-known-good routing 설정을 유지합니다.
3. 시각적 개연성에서 물리 이해를 추론하지 않기
생성된 영상이 물리적으로 그럴듯해 보여도 개입 조건에서는 실패할 수 있습니다. 가림 일관성, 객체 영속성, 동기화된 소리는 관찰 가능한 행동이지, 명시적 3D scene graph, 물리 시뮬레이터, 공유 잠재 이벤트 모듈의 존재를 증명하지 않습니다.
대신 counterfactual을 시험합니다.
- 카메라 경로만 바꾸고 객체 정체성이 유지되는지 확인합니다.
- 행동을 반대로 바꾸고 인과 순서가 개연성을 유지하는지 확인합니다.
- 재질이나 충격 강도를 바꾸고 움직임과 소리가 함께 변하는지 검사합니다.
- 영상을 연장하고 정체성, 기하, 오디오 타이밍이 언제 무너지는지 측정합니다.
- 같은 뜻의 다른 프롬프트로 반복해 특정 표현에만 성공하는지 찾습니다.
이 테스트는 공개되지 않은 메커니즘을 단정하지 않고 행동을 측정합니다.
4. 향후 방향: 영상에서 상호작용 환경으로
interactive world model은 생성에 행동과 지속 상태를 더합니다. Google DeepMind는 Genie 3가 실시간 interactive environment를 생성한다고 설명하면서도, 제한된 행동 공간, 일관성 오류, 무기한이 아닌 수 분 규모의 상호작용 한계를 함께 공개합니다 [5]. 따라서 이는 유용한 연구 방향이지만, 현재의 비디오 제품이 이미 신뢰할 수 있는 물리 시뮬레이션을 구현했다는 증거는 아닙니다.
AI 엔지니어에게 가까운 설계 질문은 구체적입니다. 시스템이 사용자 행동 아래에서 상태를 유지하는가, 불확실성과 실패를 노출하는가, 평가와 rollback을 지원하는가? 20장에서는 특정 아키텍처를 AGI의 확정된 경로로 취급하지 않고 이 시스템 관점을 확장합니다.
Quizzes
Quiz 1: 제품 팀이 공급자 데모만으로 상용 비디오 모델의 순위를 정하면 안 되는 이유는 무엇인가요?
프롬프트, 편집 도구, sampling 설정, 선별 과정이 다르기 때문입니다. 호환 가능한 조건에서 품질, 안전, 지연 시간, 비용, 권리를 비교하려면 실제 작업에 맞춘 사내 평가가 필요합니다.
Quiz 2: 공급자가 모델이 동기화된 오디오를 생성한다고 말할 때 무엇을 결론 내릴 수 있나요?
공개 기능은 시험할 수 있습니다. 하지만 그 사실만으로 통합 인코더, 물리 시뮬레이터, 학습 레시피 같은 공개되지 않은 내부 메커니즘을 알 수는 없습니다.
Quiz 3: 하나의 평균 비디오 품질 점수보다 slice별 release gate가 나은 이유는 무엇인가요?
높은 평균이 치명적인 정체성, 안전, 권리, 오디오 실패를 숨길 수 있기 때문입니다. slice 최소 기준은 일부의 중대한 실패가 평균에 묻히지 않게 합니다.
Quiz 4: interactive world-model 평가는 one-shot 비디오 평가와 무엇이 다른가요?
한 영상의 시각 품질뿐 아니라 행동에 따른 상태 변화, 지속성, 제어 가능성, 상호작용 시간이 늘어날 때의 오류 누적을 시험해야 합니다.
References
- Google. (2026). Veo 3.1 Ingredients to Video: More consistency, creativity and control. Google Blog.
- OpenAI. (2026). Sora 2 System Card. OpenAI.
- OpenAI. (2026). Sora 2 model documentation. OpenAI Developers.
- ByteDance Seed. (2026). Seedance 2.0. Official model page.
- Google DeepMind. (2026). Genie. Official model page.