Vidu 다모달 대규모 모델의 혁신과 실천 사례 QCon 상하이에서 발표 예정
2026년 10월 3일 · 읽는 시간 2분
생수과기 솔루션 책임자인 정중이 QCon 상하이 글로벌 소프트웨어 개발 대회에 참석하여 Vidu 다모달 대규모 모델의 혁신과 실천에 관한 주제 발표를 진행합니다.
이번 발표는 인공지능 생성 콘텐츠가 주도하는 내용 생산력 변혁을 주제로 하며, 비디오 생성 모델이 단순한 영상 생성을 넘어 다중 주체, 다중 렌즈, 장기 시퀀스 및 상호작용 시나리오에서 일관성, 제어 가능성, 실시간 응답 능력을 유지하는 단계로 진입하고 있음을 다룹니다.
정중 책임자는 비디오 생성의 핵심 기술적 도전 과제인 캐릭터와 장면의 일관성, 참조 기반 생성, 렌즈 및 서사 제어, 스트리밍 비디오 생성, 그리고 세계 모델 방향의 탐색을 중심으로 내용을 구성합니다. 특히 Vidu의 모델 반복과 시나리오 실천 과정에서의 기술적 경로를 결합하여, 비디오 생성 모델이 오프라인 생성 도구에서 제어 가능하고 상호작용하며 확장 가능한 내용 생산 기초 능력으로 어떻게 진화하는지 논의할 예정입니다.
발표 내용은 이미지 생성에서 비디오 생성으로 넘어갈 때 발생하는 시간 차원의 추가 문제와 연속된 화면 속 주체, 장면, 동작, 스타일 및 서사 논리의 일관성 유지 방안을 포함합니다. 또한 다중 주체 일관성, 장기 시퀀스 안정성, 동작 제어, 렌즈 언어 및 실시간 응답의 주요 병목 현상을 분석합니다.
전문적인 비디오 창작을 위해 모델이 대본, 캐릭터 관계, 감정 변화, 동작 리듬 및 렌즈 조절을 이해하는 방법과 인공지능 드라마 창작 시나리오에서의 스크립트 이해, 지능형 분할 컷, 운경 계획 및 다중 렌즈 일관성 제어 방안이 소개됩니다. 아울러 초 단위 응답, 무제한 상호작용 시간, 양방향 인지, 즉각적인 명령 준수 및 다모달 입력 출력을 특징으로 하는 Vidu S1 스트리밍 비디오 생성 모델의 방향성과 상호작용형 내용 생산의 의미를 다룹니다.
마지막으로 비디오 모델이 시공간, 동작 및 물리 세계를 이해하는 과정과 세계 행동 모델 방향의 탐색을 통해 비디오 생성, 세계 모델, 그리고 구체화된 지능 사이의 관계를 설명합니다. 이를 통해 비디오 생성 모델이 생성 가능 단계에서 제어 가능 생성, 실시간 상호작용, 그리고 세계 이해 단계로 나아가는 전체 기술 경로를 정리합니다.
한편, 10월 22일부터 24일까지 개최되는 QCon 상하이 대회는 인공지능 네이티브 구조, 에이전트 런타임, 인공지능 인프라, 데이터 시스템, 에이전트 안전 및 관측 가능성, 루프 엔지니어링, 바이브 코딩, 구체화된 지능과 세계 모델, 단말과 클라우드 협업 등 전방위 기술 방향에 집중하며 100명 이상의 전문가가 실전 사례를 공유할 예정입니다.