김뢰(金磊), 아페이쓰(凹非寺)에서 발송
量子位 | 위챗 공식계정 QbitAI
정말너무 싸다。
맞혀 보세요, 제가 아래처럼 크게 유행한 것을 하나 만들었다면GTA 6스타일《사악한 할멈》, 얼마나 많은 돈이 들었는가?
영상 주소:
링크: https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
1분에 30위안? 20위안?
전부 다 필요 없습니다——
단지5.4위안!환산해 보면,1초에 단 0.09위안입니다.
그래서 대체 어떤 AI가 이렇게 저렴한 걸까요?
돌려 말하지 않겠습니다. 바로 생수科技(Shengshu Technology)가 막 공개한Vidu Q4 미리보기 버전。
영상 주소:
링크: https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
다만 0.09위안/초는 시작 가격일 뿐, 720P에 해당하는 가격이며 해상도와 모드에 따라 가격이 다릅니다. 하지만 어쨌든같은 돈으로 5배의 장면을 찍는。
것입니다. 가격 외에도 Vidu Q4 미리보기 버전은 최고 4K 직접 출력이 가능하고, 2K, 4K 같은 초고화질 사양도 대량으로 생성할 수 있습니다. 참조 소재 측면에서는 한 번에 최대 15장의 참조 이미지와 3개의 참조 오디오를 사용할 수 있습니다.
물론,연기면에서도 Vidu Q4 미리보기 버전은 여전히 완벽하게 소화할 수 있습니다.
예를 들어 우리는 여전히 사악한 할머니로 외전을 만들었는데, 배경은 남편이 나중에 그녀가 젊을 때 좋아하던 노래를 흥얼거렸고, 할머니는 상대가 줄곧 자신의 취향을 기억하고 있었다는 것을 깨닫고 눈물을 흘리는 것입니다:
영상 주소:
3, 2, 1: https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
그렇다면 Vidu Q4 프리뷰 버전은 다른 면에서의 성능은 어떨까요?
자, 심층 실습 한 번 돌려보겠습니다~
연기력도 뛰어난데 가격도 저렴
실습 조작 방법은 정말 간단합니다. 먼저참고 소스 비디오 생성페이지로 이동해서 필요한 자산(이미지, 오디오 등)을 업로드한 뒤, 각각 프롬프트의 해당 위치에 넣어주면 됩니다.
모델은 Vidu Q4 프리뷰 버전을 선택했고, 구체적인 요구에 따라 길이, 해상도, 가로세로 비율, 생성 개수를 조정하면 됩니다:
첫 번째 실습에서는 Vidu Q4 프리뷰 버전의연기력。
을 살펴보겠습니다. 앞서의 할머니와 달리 이번에는 주인공을 외국인 남녀 두 명으로 바꾸고 대사도 영어로 바꿨습니다:
영상 주소:
3, 2, 1: https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
최종 결과를 보면, 일회성 생성임에도 불구하고 영화·드라마에서 흔히 볼 수 있는 정반대 촬영(오버 숄더 샷, 두 사람이 대화할 때 한쪽 어깨 너머로 상대방을 찍고 번갈아 전환하는 방식) 역시 안정적으로 출력을 유지했습니다.
연기력에 있어서 이런 대사 없는 멈춤은 아마 크게 울고 웃는 것보다 더 어려운 편일 것입니다.
문예 장면을 봤으니 이제액션 장면의 효과를 살펴보겠습니다.
Vidu 사용자 “星火279”가 만든 만화풍의극한의 격투 장면:
을 바로 보겠습니다. 영상 주소:
3, 2, 1: https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
전체 영상은 10초 정도로, 질주든 충돌이든 장면 전환이든 모든 디테일이 흔들림 없이 일관되게 유지됩니다.
이제 좀 상상력을 발휘해 볼까 합니다.
이번 설정은 구름 바다 위에 떠 있는 거대한 설비입니다. 우주 비행사가 관측 플랫폼 위에 서서 맞은편의 육각형 기계 프레임과 중앙의 어두운 원판을 바라보고 있습니다:
영상 주소:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
이 영상에서 AI의 실력을 가장 잘 보여주는 것은 사실 빛이다.
거대 구조물이 밝아지는 그 몇 초 동안, 우주인의 흰색 우주복과 곁의 난간, 발밑의 구름 바다는 모두 따뜻한 주황빛으로 물들었다. 빛이 어두워지면 화면은 다시 원래의 차가운 하늘빛으로 돌아갔다.
Vidu Q4 미리보기 버전의 특수효과가 화면 위에 덧씌워진 필터가 아니라 주변 환경에 실제로 영향을 미치고 있음을 확인할 수 있습니다.
마지막으로, 실용적인 것 하나 더 소개합니다커피 광고:
동영상 주소:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
매끄럽다, 여전히 아주 매끄럽다.
그리고 중요한 점은, 방금의 모든 영상을 720P 가격으로 계산하면, 총 6개의 영상, 약 110초 분량을 만드는 데 겨우 다음 금액밖에 들지 않았다는 것입니다.10위안도 안 듭니다!
또한 많은 Vidu 사용자들도 더욱 흥미로운 활용법을 공유했는데, 예를 들어국화풍의 동영상:
영상 주소:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
그리고카툰 고대풍의:
영상 주소:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
그렇습니다, Vidu Q4 프리뷰 버전은 바로 그런“빠르고, 좋고, 많고, 저렴한”류의첫 번째 티어영상 AI입니다.
어떻게 해낸 걸까요?
이렇게 한 바퀴 테스트를 마치고 나니, 하나의 의문이 자연스럽게 생겨났습니다:
같은 AI 영상인데도 Vidu Q4 프리뷰 버전은 왜 할머니의 눈물, 뒷마당의 침묵, 승강장의 주먹질까지 모두 그럴듯하게 연기해낼 수 있을까?
먼저 포지셔닝 관점에서 보면, Vidu Q4는 생수테크(生数科技)의 차세대 비디오 생성 플래그십 모델로, 이 세대의 목표는 바로전달력 있는 표현력。
이번에 공개된 프리뷰 버전은 Q4가 크리에이터를 위해 출시한 첫 번째 버전으로, 세 가지 기능을 먼저 선보였습니다: 인물 연기가 더 생생해지고, 카메라 언어에 더 많은 긴장감이 살아나며, 시각 효과 장면의 임팩트가 더 강력해졌습니다.
반면 이 세 가지 능력은 바로 많은 AI 영상이 가장 쉽게 들통나는 부분이기도 하다.
첫 번째는연기。많은 AI 인물의 문제는 사람처럼 보이지 않아서가 아니라, 연기하는 것 같지 않다는 점이다: 표정이 일부러 내세운 듯하고, 감정이 갑자기 변해버려 그 사이에 전환 과정이 없다. Q4 프리뷰 버전에서 이번에 강화된 것은 바로 표정, 감정, 신체 동작의 섬세함이다.
그 외에도 소리도 연기에 도입되었습니다. 앞서 말씀드린 것처럼 Q4 미리보기 버전은 최대 3개의 참조 오디오를 지원하는데, 이는 캐릭터에 먼저 음성 샘플을 지정해두면 모델이 그 음색을 따라 대사를 말하는 것으로 이해할 수 있습니다. 이렇게 하면 동일한 캐릭터가 장면이 바뀌고 감정이 바뀌어도 목소리는 여전히 그 사람이며, 말할 때에도 감정을 담을 수 있습니다.
두 번째는렌즈。Vidu Q4 미리보기 버전은 팔로우 숏, 서라운드, 푸시-풀, 크레인과 같은 카메라 워킹에서 인물, 피사체, 공간 간의 관계를 더욱 안정적으로 유지할 수 있으며, 같은 생성 안에서 원경, 중경, 근경 사이를 오갈 수 있습니다.
FPV 시점도 지원하는데, 바로 경주용 드론(크로스머신)처럼 장면에 바짝 붙어 고속으로 날아가는 1인칭 샷입니다. 한 클립 최장 16초로, 연속 동작과 카메라 진입에 여유를 남겨두기 딱 좋습니다.
영상 주소:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
그 아래로는특수효과와 질감。
폭발 하나를 만드는 것은 사실 어렵지 않다. 어려운 것은 대개 폭발 이후의 일이다. 불빛이 주변을 비추는지, 연기와 파티클이 움직이는 방향을 따라 퍼지는지, 인물의 동작이 특수효과의 리듬과 맞아떨어지는지가 그렇다.
Vidu Q4 미리보기 버전이 이번에 개선한 것은, 특수효과가 인물·환경·카메라와 함께 변화하도록 만드는 것이다. 앞서 실사용 테스트에서 거대 구조물에 불이 켜지던 그 몇 초 동안 우주복과 구름바다가 함께 따뜻한 주황빛으로 물들었던 것이 바로 이런 효과를 말한다.
그리고화질부분에서 Vidu Q4 미리보기 버전은 최대 4K 직접 출력을 지원한다. API로 연동되는 MaaS든, Vidu 제품에서 바로 사용하는 SaaS든 모두 4K 화면을 얻을 수 있다.
마지막 항목은다중 참조이다. 이것은 AI가 얼마나 사용하기 편한가의 문제와 더 관련이 있다. Vidu Q4 미리보기 버전은 최대 15장의 참조 이미지와 피사체 참조를 지원하며, 인물·의상·소품·장면을 각각 서로 다른 참조 이미지에 맡기고, 텍스트로 이들 사이의 관계를 설명할 수 있다. 앞부분에 나온 그 할머니처럼 광장, 폐품 수거장, 거리 사이를 오가면서도 인물의 외형이 앞뒤로 일치해야 하는 경우, 이런 능력은 특히 유용하다.
연기, 렌즈, 특수효과, 멀티 레퍼런스, 이 몇 가지를 하나씩 떼어놓고 보면 새로운 단어는 아니지만, 이것들을 동시에 잘 해내고 가격까지 초당 몇 십 센트, 심지어 몇 센트 수준으로 낮추면 이야기가 좀 달라진다.
싸기 때문에 더 감히 시도할 수 있다
AI 영상을 만져본 적 있는 분들이라면뽑기(抽卡)라는 단어는 이미 낯설지 않을 것이다.
지금은 뽑기 자체가 창작의 일부가 되었지만, 현실은 뽑을 때마다 돈이 타들어 가고, 많은 아이디어를 다 시도해 보기도 전에 예산이 먼저 바닥난다는 것이다.
다만 가격이 내려가면 이런 망설임이 확실히 훨씬 줄어든다. 창작자 입장에서는 AI 영상 제작이 드디어 휴대폰으로 사진 찍듯이 셔터를 여러 번 누르고, 마음에 들지 않으면 다시 찍는 방식이 가능해진 것이다.
우리가 직접 실측한 과금 방식으로 계산해 보면, 모든 컷을 두세 번씩 다시 뽑더라도 방금 몇 개 영상의 비용은 20~30위안 정도에 불과하다. 실제 창작에 적용하면 바로"같은 돈으로 5배의 극"。
알려진 바에 따르면 Vidu Q4 프리뷰 버전의 가격은 규격과 연동되어 있다. MaaS 측 이미지 생성 영상은 720P 약 0.6위안/초, 1080P 약 0.75위안/초이며 등급별 가격 메커니즘을 갖추고 있다. SaaS 측은 프리뷰 단계에서 두 달간 한시 할인을 진행하여 일부 사용 비용을 초당 몇 센트 수준까지 낮출 수 있다. 가장 합리적인 가격을 이용하려면 먼저 자신이 선택한 규격이 무엇인지 확인해야 한다.
가격 이야기를 마쳤으니, 다시 이번 몇 차례의 실측을 돌아보면 Vidu의 작품에는 꽤 뚜렷한 특유의 분위기가 있다는 것을 알 수 있다.
할머니가 붉은 부채를 휘두르며 폐품 처리장에 뛰어들고, 애니메이션 캐릭터 두 사람이 주먹질을 주고받으며, 바다 위 구름의 거대 구조물이 굉음과 함께 점등된다. 그런데 렌즈가 돌아서면, 할머니는 눈물을 머금으며 웃을 수 있고, 뒷마당의 남녀도 침묵을 사이에 두고 대치할 수 있다.
뜨겁고, 열정적이며, 큰 액션도 감히 소화하면서도 섬세한 문예극도 연기할 수 있다. 우리는 이런 느낌을"Vidu 특유의 맛"。
이 맛은 어디서 오는 걸까? 아마도 생수科技(Shengshu Technology)가 말한 대로, Vidu의 연구개발 팀에는 매우 젊은 기술 핵심 인재들이 모여 있으며, 이들은 모델 지표만 바라보는 것이 아니라 게임, 애니메이션, 영화, 시각특수효과에 대해서도 항상 높은 감수성을 유지하고 있다.
어떤 면에서 소위 "Vidu 특유의 맛"이란, 이 젊은 개발자들이 자신들의 기술적 미감과 창작 취향을 조금씩 모델에 학습시킨 결과인 셈이다.
프리뷰 버전조차 이미 이렇게 연기를 잘해내는데, 정식 버전은 우리가 더 기대해 볼 만하다.
마지막으로, 혜택 하나 전한다:
오늘부터 Vidu.cn에 접속하면 신규 사용자 등록 시 500포인트를 증정한다(초대 코드: LIANGZIQ4).
