Jin Lei, desde Aofeisi
QbitAI | Cuenta oficial de WeChat QbitAI
QuéDemasiado barato。
Adivina, si hago uno de estos que se vuelven virales, como el de abajo,GTA 6Estilo《Abuela Malvada》¿, cuánto costó en realidad?
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
¿Un minuto, 30 yuanes? ¿20 yuanes?
Nada de eso——
Solo cuesta¡5.4 yuanes!Haciendo el cálculo,un segundo cuesta solo 0.09 yuanes.
¿Y qué IA es tan barata?
Sin más rodeos, se trata de laVidu Q4 versión preview, recientemente abierta por Shengshu Technology。
Enlace del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
Sin embargo, 0.09 yuanes/segundo es solo el precio inicial, que corresponde a 720P; los precios varían según la resolución y el modo; pero al final se trata decon el mismo dinero, rodar 5 veces más。
Además del precio, la Vidu Q4 versión preview ofrece una calidad de imagen de hasta 4K directamente, y especificaciones ultra HD como 2K y 4K también pueden generarse en gran volumen; en cuanto al material de referencia, se pueden usar hasta 15 imágenes de referencia y 3 fragmentos de audio de referencia a la vez.
Por supuesto,en cuanto a la actuación,la Vidu Q4 versión preview también lo maneja con precisión.
Por ejemplo, una vez más usamos a la malvada abuela para un extra: el trasfondo es que el esposo luego tarareó una canción que a ella le gustaba cuando era joven, y la abuela, al darse cuenta de que él siempre recordaba sus gustos, no pudo contener las lágrimas:
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
Entonces, ¿cómo se desempeña la versión preliminar Vidu Q4 en otros aspectos?
Vamos, con una ronda de pruebas a fondo, allá vamos~
Puede actuar con gran destreza y además es muy barato
El método de operación probado en la práctica es realmente muy sencillo; vamos aVideo de referencia generativoEn la página, primero sube los recursos necesarios (imágenes, audio, etc.) y luego insértalos cada uno en la posición correspondiente dentro del prompt.
Elegimos el modelo Vidu Q4 versión de vista previa; según las necesidades específicas, basta con ajustar la duración, la resolución, la relación de aspecto y la cantidad de generaciones:
En la primera ronda de pruebas reales, veamos la versión preliminar de Vidu Q4.Actuación。
A diferencia de la anciana de hace un momento, esta vez cambiamos a los protagonistas por una pareja formada por un hombre y una mujer extranjeros, y los diálogos también pasan a ser en inglés:
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
En cuanto al resultado final, incluso generando de una sola vez, este plano/contraplano tan común en películas y series (cuando dos personas dialogan, la cámara toma a una por encima del hombro de la otra y luego alterna entre ambas) sigue manteniendo una salida estable.
Para la actuación, este tipo de pausa sin diálogo quizás resulte más difícil que llorar o reír a carcajadas.
Terminamos de ver la parte dramática; ahora veamosEscena de combatecuál es el efecto.
Vamos a ver directamente una obra de estilo cómic realizada por el usuario de Vidu “星火279”.Escenas de lucha electrizantes:
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
El video completo dura unos 10 segundos; ya sea en las carreras, los impactos o los cambios de cámara, todos los detalles se mantienen de manera estable y consistente.
A continuación, pasemos a algo muy imaginativo.
Esta vez, la ambientación es una gigantesca estructura suspendida sobre un mar de nubes. La astronauta se encuentra en una plataforma de observación, frente a un marco mecánico hexagonal y un disco oscuro central:
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
Lo que mejor demuestra la destreza de la IA en este video es, en realidad, la luz.
Durante los pocos segundos en que la megaestructura se ilumina, el traje espacial blanco del astronauta, las barandillas a su lado y el mar de nubes bajo sus pies se tiñen de un tono naranja cálido; cuando la luz se apaga, la escena vuelve al cielo frío original.
Podemos ver que los efectos especiales de Vidu Q4 en versión de vista previa no son un filtro superpuesto a la imagen, sino que realmente afectan al entorno circundante.
Por último, uno más prácticoAnuncio de café:
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
Fácil de usar, sigue siendo muy fácil de usar.
Y lo más importante es que, si calculamos todos los videos anteriores al precio de 720P, en total 6 videos y alrededor de 110 segundos, solo costaron¡Por menos de 10 yuanes!
Hay muchos más usuarios de Vidu que también han compartido formas de uso más interesantes, por ejemploEstilo de pintura china tradicionaldel video:
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
así comoEstilo caricaturesco de la antigüedadde:
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
Bueno, Vidu Q4 en versión de vista previa, es de ese tipo"Más rápido, mejor, más y con menos gasto"dePrimera divisióndel video con IA.
¿Cómo se logró?
Entonces, tras terminar esta ronda de pruebas, surge una pregunta:
Así siendo también video con IA, ¿por qué la versión preliminar Vidu Q4 logra que las lágrimas de la abuela, el silencio en el patio trasero y los golpes en el andén parezcan tan reales?
En primer lugar, desde el punto de vista del posicionamiento, Vidu Q4 es el modelo insignia de nueva generación de generación de video de Shengshu Technology, y el objetivo de esta generación esExpresividad vívida。
La versión de vista previa publicada esta vez es la primera que Q4 lanza para los creadores, y ha presentado tres capacidades: interpretación de personajes más vívida, lenguaje de cámara con mayor tensión dramática y escenas de efectos visuales con más impacto.
Y estas tres capacidades son precisamente los puntos donde muchos videos de IA muestran más fácilmente sus defectos.
El primer elemento esHabilidad de actuación。El problema de muchos personajes de IA no es que no se parezcan a humanos, sino que no parecen estar actuando: sus expresiones parecen posadas, sus emociones cambian de golpe y falta transición entre medio. Lo que la versión de vista previa Q4 ha reforzado precisamente es la finura de las expresiones, las emociones y los movimientos corporales.
Además de esto, el sonido también se ha incorporado a la representación. Como acabamos de mencionar, la versión preliminar Q4 admite hasta 3 fragmentos de audio de referencia, lo que puede entenderse como asignar primero una muestra de voz al personaje, y el modelo pronuncia los diálogos siguiendo ese timbre. De este modo, aunque el mismo personaje cambie de escena o de estado emocional, la voz sigue siendo la de esa persona y puede hablar transmitiendo emoción.
El segundo punto esobjetivo。La versión preliminar de Vidu Q4, en movimientos de cámara como seguimiento, órbita, dolly y grúa, puede mantener con mayor estabilidad las relaciones entre las personas, los sujetos y el espacio; dentro de una misma generación, además, puede alternar entre plano general, plano medio y primer plano.
También es compatible con la perspectiva FPV, es decir, ese tipo de plano en primera persona de un dron de carreras que vuela a alta velocidad pegado al escenario. Un solo clip dura como máximo 16 segundos, lo que deja justo el margen necesario para acciones continuas y avances de cámara.
Dirección del video:
https://mp.weixin.qq.com/s/Up_tCeaXu3_r2cDYHU1UEQ
Más abajo estáefectos especiales y texturas。
Generar una explosión en realidad no es difícil; lo difícil suele ser lo que viene después de la explosión: si el fuego ilumina el entorno, si el humo y las partículas se dispersan siguiendo la dirección del movimiento, si las acciones de los personajes pueden ajustarse al ritmo de los efectos especiales.
Lo que la versión preliminar de Vidu Q4 mejora en esta ocasión es precisamente que los efectos especiales cambien junto con las personas, el entorno y la cámara. En nuestra prueba anterior, esos segundos en que la megaestructura se iluminaba, con el traje espacial y el mar de nubes teñidos juntos de un naranja cálido, nos referimos exactamente a ese tipo de efecto.
Y en cuanto acalidad de imagenla versión preliminar de Vidu Q4 admite salida nativa de hasta 4K. Tanto mediante MaaS integrado vía API como mediante SaaS directamente en el producto Vidu, se puede obtener imagen en 4K.
El último punto esmulti-referenciaque tiene más que ver con la facilidad de uso de la IA. La versión preliminar de Vidu Q4 admite hasta 15 imágenes de referencia y referencias de sujeto; las personas, la ropa, los accesorios y los escenarios pueden asignarse a diferentes imágenes de referencia, y luego explicarse con texto las relaciones entre ellos. Como la anciana del principio, que debía alternar entre la plaza, el depósito de chatarra y la calle, y cuya imagen del personaje debía mantenerse consistente de principio a fin, para este tipo de casos esta capacidad resulta especialmente útil.
Aunque actuación, cámara, efectos especiales y múltiples referencias no son términos nuevos si se consideran por separado, hacerlas bien todas al mismo tiempo y además bajar el precio a unos pocos jiaos por segundo, o incluso a unos pocos fen, ya cambia bastante las cosas.
Porque, al ser barato, se atreve uno más a ensayar y equivocarse
Quienes ya han jugado con los videos de IA, sin duda estarán familiarizados con el término"gachapón"(tirar de cartas al azar).
Porque ahora, el gachapón se ha convertido en parte del proceso creativo, pero la realidad es que cada tirada quema dinero, y muchas ideas se quedan sin probarse porque el presupuesto se agota primero.
Pero si el precio baja, esa duda disminuye notablemente. Para los creadores, hacer videos con IA por fin puede ser como tomar fotos con el móvil: pulsar el obturador varias veces y repetir si no queda satisfecho.
Según la forma de facturación que probamos nosotros, incluso si cada plano se vuelve a generar dos o tres veces, el coste de los videos de recién apenas llega a veinte o treinta yuanes; en la creación real, eso significa"el mismo dinero, 5 veces más función"。
Según se sabe, el precio de la versión de vista previa de Vidu Q4 está ligado a las especificaciones. En el lado MaaS, la generación de video a partir de imagen cuesta unos 0.6 yuanes/segundo en 720P y unos 0.75 yuanes/segundo en 1080P, con un mecanismo de precios por niveles; en el lado SaaS, durante la fase de vista previa se ofrece una promoción por tiempo limitado de dos meses, con la que parte de los costes de uso puede bajar a unos pocos fen por segundo. Para conseguir el precio más ventajoso, hay que fijarse bien en qué especificación se elige.
Tras hablar del precio, si volvemos la mirada a estas rondas de pruebas, se descubre que las obras de Vidu tienen un carácter bastante distintivo.
Una anciana agita un abanico rojo irrumpiendo en un depósito de chatarra, dos personajes de anime intercambian golpes, una megaestructura sobre un mar de nubes se enciende con un estruendo; pero con un cambio de plano, la anciana también puede sonreír entre lágrimas, y esa pareja en el patio trasero puede enfrentarse en silencio.
Ardor, intensidad, atrevimiento en las grandes acciones, y a la vez capacidad para interpretar escenas dramáticas sutiles. Queremos llamar a esta sensación"el sabor Vidu"。
¿De dónde viene ese sabor? Quizás, como dice Shengshu Technology, en el equipo de desarrollo de Vidu se reúne un grupo de jóvenes y sólidos técnicos que no solo se fijan en las métricas del modelo, sino que mantienen una gran sensibilidad hacia los videojuegos, el anime, el cine y los efectos visuales.
En cierto modo, el llamado "sabor Vidu" es este grupo de jóvenes desarrolladores que ha ido entrenando su propia estética técnica y sus gustos creativos, poco a poco, dentro del modelo.
Si ya la versión de vista previa actúa tan bien, entonces la versión oficial merece que esperemos de ella todavía más.
Por último, aquí va una ronda de regalos:
A partir de hoy, al iniciar sesión en Vidu.cn, los nuevos usuarios registrados reciben 500 puntos (código de invitación: LIANGZIQ4).
