一觉起来,AI视频又双叕要变天了
之前一直困扰各位创作者的“人物一致性问题”,突然迎来了转机。
话不多说,我们先看效果
“一致性”要重点解决的,就是AI生成影视里的IP问题。
“毕竟没有观众想看自己喜欢的电影主角频频换脸吧”
而这一旦被解决,AI创作短剧、电影、绘本、广告等等等等方面的应用都将会有质的飞跃。
比如这里一个广告片的例子
可能上传的商品图片背景、角度都和要做的广告片不相干,但却能生成一些你想要的“高级”效果。
之前想生成同一人物在不同场景的分镜,通常会先用AI绘画的垫图(通常用Midjourney或者sd),或者局部重绘等方法先生成满意的画面,再通过另外的AI视频软件生成动态视频。
操作麻烦不说,保不齐垫图出来不像,还得加一层AI换脸。。。
而现在,只需上传一张参考图就搞定了,何不快哉!
官方的视频合集上面看了,这里我放点自己实测的效果。
先来个索大试试,我用Midjourney生成了个3D版的,有喜欢的朋友可以后台私信多送你几张。
提示词:索隆吃汉堡
“这标志性绿藻头、胸口上的疤痕、佩刀...”
还原的有点到位!
就是这画质堪忧,Vidu啥时候给提升下。
最近正好在看咒术回战,索性再来个五条悟,也不知道后面复活了没,这次专门找了个2D动漫版的看看效果。
提示词:五条悟在看书
这画风,有一说一确实匹配的让我有些喜出望外,不过同样有点小瑕疵,动作连贯性有待进一步加强,另外,旁边这位女士是...
难道直接预测了五条老师的女友?
不过以上对于一致性问题来说都小问题,等待官方下一版本的优化了,你也可以立即在官网免费体验:https://www.vidu.studio/
日本的网友也玩得飞起,果然一上来就是小姐姐
依稀记得半年前AI生成视频另一大Bug“4秒动态PPT效果,运动幅度太小”是咱国产的可灵AI率先开放给大家使用的,这次,是生数科技的Vidu。
而“角色一致性”这一功能,除了同样是我们国内的AI视频生成产品Pixverse有尝试,在Runway和其他软件还暂未看到。
乔老爷子曾经说过:“创新区分领袖和跟随者。”
也许之前,在AI生成视频方面,我们国内的AI厂家普遍都在扮演跟随者的角色。但这一次,不论是可灵AI、Pixverse 的大胆创新,还是Vidu的技术突破,国内的AI技术正在从追赶者转型为引领者,在国际舞台占有重要地位。
不但首发即开放给全球用户体验使用,更是在不断创新,探索AI视频领域的未来走向。
我们曾经在追随,但现在,我们正在引领新的变革。
好了,今天就聊到这里。如果你觉得这篇文章有帮助,记得点赞、收藏、分享给朋友们哦!咱们下次见啦!
附:
Vidu官网:https://www.vidu.studio/
可灵AI官网:https://klingai.kuaishou.com/
Pixverse官网:https://pixverse.ai/
好文章,需要你的鼓励
在迪拜Gitex 2025大会上,阿联酋成为全球AI领导者的雄心备受关注。微软正帮助该地区组织从AI实验阶段转向实际应用,通过三重方法提供AI助手、协同AI代理和AI战略顾问。微软已在阿联酋大举投资数据中心,去年培训了10万名政府员工,计划到2027年培训100万学习者。阿联酋任命了全球首位AI部长,各部门都配备了首席AI官。微软与政府机构和企业合作,在公民服务和金融流程等领域实现AI的实际应用,构建全面的AI生态系统。
Google DeepMind最新研究发现,视频生成AI模型Veo 3展现出惊人的零样本学习能力,能够在未经专门训练的情况下完成图像分割、边缘检测、迷宫求解等多种视觉任务。研究团队通过18,384个视频样本验证了这一发现,认为视频模型正朝着通用视觉智能方向发展,可能引发类似大语言模型的行业变革。
苹果与俄亥俄州立大学研究人员发布名为FS-DFM的新模型,采用少步离散流匹配技术,仅需8轮快速优化即可生成完整长文本,效果媲美需要上千步骤的扩散模型。该模型通过三步训练法:处理不同优化预算、使用教师模型指导、调整迭代机制来实现突破。测试显示,参数量仅1.7亿至17亿的FS-DFM变体在困惑度和熵值指标上均优于70-80亿参数的大型扩散模型。
北航团队开发的GeoSVR技术突破了传统3D重建方法的局限,采用稀疏体素表示和体素不确定性评估,无需依赖初始点云即可实现高精度表面重建。该方法通过智能的深度约束和体素协同优化策略,在DTU等标准数据集上取得了最佳性能,为VR/AR、文物保护、影视制作等领域提供了新的技术选择。