字节跳动发布Seedance 2.0多模态AI视频生成模型
Seedance 2.0能够考虑摄像机运动、视觉效果和动作细节。
科技巨头在最新AI模型竞赛中持续较量,字节跳动推出了下一代视频生成器。这家TikTok背后的中国公司在博客文章中表示,Seedance 2.0支持结合文本、图像、视频和音频的多模态提示。
公司声称该模型"在生成质量上实现了实质性飞跃",在生成包含多个主体的复杂场景以及遵循指令方面都有显著改进。用户可以通过向Seedance 2.0提供最多九张图像、三个视频片段和三个音频片段来优化文本提示。
该模型能够生成长达15秒的带音频视频片段,同时考虑摄像机运动、视觉效果和动作细节。据字节跳动介绍,它还能参考基于文本的故事板。
过去一年中,AI驱动的视频生成模型变得更加先进,谷歌Veo 3增加了生成音频支持片段的能力,OpenAI推出了Sora 2以及一款允许用户创建具有"超真实动作和声音"视频的新应用。AI初创公司Runway也发布了其AI视频模型的新版本,声称具有"前所未有的"准确性。
在字节跳动分享的一个示例中,展示了两名花样滑冰运动员一起表演的场景,公司表示Seedance 2.0能够"可靠地执行一系列高难度动作——包括同步起跳、空中旋转和精确着冰——同时严格遵循现实世界的物理定律。"
社交媒体上的用户已经开始展示这个新工具的能力,有人发布了一个AI生成的视频,其中包含布拉德·皮特和汤姆·克鲁斯相似形象的电影式打斗场景。《死侍》编剧雷特·里斯转发了这个视频并评论道:"我不得不说,我们可能要完蛋了。"
其他帖子展示了Seedance 2.0生成动漫风格片段、卡通、电影级科幻场景以及看起来像内容创作者制作的视频的能力。目前尚不清楚Seedance 2.0提供什么版权保护措施,在X平台上快速搜索会发现大量包含《龙珠Z》、《恶搞之家》、《宝可梦》等角色的片段。
目前,Seedance 2.0仅通过字节跳动的Dreamina AI平台和其AI助手豆包提供服务。尚不清楚它是否会进入TikTok——特别是现在该应用在美国已经易主。
Q&A
Q1:Seedance 2.0有什么特别的功能?
A:Seedance 2.0是字节跳动推出的多模态AI视频生成模型,支持结合文本、图像、视频和音频的提示。用户可以提供最多九张图像、三个视频片段和三个音频片段来优化生成效果,能够生成长达15秒的带音频视频片段。
Q2:Seedance 2.0在技术上有哪些突破?
A:该模型在生成质量上实现了实质性飞跃,特别是在生成包含多个主体的复杂场景以及遵循指令方面。它能够考虑摄像机运动、视觉效果和动作细节,严格遵循现实世界的物理定律,可以生成从动漫风格到电影级科幻场景的各类视频。
Q3:普通用户如何使用Seedance 2.0?
A:目前Seedance 2.0仅通过字节跳动的Dreamina AI平台和其AI助手豆包提供服务。尚不清楚它是否会进入TikTok平台,特别是考虑到TikTok在美国的现状。用户需要通过这些指定平台来体验该技术。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。