一张草图直接生成视频游戏，谷歌推出生成交互大模型

谷歌DeepMind推出Genie，一个无需数据标记、无监督训练的生成交互模型，具有110亿参数，能基于图像、照片或草图生成可控制动作的视频游戏。Genie通过大规模训练，学习潜在动作关系，可应用于其他领域。

专注AIGC领域的专业社区，关注微软&OpenAI、百度文心一言、讯飞星火等大语言模型（LLM）的发展和应用落地，聚焦LLM的市场研究和AIGC开发者生态，欢迎关注！

谷歌DeepMind的研究人员推出了，首个无需数据标记、无监督训练的生成交互模型——Generative Interactive Environments，简称“Genie”。

Genie有110亿参数，可以根据图像、真实照片甚至草图，就能生成各种可控制动作的视频游戏。Genie之所以有如此神奇功能，主要使用了3万小时，6800万段的游戏视频进行了大规模训练。

并且在训练过程中没有使用任何真实动作标签或其他特定提示，但Genie可以基于帧级别的，使用户在生成的环境中进行各种动作控制非常强！

值得一提的是，Genie是一个通用基础模型，也就是说其学到的潜在动作关系、序列、空间可以应用在其他领域中。

论文地址：https://arxiv.org/abs/2402.15391

项目地址：https://sites.google.com/view/genie-2024/home

Genie的核心架构用了ST-Transformer（时空变换器）。这是一种结合了Transformer模型的自注意力机制与时空数据的特性，以有效处理视频、多传感器时间序列、交通流量等时空数据。

ST-Transformer主要通过捕捉数据在时间和空间上的复杂依赖关系，提高了对时空序列的理解和预测能力，主要有3大模块组成。

视频分词器

这是一个基于VQ-VAE的模块,可将原始视频帧压缩成离散的记号表示,以降低维度并提高后续模块的视频生成质量。

一张草图直接生成视频游戏，谷歌推出生成交互大模型

这个过程类似自然语言处理中的分词，将连续的视频帧序列分解为离散的视频片段。

视频分词器使用了ST-transformer来对视频进行编码，并生成对应的视频标记。这些标记将作为后续动力学模型的输入，用于预测下一帧视频。

潜在动作模型

这是一个无监督学习模块,可从原始视频中推断出观察到的状态变化对应的潜在动作。并根据这些潜在动作实现对每一帧的控制。潜在动作模型通过对视频标记序列进行建模，学习到了不同帧之间的动作关系。

一张草图直接生成视频游戏，谷歌推出生成交互大模型

具体来说，潜在动作模型可以将一个视频标记序列作为输入，并生成对应的潜在动作序列。这些潜在动作序列可以用于控制生成环境中的每一帧，使用户能够在生成的交互环境中进行精确的操作。

动力学模型

主要基于潜在动作模型学习到的动作关系，根据潜在动作和过去的帧标记预测下一帧的视频。可以把该模块看作是一个预测模型，通过学习视频序列的动态变化模式，能够生成逼真的连续视频。

动力学模型的输入包括前一帧的图像表示和当前帧的动作表示。为了将图像表示和动作表示进行融合，Genie采用了一个基于Transformer架构的编码器来对它们进行编码。

一张草图直接生成视频游戏，谷歌推出生成交互大模型

在编码器中，首先对前一帧的图像进行编码，并采用了一种视频标记器的方法，将图像分割成若干个离散的标记，每个标记代表图像中的一个局部区域。这种分割可以帮助模型捕捉到图像中的空间信息。

一张草图直接生成视频游戏，谷歌推出生成交互大模型

当前帧的动作表示也通过编码器进行编码。动作表示可以是离散的动作类别或连续的动作向量，具体的形式取决于具体的应用场景。

编码器将动作表示转换为一个固定长度的向量，以便与图像表示进行融合。在获得图像表示和动作表示的编码后，它们被输入到动力学模型中进行预测。

来源：AIGC开放社区

0赞

好文章，需要你的鼓励

人工智能

大语言模型

企业文化

2025-12-12

奥运级别的努力：首席信息官为2026年AI颠覆做准备

AI颠覆预计将在2026年持续，推动企业适应不断演进的技术并扩大规模。国际奥委会、Moderna和Sportradar的领导者在纽约路透社峰会上分享了他们的AI策略。讨论焦点包括自建AI与购买第三方资源的选择，AI在内部流程优化和外部产品开发中的应用，以及小型模型在日常应用中的潜力。专家建议，企业应将AI建设融入企业文化，以创新而非成本节约为驱动力。

人工智能

图像识别

新型算法

2025-12-12

字节跳动发布GAR：让AI能像人类一样精准理解图像任何区域的突破性技术

字节跳动等机构联合发布GAR技术，让AI能同时理解图像的全局和局部信息，实现对多个区域间复杂关系的准确分析。该技术通过RoI对齐特征重放方法，在保持全局视野的同时提取精确细节，在多项测试中表现出色，甚至在某些指标上超越了体积更大的模型，为AI视觉理解能力带来重要突破。

人工智能

自然语言处理

个性化推荐

2025-12-12

Spotify推出AI播放列表功能让用户掌控推荐算法

Spotify在新西兰测试推出AI提示播放列表功能，用户可通过文字描述需求让AI根据指令和听歌历史生成个性化播放列表。该功能允许用户设置定期刷新，相当于创建可控制算法的每周发现播放列表。这是Spotify赋予用户更多控制权努力的一部分，此前其AI DJ功能也增加了语音提示选项，反映了各平台让用户更好控制算法推荐的趋势。

Inclusion AI推出万亿参数思维模型Ring-1T：首个开源的超大规模推理引擎如何重塑AI思考边界

人工智能

强化学习

开源模型

2025-12-12

Inclusion AI推出万亿参数思维模型Ring-1T：首个开源的超大规模推理引擎如何重塑AI思考边界

Inclusion AI团队推出首个开源万亿参数思维模型Ring-1T，通过IcePop、C3PO++和ASystem三项核心技术突破，解决了超大规模强化学习训练的稳定性和效率难题。该模型在AIME-2025获得93.4分，IMO-2025达到银牌水平，CodeForces获得2088分，展现出卓越的数学推理和编程能力，为AI推理能力发展树立了新的里程碑。

一张草图直接生成视频游戏，谷歌推出生成交互大模型

来源：AIGC开放社区

人工智能

大语言模型

企业文化

奥运级别的努力：首席信息官为2026年AI颠覆做准备

人工智能

图像识别

新型算法

字节跳动发布GAR：让AI能像人类一样精准理解图像任何区域的突破性技术

人工智能

自然语言处理

个性化推荐

Spotify推出AI播放列表功能让用户掌控推荐算法

人工智能

强化学习

开源模型

Inclusion AI推出万亿参数思维模型Ring-1T：首个开源的超大规模推理引擎如何重塑AI思考边界

2024

03/04

16:04

分享

点赞

AIGC开放社区

专注AIGC领域的专业社区，关注微软OpenAI、百度文心一言、讯飞星火等大语言模型（LLM）的发展和应用落地，聚焦LLM的市场研究和AIGC开发者生态，欢迎关注！

关注官方公众号

关注官方微博

关注官方喜马拉雅

友情链接

业界热点: