上周,Inception公司发布了Mercury 2大语言模型,这是一款基于扩散技术而非主要AI实验室普遍采用的自回归方法构建的模型。在本周的The New Stack Agents节目中,Inception首席执行官兼联合创始人Stefano Ermon解释了扩散模式的生成式AI如何重塑AI应用的构建方式。
首先介绍一些背景:传统大语言模型从左到右逐个Token生成文本,Ermon将这种系统称为"高级自动补全"。而扩散模型的工作方式不同:它们从粗略的答案开始,并行优化,就像Stable Diffusion等图像模型从噪声中生成图像一样。根据Inception自己的测试,这种模型每秒能产生超过1000个Token,比OpenAI、Anthropic和谷歌的速度优化模型快5到10倍。
Ermon向TNS AI高级编辑Frederic Lardinois表示:"我们看到Mercury 2模型作为一个推理模型,实际上能够匹配这些前沿实验室(OpenAI、Anthropic、Meta和谷歌)速度优化模型的质量,同时在端到端延迟方面快5到10倍,也就是你等待答案所需的时间更短。"
自回归模型较慢是因为它们通过内存移动数据而不是进行数学运算。扩散模型专注于并行计算,这正是GPU设计的初衷。GPU巨头英伟达作为Inception的投资者,正在帮助优化服务引擎,Ermon说道。
Ermon在斯坦福大学首创了图像扩散模型,并发表了获得ICML 2024最佳论文奖的基础文本扩散论文。他坦率地承认存在权衡:Mercury 2的质量与Claude Haiku和Google Flash级别的模型相匹配,而非Claude Opus或OpenAI GPT-4。但他认为随着模型规模扩大,经济性将占据优势。强化学习是当今推理模型背后的技术,在扩散架构上也自然更快,因为其瓶颈在于推理。
Inception是唯一发布生产级扩散式大语言模型的公司,谷歌的文本扩散模型仍处于"实验"阶段。Mercury 2现已通过OpenAI兼容的API提供服务,AWS Bedrock集成即将推出。
Q&A
Q1:Mercury 2与传统大语言模型有什么区别?
A:Mercury 2基于扩散技术构建,不同于传统大语言模型的自回归方法。传统模型逐个Token生成文本,而扩散模型从粗略答案开始并行优化,就像图像生成模型从噪声中生成图像一样,这使其速度比主流模型快5到10倍。
Q2:Mercury 2的性能表现如何?
A:根据Inception的测试,Mercury 2每秒能产生超过1000个Token,在质量上能匹配Claude Haiku和Google Flash级别的模型,虽然还达不到Claude Opus或GPT-4的水平,但在速度方面有显著优势。
Q3:扩散模型为什么比自回归模型更快?
A:自回归模型较慢是因为需要通过内存移动数据而不是进行数学运算,而扩散模型专注于并行计算,这正是GPU设计的核心优势。此外,强化学习技术在扩散架构上也自然更快。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。