7 月6 日,腾讯新一代自研通用多模态大模型混元Hy3正式发布并开源。相比preview版本,它展现出显著强于同尺寸模型且比肩(参数规模2—5倍的)旗舰模型的智能水平,不仅延续了清晰陡峭的能力增长曲线,并且通过进一步提升后训练的算力规模以及数据质量和多样性,在各类任务上再次跃升,以较小尺寸首次比肩国内外大尺寸旗舰模型的效果。英特尔作为混元模型在算力平台领域的重要合作伙伴,也在第一时间完成了Hy3在至强6处理器与Gaudi 2E AI 加速器平台上的适配与优化, 以实际行动来加速优质开源大模型在产业应用中的快速落地。
此次英特尔对Hy3的快速支持与适配优化,包含了针对该模型中多个关键组件与算子的优化,这让至强6处理器平台能够通过充分释放其内置的英特尔AMX(高级矩阵扩展)技术的潜能,为该模型提供更为高效且强劲的推理加速支撑,进而可在推荐配置下,仅使用单台至强6服务器即可部署总参数295B、BF16精度的满血版 Hy3模型。
至强6平台部署方案
目前,英特尔已在 SGLang 主分支完成针对 Hy3 与至强6处理器硬件特性的专属优化,以最大化发挥这款处理器平台的算力与带宽优势。按照以下步骤,即可完成该模型在至强6平台上的安装与适配:
平台推荐配置:搭载两颗至强6性能核处理器,推荐选用 6978P(120 核)或 6980P(128 核)型号,每颗处理器均需配置为 SNC3 模式,整个平台建议搭配 1TB或以上容量的内存。
https://docs.sglang.io/platforms/cpu_server.html#launch-of-the-serving-engine
#启动server命令python -m -sglang.launch_server --model-path HY-3.0_ID --dtype bfloat16 --trust-remote-code --device cpu --disable-overlap-schedule --tp 6
值得一提的是,如果想获得更好的解码性能,可以在server 启动命令中增加 "--enable-torch-compile"。
Gaudi® 2E AI 加速器平台部署方案
英特尔Gaudi 2E AI加速器对Hy3的支持和适配也已就绪,在仅使用单节点4卡高速互联的情况下即可完成该模型的部署与应用,为用户带来更高的灵活性及更低的部署和应用门槛。
按照以下步骤,既可完成Hy3模型在Gaudi 2E AI加速器上的部署:
平台推荐配置:单节点适配方式需要安装至少4块Gaudi 2E PCIe加速卡,基于单卡96GB HBM的配置实现4卡384GB的HBM总容量。
https://github.com/HabanaAI/vllm-fork/tree/aice/v1.22.0
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。