IDC发布了一份关于AI就绪数据存储基础设施(AI-RDSI)的研究报告,该报告由Hammerspace公司进行分发。
这份报告是四部分系列研究的第一部分,其他部分将涵盖客户之声、竞争格局以及市场规模和预测。
AI-RDSI文档的IDC观点部分指出,"不到一半的AI试点项目能够推进到生产阶段"。报告强调"组织必须从以数据为中心的角度来处理AI项目"。作者还表示"供应商必须准备好在合作伙伴和竞争对手的生态系统中运营,以提供全栈AI基础设施产品"。
AI-RDSI的定义为:一个能够支持AI工作负载数据需求的数据存储基础设施,包括数据摄取、处理、分析和部署的全生命周期。
IDC作者谈到了数据物流的概念,即数据从创建或摄取开始在组织数据处理环境中的整个流程,并用图表说明了这一概念。
AI系统需要单一的数据真实来源,要么"具备复制数据管理能力,要么在所有存储中建立单一统一的元数据环境"。
这种数据基础设施有五个主要属性:
性能 - 数据吞吐量、IOPS、延迟、网络带宽和性能密集型计算需求,报告指出"实现高吞吐量可能需要使用并行文件系统或并行NFS(pNFS)等技术"。
规模
服务级别 - 报告提到99.999%是常见的要求。
数据物流
数据信任
分析师深入探讨了每个部分的更多细节,并讨论了AI-RDSI本体论和软件分类法。他们最后为IT供应商和IT采购方提供了建议。最终总结指出"太多AI项目以失败告终...我们认为对存储基础设施关注不够,导致项目受到数据孤岛、数据质量差和存储性能不足的阻碍"。
IDC全球基础设施研究部基础设施软件平台研究副总裁Phil Goodwin在最后表示:"这项研究帮助IT供应商定义AI就绪数据存储产品要求,并帮助IT采购方识别适合其需求的解决方案"。
Hammerspace对这份IDC原创研究报告的内容非常认可,因此获得了转载许可。
评论
我们注意到IDC报告忽略了使用闪存硬件和GPU Direct for Objects的快速访问对象存储 - 如Cloudian、Scality和MinIO - 将对象存储定位为适合中等或较低性能需求的解决方案。
报告强调数据可用性的重要性:
以1PB数据和99.999%的可用性计算,0.001%的数据面临不可用风险;1PB的0.001% = 0.00001 x 1 x 10^15 = 1 x 10^10字节或10GB。
在对象存储领域,Scality的RING和Cloudian的Hyperstore提供14个9(99.999999999999%)的数据持久性和可用性,意味着只有1KB数据不可用,仅为10GB的0.00001%,这样的表现更好。
好文章,需要你的鼓励
穆拉蒂时隔18个月首次接受重大媒体采访,介绍其创立的Thinking Machines Lab正在开发的"交互模型"。该模型能以200毫秒间隔处理音频、文本和视频流,捕捉人类交流中的中断、修正和停顿。她还谈及OpenAI"政变周"经历,强调行业决策权过于集中的担忧,并回应了公司近期研究人员离职问题,表示这是初创实验室的正常波动。
STATE16研究院这篇综述发现,物理AI系统存在"静默失效"风险——AI以高度自信执行基于错误世界信息的动作,却不触发任何报警,并提出在AI输出与物理执行之间建立独立授权层的框架。
本期《Quick Charge》播客涵盖多个热点话题:特斯拉疑似试图删除FSD欺诈相关证据以规避巨额赔付;卡特彼勒持续推进建筑领域电气化布局;住宅太阳能30%税收抵免即将到期。此外,嘉宾Tom Pacheco就高压系统与电池技术培训展开探讨,强调电动车技术人才培养的紧迫性。节目同时提醒有意安装太阳能的用户尽快行动,可通过EnergySage平台比较多家安装商报价。
UIUC与微软联合研发的OpenWebRL框架让4B小模型仅凭400条初始数据,通过在真实网站上边做边学的强化学习方式,在网页智能体基准上超越了用27万条数据训练的竞争对手。