AI时代数据存储架构如何创新?西部数据在WAIC公布路线图
科技
科技 > 数码 > 正文

AI时代数据存储架构如何创新?西部数据在WAIC公布路线图

智东西

作者 | ZeR0

编辑 | 漠影

智东西7月21日报道,世界人工智能大会WAIC 2026期间,西部数据通过参展与举行专题分论坛,全面呈现存储基础设施如何支撑AI的规模化发展。

数据如何被存储、管理与长期保留,已成为决定AI能否实现可持续、经济高效规模化发展的关键因素。

在展台上,西部数据展示了两项业界首创的先进HDD创新技术:高带宽硬盘技术双枢轴硬盘技术,以及HAMR(热辅助磁记录)、ePMR(能量辅助垂直磁记录)和UltraSMR技术,并展现了这些技术如何与其平台产品组合相辅相成,专为满足规模化AI基础设施的需求而打造。

AI时代数据存储架构如何创新?西部数据在WAIC公布路线图

其中,高带宽硬盘技术通过多磁头在多个磁道同时进行读写,可在不增加功耗的前提下提供高达传统HDD 2倍的带宽。该技术具备清晰的拓展路径,未来可实现高达8倍的带宽增益,目前已交付客户进行验证。

双枢轴技术在独立枢轴上增加了第二组独立运行的执行器,可在3.5英寸硬盘内提供高达2倍的顺序IO性能增益 。这与以往牺牲容量且需要客户大幅度修改软件的双执行器设计不同,双枢轴技术通过缩小磁碟间距,在单个硬盘中搭载更多磁碟,从而提升整体容量。

通过这些技术的结合,西部数据将使硬盘顺序IO性能整体提升至4倍,在实现100TB HDD的同时,仍能保持客户当前享有的每TB相对IO速率。这有效减少了客户在容量扩展过程中增加SSD部署或重构服务架构的需求。

西部数据还展出了面向大规模数据存储环境的多款Ultrastar企业级HDD解决方案,包括40TB和34TB Ultrastar DC HC6100数据中心UltraSMR硬盘、30TB和28TB Ultrastar DC HC5090数据中心CMR硬盘、采用HAMR技术的40TB Ultrastar DC HCS100数据中心UltraSMR硬盘,以及采用高带宽硬盘和双枢轴技术的性能优化型硬盘。

值得注意的是,采用UltraSMR ePMR技术的40TB HDD现已进入客户认证阶段,并计划于2026年下半年实现量产。

西部数据展出的精选先进存储平台解决方案,包括全新Ultrastar Data60 3000混合存储平台、OpenFlex Data24 4200存储平台以及RapidFlex C2000网络交换桥接适配器,旨在支持可扩展部署、灵活的资源利用以及满足现代数据基础设施的要求。

7月19日下午,西部数据举办以“面向AI时代的数据存储架构创新”为主题的分论坛。西部数据开发工程高级副总裁Tim Rausch发表主题演讲。

西部数据从一个关键差异点重新审视了AI基础设施:即计算周期可以重复利用,而数据会持续累积。

Tim强调,AI不仅是计算系统,更是数据系统,在其中训练和推理往复循环。每一次交互都会产生新的数据,这些数据可被存储、重新纳入训练并用于改进后续模型,使存储需求呈现持续性和累积性。如何高效管理这些海量数据,已成为行业面临的核心挑战。

他着重分享了三类工作负载:

第一类是训练数据,通常一次写入、存放在HDD上,并被周期性读取,因为模型并非始终处于训练状态。随着用户生成的内容回流到AI数据循环中,训练数据量会持续增长。这一层最看重的是能够扩展到EB级、且具有成本效益的存储,而这正是HDD的用处。

第二类是推理,例如我与AI交互,请它提供晚餐食谱或生成一张图片,同时还有数百万用户在以类似的方式使用AI,这会产生大量随机小数据读取,还需要内存来保留对话上下文。因此,这一层既需要高带宽和高IOPS,也需要持久化存储,这正是SSD发挥作用的场景。

第三类是推理输出,也就是AI为我生成的食谱、图片或其他内容。此外,AI还会保留日志、追踪记录、合规记录和元数据。很多数据最初位于HBM或DRAM中,但很快会向下迁移到HDD,进行持久化存储。

AI存储栈与传统云应用使用的存储栈有所不同。传统应用可能主要依赖两个存储层级:闪存和HDD。假设一个应用中有数千张图片,用户打开应用时最先看到的10到20张图片可能来自NAND闪存,以便快速呈现;继续向下浏览时,后续图片则从HDD加载,因为HDD更具成本效益。开发者会根据性能与成本的平衡,将内容放到合适的存储层。

AI构建者采用同一套原则,但涉及到更多层级:

上层是模型权重/GPU显存溢出,即HBM或DRAM紧邻成本高昂的GPU,以便持续向其供给数据。

下一层是KV缓存,也就是AI系统的短期记忆,主要使用DRAM和SSD。

再下一层是语义数据库,其中包含向量、嵌入和检索增强生成(RAG)数据,通常运行在SSD上的高性能数据层。

最底层是HDD大容量存储,用来保存日志、用户生成内容的副本以及训练数据。

AI时代数据存储架构如何创新?西部数据在WAIC公布路线图

“在规模化发展中,经济性决定架构。通过闪存处理性能敏感型小数据读取,由HDD承载不断累积的写入流,这种智能数据分层和均衡的存储架构不仅能够从容应对持续增长的数据规模,更让AI基础设施变得务实、优雅且经济可行。”Tim说。

他展示了一个案例:生成一个3.97MB的视频需要在整个存储栈中完成46.5GB的读写,并在后端留下506MB数据。当推理输出被存储、重新纳入系统并用作合成训练数据后,便形成“模型改进—更多推理—更多输出被留存”的自我强化循环,持续扩大持久存储层。

AI时代数据存储架构如何创新?西部数据在WAIC公布路线图

Tim认为,成功的AI企业会将数据放在正确的层级,并让数据在AI存储栈的4个层级之间持续迁移。

“目前我们看到,约80%的AI内容存储在HDD上,20%存储在SSD上。”他谈道,他并不是主张HDD占据的市场份额应当提高,而是想强调数据总量本身正在增长,HDD与SSD并不是在面临存量竞争,而是彼此互补,HDD、SSD、DRAM和HBM应根据各自的性能和经济性部署在最合适的层级。

为应对持续累积的数据需求,西部数据分享了未来五年的发展路线图。

西部数据将采取ePMR与HAMR并行发展的路径,帮助客户更平稳地迈向2029年单盘100TB以上的容量。

AI时代数据存储架构如何创新?西部数据在WAIC公布路线图

对于需要高性能的工作负载,西部数据将通过高带宽硬盘技术与双枢轴技术提供带宽与IO性能方面的增益。

针对AI交互生成并需要持久留存的数据,可通过功耗优化型HDD提供经济可持续的解决方案。

此外,西部数据还将利用其智能平台,将HDD的经济性和优势延伸至更广泛的客户群体。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载