为什么人工智能数据增长打破了传统基础设施规划

编辑部 · 发布 2026/08/08 · 更新 2026/08/08

为什么人工智能数据增长打破了传统基础设施规划

当谈到人工智能工作负载时,计算呈线性扩展,而数据呈指数扩展,在训练、推理、日志、嵌入、合成输出和保留窗口中不断积累。要点 计算和数据通过不同的运营模式进行扩展,因此将存储视为辅助容量购买会产生长期风险。人工智能数据中心规划需要分层感知的保留,因为训练数据、推理日志、嵌入和检查点具有不同的访问和成本配置文件。

为什么人工智能数据增长打破了传统基础设施规划

当谈到人工智能工作负载时,计算呈线性扩展,而数据呈指数扩展,在训练、推理、日志、嵌入、合成输出和保留窗口中不断积累。

要点

  • 计算和数据通过不同的运营模式进行扩展,因此将存储视为辅助容量购买会产生长期风险。
  • 人工智能数据中心规划需要分层感知的保留,因为训练数据、推理日志、嵌入和检查点具有不同的访问和成本配置文件。
  • 存储架构通过保留调整、审计、恢复和模型改进所需的数据来塑造人工智能系统的灵活性。 人工智能数据中心现在位于旧的基础设施计划无法处理的资源模型中。数据中心用电量预计将从 2025 年的 485TWh 增加到 2030 年的 950TWh,这表明人工智能基础设施的增长已经对电力、空间和容量规划的限制产生了压力。

更难的问题是不对称。计算使用量会根据工作负载计划而上升、下降和刷新。每次训练运行、推理会话、评估通过和审计要求后,数据都会保留。这使得存储架构成为任何为多年运营而构建的人工智能数据中心的主要设计决策。

计算投资遵循刷新周期,同时数据仍然存在

随着 GPU 集群的老化、利用率目标的变化以及训练计划在容量池中的变化,计算投资会变得周期性。数据不会在同一周期重置。一旦创建、验证、记录、嵌入或保留,它就成为人工智能系统必须持续管理的操作基础的一部分。

Neocloud 可以为新客户群体添加 GPU 容量,然后在合同期或工作负载高峰后重新平衡该容量。该时期的推理日志、输出跟踪、安全评估、模型检查点和客户特定的微调记录在计算窗口关闭后仍然有用。 这些数据资产具有上下文、合规价值和模型改进潜力。

这种差距会造成规划错误。财务团队可以将计算建模为与利用率相关的可刷新资产,而存储则作为与历史相关的累积资产来增长。使用相同的规划逻辑处理两者隐藏了长期成本曲线。

人工智能工作负载创建的操作数据远远超出训练数据集

人工智能工作负载生成的不仅仅是精心策划的培训数据,因为生产系统在每一步都会创建操作记录。提示、响应、嵌入、检索跟踪、评估结果、中间文件、元数据和策略日志都会在模型部署后增加存储重量。

检索增强生成服务说明了这种模式。每个查询都可以生成向量查找、源文档引用、提示模板、响应变体、用户反馈、延迟跟踪和安全审查记录。 单个响应很小,但当团队保留调试、调整、合规性和客户质量审查的证据时,完整的生产记录就会变得更大。

数据创建的规模已经反映了这种运营现实,IDC 预测全球每年的数据生成量将从 2025 年的 218ZB 增加到 2030 年的 718ZB。*人工智能系统增加了一个新的层面,因为它们在使用数据的同时生成数据。 该反馈循环使删除策略、层放置和检索成本成为模型操作的核心。

传统基础设施规划模型在复合数据增长下失败

当传统基础设施规划假设存储增长以可管理的比率跟踪计算增长时,就会失败。人工智能打破了这一假设,因为可以根据已知的工作负载峰值来安排计算,而数据则通过跨模型管道的持续积累、重用、保留和复制来增长。

规划 10PB 精选训练数据的平台团队可能会错过围绕其形成的更大数据。随着时间的推移,重复的暂存副本、合成数据变体、嵌入索引、检查点存档、评估数据集和推理日志可能会超出原始训练集。 存储问题不再与一个数据集有关,而更多地与每个衍生品的生命周期有关。

实际约束很简单。当计算紧张时,您可以推迟训练运行,但不能安全地忽略不断扩大的数据资产。存储架构成为成本、访问和弹性的控制平面。

AI数据中心存储层决定长期系统经济性

人工智能数据中心存储层在决定经济性方面发挥着巨大作用,因为不同的数据类型具有不同的访问模式、保留价值和性能需求。单层强制每个字节采用相同的成本结构,即使在任何给定时间只有一小部分需要最高性能。

训练批次、活动特征存储和当前检查点写入需要高吞吐量访问。较旧的检查点、原始源数据、推理日志、合成变体和合规性记录需要以较低的单位成本获得持久的容量。 WD 通过存储架构适应这种执行环境,该架构根据生命周期阶段放置数据,而不是将所有 AI 数据视为同样热门。

实用的分层模型从五个控件开始:

  • 在计划运行期间,将主动训练输入保持在靠近 GPU 集群的位置。
  • 当重用频率下降时,将较旧的检查点移至成本较低的容量。
  • 根据保留值和审计要求存储推理日志。
  • 当访问模式不同时,将嵌入索引与源文档分开。
  • 随着工作负载从实验转移到生产服务,重新平衡各层。 权衡不是速度与容量。更好的问题是哪些数据需要速度、需要多长时间以及单位成本是多少。该帧可以保护性能,而不会强制每个保留的字节进入最昂贵的层。

当保留需求继续扩大时,容量规划就会中断

人工智能团队很少知道数据在创建时的全部价值。在启动过程中看似一次性的日志对于几个月后的微调、事件审查、模型行为分析或监管证据可能变得很重要。

模型服务系统可以从 30 天的推理日志保留开始,然后在客户升级、策略审查或评估需求后转移到 180 天。这种转变会成倍增加存储需求,而 GPU 数量却没有相应变化。 计算资产看起来很稳定,而数据资产则承担了新的运营负担。

保留也会造成治理约束。过于激进的删除会减少可用于审计、质量审查和模型改进的证据。将所有内容保留在高级层会浪费预算和机架空间。 持久的设计选择是分层感知保留,其中访问频率、法律价值和模型实用性决定放置。容量规划必须从数据生命周期策略开始,然后将基础架构映射到该策略。

计算配置解决了峰值需求,而存储则吸收了历史数据

计算配置可以解决工作负载峰值问题,因为训练、批量推理和评估作业可以在集群之间进行调度、排队或移动。存储吸收历史记录,因为它必须保留这些作业产生的内容,即使在计算任务结束后也是如此。

基础模型团队可以为主要训练运行配置 GPU、完成运行并将容量释放回池中。由此产生的检查点、验证结果、失败的实验记录、标记化数据集和安全评估仍然需要持久存储。某些文件将支持未来的微调。 有些人会支持审计。有些永远不会再被阅读,但你需要政策来知道哪个是哪个。

这种区别对于人工智能基础设施容量规划很重要,因为峰值计算和持久存储遵循不同的故障模式。计算稀缺会降低吞吐量。存储稀缺迫使删除、层级压力或紧急采购。 这些响应会带来更大的长期风险,因为它们会影响模型质量、数据沿袭和恢复状态。计算是一个调度问题。存储是一个机构记忆问题。

AI 基础设施成本从 GPU 获取转向数据保留

随着部署的成熟,数据保留会占用更多的人工智能基础设施预算,因为生产系统积累运营历史记录的速度通常比团队淘汰它的速度要快。 GPU 的采购在扩建中引起了人们的关注,但保留的数据确定了电力、空间、复制、重建时间和管理工作的多年成本底线。

运行频繁微调周期的人工智能实验室通常会保留基础数据集、候选数据集、拒绝的数据集、检查点、评估运行和生产反馈。 存储该材料的成本取决于有多少位于高性能层、有多少转移到容量层以及有多少必须保持复制以保证持久性。错误的放置会将有用的历史记录变成可避免的成本负担。

财务问题也发生了变化。每 GPU 小时的成本在训练期间很重要,但每存储 PB 的成本在系统的整个使用寿命期间都很重要。如果存储计划依赖于手动移动、扁平层或短期保留假设,则在 5PB 时看起来可以接受的存储计划在 50PB 时可能会失败。 规模单位经济是一种架构选择。

存储架构决定了人工智能系统保持灵活性的时间长度

存储架构决定哪些数据仍然可用,哪些数据变得太昂贵而无法保留,以及哪些数据在团队需要时变得太慢而无法检索。当数据放置随着时间的推移遵循工作负载值时,人工智能系统会保持开放的选择。

严格的架构使团队可以保留原始数据以供以后重新处理,保留用于行为分析的推理记录,保留用于回归测试的评估集,并将旧材料移至容量层而不会失去控制。 WD 在这方面的作用是实际的:容量优化的 HDD 基础支持大量保留数据,而闪存则保持与活动、延迟敏感的工作保持一致。

存储最终决定了人工智能系统随着时间的推移可以记住、重用、防御和改进的程度。计算为当前的工作提供动力。数据决定了下一个工作能知道什么。

  • 资料来源:IDC 全球数据圈预测,2026-2030 年

来源:Blog

Related Articles

继续阅读相关文章

Topics & FAQ

相关专题与 FAQ

暂无内容