直击WAIC 2026,深信服统一存储重构AI时代数据存储逻辑

2026/07/23 20:24AI云资讯10843

7月17日-20日,2026世界人工智能大会(WAIC)在上海举行。作为全球AI领域的风向标,大会指出,人工智能全方位重构人类经济社会发展模式,为经济转型、技术突破和效率提升注入强劲动能。

数据存储作为AI基础设施的关键一环,其承载能力与架构创新成为行业焦点。大会期间,西部数据举办了面向AI时代的数据存储架构创新论坛,邀请产业链上下游代表,共同探讨AI基础设施的协同优化路径。深信服首席技术专家廖俊峰受邀出席,并发表主题演讲《人工智能时代数据承载的挑战与解决之道》。本次演讲系统剖析AI浪潮下存储系统面临的现实困境,并提出全链路端到端的解决方案。

AI时代数据链路从一次性交付转向持续生产闭环

AI生产对数据基础设施提出的新要求。在传统数据处理模式下,数据从采集到入湖再到分析是一次性交付的线性流程。而在AI时代,AI不是数据的一次性消费者,而是一个持续读取、加工、生成和反馈数据的循环系统

由此带来了多重技术变化:

同一原始对象会派生训练样本、Chunk、Embedding、索引、模型工件和回答引用等多种产物。

数据关系从简单的“文件属于哪个目录”扩展为“资产-版本-派生物-任务-结果”的复杂图关系。

写入模式从一次性入湖演变为持续追加、局部更新、批量重构和版本切换。

DataLoader、Spark、向量检索、Agent工具和数据治理系统等多样化的消费者同时接入,协议和数据语义并不统一。

廖俊峰强调,识别数据底座问题不能停留在笼统的AI平台问题层面,必须量化为可观测的时间、算力、容量、一致性或风险成本。一般AI生产受阻的原因包括数据准备慢、算力等待、重复容量高、数据状态不一致、结果不可复现等。

深信服首席技术专家廖俊峰发表主题演讲

高性能统一存储底座:解决数据慢、算力等待问题

针对数据供给速度不足造成的算力等待问题,廖俊峰提出了高性能统一存储底座的建设思路。企业已经部署了对象存储和高性能文件存储,为什么还要建设统一的高性能数据底座?核心价值不在于多支持一种协议,而在于减少为了适配计算而发生的数据复制,缩短从数据产生到任务启动的时间

在技术路线上,本次演讲详细对比了四种架构方案——文件真源映射S3、对象真源外挂文件层、对象底座增加层级命名空间、以及协议无关数据模型。

廖俊峰指出,协议互通的目标是让业务系统、数据平台和AI工作流按照自己的协议访问同一份数据,同时通过统一身份与一致性机制减少同步任务和重复容量。多协议架构选型的关键判断依据,在于真源归属、元数据统一性、写冲突处理策略。

在演讲过程中,廖俊峰还介绍了“目录桶”这一创新设计——它不是对象存储界面上的目录皮肤,而是为层级命名空间建立独立索引和操作语义的实质性能力。

在数据路径优化方面,S3 over RDMA技术使大数据Payload通过RDMA直接进入注册的Host Memory或GPU Memory,绕开传统TCP数据路径中的CPU和内存搬运开销。

但是,廖俊峰提醒,部署RDMA和高速网络后,AI任务可能没有显著加速,原因在于全路径端到端的瓶颈。高性能数据面是Namespace、协议、网络、内存、存储引擎和可靠性的端到端系统工程,能够消除各层独立优化带来的性能瓶颈、资源浪费、故障断层等问题。

AI统一数据湖:确保数据找得到、用得对、可追溯

如果说高性能统一存储底座解决的是“数据能否快速到达计算”的问题,那么AI统一数据湖解决的是“什么数据可以进入计算”的问题。

对此,廖俊峰提出Context Lake的概念——它并非替代数据湖,而是在数据湖之上增加面向AI消费所需的版本、血缘、权限和上下文服务。

其中,他深度解析了多个关键技术点——

在数据版本控制方面,探讨如何在不复制完整数据集的前提下支持Branch、Commit、Merge和Rollback。

在血缘追踪方面,指出传统“任务A生成表B”的血缘不足以支撑RAG与Agent的复杂场景,需要贯通原文、向量与回答引用。

在向量检索方面,提出“向量桶”概念,将原始数据与向量特征纳入同源治理,确保检索结果必须同时满足语义相关、权限允许、版本有效和生命周期未失效。

他还特别强调了统一视图的重要性——跨桶、跨目录和跨异构设备的同一数据,在路径变化后仍需保持可追踪。在不全量迁移数据的前提下,通过首次建库建立资产基线、增量事件维持新鲜度、对账扫描修复漏报和漂移三管齐下,可以确保统一视图及时同步异构存储数据变化。

廖俊峰明确指出,AI数据湖的建设不等于将所有数据迁移到一套全闪存储,而是要逻辑统一、物理按需——统一视图决定“应该用什么数据”,数据流动决定“数据应该在什么位置运行”。

最后,他描绘了上下文供应链的数据闭环图景:统一视图找到正确数据 → 数据流动将数据存放在合适位置 → 高性能路径供给计算 → 版本、血缘和向量能力保证结果可追溯。此外,需要具备存储防勒索能力,守护AI业务“事前-事中-事后”全流程的数据安全。

AI数据基础设施的建设,需要从AI数据生产链路出发,系统性满足数据供得快、找得到、用得对、可追溯的全链路需求。这不仅是存储技术的升级,更是从“数据仓库”静态思维向“数据供应链”动态思维的转变,是AI走向规模化、产业化落地的关键基础设施支撑。

廖俊峰总结道,AI时代的数据底座,不只是把数据存下来,而是让正确版本的数据以合适的协议和性能进入计算,并使每一次训练、检索和Agent决策都可以被验证、被治理、被持续复用。

附:AI数据底座建设的技术原则

从AI数据生产链路出发:围绕训练、检索与Agent,按数据消费链路进行设计,而不是从单一协议或产品分类出发。

系统能力与介质能力协同:底层介质提供性能、容量与耐久基础,系统实现并行访问、统一调度与治理。

AI数据湖先建立可信资产身份:统一视图、版本、权限、变化事实与血缘,再叠加语义、向量和生命周期策略。

文件与对象协同承载:对象承载海量数据,文件承载生产语义,通过协议互通减少数据复制与流程割裂。

性能必须覆盖完整数据路径:优化Namespace、协议、网络与内存,存储引擎、介质与可靠性机制。

相关文章

AI企业

更多>>

AI硬件

更多>>

AI产业

更多>>

AI技术

更多>>
AI云资讯(爱云资讯)立足人工智能科技,打造有深度、有前瞻、有影响力的泛科技信息平台。
合作QQ:1211461360微信号:icloudnews