国内算力基础设施厂商中科曙光,近期正式对外透露,即将推出面向大模型推理场景的全新存储加速技术,这套技术专门针对大模型推理过程里的高频数据访问痛点做了针对性优化,能大幅提升推理场景下存储系统的数据吞吐效率,降低大模型推理的整体运行成本,为国内大模型规模化落地提供更高效的存力支撑。
现在大模型推理的商业化落地速度越来越快,大量AI对话应用、行业智能体都在大规模部署推理算力,很多用户在实际运行过程中发现,推理场景的性能瓶颈,很多时候不是出在计算芯片上,而是卡在了存储环节。大模型推理过程中,需要反复高频访问大量的模型参数数据,传统存储系统的调度逻辑没有针对推理场景优化,很容易出现数据排队等待的情况,导致计算芯片经常处于等数据的空闲状态,算力资源被白白浪费。
中科曙光这次即将发布的全新推理存储加速技术,核心就是解决推理场景里的这类数据调度难题。这套技术针对大模型推理的运行特征,重新设计了存储系统的数据调度逻辑,能把推理过程里重复访问的高频数据提前调度到靠近计算芯片的高速存储区域,不用每次都从远端的大容量存储里调取,大幅缩短了数据的访问延迟,让计算芯片几乎不用花时间等待数据加载,算力资源的利用率能得到明显提升。
这项新技术并不是凭空研发的,它是中科曙光过去多年在AI存储领域技术积累的延伸。此前中科曙光自研的ParaStor分布式存储系统,已经成功落地国内首个全国产十万卡AI超集群“曙光8000(登峰)”,这套存储系统能提供EB级的存储容量和TB级的访问带宽,还支持冷热数据分层技术,已经在大模型训练场景里得到了大规模验证,积累了大量大规模智算集群的存储落地经验。这次面向推理场景推出的新技术,就是把训练场景里沉淀的存力优化经验,进一步延伸到了推理侧。
在实际的运行表现上,这套新技术能给大模型推理场景带来非常直观的体验提升。部署了这套技术的推理集群,单台服务器能同时承载的推理请求数量可以大幅提升,在同等算力规模下,能支撑更多用户同时在线访问,不用额外增加大量的计算服务器,就能满足业务增长的需求,能帮运营方大幅降低推理业务的整体部署成本。
同时这套技术还能和中科曙光现有的存储产品线无缝对接。此前中科曙光已经完成了ParaStor产品线的全面升级,推出了面向AI训练场景的F9000全闪存储,和面向混合云场景的S6000存储产品,这套全新的推理加速技术,可以直接在现有产品的基础上完成升级,用户已经部署的曙光存储设备,不需要全部替换硬件,就能通过固件升级获得这项新能力,不用付出高昂的改造成本。
在行业适配层面,这项新技术也能覆盖大量不同的推理落地场景。不管是面向C端的通用大模型对话平台,还是面向金融、通信、能源等关键行业的专属大模型应用,都能通过这项技术提升推理集群的运行效率。此前中科曙光已经和达梦、科大讯飞等生态伙伴建立了深度合作,后续这项新技术落地之后,会快速融入到现有生态的各类AI应用方案里,覆盖更多行业的大模型推理场景。
根据此前公开的信息,中科曙光在赛迪顾问发布的2026年中国分布式存储市场报告里,已经在AI大模型、具身智能、自动驾驶、教育四个细分行业拿下了存储市场第一,其中AI存储已经连续三年保持市场份额第一。这次面向推理场景的全新存储技术发布之后,会进一步补齐中科曙光在大模型推理侧的存力能力拼图,形成覆盖AI训练、推理全场景的完整存储产品矩阵。
接下来,中科曙光会在2026数博会期间正式对外发布这项新技术的完整细节,同步带来配套的落地解决方案,帮助更多大模型运营方和智算中心用户,提升推理集群的运行效率,降低大模型推理的整体运行成本,助力国内大模型商业化落地的进程进一步提速。
关注
8文章
7443浏览量
96566免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com