中科曙光推出ParaCache方案:减少大模型重复计算 提升处理效率与算力利用率

   发布时间:2026-08-30 04:32 作者:陆辰风

在大模型应用不断拓展至长文本处理、多轮对话交互、知识库智能问答以及智能体协作等复杂场景的当下,计算效率与算力资源优化成为行业关注的焦点。中科曙光近日推出的新一代词元加速方案ParaCache,通过创新性的计算结果复用机制,为这一难题提供了解决方案。该方案的核心在于将大模型已完成的计算过程进行存储,并在后续请求中直接调用,避免重复计算带来的性能损耗。

据技术团队介绍,ParaCache实现了对GPU显存、CPU内存、固态硬盘及分布式存储的统一管理,构建了多层级的数据缓存体系。系统会根据计算结果的使用频率,自动将其分配至不同层级的存储介质中,高频数据优先存储于高速缓存,低频数据则下沉至分布式存储。这种分层调度机制不仅提升了数据访问效率,更通过跨请求、跨节点的共享机制,真正实现了"一次计算、多次复用"的技术目标。

实际应用测试数据显示,在处理约12万词元的长文本输入时,ParaCache可将模型生成响应前的等待时间压缩至原有水平的1.5%,降幅高达98.5%。在高并发场景下,系统每秒处理的词元数量较传统方案提升27倍,有效解决了多用户同时访问时的性能瓶颈问题。中科曙光分布式存储产品部负责人指出,这种"以存储换算力"的模式已成为行业共识,标志着存储系统从被动响应向主动优化的角色转变。

目前,该方案已在某头部互联网企业的在线推理业务中完成部署,并顺利通过全国产十万卡AI超算集群曙光8000的验证测试。其应用场景覆盖长文本对话、知识库检索、智能客服交互、智能体协作以及高并发推理等多个领域,为金融、医疗、教育等行业的智能化转型提供了基础设施支撑。技术专家表示,ParaCache的推出标志着AI算力基础设施进入结构化升级阶段,存储系统的深度参与正在重塑计算架构的效率边界。

 
 
更多>同类内容
全站最新
热门内容
本栏最新