华为推出AI推理技术UCM：减少HBM依赖，9月将正式开源

2025-08-14

快科技8月13日消息，据媒体报道，在2025金融AI推理应用落地与发展论坛上，华为重磅发布了其AI推理创新技术——UCM（推理记忆数据管理器）。这项技术被业内看作是有望重塑国内AI推理格局的关键突破。

UCM技术的核心是其先进的KV Cache系统，它融合了多种缓存加速算法工具和精细的分级管理策略，能高效处理推理过程中产生的大量记忆数据。这带来了诸多明显优势，比如能有效扩大上下文窗口，保证推理过程具备高吞吐量和低延迟，还能显著降低每个Token的推理成本。

特别重要的是，UCM技术有望缓解当前因HBM（高带宽内存）资源短缺导致的任务停滞和响应延迟问题，为AI应用提供更流畅的体验，进而减少行业对HBM的过度依赖。

此次论坛不仅是UCM技术的首次亮相，华为还宣布将和中国银联携手，共同发布双方在AI推理领域的最新应用成果。论坛还邀请了来自信通院、清华大学、科大讯飞等机构的专家，他们分享了在优化大模型推理速度及提升用户体验方面的前沿经验。

华为数据存储产品线副总裁樊杰在演讲中强调了高质量行业数据与高性能存储对AI发展的重要性。他指出，未来的AI飞跃将在很大程度上依赖于此，高性能AI存储系统能把数据加载时间从数小时缩短至几分钟，同时让算力集群的效率翻倍。

华为计划在2025年9月正式开源UCM技术，首发平台是魔擎社区。后续，华为会逐步将该技术贡献给业界主流的推理引擎社区，并向所有采用“共享一切”(Share Everything)架构的存储厂商及生态伙伴开放共享。

本文仅代表作者观点，版权归原创者所有，如需转载请在文中注明来源及作者名字。

免责声明：本文系转载编辑文章，仅作分享之用。如分享内容、图片侵犯到您的版权或非授权发布，请及时与我们联系进行审核处理或删除，您可以发送材料至邮箱：service@tojoy.com