根据公开资料,芯展速于WAIC 2026展出了其AI90软硬件一体化AI推理加速方案。本次展示的核心亮点之一是该方案在提升生成式AI模型推理效率方面的能力。
具体来看,芯展速的AI90方案结合了智能P2P多卡互联技术。这项技术使得使用8卡NVIDIA GeForce RTX 5090集群进行推理加速时,性能可达到5.8倍的提升,并且支持处理超过128K的上下文长度。
在系统架构层面,为了支撑AI模型运行过程中产生的特定数据写入需求,芯展速同步推出了PT200Z AI SSD。这一配套产品旨在解决KV Cache卸载操作所带来的高写入负载问题,确保整个推理流程的稳定性和高效性。
从时间线角度看,本次展示发生在WAIC 2026期间,标志着芯展速在AI硬件加速领域发布了其最新的技术成果。这为业界提供了一个观察前沿AI计算解决方案的时间节点。
谈及背景,当前大型语言模型(LLM)的快速发展对算力提出了极高的要求。推理阶段的效率和内存管理成为制约模型规模扩展的关键瓶颈。芯展速 AI90方案正是针对这一行业痛点进行深度优化的体现。
在适用场景方面,AI90方案尤其适用于需要处理超长上下文、高并发请求的大型企业级AI应用,例如复杂的代码生成、长篇文档摘要或多轮对话系统等。其对大模型的支持能力是关键卖点之一。
从影响分析来看,芯展速 AI90固态硬盘显存化方案的亮相,预示着AI推理加速正朝着软硬件深度融合和内存级计算的方向发展。将存储层级的特性引入到模型推理流程中,有望突破传统GPU内存带宽的限制。
观察点在于,本次展示不仅关注了算力的提升(5.8倍加速),也同时解决了数据持久化和写入性能的问题(PT200Z AI SSD)。这种从计算能力到存储支撑的整体解决方案布局,是值得行业持续关注的重点。
对于业界开发者和企业用户而言,芯展速此次展示提供了一个参考点:未来AI基础设施的优化将是一个系统工程,需要同时考虑互联技术、核心算力以及高效的存储协同工作。建议关注后续该方案在实际大规模部署中的性能验证报告。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。