近日,我院徐晟老师课题组在存算一体化(Processing-in-Memory, PIM)架构与图计算加速领域取得重要研究进展,连续两项研究成果被计算机体系结构与集成电路领域的顶级国际期刊接收。这两项成果分别为:发表于IEEE Transactions on Very Large Scale Integration (VLSI) Systems期刊的论文“Identifying Optimal Workload Offloading Partitions for CPU-PIM Graph Processing Accelerators”,以及发表于IEEE Transactions on Emerging Topics in Computing (TETC)期刊的论文“Balancing Graph Processing Workloads in Heterogeneous CPU-PIM Systems”。
IEEE TVLSI与IEEE TETC均是专注于集成电路与新兴计算系统设计的国际权威期刊,在计算机体系结构、电子设计自动化及高性能计算领域具有极高的学术影响力。两篇论文均以安徽师范大学为第一单位,第一作者为徐晟老师,其指导的2023级硕士研究生李城作为学生第一作者深度参与了论文的核心工作,中国科学院计算技术研究所陈晓明研究员为论文的共同通讯作者。
研究成果一:RDPIM——面向CPU-PIM图计算加速器的最优卸载框架
存内计算架构通过将计算逻辑集成于内存中,极大缓解了传统冯·诺依曼架构中的“内存墙”瓶颈。然而,如何将程序精确地划分为适合主机处理器与内存端处理单元执行的代码块,是该领域的核心挑战。现有方法依赖详尽的程序剖析构建控制流图(Control-Flow Graph, CFG),但没有考虑到在PIM环境下,代码块的实际执行时间会因缓存命中率、数据冲刷及远程访问等因素发生剧烈波动,从而导致卸载决策不准确。
针对这一问题,研究团队提出了名为RDPIM的性能变异性感知卸载框架。该工作系统性地研究了导致代码块执行时间在PIM环境下剧烈变化的三个关键特征:缓存缺失、数据冲刷和远程访问。通过对数据依赖与输入图连通性的深入分析,团队创新性地提出了一种基于重用距离(Reuse Distance, RD)的分析模型,首次将RD分析引入PIM架构,能够精准预测不同卸载方案下代码块的实际性能,从而指导生成最优的任务划分方案。实验表明,与纯CPU执行相比,RDPIM平均实现了2倍加速,与当前最先进的PIM卸载方案相比,加速比最高可达1.6倍,显著提升了CPU-PIM异构系统的能效。

研究成果二:CAPLBS——面向异构CPU-PIM系统的在线负载均衡调度器
在解决了“如何最优卸载”的问题后,团队进一步关注“如何均衡执行”的挑战。现有PIM图计算加速器为了最大化近数据处理优势,通常倾向于将大量工作负载卸载至内存端,这往往导致强大的主机处理器被闲置,而性能相对较弱的内存端计算核心过载,造成严重的负载失衡与资源浪费。
为解决该问题,团队提出了名为CAPLBS的在线负载均衡调度框架。其核心思想是在主机处理器空闲时,以最小的片外数据同步开销,将内存端的工作负载“偷取”回主机端执行。为了精确量化复杂工作负载在不同计算单元间的数据竞争程度,团队深入探索了输入图的拓扑连接性与不同图算法的访存模式,提出了“局部性凝聚子图(Locality Cohesive Subgraph, LCS)”结构,并设计了“PIM-skew”和“Locality-skew”两项创新性指标,用于在线预测数据竞争并做出最优的负载窃取决策。实验结果显示,CAPLBS相较于纯CPU执行实现了平均4.8倍加速(最高9.1倍),相较于当前最先进的局部感知细粒度原子操作卸载方案,性能提升了1.3倍。该框架无额外硬件开销,可与现有所有PIM图加速器互补工作。

以上两项研究成果的连续发表,标志着我院在存内计算、图计算加速及异构系统协同设计等前沿方向的研究水平达到了新高度。该系列工作是团队在智能物联与计算机系统结构领域长期积累的成果,也是我院在“人工智能+新硬件”交叉学科方向上科研实力与人才培养能力的有力体现。