计算机研究与发展杂志2025年第5期
-
- Neptune:一种通用网络处理器微结构模拟和性能仿真框架
- 林涵越,吴婧雅,卢文岩,钟浪辉,鄢贵海,
- 网络包处理是网络设备的基本功能,涉及报文修改、校验和与哈希计算、数据包镜像或过滤、统计限速等多项任务.作为网络包处理的重要部件,网络处理器(networkprocessor,NP)基于处理器结构,为网络设备提供线速的性能和充分的可编程能力,但其架构多样,可分为单段式架构和多段式架构,现有模拟方法无法同时对二者性能进行模拟仿真.因此,提出一种通用网络处理器的结构模拟和性能仿真框架Neptune,采用多段式架构作为硬件抽象,使用事件链表、核间队列结构为数据通路和多段式架构模拟提供保障,同时满足单段式架构模拟需求.另外,借助同步图计算模式进行准确的并行模拟,并采用混合事件与时间驱动方法保障模拟高效性.实际测试中,Neptune以95%以上准确率支持2种架构的模拟,并以3.31MIPS的性能对网络处理器进行模拟,相较PFPSim取得1个数量级的性能提升.最后,展示了3个运用该框架进行网络处理器优化分析的应用案例.
-
- FireLink:一种面向芯粒设计空间探索的评估框架
- 李开,曾坤,荣培涛,陈志强,张甜,王永文,
- 基于先进封装技术的芯粒(Chiplet)集成芯片在制造成本、设计效率以及专用定制等方面更具优势,是延续芯片性能增长的有效途径.设计空间探索(designspaceexploration,DSE)作为体系结构量化分析的重要方法,能够帮助设计者理解并权衡设计参数间的复杂关系.但是将传统的芯片体系结构DSE方法直接应用于Chiplet设计时,存在评估不全面、模拟不精确以及探索效率低下等问题,针对这些问题提出了解决方案FireLink,作为一个面向Chiplet设计空间探索的评估框架,它支持Chiplet微架构以及互连网络的建模和模拟,具备高效评估性能、功耗、面积和成本指标的能力.此外,在该框架下采用了ID3(iterativedichotomiser3)机器学习算法进行了实验,结果显示该框架能够有效提高DSE的效率.与现有的DSE框架和方法相比,FireLink在评估全面性、建模完整性和高效性方面具有显著优势,使得设计者能够在更短时间内探索更广泛的设计空间,进而选定较优的Chiplet设计方案.
-
- 一种面向纠删码的存储库优化方法
- 谢汶兵,关睿雪,张艺鸣,李佳梅,王俊,
- 信息时代,数据存储的可靠性、一致性、安全性和实时性至关重要.纠删码(erasurecode,EC)在允许多个存储设备发生故障的同时保证最低的存储开销,被大量应用在数据存储领域.纠删码的编码与解码运算具有计算密集的特征,其性能高低直接影响存储系统的使用效率.作为编码和解码运算中最耗时的部分,多层循环包裹的伽罗华域乘法计算是纠删码优化的一个焦点.首先分析了伽罗华域乘法计算的查表方法中常用的log查表法(LT)、完全乘法查表法(MT)、移位分解法(SH)的优劣势,然后对已有的伽罗华域GF(28)查表方法进行了优化,提出4b分割法以大幅减少查表开销.在此基础上,利用64位现代处理器体系结构特点,从数据访问粒度扩展和单指令多数据(singleinstructionmultipledata,SIMD)向量化利用实现数据级并行化2个角度优化了多层循环中的数据级访问粒度,提高了编码与解码的运算性能.基于开源存储加速库(Intelstorageaccelerationlibrary,ISA-L)在申威平台和x86平台上实现和验证了上述优化方法的有效性.结果表明所提优化方法在不同数据规模下均有加速效果,申威平台与优化前相比平均性能加速比为3.28倍,x86平台与优化前相比平均性能加速比为2.36倍.
-
- 面向LoongArch边界检查访存指令的GCC优化
- 舒燕君,郑翔宇,徐成华,黄沛,王永琪,周凡,张展,左德承,
- 为了减少内存安全检查的开销,LoongArch指令集架构引入了边界检查访存类指令.然而,作为一种新的内存访问指令,目前GCC(GNUcompilercollection)编译器不支持该类指令,LoongArch硬件能力不能得到充分利用.针对此LoongArch边界检查访存指令改进了GCC编译器,实现利用该类指令优化程序的内存安全检查.具体而言,完成了3个方面的工作:1)设计实现了针对边界检查访存指令的内建函数;2)改进GCCRTL(registertransferlanguage)阶段的优化器,使其能够识别无异常处理和带异常处理2种情况的边界检查访存语义,并自动优化;3)面向LoongArch边界检查访存指令触发的边界检查异常(boundcheckexception,BCE),设计了新的Linux内核异常信号SIGBCE和相应的运行时库glibc(GNUClibrary)的信号处理函数,实现了BCE处理.通过在GCC12.2.0和龙芯3C5000L服务器进行实验,验证了改进后的编译器不仅能正确使用新引入的边界检查访存指令,而且在某些安全函数中带来接近20%的性能提升.完善了LoongArch生态,推进了LoongArch指令集发展,对此类特定指令编译器优化工作有一定的借鉴意义.
-
- 考虑长度匹配的快速单通量量子电路布线算法
- 刘耿耿,余延涛,周茹平,魏榕山,徐宁,
- 由于快速单通量量子(rapidsingle-flux-quantum,RSFQ)电路的高频特性,对电路的版图设计构成了巨大挑战.针对RSFQ电路的高频特性带来的电路时延问题,可以在布线阶段通过使用延时元件如无源传输线来解决.因为无源传输线的时延与它的长度近似成正比,且传输线的功耗不随着线长增加而增大,所以对于快速单通量量子电路而言长度匹配布线是一个非常重要的问题.为此,提出了一种高效的考虑长度匹配的RSFQ电路布线算法,包括3个关键策略:1)在生成初始路径时,提出了一种迂回布线的方法,在不改变初始布线空间的情况下,满足无源传输线的部分长度匹配;2)提出了一种基于区域感知的迭代资源插入策略,减少需要添加的额外资源区域;3)提出了一种考虑阻塞代价的长度匹配驱动布线策略,提高了对布线空间的资源利用.实验结果表明所提算法与现有的多端布线算法相比,布线所需的区域面积减少了8%,运行时间减少了36%,从而取得快速且高质量的布线结果.
-
- 大模型时代的混合专家系统优化综述
- 史宏志,赵健,赵雅倩,李茹杨,魏辉,胡克坤,温东超,金良,
- 近年来,大模型推动自然语言处理、机器视觉等众多领域取得前所未有的进展.混合专家(mixtureofexperts,MoE)凭借在模型参数扩展、计算成本控制和复杂任务处理等方面的独特优势成为大模型的主流架构之一.然而,随着参数规模的持续增长,系统的执行效率和可扩展能力愈发难以满足需求,亟待解决.系统优化方法是解决这一挑战的有效途径,日益成为研究热点.故综述大模型时代MoE系统优化技术的研究现状,首先介绍MoE大模型的发展现状,并分析其在系统端面临的性能瓶颈;然后从内存占用、通信延迟、计算效率和并行扩展4个系统核心维度对最新的研究进展进行全面梳理和深入分析,并对其中涉及的关键技术、适用场景和待优化方向进行详细对比阐述;最后总结MoE系统优化的研究现状,并展望未来研究方向.
-
- 基于类别对抗联合学习的跨提示自动作文评分方法
- 张春云,赵洪焱,邓纪芹,崔超然,董晓琳,陈竹敏,
- 自动作文评分(automatedessayscoring,AES)能够有效减轻教师的作文评阅负担并为学生提供客观、及时的反馈,是自然语言处理在教育领域的一项重要应用.跨提示AES旨在学习一个可迁移的自动评分模型,使之能够有效为目标提示的作文评分.然而,现有的跨提示AES大都是面向目标提示数据可见的场景,通过将源提示和目标提示的特征分布进行对齐,学习提示不变特征表示来学习可迁移到目标提示的评分模型,但是这类方法无法应用于目标提示数据不可见的场景.面向目标提示数据不可见的场景,提出一种基于类别对抗联合学习的跨提示AES方法.一方面,通过对分类和回归联合任务进行联合建模来学习2个任务的共享特征,从而实现二者性能的相互促进;另一方面,不同于现有方法采用提示无关特征来提升模型泛化性能,针对不同提示的类别分布差异引入类别对抗策略,通过对不同提示进行类别级特征对齐,学习不同提示间的细粒度不变特征表示,从而提升模型泛化性能.将所提出方法用于自动学生评估奖(ASAP)和ASAP++数据集,分别对作文的总体评分和属性评分进行预测.实验结果表明,与6种经典方法相比,在平方卡帕(QWK)指标上取得最好的实验效果.
-
- 四元数神经网络的通用近似与逼近优势
- 吴锦辉,姜远,
- 四元数神经网络将实值神经网络推广到了四元数代数中,其在偏振合成孔径雷达奇异点补偿、口语理解、机器人控制等任务中取得了比实值神经网络更高的精度或更快的收敛速度.四元数神经网络的性能在实验中已得到广泛验证,但四元数神经网络的理论性质及其相较于实值神经网络的优势研究较少.从表示能力的角度出发,研究四元数神经网络的理论性质及其相较于实值神经网络的优势.首先,证明了四元数神经网络使用一个非分开激活的修正线性单元(rectifiedlinearunit,ReLU)型激活函数时的通用近似定理.其次,研究了四元数神经网络相较于实值神经网络的逼近优势.针对分开激活的ReLU型激活函数,证明了单隐层实值神经网络需要约4倍参数量才能生成与单隐层四元数神经网络相同的最大凸线性区域数.针对非分开激活的ReLU型激活函数,证明了单隐层四元数神经网络与单隐层实值神经网络间的逼近分离:四元数神经网络可用相同的隐层神经元数量与权重模长表示实值神经网络,而实值神经网络需要指数多个隐层神经元或指数大的参数才可能近似四元数神经网络.最后,模拟实验验证了理论.
-
- 消除互补性争议的多视图聚类算法
- 赵玉涵,陈松灿,
- 多视图聚类旨在利用来自不同视图的异构信息发现底层数据结构,并划分样本所属类别.一致性和互补性是影响多视图聚类性能的2个关键要素.一致性强调不同视图间的语义相似性,互补性则强调每个视图内特有信息的相互补充.目前对一致性研究已相对深入,但对互补性研究存在争议,其中一些方法认为一致性和互补性能互助,但仅将二者约束至同一特征空间中实际上造成了二者的冲突.而另一些方法则据此认为应丢弃互补信息,但这又造成信息浪费.直觉上互补性应该存在,贡献在于发现了现有方法没有足够洞悉并触及到互补性的本质,即一致性和互补性并非独立而是相互耦合,结果导致冲突.受此启发,通过解耦实现了2种信息的分离,具体使它们位于不同的特征子空间而非现在的同一特征空间,从而发展出了一种兼顾一致性和互补性的多视图聚类算法,在有效提取出互补信息的同时避免二者冲突.在标准数据集上的对比实验验证了所提算法的有效性.
-
- 基于增量信息交互的极小不可满足子集求解算法
- 蒋璐宇,欧阳丹彤,张奇,太然,张立明,
- 极小不可满足子集(minimalunsatisfiablesubset,MUS)的求解是理论计算机科学的重要问题.由于MUS的个数随问题规模呈指数级增长,现有算法致力于在合适的时间限制内求解出尽可能多的MUS.在庞大的搜索空间中,选择合适的节点来扩展可以大幅减小收缩和扩充操作的时间开销,从而提高算法的求解效率.提出一种基于增量信息交互的MUS求解算法MARCO-MSS4MUS,利用MUS、极小修正集(minimalcorrectionset,MCS)和极大可满足子集(maximalsatisfiablesubset,MSS)之间的对偶和互补关系,在采用MARCO算法框架增量求解MSS和MUS的过程中,根据已求解的MSS的交集和并集信息辅助选择节点来扩展,即通过增量的MSS信息启发用于扩展节点选择以加速MUS枚举,这一过程同时利于算法找到更多的MSS,在枚举过程中新识别出的MSS又能辅助下一轮扩展节点的选择,从而实现了增量信息的有效交互.针对交互的增量信息提出2个定理及2个推论,从理论角度分析了MARCO-MSS4MUS算法的可行性,并通过MUS标准测试用例上的实验验证了所提算法相较于当前先进算法的优越性,在部分测试用例上的结果显示所提算法的枚举效率和枚举获胜个数较已有算法均有显著的提高.
-
- 弹性梯度集成的概念漂移适应
- 郭虎升,张羽桐,王文剑,
- 随着流数据的大量涌现,概念漂移已成为流数据挖掘中备受关注且具有挑战性的重要问题.目前,多数集成学习方法未针对性地识别概念漂移类型,并采取高效的集成适应策略,导致模型在不同漂移类型上的性能参差不齐.为此,提出了一种弹性梯度集成的概念漂移适应(elasticgradientensembleforconceptdriftadaptation,EGE_CD)方法.该方法首先通过提取梯度提升残差,计算流动残差比检测漂移位点,之后计算残差波动率识别漂移类型;然后,利用学习器损失变化提取漂移学习器,结合不同漂移类型与残差分布特征删除对应学习器,实现弹性梯度剪枝;最后,将增量学习与滑动采样方法结合,通过计算最优拟合率优化学习器拟合过程,再根据残差变化实现增量梯度生长.实验结果表明,所提方法提高了模型对不同漂移类型的稳定性与适应性,取得了良好的泛化性能.
-
- 面向子空间聚类的多视图统一表示学习网络
- 林毓秀,刘慧,于晓,张彩明,
- 多视图子空间聚类旨在挖掘多视图的丰富信息来指导高维数据聚类,其研究关键在于如何有效地学习多视图统一表示和子空间表示.近年来,深度聚类方法利用神经网络强大的表征能力取得了优异的性能.然而,多视图数据固有的多源异构性使得大多数现有方法以单模态编码器实现对各个视图的独立编码,不仅增加了模型参数量,同时限制了模型的泛化能力.另一方面,低秩子空间表示被证明能够提升聚类性能,传统的核范数正则化优化没有考虑不同奇异值隐含的信息量差异,是矩阵秩的一个有偏估计.为此,提出了一种面向子空间聚类的多视图统一表示学习网络.首先,基于Transformer构建编码器,通过共享参数将异构视图以相同的映射规则投影到低维特征空间.其次,针对每个样本在不同视图中可能具有不同的表现,采用视图内样本加权融合的方法学习多视图统一表示.最后,引入加权Schatten-p范数对子空间表示矩阵施加低秩约束.在7个多视图数据集上的广泛实验验证了所提方法的有效性和优越性.
-
- 以太网RDMA网卡综述
- 黄曼蒂,李韬,杨惠,李成龙,张毓涛,孙志刚,
- 目前数据中心规模迅速扩大和网络带宽大幅度提升,传统软件网络协议栈的处理器开销较大,并且难以满足众多数据中心应用程序在吞吐、延迟等方面的需求.远程直接内存访问(remotedirectmemoryaccess,RDMA)技术采用零拷贝、内核旁路和处理器功能卸载等思想,能够高带宽、低延迟地读写远端主机内存数据.兼容以太网的RDMA技术正在数据中心领域展开应用,以太网RDMA网卡作为主要功能承载设备,对其部署发挥重要作用.综述从架构、优化和实现评估3个方面进行分析:1)对以太网RDMA网卡的通用架构进行了总结,并对其关键功能部件进行了介绍;2)重点阐述了存储资源、可靠传输和应用相关3方面的优化技术,包括面向网卡缓存资源的连接可扩展性和面向主机内存资源的注册访问优化,面向有损以太网实现可靠传输的拥塞控制、流量控制和重传机制优化,面向分布式存储中不同存储类型、数据库系统、云存储系统以及面向数据中心应用的多租户性能隔离、安全性、可编程性等方面的优化工作;3)调研了不同实现方式、评估方式.最后,给出总结和展望.
-
- 无丢失网络流量管理综述
- 张乙然,王尚广,任丰原,
- 近年来,无丢失网络在高性能计算、数据中心等领域得到了广泛应用.无丢失网络通过链路层流量控制技术保障网内交换机不会因缓存溢出而丢包,避免了数据丢失与重传,极大提高了应用的时延和吞吐量性能.然而,链路层流量控制带来的负面效应(拥塞扩展、死锁等)使得无丢失网络的大规模部署面临着诸多挑战.因此,引入流量管理技术来提升无丢失网络的可扩展性得到了更多关注.对应用于高性能计算领域和数据中心领域的典型无丢失网络InfiniBand和无丢失以太网的流量管理研究进展进行系统性综述,首先介绍链路层流量控制的负面影响和流量管理的目标,总结无丢失网络传统的流量管理架构.然后根据流量管理技术路线(拥塞控制、拥塞隔离、多路径负载均衡等)以及驱动的位置(发送端驱动、接收端驱动等),对InfiniBand和无丢失以太网流量管理的最新研究进展进行分类和阐述,分析对应的优势以及局限性.最后指出无丢失网络流量管理进一步研究中需要着重探索的问题,包括无丢失网络流量管理统一架构、主机内与网络联合流量管理以及面向领域应用的流量管理.
-
- OpenPlanner:一个开源的时间敏感网络流量规划器
- 姜旭艳,全巍,付文文,张小亮,孙志刚,
- 时间敏感网络(time-sensitivenetworking,TSN)在工业控制、航空电子和车载网络中具有广泛的应用前景.TSN流量规划是在拓扑结构、网络资源、设备能力和业务需求等多维约束下,为TSN交换机计算关键帧的无冲突发送时刻的过程,规划问题是一个NP完全问题.目前不论是学术界的TSN规划算法研究,还是工业界的TSN部署应用都急需一个开源的规划器软件.提出一种构件化、松耦合的TSN规划器软件架构LOCAP(loose-coupledcomponent-basedarchitectureofplanner),通过规划参数最小集和规划结果通用表等接口规范设计,实现规划算法与规划工具、规划器软件与交换硬件实现的松耦合.OpenPlanner是基于LOCAP架构使用Python语言编写的开源TSN规划器,其内嵌自研和第三方贡献的多个可满足性模理论规划算法和启发式规划算法.基于OpenPlanner对不同算法的运行时间开销以及解的质量进行了评估,指出多样化的TSN应用场景需要不同的规划算法.据调研,OpenPlanner是目前唯一的开源TSN规划器,规划结果已部署到OpenTSN开源网络、银河衡芯TSN芯片以及芯准TTE等多个硬件平台,在卫星、无人车和火炮等多个系统中得到应用.
