计算机研究与发展杂志

计算机研究与发展杂志2023年第5期

  • 机器学习方法赋能系统软件:挑战、实践与展望
    唐楚哲,王肇国,陈海波,
    机器学习方法为构建系统软件带来了新的机遇.为充分利用硬件资源支撑新型应用,系统软件的设计与实现需要不断改进与演化,以适应不同场景的需求.机器学习方法具有从数据中提取规律并自动优化系统性能的潜力.然而,使用机器学习方法赋能系统软件面临一些挑战,包括设计面向系统软件的定制化模型、获取足量且高质量的训练数据、降低模型开销对系统性能的影响,以及消除模型误差对系统正确性的影响等.介绍了上海交通大学并行与分布式系统研究所在索引结构、键值存储系统、并发控制协议等方面应用机器学习方法优化系统软件的实践,并从模型设计、系统集成和实践者自身知识储备等方面总结了经验与教训.此外,还回顾了国内外相关研究,并对此研究方向提出了展望与建议,希望为未来的研究提供参考与帮助.
  • CPU-GPU MPSoC中使用寿命驱动的OpenCL应用调度方法
    曹坤,龙赛琴,李哲涛,
    近年来,集成CPU和GPU的多处理器片上系统(multiprocessorsystem-on-chips,MPSoC),凭借兼顾GPU核心的并行计算能力和CPU核心的通用计算能力,已经广泛应用于工业控制、汽车电子、智慧医疗等领域.为了充分发挥CPU-GPUMPSoC的性能,开放计算语言(opencomputinglanguage,OpenCL)逐渐成为一种主流的应用程序编写标准.然而,在将OpenCL应用部署到CPU-GPUMPSoC的过程中,现有研究工作大多忽略了对芯片温度和使用寿命的管理,导致处理器核心在执行应用时超过了峰值温度,甚至永久性故障的提前发生,无法保证OpenCL应用的长久稳定运行.为了弥补上述缺点,提出了一种包含静态和动态应用调度技术的方法.静态应用调度技术是基于改进交叉熵策略,将OpenCL应用的特性充分考虑在内,有效提高了OpenCL应用设计点的寻优效率.动态应用调度技术是基于反馈控制策略,克服了传统方案中无法有效应对系统运行时新到应用的缺陷,能够最小化新到应用的平均延迟.实验表明,所提方法可以将应用的平均延迟降低34.58%,同时满足温度、能耗、使用寿命的约束.
  • 异构多核全局限制性可抢占并行任务可调度分析
    韩美灵,孙施宁,邓庆绪,
    异构多核平台可以利用不同类别体系结构的处理器来执行特定任务,从而达到提高性能和降低功耗的目的.然而,向大规模异构平台迁移极其困难,且大规模的、必要的程序并行会导致软件调度的复杂度.虽然,基于有向无环图(directedacyclicgraph,DAG)并行任务模型已有相关的研究工作,但是基于DAG任务模型的限制性可抢占的调度策略研究仍存在不足.鉴于此,主要讨论了DAG任务在异构平台上进行全局固定优先级限制性可抢占调度时的最差响应时间(worstcaseresponsetime,WCRT)分析,对并行任务的每个结点可用的处理器资源进行了一定的限制,即只能执行在规定类型处理器上的任务.基于最新的单分类并行任务的可调度性分析,提出了多个并行任务的可调度性分析.进一步,提出了高优先级任务的干涉量与低优先级任务的阻塞量的计算方法;结合最新的分类并行任务的任务内干涉计算方法,最终提出了一种伪多项式的分析方法.实验结果表明,提出的算法能够在合理的时间范围内得到任务集可调度性的分析结果,且任务集的接受率随各个参数的变化符合预期.
  • Mort:面向实时数据分发和传输优化的依赖性任务卸载框架
    殷昱煜,苟红深,李尤慧子,黄彬彬,万健,
    在边缘协同计算中,单一设备已无法满足大量复杂任务对系统高计算能力和低时延的需求,通常需要将任务卸载到邻近具有丰富计算存储资源的边缘服务器上,同时,通过发布订阅模式构建统一的通信协议,支撑任务对数据共享和隐私保护的需求.在发布订阅系统中,任务往往具有依赖性、执行周期性和高频率数据分发等特性,而传统的任务卸载算法主要针对数据单次传输和任务单次执行的场景,无法有效应对发布订阅系统中的任务卸载问题.因此,设计一个任务卸载及管理框架Mort.该框架使用基于静态代码分析的任务分解方法解构任务之间的依赖性,支撑任务并行;采用基于非线性整数规划建模和基于分组及资源融合的卸载算法,优化网络数据传输;采用基于协程的调度模型调度卸载后的任务,减少任务调度开销.大量的仿真实验和真实场景实验表明,Mort的数据传输优化能达到最优解的80%~90%,且引入的系统开销仅约为2%.
  • 实时计算机系统结构综述
    龚小航,蒋滨泽,陈香兰,高银康,李曦,
    在时间敏感的嵌入式系统中,任务需要满足其最后截止期限,错失任务期限会显著影响服务质量或带来灾难性后果.与通用系统相比,实时系统研究进展缓慢,甚至很多基本概念都未达成共识.精确计时(precisiontimed,PRET)机和实时处理单元(real-timeprocessingunit,RPU)是2套现有的实时系统解决方案,以它们为例介绍实时系统相关的概念,阐述实时系统发展中遇到的问题,比较异同,并分析实时系统各个层次遇到的问题和现有的解决方法.在应用层,用户需要定时操作的接口;在指令集架构(instructionsetarchitecture,ISA)层,应充分利用硬件提供的资源,向上层提供足够的时间语义抽象和计时精度;硬件层需要支持ISA的时间属性和时间语义,并在保证实时性的基础上尽可能地提高性能.对实时系统的研究面临许多挑战.在现有的实时系统设计研究的过程中,关键问题在于上层应用的时间语义难以与底层实现保持一致.
  • 时间和能量敏感的端—边—云车路协同系统资源调度优化方法
    郑莹莹,周俊龙,申钰凡,丛佩金,吴泽彬,
    随着信息技术的不断发展,智能交通系统逐渐成为未来交通的发展方向.然而,智能交通系统中时间敏感型和计算密集型应用的日益增多,给资源有限的车辆终端带来了严峻挑战.端—边—云层次性计算架构是应对该挑战的有效手段.在基于端—边—云架构的车路协同系统中,车辆用户可以将时间敏感型任务卸载到附近的路边单元执行以保证应用的实时性,而将计算密集型任务卸载到云以满足其算力需求.但是,任务卸载也会导致额外的传输时延和能量开销.此外,任务在传输过程也可能遭受错误而导致可靠性降低.因此,为保障端—边—云车路协同系统中车辆的用户体验,提出一种基于多智能体强化学习的资源调度方案.该方案通过充分利用端—边—云架构的特点并采用集中训练—分散执行的框架来构建深度神经网络,以制定任务卸载和车路计算资源分配的最优决策,最终实现可靠性约束下的系统时延和能耗优化.为验证所提方案的有效性,实验通过效用值来体现算法在时延和能耗2方面的优化.实验结果表明,与现有算法相比,所提方案在满足可靠性约束的前提下,效用值可以提高到221.9%.
  • SAF-CNN:面向嵌入式FPGA的卷积神经网络稀疏化加速框架
    谢坤鹏,仪德智,刘义情,刘航,赫鑫宇,龚成,卢冶,
    传统的卷积神经网络加速器及推理框架在资源约束的FPGA上部署模型时,往往面临设备种类繁多且资源极端受限、数据带宽利用不充分、算子操作类型复杂难以适配且调度不合理等诸多挑战.提出一种面向嵌入式FPGA的卷积神经网络稀疏化加速框架(sparseaccelerationframeworkofconvolutionalneuralnetwork,SAF-CNN),通过软硬件协同设计的方法,从硬件加速器与软件推理框架2个角度进行联合优化.首先,SAF-CNN构建并行计算阵列,并且设计并行编解码方案,实现单周期多数据的传输,有效减少通信代价.其次,设计细粒度结构化块划分剪枝算法,于输入通道维度进行块内裁剪来获得稀疏且规则的权重矩阵,借此显著降低计算规模和DSP乘法器等资源占用.然后,提出一种兼容深度可分离卷积的输入通道维度动态拓展及运行时调度策略,实现输入通道参数灵活适配与逐通道卷积和逐点卷积的资源复用.最后,提出一种计算图重构及硬件算子融合优化方法,提升硬件执行效率.实验采用2种资源受限的低端FPGA异构平台IntelCycloneV与XilinxZU3EG,结果表明SAF-CNN加速器可分别实现76.3GOPS与494.3GOPS的计算性能.与多核CPU相比,SAF-CNN在进行SSD_MobileNetV1目标模型检测时,可实现3.5倍与2.2倍的性能提升,模型推理速度高达26.5fps.
  • 面向边缘计算的服务解耦与部署策略
    李丽颖,张润泽,魏同权,
    在这个万物互联的时代,海量的设备和数据、云和设备之间存在巨大的传输延迟,给开发应用、处理数据、最终提升系统的服务质量带来了多重挑战.因此,通过在终端设备附近部署计算能力以显著减少传输到云服务器的数据量和服务请求的响应时间的边缘计算结构应运而生.然而,负载均衡、边缘设备的安全性和移动性依旧是影响边缘计算架构的服务质量的关键点.为了解决上述问题,提出了一种2阶段的服务质量优化方案以解决移动边缘计算架构下的服务部署问题.在第1阶段,考虑了服务的解耦和边缘服务器的负载均衡问题,对服务部署问题进行建模,提出了一种集中式服务的实时解耦方案,并且设计了一种静态部署策略;在第2阶段,考虑了边缘设备的移动性,设计了一种设备移动感知的服务动态部署策略,优化了移动边缘计算架构下的服务质量.在2个数据集上的实验结果表明,所提出的静态部署策略能够使服务请求的响应时间降低36%,所提出的动态部署策略能进一步降低13%的服务响应时间.
  • ROS2多线程执行器上DAG任务的优先级分配方法
    纪东,魏阳杰,李宇溪,王义,
    随着机器人操作系统(robotoperatingsystem,ROS)的日益普及,系统也变得更加复杂,这类系统的计算平台正逐渐转变为多核心平台.在ROS中,任务执行的顺序取决于底层任务调度策略和分配给任务的优先级,而最大限度地缩短所有任务的执行时间是并行系统任务调度的一个重要目标.受强化学习在解决各种组合优化问题的最新研究成果的启发,在考虑ROS2多线程执行器的调度机制和执行约束的前提下,提出了一种基于强化学习的任务优先级分配方法,该方法提取了基于有向无环图形式表示的任务集的时间和结构特征,通过策略梯度和蒙特卡洛树搜索(MonteCarlotreesearch,MCTS)方法有效地学习ROS2调度策略并给出合理的优先级设置方案,最终达到最小化并行任务的最大完工时间的目的.通过模拟平台环境下随机生成的任务图以评估所提方法,结果表明所提方法明显优于基准方法.作为一种离线分析方法,所提方法可以很容易地扩展到复杂的ROS中,在可接受的时间内找到接近最优的解决方案.
  • 基于公共情感特征压缩与融合的轻量级图文情感分析模型
    甘臣权,付祥,冯庆东,祝清意,
    由于图文结合更能反映用户的态度和立场,图文情感分析已成为研究热点之一.然而,现有图文情感分析方法无法有效地提取融合图文信息,致使模型性能低、参数量大、不易部署.对此,提出了一种基于公共情感特征压缩与融合的轻量级图文情感分析模型.该模型结合卷积层和全连接层设计的图文特征压缩模块在提取图文特征的同时也进行了压缩,降低了特征维度.此外,提出了一种基于门控机制的公共情感特征融合模块,将图文特征映射到相同的情感空间,消除了图文特征间的异构性,通过提取、融合图像和文本的公共情感特征,减少了冗余信息.在Twitter,Flickr,GettyImages这3个基线数据集上的实验结果表明:所提模型比早期模型更有效地提取融合了图文情感信息;和最新模型相比,所提模型大大减少了模型参数并具有更优越的性能,更易部署.
  • 利用混杂核模糊补互信息选择特征
    袁钟,陈红梅,王志红,李天瑞,
    模糊粗糙集理论目前在数据挖掘和机器学习等领域受到了广泛的关注.该理论提供了一种能克服离散化问题的有效工具,并能直接应用于数值或混合属性数据.在模糊粗糙集模型中,定义模糊关系来测量对象之间的相似性,数值属性值不再需要离散化.模糊粗糙集理论已经被成功应用于许多领域,如属性约简、规则提取、聚类分析和离群点检测.信息熵被引入到模糊粗糙集理论进行模糊和不确定信息的表示,产生了不同形式的模糊不确定性度量,如模糊信息熵、模糊补熵和模糊互信息等.然而,大部分所提关于决策的模糊互信息都是非单调的,这可能导致一个不收敛的学习算法.为此,基于混杂核模糊补熵,定义了关于决策的模糊补互信息,证明了其随特征呈单调性变化.进而,利用混杂核模糊补互信息探索特征选择方法并且设计了相关的算法.实验结果展示了在大多数情况下所提算法可以选取更少的特征且能保持或提高分类准确率.
  • 基于图神经网络的OpenCL程序自动优化启发式方法
    叶贵鑫,张宇翔,张成,赵佳棋,王焕廷,
    物联网的发展与普及促使计算机异构架构迅速发展,开放运算语言(opencomputinglanguage,OpenCL)作为首个跨平台异构并行计算框架,具有标准化、可移植性等优点,但因不同平台下软硬件的复杂性和多样性,使OpenCL在性能上的移植性存在一定的缺陷.现有的方法通过深度学习构建优化模型来提高程序运行效率,但所构建的预测模型仅考虑代码的顺序依赖关系,忽略了语法语义信息,导致代码优化效果不明显.为解决上述问题,提出了一种基于多关系图神经网络的OpenCL程序自动优化启发式方法.该方法首先把OpenCL代码转换成多关系代码图,能够提取代码的深度结构与语法语义特征;然后利用改进后的图神经网络模型,将构建的代码图编码为高维的特征向量;最后使用决策网络完成任务预测.为验证方法的有效性,分别在异构设备映射和线程粗化因子预测2个任务上进行实验评估.结果表明,在异构设备映射任务中,最优设备预测准确率能够达到88.7%,相较于现有最先进的方法,加速比可提高7.6%;在线程粗化任务中,加速比相较于现有最优的方法可提高5.2%.
  • 基于混合计数布隆过滤器的高效数据名查找方法
    许可,李彦彪,谢高岗,张大方,
    数据名查找是信息中心网络、内容分发网络、5G核心网中基础功能组件的关键操作,需要面向大规模规则表进行最长前缀匹配,在查找速度、更新开销和存储开销等方面面临严峻挑战.首先设计了混合计数布隆过滤器(HyCBF),将数据名前缀和前缀标记维护在同一个计数布隆过滤器中同时保持二者的逻辑独立性.这样可在不增加额外存储开销和时间开销的情况下提供更丰富的指示信息.基于此,提出HyCBF辅助的二分数据名查找(HyBS)方法以实现高效查找.进一步,为缓解二分查找过程中因回溯导致的性能损失,为HyCBF中每个条目关联一个特征比特位图以降低其假阳性率.实验表明,HyBS相比现有方法在查找性能和更新速度方面具有明显优势,存储效率也有一定提升.此外,将HyBS集成到向量化数据包处理(VPP)框架中进行系统性能评估,结果表明HyBS可用于构建高通量可扩展的数据名查找引擎.
  • 基于资源需求预测的动态服务功能链迁移方法
    阳勇,孟相如,康巧燕,陈港,
    针对网络功能虚拟化环境下服务功能链资源需求变化引起的底层网络过载问题,提出一种基于资源需求预测的动态服务功能链迁移方法.首先,综合考虑迁移开销和迁移后底层网络的资源占用情况,建立底层网络开销模型.其次,利用经验模态分解将资源需求序列分解成本征模函数分量与残差分量,再通过径向基函数神经网络实现对各分量的预测,神经网络的训练过程采用粒子群算法进行参数优化.最后,对下一时隙即将过载的物理节点或链路,选择对过载资源占用最多的虚拟网络功能或虚拟链路进行迁出,并基于流量优化的原则,通过对全局拓扑的感知选择能最小化底层网络开销的物理节点迁入.仿真实验表明,所提的资源需求预测模型在提高预测精度的同时能缩短预测时间,所提的服务功能链迁移方法在降低底层网络开销、减少端到端时延和提高服务功能链可靠性等方面有较好性能.
  • 针对冗余零的跨平台细粒度性能分析技术
    游心,杨海龙,雷克伦,孔祥浩,徐筠,栾钟治,钱德沛,
    冗余零造成的软件低效行为会导致大量的0值被读取甚至被用来重复地进行无用的计算,从而导致内存、计算资源的浪费.然而,现有的编译器工具链都不能够有效地识别并消除应用程序中0值相关的冗余操作,且冗余零相关的硬件优化方法仍然没有应用于商业处理器中.虽然ZeroSpy能够识别冗余零并提示足够的信息来指导优化,但其检测方法仍然局限于Intel平台,且其过大的性能开销阻碍了更加广泛的使用.针对冗余零的跨平台细粒度性能分析工具DrZero则可以克服上述限制.DrZero支持x86和ARM平台,并实现在线细粒度缓存迹分析来减少性能开销.为了支持ARM平台,基于数据流分析的数据类型推断方法可以自动推断内存读取值的数据类型.经过评测,DrZero的以代码、数据为中心的分析模式可以在x86和ARM平台上分别以平均45.31倍、54.20倍和14.12倍、13.40倍的性能开销识别冗余零并给出优化建议.此外,在x86平台上与ZeroSpy所报告的性能开销相比,DrZero的平均性能开销分别在以代码、数据为中心的分析模式下降低了37.2%,55.8%.基于DrZero给出的性能优化指导,应用程序优化后在x86和ARM上分别达到了最高1.76倍和2.12倍的性能加速.DrZero的实现代码已经开源:https://github.com/buaa-hipo/zerospy-drcctprof.
  • 大规模海洋数据同化的并行优化
    蔡迪,洪学海,肖俊敏,谭光明,
    海洋数据同化是一种同时利用海洋观测资料和海洋数值模式对海洋数据进行修正的有效方法,经过处理的海洋数据更加接近海洋的真实情况.在高分辨率下,基于中国科学院大气物理研究所(InstituteofAtmosphericPhysics,ChineseAcademyofSciences,IAP)和大气科学和地球流体力学数值模拟国家重点实验室(StateKeyLaboratoryModellingforAtmosphericSciencesandGeophysicalFluidDynamics,LASG)发展的LASG/IAP气候系统海洋模式(LASG/IAPclimateoceanmodel,LICOM)的同化并行程序往往涉及大量的文件读取、通信和计算,以往的研究虽然对这些方面进行了优化,但是由于优化只是停留在上层算法层面,没有考虑底层的文件系统以及超算集群的架构,因此优化的效果不太明显.针对以往研究存在的问题,进一步将海洋数据同化的数据特性、计算特性与所使用的超算平台的架构特性相结合,在此基础上结合时间局部性和空间局部性,提出了基于计算拓扑图的负载均衡策略、基于Lustre文件存储架构和超算集群特性的并行优化策略,以及计算、读取通信、写回3层重叠策略.最后,使用高分辨率数据集,在天河2号超算集群上对所提算法进行了测试.相比于现有算法,所提的算法在4000核下对总体同化性能上提升了18倍.另外,还在曙光7000超算集群上开展了测试.在4000块DCU加速卡上,相比于已有算法,所提算法提升总体计算性能8倍左右.
计算机研究与发展封面

中文名称:计算机研究与发展

杂志社官网:https://crad.ict.ac.cn/

英文名称:Journal of Computer Research and Development

语言:中文

类别:自动化技术、计算机技术

主 编:徐志伟

创刊时间:1958

出版周期:月刊

国内刊号:11-1777/TP

国际刊号:1000-1239

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京中关村科学院南路6号
  • 电话:(010)62620696
  • E-mail:crad@ict.ac.cn