计算机研究与发展杂志2024年第12期
-
- 基于SRAM和NVM的存内计算技术综述
- 张章,施刚,王启帆,马永波,刘钢,钱利波,
- 集存储与计算于一身的快速低功耗存内计算架构,突破了存储与计算分离的传统冯·诺依曼体系,解决了限制处理器算力的“内存墙”问题,成为新型计算架构的研究热点.存内计算的基础器件包括高速且工艺成熟的静态随机存取存储器(staticRAM,SRAM)、低功耗高响应且非易失的忆阻器(memristor)、高密度低静态功耗非易失的磁性随机存取存储器(magneticRAM,MRAM).研究者们基于上述器件完成大量存内计算研究,但是关于这些存内计算架构全面且系统总结的文献综述仍然缺失.首先从SRAM、忆阻器、MRAM方向出发概述了不同器件的存内计算原理、当前存内计算架构发展状况和实际应用场景等.然后针对当前存内计算架构存在的各种问题和挑战给出了现有解决方案和未来解决方向.最后对基于以上器件的存内计算研究重点进行了总结并概述了目前的研究短板、展望未来的发展方向.
-
- ChipletNP: 基于芯粒的敏捷可定制网络处理器架构
- 李韬,杨惠,厉俊男,刘汝霖,孙志刚,
- 5G,8K视频等新业务类型不断涌现,使得网络处理器(networkprocessor,NP)的应用场景日趋复杂多样.为满足多样化网络应用在性能、灵活性以及服务质量保证等方面的差异化需求,传统NP试图在片上系统(systemonchip,SoC)上集成大量处理器核、高速缓存、加速器等异质处理资源,提供面向多样化应用场景的敏捷可定制能力.然而,随着摩尔定律和登纳德缩放定律失效问题的逐渐凸显,单片NP芯片研制在研发周期、成本、创新迭代等方面面临巨大挑战,越来越难以为继.针对上述问题,提出新型敏捷可定制NP架构ChipletNP,基于芯粒化(Chiplet)技术解耦异质资源,在充分利用成熟芯片产品及工艺的基础上,通过多个芯粒组合,满足不同应用场景下NP的快速定制和演化发展需求.基于ChipletNP设计实现了一款集成商用CPU、FPGA(fieldprogrammablegatearray)和自研敏捷交换芯粒的银河衡芯敏捷NP芯片(YHHX-NP).基于该芯片的应用部署与实验结果表明,ChipletNP可支持NP的快速敏捷定制,能够有效承载SRv6(segmentroutingoverIPv6)等新型网络协议与网络功能部署.其中,核心的敏捷交换芯粒相较于同级商用芯片能效比提升2倍以上,延迟控制在2.82?s以内,可以有效支持面向NP的Chiplet统一通信与集成.
-
- HVMS:基于混合向量化的SpMV优化机制
- 颜志远,解壁伟,包云岗,
- 在科学计算和系统工程等领域,稀疏矩阵向量乘(sparsematrix-vectormultiplication,SpMV)占据着极其重要的位置.受限于矩阵稀疏性所导致的访存不规则性,向量优化一直是SpMV的难点.针对此问题,进行深入分析并且总结影响SpMV向量化效率的主要因素.除却稀疏矩阵内非零元分布的不规则,不同稀疏矩阵之间的非零元分布特征亦有明显不同,导致单一的向量优化策略难以适用于多种不同特征的稀疏矩阵.另一方面,多样化向量硬件在向量特性和指令上的差异,影响了SpMV向量优化方法的通用性.把不规则的稀疏矩阵映射到规则的向量硬件上进行计算,是SpMV向量化面临的最主要挑战.基于此,提出一种基于混合向量化方法的SpMV优化机制(hybridvectorization-optimizedmechanismofSpMV,HVMS).HVMS首先对向量硬件的特性进行抽象建模,并基于抽象出的基本操作,设计相应的规则指导稀疏矩阵进行规则化转换.按照不同的矩阵特征,HVMS将稀疏矩阵划分为不同的部分,弱化稀疏矩阵的不规则程度,并引入不同的优化策略最大化SpMV的向量化效率,从而提升性能.基于IntelXeon平台,在30个常用稀疏矩阵上对HVMS进行实验分析.结果表明,相比现有代表性工作如CVR,SELL-C-σ,IntelMKL,HVMS分别获得1.60倍、1.72倍和1.93倍的平均加速比.
-
- 面向深度神经网络大规模分布式数据并行训练的MC<sup>2</sup>能耗模型
- 魏嘉,张兴军,王龙翔,赵明强,董小社,
- 深度神经网络(deepneuralnetwork,DNN)在许多现代人工智能(artificialintelligence,AI)任务中取得了最高的精度.近年来,使用高性能计算平台进行大规模分布式并行训练DNN越来越普遍.能耗模型在设计和优化DNN大规模并行训练和抑制高性能计算平台过量能耗方面起着至关重要的作用.目前,大部分的能耗模型都是从设备的角度出发对单个设备或多个设备构成的集群进行能耗建模,由于缺乏从能耗角度对分布式并行DNN应用进行分解剖析,导致罕有针对分布式DNN应用特征进行建模的能耗模型.针对目前最常用的DNN分布式数据并行训练模式,从DNN模型训练本质特征角度出发,提出了“数据预处理(materialspreprocessing)–前向与反向传播(computing)–梯度同步与更新(communicating)”三阶段MC2能耗模型,并通过在国产E级原型机天河三号上使用最多128个MT节点和32个FT节点训练经典的VGG16和ResNet50网络以及最新的VisionTransformer网络验证了模型的有效性和可靠性.实验结果表明,MC2与真实能耗测量结果相差仅为2.84%,相较4种线性比例能耗模型以及AR,SES,ARIMA时间预测模型准确率分别提升了69.12个百分点,69.50个百分点,34.58个百分点,13.47个百分点,5.23个百分点,22.13个百分点,10.53个百分点.通过使用的模型可以在超算平台得到DNN模型的各阶段能耗和总体能耗结果,为评估基于能耗感知的DNN大规模分布式数据并行训练及推理各阶段任务调度、作业放置、模型分割、模型裁剪等优化策略的效能提供了基础.
-
- Web 3.0数字经济风险感知技术综述
- 贾金萍,肖诗涵,钱堃,杨艳琴,张召,
- Web3.0数字经济体系以区块链平台为基础设施,围绕加密货币、NFT、数字藏品等数字资产和去中心化金融(DeFi)、游戏金融(GameFi)等去中心化应用(DApp)开展各项社会经济活动.在公有链和开放联盟链下,作为DApp内核的智能合约可以由任何个人或组织予以部署,并对全体用户可见及可调用.这种开放性给经济发展带来了新的机遇,同时也蕴含了许多金融风险.以智能合约为中心分析了Web3.0数字经济潜在的风险,并从智能合约的编码、功能、应用3个层面总结了风险感知技术的研究现状.首先介绍了智能合约漏洞检测技术的研究挑战、安全漏洞类型和4类漏洞检测方法;其次分析了常见的智能合约骗局类型,并根据训练数据的不同分类总结了现有的智能合约骗局识别技术;接着介绍了基于区块链交易记录对4种非法交易行为进行检测的技术现状;最后结合对现有工作局限性的分析,展望了未来的研究方向.
-
- WebAssembly安全综述
- 庄骏杰,胡霜,华保健,汪炀,潘志中,
- WebAssembly是一种新兴的二进制指令集体系结构与代码分发格式,旨在为高级程序语言提供统一且架构无关的编译目标.由于其安全、高效与可移植等先进特性,WebAssembly在Web领域与非Web领域均得到了广泛应用,正在成为最有前景的跨平台公共语言标准之一.尽管WebAssembly提供了多种先进特性以保证安全性,然而,已有研究表明,WebAssembly仍然存在特有的攻击面从而导致安全问题,这些安全问题直接影响到基于WebAssembly的整个软件系统生态.因此,对WebAssembly安全问题的产生机理、现有解决方案以及亟待解决的科学问题展开系统研究尤为重要.基于WebAssembly安全研究领域已经公开发表的42篇研究论文,对WebAssembly安全的相关研究进行了系统研究、分析、归纳和总结:首先,研究分析了WebAssembly的核心安全特性,并在此基础上首次提出了WebAssembly的4层安全威胁模型,包括高级语言支持、编译工具链、二进制表示和语言虚拟机,并对每一层的安全威胁和攻击面进行了详细讨论;其次,提出了WebAssembly安全研究的分类学,将已有研究划分为安全实证研究、漏洞检测与利用、安全增强、形式语义与程序验证4个热点研究方向,并对这4个方向分别进行了综述、分析和总结;最后,指出了该领域待解决的科学问题,并展望了5个潜在的研究方向.
-
- 实时多媒体传输延迟优化:架构、进展与展望
- 孟子立,徐明伟,
- 实时多媒体传输是互联网最重要的应用之一,其系统对于传输延迟提出了很高的需求.其中,延迟波动是延迟优化中最具有挑战性的问题.然而,传统的尽力而为的传输服务在很多情况下无法满足实时多媒体传输对延迟波动的要求.首先,阐述了实时多媒体传输面临的主要挑战.其次,分析了如果要优化实时多媒体传输的延迟亟需解决的关键问题.基于上述问题归纳了实时多媒体传输系统架构中的2个关键通路、5个核心组件.围绕各个组件涉及的技术,梳理了代表性研究成果.在此基础上,总结了面向实时多媒体传输及低延迟应用的研究分支,并对各研究分支优化算法与应用进行综述.通过分析发现,延迟的尾部波动是实时多媒体延迟优化应关注的主要目标.最后,提出了未来可能的研究方向.
-
- 全同态加密研究进展
- 白利芳,祝跃飞,李勇军,王帅,杨晓琪,
- 随着数字化进程的加速推进,数据安全和隐私保护问题备受关注.数据加密一直是解决该问题的重要手段,但加密存储和传输较为常见,一旦涉及计算往往需要先解密,以明文形式计算后再加密.全同态加密(fullyhomomorphicencryption,FHE)将加密延展到计算层面,无需解密即可以完成密文的处理任务,有保护数据安全和用户隐私的天然特性.首个FHE方案于2009年由Gentry提出,自此FHE方案一直备受业界和学界的关注.从FHE方案的构造思想、不同研究阶段及面临的问题等方面梳理分析了FHE10余年的研究进展,从算法库实践、标准化进展以及典型应用场景等方面介绍了FHE的应用进展,并提出未来研究的方向建议.
-
- 支持策略更新和即时密文验证的外包属性基加密方案
- 苏泽林,张文芳,王小敏,
- 属性基加密提供了全新的基于密码学的访问控制方案,适用于多用户数据共享场景,但由于加密阶段和访问策略更新过程的计算和通信开销较大,且现有的外包属性基加密方案大多数都没有提供面向数据拥有者的密文正确性验证方法,很大程度上限制了属性基加密的实际应用.针对上述问题,提出了一种支持动态策略更新和即时验证密文正确性的属性基外包加密方案,能够在不可信云环境下有效地保护数据的隐私性.方案根据外包加密原理设计策略更新过程,只需要完成少量计算即可生成更新密钥.利用双线性对的运算特性和解密运算结构设计密文验证算法,通过引入验证转换密钥使密文验证效率明显高于解密运算效率.方案根据不同的云环境模型设计了高效验证算法和严格验证算法,分别适用于诚实且好奇和不可信的云环境中.方案在标准模型下被证明满足选择明文攻击安全性.性能分析和效率对比表明,该方案的本地加密、策略更新和密文验证的计算量都有所减少,使得整体方案较现有方案更加轻量化,适用于资源受限设备的数据共享场景.
-
- 使用编码的反向散射通信协议设计与性能分析
- 何昕,吴帆,祝玉军,许勇,杨盘隆,
- 周围环境中不断增加的物联网设备带来了巨大的机遇,但也带来了挑战,包括有限的电池寿命、低计算能力和多址接入的可扩展性.反向散射通信使得无处不在的物联网设备能够以超低功耗的方式进行通信,然而,支持大规模并发通信也是反向散射通信需要研究的问题之一.针对大规模标签并发通信误码率(BER)较高、传输速率低等问题,设计基于编码的码分多址(CDMA)接入技术,以支持多标签反向散射并发可靠通信.首先,该系统利用沃尔什(Walsh)码等正交性较强的码片区分标签并结合纠错编码,以增强抗干扰能力;其次利用相关检测与译码联合解码以降低误码率,实现信道的可靠通信;最后,在此基础上,基于K均值聚类算法(K-meansclusteringalgorithm)设计标签分组机制,充分利用时-码2维资源扩充容量.实验表明,该方案能够实现100+个标签的可靠通信,误码率约2%、吞吐量达到了39Mbps.
-
- 基于兴趣函数的多样化Option-Critic算法
- 栗军伟,刘全,黄志刚,徐亚鹏,
- Option框架作为分层强化学习的一种常用时序抽象方法,允许智能体在不同的时间尺度上学习策略,可以有效解决稀疏奖励问题.为了保证Option可以引导智能体访问更多的状态空间,一些方法通过引入基于互信息的内部奖励和终止函数来提升Option内部策略的多样性.但这会导致算法学习速度慢和内部策略的知识迁移能力低等问题,严重影响了算法性能.针对以上问题,提出基于兴趣函数优化的多样化Option-Critic算法(diversity-enrichedOption-Criticalgorithmwithinterestfunctions,DEOC-IF).该算法在多样化Option-Critic算法(diversity-enrichedOption-Critic,DEOC)的基础上,通过引入兴趣函数约束上层策略对Option内部策略的选择,既保证了Option集合的多样性,又使得学习到的内部策略可以关注状态空间的不同区域,有利于提高算法的知识迁移能力,加快学习速度.此外,DEOC-IF算法引入一种新的兴趣函数更新梯度,有利于提高算法的探索能力.为了验证算法的有效性和知识迁移能力,分别在4房间导航任务、Mujoco和MiniWorld实验环境中,将DEOC-IF算法与其他最新算法进行对比实验.结果表明,DEOC-IF算法具有更好的性能优势和策略迁移能力.
-
- 一种基于在线蒸馏的轻量化噪声标签学习方法
- 黄贻望,黄雨鑫,刘声,
- 利用含有有损标签的噪声数据来训练深度学习模型是机器学习中的研究热点.研究表明深度学习模型训练易受噪声数据的影响而产生过拟合现象.最近,一种将元学习与标签校正相结合的方法能够使模型更好地适应噪声数据以减缓过拟合现象,然而这种元标签校正方法依赖于模型的性能,同时轻量化模型在噪声数据下不具备良好的泛化性能.针对这一问题,本文结合元学习提出一种基于在线蒸馏的轻量化噪声标签学习方法KDMLC(knowledgedistillation-basedmeta-labelcorrectionlearning),该方法将深度神经网络与多层感知机构成的元标签校正(metalabelcorrection,MLC)模型视为教师模型,对噪声标签进行校正并指导轻量化模型进行训练,同时采用双层优化策略训练并增强教师模型的泛化能力,从而生成更高质量的伪标签用于训练轻量化模型.实验表明,KDMLC在高噪声水平下对比MLC方法准确率提高了5.50个百分点;同时对CIFAR10数据集使用Cutout数据增强,KDMLC在高噪声水平下对比MLC准确率提升了9.11个百分点,而在真实噪声数据集Clothing1M上的实验,KDMLC也优于其他方法,验证了KDMLC的可行性和有效性.
-
- 一种跨区域跨评分协同过滤推荐算法
- 于旭,彭庆龙,詹定佳,杜军威,刘金环,林俊宇,巩敦卫,张子迎,于婕,
- 传统跨评分协同过滤范式忽视了目标域中评分密度对用户和项目隐向量精度的影响,导致评分稀疏区域评分预测不够准确.为克服区域评分密度对评分预测的影响,基于迁移学习思想提出一种跨区域跨评分协同过滤推荐算法(cross-ratingcollaborativefilteringrecommendationalgorithm,CRCRCF),相对于传统跨评分协同过滤范式,该算法不仅能有效挖掘辅助域重要知识,而且可以挖掘目标域中评分密集区域的重要知识,进一步提升目标域整体,尤其是评分稀疏区域的评分预测精度.首先,针对用户和项目,分别进行活跃用户和非活跃用户、热门项目和非热门项目的划分.利用图卷积矩阵补全算法提取目标域活跃用户和热门项目、辅助域中全体用户和项目的隐向量.其次,对活跃用户和热门项目分别构建基于自教学习的深度回归网络学习目标域和辅助域中隐向量的映射关系.然后,将映射关系泛化到全局,利用非活跃用户和非热门项目在辅助域上相对较准确的隐向量推导其目标域上的隐向量,依次实现了跨区域映射关系迁移和跨评分的隐向量信息迁移.最后,以求得的非活跃用户和非热门项目在目标域上的隐向量为约束,提出受限图卷积矩阵补全模型,并给出相应推荐结果.在MovieLens和Netflix数据集上的仿真实验显示CRCRCF算法较其他最先进算法具有明显优势.
-
- 基于劳资博弈模型的实用查询定价新算法
- 王会举,黄玮煊,岳晓,
- 在数据要素化的推动下,传统查询定价方法因其前提假设要求过高、灵活动态性支持有限、关键因素考虑不足等问题,面临落地难的巨大挑战.为解决以上问题,创新设计了基于劳资博弈模型的查询定价算法,该算法利用劳资博弈模型对数据交易中参与方进行建模,将数据交易平台和数据买方分别视作工会和用人单位;数据交易平台(工会)负责各交易数据集价值(劳动者工资)公平透明计算,以尽可能促成交易为目标;数据买方根据各数据集估量价值、自身需求和自身预算,决定各数据集购买数量,藉此实现兼顾三方利益的交易数据集定价.实验表明,该算法相比于流行的斯塔克伯格博弈模型,更能兼顾各方利益,更加公平;相比于传统的基于查询的数据定价方法,该定价算法更易落地应用、更具动态灵活性,可以跟随查询结果的变化实现价格的动态调整.该定价算法时间复杂度为O(N)(N为查询相关数据集个数),且具有无套利性.
-
- 基于深度学习的查询建议综述
- 田萱,徐泽洲,王子涵,
- 查询建议是当今搜索引擎必不可少的一个组成部分,它可以在用户输入完整查询前提供查询候选项,帮助用户更准确、更快速地表达信息需求.深度学习技术有助于提升查询建议的准确度,成为近年来推动查询建议发展的主流技术.主要对基于深度学习的查询建议研究现状进行归纳整理与分析对比,根据深度学习应用阶段不同,把其分为生成式查询建议与排名式查询建议2类,分析其中每种模型的建模思路和处理特征.此外还介绍了查询建议领域常用的数据集、基线方法与评价指标,并对比其中不同模型的技术特点与实验结果.最后总结了基于深度学习的查询建议研究目前面临的挑战与未来发展趋势.
