计算机研究与发展杂志

计算机研究与发展杂志2023年第7期

  • 面向无人驾驶系统的仿真模糊测试:现状、挑战与展望
    戴嘉润,李忠睿,张琬琪,张源,杨珉,
    无人驾驶技术是交通运载领域中最具颠覆性的创新技术,其广泛的应用前景推动了众多科技企业和整车厂商的争相布局.安全性,作为无人驾驶重要的预期属性,是其大规模落地的必要前提.目前,在无人驾驶系统安全测评领域,仿真模糊测试技术因其高效的无人驾驶事故场景挖掘能力而备受关注.然而,面向该技术的研究仍在起步阶段,相关的研究成果还无法可靠地缓解无人驾驶系统的功能安全问题.在此背景下,首先介绍了仿真模糊测试的基本架构以及研究现状.随后,尝试总结已有工作的不足与面临的挑战,并提出针对性的优化方案.为验证这些优化方案的有效性和先进性,进一步将其用于主流开源无人驾驶系统Apollo和Autoware的安全评测中.结果显示,这些方案可以极大地提升现有仿真模糊测试技术的事故挖掘与分析能力.在此基础上,进一步展望了该领域中可能的研究方向,为后续工作提供指导性建议.
  • 面向机器学习的安全外包计算研究进展
    陈珍珠,周纯毅,苏铓,高艳松,付安民,
    依靠机器学习,传统产业的数字化转型带来了海量数据增长,而产品服务的智能化提升则刺激了算力需求.云计算的灵活资源调配可以为资源有限的企业和用户提供便宜便捷的外包计算服务,实现机器学习的模型训练和模型托管,加快产品和服务的智能化建设,促进数字经济增长.然而,数据和模型外包伴随控制权转移,可能带来数据泄露风险和计算安全问题.近年来,机器学习的外包安全问题受到越来越多研究者的关注,并取得了一些显著成果.通过对2018—2022年这5年国内外机器学习安全外包研究工作调研,首先对现有主流的外包模型进行分类和特征归纳,依据任务阶段将外包模型划分为模型训练和模型托管模式,以及依据云服务商数量将外包模式划分为单云模式和多云模式.其次重点从逻辑回归、朴素贝叶斯分类、支持向量机、决策树和神经网络等典型机器学习算法角度对机器学习安全外包计算相关研究进展进行了深入阐述和分析.最后从不同角度分析和讨论了目前机器学习安全外包研究存在的不足,并展望未来面临的挑战和机遇.
  • 开源软件缺陷预测方法综述
    田笑,常继友,张弛,荣景峰,王子昱,张光华,王鹤,伍高飞,胡敬炉,张玉清,
    开源软件缺陷预测通过挖掘软件历史仓库的数据,利用与软件缺陷相关的度量元或源代码本身的语法语义特征,借助机器学习或深度学习方法提前发现软件缺陷,从而减少软件修复成本并提高产品质量.漏洞预测则通过挖掘软件实例存储库来提取和标记代码模块,预测新的代码实例是否含有漏洞,减少漏洞发现和修复的成本.通过对2000年至2022年12月软件缺陷预测研究领域的相关文献调研,以机器学习和深度学习为切入点,梳理了基于软件度量和基于语法语义的预测模型.基于这2类模型,分析了软件缺陷预测和漏洞预测之间的区别和联系,并针对数据集来源与处理、代码向量的表征方法、预训练模型的提高、深度学习模型的探索、细粒度预测技术、软件缺陷预测和漏洞预测模型迁移六大前沿热点问题进行了详尽分析,最后指出了软件缺陷预测未来的发展方向.
  • 基于错误路径行为一致性的内核引用计数缺陷检测
    熊忻,谈心,张源,
    内核中的引用计数缺陷会引起内存泄露、释放后使用漏洞等严重安全问题.针对这类缺陷,提出基于错误路径行为一致性分析的缺陷检测方案.相比已有工作,该方案引入错误路径的语义信息来推断合理的引用计数行为,从而检出以往难以覆盖的引用计数缺陷.具体而言,首先,该方案基于代码特征识别函数中所有的错误路径.其次,采用路径敏感的静态分析对各条错误路径上的引用计数行为进行分析汇总,以推断该函数在错误路径上引用计数操作的主流倾向.最终,基于一致性分析原理,将与主流倾向不一致的路径标识为潜在缺陷.实验表明,该方案在Linux内核版本5.6-rc2和版本5.17上分别发现21个和9个引用计数缺陷,且大部分都被开发者确认;其中,在内核版本5.6-rc2上有9个缺陷是已有工作无法覆盖的.
  • HeapAFL:基于堆操作行为引导的灰盒模糊测试
    余媛萍,苏璞睿,
    随着软件开发环境和业务逻辑的复杂度不断增加,大量的堆内存对象生命周期及其引用关系造成堆内存操作行为错综复杂,极易引发程序错误造成漏洞.模糊测试作为高效的软件代码错误检测技术,常用于漏洞挖掘.然而,目前最先进的模糊测试工具专注于代码全覆盖功能测试,忽略了执行时堆内存操作状态信息,从而错过堆内存漏洞发现机会.针对上述问题,提出了一种基于堆操作行为引导的灰盒模糊测试方法HeapAFL,在不依赖漏洞先验知识的情况下,其通过静态分析插桩基础堆操作函数及其参数监测执行时控制流和数据流变化,反馈堆操作行为信息,指导模糊测试中种子优先变异阶段,探索多样化堆操作行为从而更高概率触发堆内存错误类漏洞.在6个真实应用程序上验证方法效果,并与6个最先进的模糊测试工具进行比较,实验中的CPU总共测试了4032h.实验结果表明,HeapAFL在漏洞挖掘效果和崩溃发现效率上优于对比工作.在漏洞挖掘数量上,HeapAFL相比于基准模糊测试方法AFL,AFLFast,PathAFL,TortoiseFuzz,Angora,Memlock分别提升了1.32倍,1.39倍,1.92倍,1.56倍,2.78倍,2.08倍.最终,HeapAFL在数据集上挖掘到了25个堆内存错误类漏洞,其中包括19个已知的漏洞(即1day)和6个未知的漏洞(即0day),并报告给CVE(commonvulnerabilitiesandexposures)官方漏洞库后已经获得了2个CVE漏洞编号,其余漏洞正在等待审核.
  • openEuler中C标准库替换的兼容性分析
    吴亦泽,于佳耕,郑晨,武延军,
    当前大多数Linux发行版使用功能强大的glibc(GNUClibrary)作为C标准库(简称C库),但glibc的LGPL协议存在商用不友好条款,制约了商业Linux发行版的推广.一种可行的解决方案是选择某个与glibc相比尚有功能缺陷但适宜商用的C库加以补全,从而制成新的C库以替代glibc.开源欧拉(openEuler)操作系统社区以MIT协议的musllibc作为新的C库选型.新C库对已有应用软件的兼容是成功替换的关键,而精确的兼容性分析算法不仅可以定位缺失API,还可以量化计算兼容性和API补全的优先级.为此,提出兼容性分析算法来研究openEuler的4种主要软件生态中的musllibc兼容性和缺失API优先级.基于应用软件包之间的依赖关系和谷歌PageRank算法的思想,提出了PackageRank算法和APIRank算法,分别用于软件包兼容性度量和优先级计算.这2种算法提供了系统个性化兼容分析的方法,所需信息易于获取,适用于缺乏用户数据统计的、尚不完整而仍有开发需求的系统及构件.这2种算法在musllibc上的分析结果清晰准确,与软件生态的特点和现状相符,与musllibc的国际社区开发者的观点接近,为openEuler的新C库补全工作提供了有效指导.
  • 基于多目标混合蚁狮优化的算法选择方法
    李庚松,刘艺,郑奇斌,李翔,刘坤,秦伟,王强,杨长虹,
    算法选择是指从可行算法中为给定问题选择满足需求的算法,基于元学习的算法选择是应用较为广泛的方法,元特征和元算法是其中的关键内容,而现有研究难以充分利用元特征的互补性和元算法的多样性,不利于进一步提升方法性能.为了解决上述问题,提出基于多目标混合蚁狮优化的算法选择方法(SAMO),设计算法选择模型,以集成元算法的准确性和多样性作为优化目标,引入元特征选择和选择性集成,同时选择元特征和异构元算法以构建集成元算法;提出多目标混合蚁狮算法对模型进行优化,使用离散型编码选择元特征子集,通过连续型编码构建集成元算法,应用增强游走策略和偏好精英选择机制提升寻优性能.使用260个数据集、150种元特征和9种候选算法构建分类算法选择问题来进行测试,分析方法的参数敏感性,将多目标混合蚁狮算法与4种演化算法进行比较,通过对8种对比方法与所提方法进行对比实验,结果验证了所提方法的有效性和优越性.
  • 联邦学习开源框架综述
    林伟伟,石方,曾岚,李董东,许银海,刘波,
    近年来,联邦学习作为破解数据共享壁垒的有效解决方案被广泛关注,并被逐步应用于医疗、金融和智慧城市等领域.联邦学习框架是联邦学习学术研究和工业应用的基石.虽然Google、OpenMined、微众银行和百度等企业开源了各自的联邦学习框架和系统,然而,目前缺少对这些联邦学习开源框架的技术原理、适用场景、存在问题等的深入研究和比较.为此,根据各开源框架在业界的受众程度,选取了目前应用较广和影响较大的联邦学习开源框架进行深入研究.针对不同类型的联邦学习框架,首先分别从系统架构和系统功能2个层次对各框架进行剖析;其次从隐私机制、机器学习算法、计算范式、学习类型、训练架构、通信协议、可视化等多个维度对各框架进行深入对比分析.而且,为了帮助读者更好地选择和使用开源框架实现联邦学习应用,给出了面向2个不同应用场景的联邦学习实验.最后,基于目前框架存在的开放性问题,从隐私安全、激励机制、跨框架交互等方面讨论了未来可能的研究发展方向,旨在为开源框架的开发创新、架构优化、安全改进以及算法优化等提供参考和思路.
  • 基于适应性自训练的少样本关系抽取建模
    陈洪辉,郑建明,蔡飞,韩毅,
    关系抽取(relationextraction,RE)是自然语言处理中的一项基础任务,可以支撑许多下游任务,例如对话生成和机器阅读理解等.在现实生活中,由于新关系类别不断涌现,人工标注的成本和速度无法满足传统基于有监督学习的关系抽取模型的训练要求.面对这种现实挑战,神经雪球提出一种自助采样的方法,通过对有限标注数据的信息迁移,不断为无标注数据打上标签,增加标注数据量,从而提升模型分类性能.然而,固定的阈值选择以及同等对待入选的无标注数据使得神经雪球模型容易受到噪声数据的影响.为了解决这2个缺陷,基于适应性自训练的关系抽取(adaptiveself-trainingrelationextraction,Ada-SRE)模型由此提出.具体地,Ada-SRE基于元学习的思想提出自适应阈值模块,能够为每个关系类别提供合适的阈值选择.另外,Ada-SRE还提出基于梯度反馈的赋权策略,为每个入选的示例提供相应的权重,避免噪声数据的干扰.实验结果表明,相比于神经雪球模型,Ada-SRE有更好的关系抽取能力.
  • 基于在线集成的概念漂移自适应分类方法
    郭虎升,丛璐,高淑花,王文剑,
    针对流数据中概念漂移发生后,在线学习模型不能对分布变化后的数据做出及时响应且难以提取数据分布的最新信息,导致学习模型收敛较慢的问题,提出一种基于在线集成的概念漂移自适应分类方法(adaptiveclassificationmethodforconceptdriftbasedononlineensemble,AC_OE).一方面,该方法利用在线集成策略构建在线集成学习器,对数据块中的训练样本进行局部预测以动态调整学习器权重,有助于深入提取漂移位点附近流数据的演化信息,对数据分布变化进行精准响应,提升在线学习模型对概念漂移发生后新数据分布的适应能力,提高学习模型的实时泛化性能;另一方面,利用增量学习策略构建增量学习器,并随新样本的进入进行增量式的训练更新,提取流数据的全局分布信息,使模型在平稳的流数据状态下保持较好的鲁棒性.实验结果表明,该方法能够对概念漂移做出及时响应并加速在线学习模型的收敛速度,同时有效提高学习器的整体泛化性能.
  • 一种新的半监督归纳迁移学习框架:Co-Transfer
    文益民,员喆,余航,
    在许多实际的数据挖掘应用场景,如网络入侵检测、Twitter垃圾邮件检测、计算机辅助诊断等中,与目标域分布不同但相关的源域普遍存在.一般情况下,在源域和目标域中都有大量未标记样本,对其中的每个样本都进行标记是件困难的、昂贵的、耗时的事,有时也没必要.因此,充分挖掘源域和目标域中标记和未标记样本来解决目标域中的分类任务非常重要且有意义.结合归纳迁移学习和半监督学习,提出一种名为Co-Transfer的半监督归纳迁移学习框架.Co-Transfer首先生成3个TrAdaBoost分类器用于实现从原始源域到原始目标域的迁移学习,同时生成另外3个TrAdaBoost分类器用于实现从原始目标域到原始源域的迁移学习.这2组分类器都使用从原始源域和原始目标域的原有标记样本的有放回抽样来训练.在Co-Transfer的每一轮迭代中,每组TrAdaBoost分类器使用新的训练集更新,其中一部分训练样本是原有的标记样本,一部分是由本组TrAdaBoost分类器标记的样本,还有一部分则由另一组TrAdaBoost分类器标记.迭代终止后,把从原始源域到原始目标域的3个TrAdaBoost分类器的集成作为原始目标域分类器.在UCI数据集和文本分类数据集上的实验结果表明,Co-Transfer可以有效地学习源域和目标域的标记和未标记样本从而提升泛化性能.
  • 基于双生成器网络的Data-Free知识蒸馏
    张晶,鞠佳良,任永功,
    知识蒸馏(knowledgedistillation,KD)通过最大化近似输出分布使“教师网络”指导“学生网络”充分训练,成为大规模深度网络近端迁移、部署及应用的重要技术.然而,隐私保护意识增强与传输问题加剧使网络训练数据难以获取.如何在Data-Free的自由环境下,保证压缩网络准确率成为重要的研究方向.Data-Free学生网络学习(data-freelearningofstudentnetworks,DAFL)模型,建立“教师”端生成器获得与预训练网络分布近似的伪数据集,通过知识蒸馏训练“学生网络”.然而,该框架中生成器构建及优化仍存在2个问题:1)过度信任“教师网络”对缺失真实标签伪样本的判别结果,同时,“教师网络”与“学生网络”优化目标不同,使“学生网络”难以获得准确、一致的优化信息;2)仅依赖于“教师网络”训练损失,导致数据特征多样性缺失,降低“学生网络”泛化性.针对这2个问题,提出双生成器网络架构DG-DAFL(doublegenerators-DAFL),分别建立“教师”与“学生”端生成器并同时优化,实现网络任务与优化目标一致,提升“学生网络”判别性能.进一步,增加双生成器样本分布差异损失,利用“教师网络”潜在分布先验信息优化生成器,保证“学生网络”识别准确率并提升泛化性.实验结果表明,该方法在Data-Free环境中获得了更为有效且更鲁棒的知识蒸馏效果.DG-DAFL方法代码及模型已开源:https://github.com/LNNU-computer-research-526/DG-DAFL.git.
  • 基于频率-时间扩张密集网络的语音增强方法
    黄翔东,陈红红,甘霖,
    含噪条件下的语音增强技术是语音信号领域的重要研究方向之一,该技术对于提升语音视频通话的质量、提高人机交互和语音识别的性能具有重要作用.为此,提出了基于扩张卷积和密集连接的语音增强网络结构,通过学习语音时频谱的频率、时间轴的上下文信息,有效提高了网络的特征表达能力.具体来说,所提结构将扩张卷积融入到时间、频率处理的基础单元中,以确保在频率方向和时间方向上均可获得足够大的感受野,提取出深层语音特征;同时,密集连接被应用到这2个基础单元的级联结构中,由此可避免多处理模块级联带来的信息丢失,从而增强特征利用效率.实验结果表明所提出的语音增强网络在语音质量客观评估(perceptualevaluationofspeechquality,PESQ)和短时客观可懂度(short-timeobjectiveintelligibility,STOI)以及各类主观平均意见方面的总体评分,相比于现有的各类语音增强模型,均居于领先水平.此外,所提网络对各种含噪条件的泛化能力也在实验中得以评估.
  • 基于跨维度协同注意力机制的单通道语音增强方法
    康宏博,冯雨佳,台文鑫,蓝天,吴祖峰,刘峤,
    近年来,卷积神经网络在语音增强任务中得到了广泛的应用.然而,目前广泛使用的跳跃连接机制在特征信息传输时会引入噪声成分,从而不可避免地降低了去噪性能;除此之外,普遍使用的固定形状的卷积核在处理各种声纹信息时效率低下,基于上述考虑,提出了一种跨维度协同注意力机制和形变卷积模块的端到端编-解码器网络CADNet.具体来说,在跳跃连接中引入跨维度协同注意力模块,进一步提高信息控制能力.并且在每个标准卷积层之后引入形变卷积层,从而更好地匹配声纹的自然特征.在TIMIT公开数据集上进行的实验验证了所提出的方法在语音质量和可懂度的评价指标方面的有效性.
  • 基于句法增强的细粒度情感三元组抽取方法
    刘欣逸,宁博,王明,杨超,商迪,李冠宇,
    属性级情感三元组抽取(aspectsentimenttripletextraction,ASTE)任务主要是从句子中检测出属性词及其对应的评价词和情感倾向,然而当抽取多词属性词和评价词时,无法准确地抽取出全部的单词;当面对重复的属性词和评价词时,以往的研究很难学习到"属性词-评价词"词对之间所有的关联关系.为解决这些问题,提出了一种基于句法增强的多任务学习框架,来解决端到端的情感三元组抽取任务.句子中的句法结构反映的是句法属性和依赖关联信息,这对抽取任务和情感分类任务有积极作用.该方法是利用依存句法嵌入图卷积网络充分挖掘句法特征,并将其传递到属性词抽取、评价词抽取和情感分析这3个子任务中,实现了句法信息与多任务联合学习框架的融合.在情感分析任务的4个英文数据集和1个中文数据集上对模型进行了评估,实验结果表明,提出的方法是有效的且明显优于其他的基线模型,同时对具体案例进行分析,证明该方法一定程度上解决了多词和重复词的问题.
  • HyperTree:高并发B+树索引加速器
    吴婧雅,卢文岩,鄢贵海,李晓维,
    B+树是关系型数据库中用来加速查询的常用索引结构,通过构建平衡树维护关键属性的顺序.索引提升了数据库查询性能,但其严格的有序关系增加了数据库表的维护开销.特别是在大数据场景下,数据量激增使得索引查询和维序性能进一步下降.如何平衡B+树的查询和维序性能,以及在大数据场景下提升索引查询和维序的效率,对提升索引系统性能具有重要意义.由此设计了一种专用的B+树索引加速系统,对存储和计算进行协同优化,均衡提升索引查询和维序性能.利用内存突发读写高带宽的特性设计规则的树和节点存储格式以提升内存带宽利用效率,设计高效的同构计算架构和多数据通道以提升索引操作并行度.同时设计解耦合的子树结构缓解索引维护时的树读写冲突.实验结果表明,相比于CPU,B+树索引加速系统能够提升系统查询性能超过6.84倍,提升索引维序性能提升超过29.14倍.
  • 针对gem5指令集实现及其功能测试的自动代码生成
    赵紫微,涂航,刘芹,李莉,余涛,
    在嵌入式领域,计算机系统模拟器是研究与原型开发的重要工具.对于采用解释执行的模拟器,其CPU模型的译码过程会影响性能,如何提升译码过程的性能是提高仿真效率的关键问题之一.此外,对于无标准测试集的指令集来说(例如自定义指令),手动编写指令功能测试的开发效率较低,并且其与实现译码过程所需的指令信息基本相同.为解决上述问题,提出一个代码生成方案,输入一份指令集描述,输出针对gem5优化后的指令集实现代码和功能测试代码.首先,扩展gem5的指令集描述语言,将其分为编码描述、功能描述和测试描述.其次,针对gem5优化译码决策树构建算法,并为gem5生成译码模块代码、指令集实现代码和指令功能测试用例.最后,以Cortex-M3指令集为例与原方案相比,总生成时间减少约64%,编译后的可执行文件代码大小减少约407KB,性能提升约13%,并且能够提高开发效率.
计算机研究与发展封面

中文名称:计算机研究与发展

杂志社官网:https://crad.ict.ac.cn/

英文名称:Journal of Computer Research and Development

语言:中文

类别:自动化技术、计算机技术

主 编:徐志伟

创刊时间:1958

出版周期:月刊

国内刊号:11-1777/TP

国际刊号:1000-1239

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京中关村科学院南路6号
  • 电话:(010)62620696
  • E-mail:crad@ict.ac.cn