计算机研究与发展杂志

计算机研究与发展杂志2023年第8期

  • 基于反向伪标签最优化传输的无监督域自适应
    孙昊,韩忠义,王帆,尹义龙,
    现实世界中训练数据和测试数据往往存在分布差异,导致基于独立同分布假设的模型丧失鲁棒性.无监督域自适应是一种重要解决方法,极具应用价值.鉴于此,国内外研究者进行大量理论基础和方法技术的研究,促进了很多应用领域的发展,包括自动驾驶、智慧医疗等.但是,目前主流的方法仍存在一些问题:源域和目标域的概率分布距离是否能真正代表它们之间的差异,以及如何更准确地度量2个分布之间的差异,仍然是一个值得探讨的问题.同时,如何更有效地利用伪标签,也是一个值得继续探索的问题.提出了反向伪标签最优化传输(backwardpseudo-labelandoptimaltransport,BPLOT),不仅利用瓦瑟斯坦距离和格罗莫夫-瓦瑟斯坦距离,从最优化特征-拓扑传输的角度更准确地计算了2个分布之间的差异;而且提出了反向验证伪标签的模块来更有效地利用伪标签,在训练过程中验证伪标签的质量.将所提出的方法在多个无监督域自适应的数据集上进行了实验验证.实验结果表明,BPLOT模型的效果超过了所有对比的基准方法.
  • 基于自步学习的开放集领域自适应
    刘星宏,周毅,周涛,秦杰,
    领域自适应的目的是将从源领域获得的知识泛化到具有不同数据分布的目标领域.传统的领域自适应方法假设源域和目标域的类别是相同的,但在现实世界的场景中并非总是如此.为了解决这个缺点,开放集领域自适应在目标域中引入了未知类以代表源域中不存在的类别.开放集领域自适应旨在不仅识别属于源域和目标域共享的已知类别样本,还要识别未知类别样本.传统的领域自适应方法旨在将整个目标域与源域对齐以最小化域偏移,这在开放集领域自适应场景中不可避免地导致负迁移.为了解决开放集领域自适应带来的挑战,提出了一种基于自步学习的新颖框架SPL-OSDA(self-pacedlearningforopen-setdomainadaptation),用于精确区分已知类和未知类样本,并进行领域自适应.为了利用未标记的目标域样本实现自步学习,为目标域样本生成伪标签,并为开放集领域自适应场景设计一个跨领域混合方法.这种方法最大程度地减小了伪标签的噪声,并确保模型逐步从简单到复杂的例子中学习目标域的已知类特征.为了提高模型在开放场景的可靠性以满足开放场景可信人工智能的要求,引入了多个准则以区分已知类和未知类样本.此外,与现有的需要手动调整超参数阈值以区分已知类和未知类的开集领域自适应方法不同,所提方法可以自动调整合适的阈值,无需在测试过程中进行经验性调参.与经验性调整阈值相比,所提的模型在不同超参数及实验设定下都表现出了良好的鲁棒性.实验结果表明,与各种最先进的方法相比,所提方法在不同的基准测试中始终取得卓越的性能.
  • 二次解耦与活体特征渐进式对齐的域自适应人脸反欺诈
    封筠,史屹琛,高宇豪,贺晶晶,余梓彤,
    现有的人脸反欺诈(faceanti-spoofing,FAS)方法虽然在域内测试表现良好,但在跨域场景下性能会大幅度下降.当前基于域对抗对齐的跨域人脸反欺诈方法,因其对齐网络和分类网络彼此独立,无法保证对齐任务直接服务于分类任务.提出了一种基于二次解耦与活体特征课程学习渐进式对抗对齐的域自适应人脸反欺诈(domainadaptationforfaceanti-spoofingbasedondualdisentanglementandlivenessfeaturecurriculumlearningprogressiveadversarialalignment,DDCL)方法,首先将源域特征启发式解耦为域相关特征和域无关特征,之后使用分类器的梯度信息将域无关特征中的活体相关和无关特征进行第2次解耦.在训练过程中为减轻优化难度,通过课程学习的方式对目标域特征与活体相关、无关特征的组合进行渐进式对抗对齐,逐步提高活体相关特征的比重,增强目标域特征与活体检测任务的相关性,从因果角度给出活体对齐域自适应的解释.在CASIA-MFSD,IdiapReplay-Attack,MSU-MFSD与OULU-NPU公开数据集上的实验结果表明,与现有10种方法相比,所提出的方法获得了22.5%的最佳平均HTER值,并在4个测评协议上均达到了当前先进水平,尤其是I-M和O-M测评协议的HTER值分别达到了12.4%和12.8%,能显著降低模型在目标域上的错误率,具有更好的跨域泛化能力.
  • 面向特征演变环境的标记噪声鲁棒学习算法
    张震宇,姜远,
    在现实应用中,数据通常以流的形式不断积聚,数据的特征可能随时间而演变.例如,在环境监测任务中,由于旧传感器达到使用寿命和新传感器的部署,数据特征可能会动态地消失或增加.此外,除了可演变的特征空间,数据标记可能存在噪声.当特征空间演变和数据标记带噪同时发生时,设计具有理论保障的学习算法,尤其是具备对算法泛化能力的理解是非常具有挑战性的.为了应对这一挑战,提出了一种在特征演变环境中针对标记带噪数据的差异度量方法,称为容忍标记噪声的演变差异.该差异度量启发了泛化误差分析,并根据泛化误差的理论分析设计了一种基于深度神经网络实现的学习算法.合成数据上的实证研究验证了所提差异度量的合理性,而在现实应用任务上的实验则验证了所提算法的有效性.
  • ADIC:一种面向可解释图像识别的自适应解纠缠CNN分类器
    赵小阳,李仲年,王文玉,许新征,
    近年来,卷积神经网络(convolutionalneuralnetwork,CNN)作为一种典型的深度神经网络模型,在图像识别、目标检测和语义分割等计算机视觉领域中取得了令人瞩目的成效.然而,CNN端到端的学习模式使其隐藏层的逻辑关系以及模型决策结果难以被解释,这限制了其推广应用.因此,研究可解释的CNN具有重要意义和应用价值.为了使CNN的分类器具有可解释性,近年来涌现出了很多在CNN架构中引入基础概念作为插入式成分的研究.事后概念激活向量方法以基础概念为表现形式,用于分析预训练的模型,但依赖独立于原始模型的额外的分类器,解释结果可能并不符合原始模型逻辑.另外,现有的一些基于概念的事前可解释方法对于CNN潜在分类空间中的概念处理太过绝对.引入图卷积网络模块,设计了一种类内概念图编码器(within-classconceptsgraphsencoder,CGE)学习类内基础概念及其潜在交互.在CGE基础上,设计实现不同依赖关系的基础概念不同程度解纠缠的正则化项,提出了潜在空间自适应解纠缠的可解释CNN分类器(adaptivedisentangledinterpretableCNNclassifier,ADIC).将ADIC嵌入ResNet-18和ResNet-50架构,在Mini-ImageNet和Places365数据集上的分类实验和可解释图像识别实验结果表明,ADIC在保证基准模型具有自解释能力的前提下,可以进一步提高基准模型的精度.
  • 针对情境感知的自然语言的因果去偏推理方法
    张大操,张琨,吴乐,汪萌,
    情境感知的自然语言推理任务要求模型能够根据给定情境信息判断前提句子与假设句子之间的语义推理关系.大量的研究工作通过利用情境信息增强对输入句子的语义表征学习,取得了显著的效果.然而,这些方法忽略了情境信息以及输入句子之间存在的虚假关联,导致模型存在泛化性及鲁棒性差的问题.同时,已有的去偏方法未能充分考虑语义推理过程中情境信息的影响,造成情境信息利用不充分、虚假关联识别不准确的问题.针对以上问题,通过融合因果推断方法,提出一种全新的因果去偏推理方法CBDRM(causal-baseddebiasedreasoningmethod),在充分考虑情境信息的条件下,缓解模型在推理过程中受到的有偏信息的影响.具体而言,首先通过统计分析为输入数据构建因果图,实现对输入数据中的不同变量之间的关系的准确刻画;在此基础上,利用预训练模型的有偏训练实现输入数据对预测结果的总因果效应的计算.同时,利用因果反事实方法实现计算数据中的虚假关联所导致的直接因果效应.通过从总因果效应中去除虚假关联所带来的直接因果效应,实现了对输入句子的语义推理关系的无偏预测.更进一步,考虑到在语义推理过程中情境信息对语义表达的影响,设计了一个全新的对比学习模块,实现了在考虑情境信息的情况下输入文本的语义表示,进一步提升了模型的无偏推理性能.最后,在公开数据集上进行了大量的实验验证.实验结果充分证明了所提出的方法的有效性.为了对无偏自然语言推理方法进行更好的评估,构建并公开了一个无偏的情境感知的自然语言推理挑战集,用于推动该领域的相关研究.
  • 给定预算下基于相对熵置信区间的蒙特卡洛树搜索最优动作识别算法
    刘郭庆,钱宇华,张亚宇,王婕婷,
    蒙特卡洛树搜索(MonteCarlotreesearch,MCTS)将强化学习的反馈优化与生长树的动态规划相结合,在输出当前状态的最佳动作的同时极大地减少了计算量,因此成为开放环境下众多领域智能系统的关键通用方法.但由于计算资源匮乏或者计算成本昂贵等原因,完全充分地对树结构进行搜索是难以实现的,因此在有限的预算下高效合理地分配计算资源从而获得当前状态下的最优动作是目前研究的一个重要问题.现有大多数算法仅以识别准确率作为性能指标,通过实验对比验证算法性能,缺少对算法的识别误差和影响因素的分析,从而降低了算法的可信性和可解释性.针对该问题,选择基础核心的2名玩家、完全信息、零和博弈场景,提出了固定预算设定下MCTS抽象模型的最优行动识别算法DLU——基于相对熵置信区间的纯探索(relativeentropyconfidenceintervalbasedpureexploration).首先提出了基于相对熵置信区间的估值方法对叶子节点胜率进行估计,其可以从底层提高树节点估值准确性;其次给出了第1层节点值估计、最优节点选择策略以形成完整算法流程;然后推导了DLU算法的识别误差上界,并分析了算法性能的影响因素;最后在人造树模型和井字棋2种场景下验证算法性能.实验结果表明,在人造树模型上基于相对熵的算法类具有更高的准确度,且模型越复杂识别难度越高时,该算法类的性能优势越显著.在井字棋场景下,DLU算法能有效地识别最优动作.
  • 基于用户重购行为的产品推荐方法
    耿杰,刘春丽,魏雪梅,程明月,袁昆,李洋,刘业政,
    重复购买是消费者日常消费决策中的常见现象,考虑用户重购行为对于提升产品个性化推荐准确性至关重要.然而针对用户重购行为建模和预测的研究工作相对较少,还有很多问题有待解决.已有推荐技术主要通过深度挖掘产品、用户或时间某一层面信息来进行重购产品推荐,忽略了对多层次信息融合建模方法的研究,同时也忽略了重购推荐结果的可解释性需求.因此,融合多层次用户偏好信息,构建了具有双层注意力机制的可解释用户重复消费推荐方法.该方法融合注意力机制和指针生成网络,多层次提取并学习用户重购偏好,同时基于信息处理理论构建S型用户重购动态偏好函数,融合产品流行度信息进行重购产品和新颖产品的混合推荐,提高了模型可解释性和准确性.真实数据集上的实验结果表明,所提方法在多个性能指标上都优于对比方法,且学习出的参数具备较好的可解释性.此外,通过回归分析验证了S型重购动态偏好函数的可信性,进一步增强了理论的可解释性.
  • 基于对比学习的全局增强动态异质图神经网络
    焦鹏飞,刘欢,吕乐,高梦州,张纪林,刘栋,
    图神经网络由于其对图结构数据的强大表征能力近年来受到广泛关注.现有图神经网络方法主要建模静态同质图数据,然而现实世界复杂系统往往包含多类型动态演化的实体及关系,此类复杂系统更适合建模为动态异质图.目前,动态异质图表示学习方法主要集中于半监督学习范式,其存在监督信息昂贵和泛化性较差等问题.针对以上问题,提出了一种基于对比学习的全局增强动态异质图神经网络.具体地,所提网络首先通过异质层次化注意力机制根据历史信息来生成未来的邻近性保持的节点表示,然后通过对比学习最大化局部节点表示和全局图表示的互信息来丰富节点表示中的全局语义信息.实验结果表明,提出的自监督动态异质图表示学习方法在多个真实世界数据集的链路预测任务上的AUC指标平均提升了3.95%.
  • 可信的端到端深度学生知识画像建模方法
    王士进,吴金泽,张浩天,沙晶,黄振亚,刘淇,
    学生知识画像是对学生在不同知识概念掌握程度的全面精准的表示.通常,智能教育系统中使用知识追踪方法,基于显式的学生交互数据,对学生在某些知识概念的隐式掌握程度进行建模.然而知识追踪方法的预测结果与学生知识画像存在着时序、预测粒度不一致的情况,导致其产生的学生知识画像不可信.对此,首先基于端到端的学生知识掌握度预测目标定义并形式化学生知识画像预测任务,然后提出了一种深度知识画像(deepknowledgeportrait,DKP)模型.该方法首先在知识粒度上学习交互表征,引入了知识难度、知识概念等特征在知识粒度上区分交互;然后,采用双向长短时记忆网络基于学生历史交互序列,建模学生知识状态变化.最后针对待预测知识概念,使用了多头注意力池化层强化历史序列中的相关交互以进行该概念下的学生掌握度预测.在3个真实的数据集上的实验结果表明,所提出的方法更适合学生知识画像预测任务从而获得更可信的学生知识画像,并在各项性能上超过了现有的方法.
  • 多层次知识自蒸馏联合多步骤训练的细粒度图像识别
    余鹰,危伟,汤洪,钱进,
    细粒度图像识别具有类内差异大、类间差异小的特点,在智能零售、生物多样性检测和智慧交通等领域中有着广阔的应用场景.提取到判别性强的多粒度特征是提升细粒度图像识别精度的关键,而已有工作大多只在单一层次进行知识获取,忽略了多层次信息交互对于提取鲁棒性特征的有效性.另外一些工作通过引入注意力机制来找到局部判别区域,但这不可避免地增加了网络复杂度.为了解决这些问题,提出了多层次知识自蒸馏联合多步骤训练的细粒度图像识别(multi-levelknowledgeself-distillationwithmulti-steptrainingforfine-grainedimagerecognition,MKSMT)模型.该模型首先在网络浅层进行特征学习,然后在深层网络再次进行特征学习,并利用知识自蒸馏将深层网络知识迁移至浅层网络中,优化后的浅层网络又能帮助深层网络提取到更鲁棒的特征,进而提高整个模型的性能.实验结果表明,MKSMT在CUB-200-2011、NA-Birds和StanfordDogs这3个公开细粒度图像数据集上分别达到了92.8%、92.6%和91.1%的分类准确度,性能优于当前大部分细粒度识别算法.
  • 基于链路信息估计的低轨卫星网络传输控制协议
    王子涵,张娇,张远,潘恬,黄韬,
    近年来,低轨卫星星座快速发展,其在军事和民用领域也将发挥越来越重要的作用.如何提高低轨卫星网络的带宽利用率成为保障低轨卫星星座发挥价值的重要研究方向.而传统TCP(TransmissionControlProtocol)协议及其变种主要针对地面网络设计,难以适应长往返时延、高误码率、高动态变化的低轨卫星网络.因此,为了充分利用低轨卫星网络的带宽资源,承载高速率业务,需要针对卫星网络的特点设计新型传输控制协议.首先,分析了低轨卫星网络的特点以及现有传输控制协议在卫星网络中存在的问题;然后,提出了基于路径信息估计和时延区分的新型拥塞控制DDTCP(delay-differentiatedTCP)算法.低轨卫星网络端到端时延可能由多种因素引起,DDTCP在源端会保存过去一段时间内的时延信息,进而通过路径时延区分机制对拥塞窗口演化进行分类处理,可以在网络状况发生突变后,快速设置合理的拥塞窗口,避免链路缓存溢出或吞吐下降.实验结果表明,新的传输控制协议DDTCP可以在低轨卫星网络中实现更高、更稳定的吞吐量,与传统拥塞控制算法相比,吞吐量提升19%以上.
  • 边缘计算中面向互动直播的用户分配策略
    刘伟,张骁宇,杜薇,彭若涛,
    将互动直播部署在边缘计算环境中,可以在网络边缘对直播视频进行转码和传输,通过用户附近的边缘服务器提供低延迟的直播服务.然而,在多边缘服务器、多用户场景下存在着直播用户分配问题,导致直播用户体验质量(qualityofexperience,QoE)无法得到保证.为了提高直播用户QoE,需要根据用户的个性化需求合理地分配服务器资源.首先分析真实数据集,发现大多数用户处于多基站重叠覆盖区域内,并且不同用户的互动需求存在差异;然后根据互动直播的特点提出一种适用于边缘计算场景的用户QoE模型,该模型综合考虑了直播用户的视频质量和互动体验;最后设计一种高效的直播用户分配算法,优化了多边缘服务器重叠覆盖区域内的直播用户QoE.仿真实验表明,所提出的用户分配策略可为用户提供高码率和低延迟的直播视频,同时能有效降低边缘服务器切换次数和码率抖动,使直播用户QoE相较于其他策略提升超过19%.
  • Android恶意应用的静态检测方法综述
    潘建文,崔展齐,林高毅,陈翔,郑丽伟,
    Android系统的开放性和第三方应用市场的多样性,使其在取得高市场占有率的同时也带来了巨大的风险,导致Android恶意应用层出不穷并广泛传播,严重威胁了用户的隐私和经济安全.如何有效检测Android恶意应用受到了研究人员的广泛关注.根据是否运行应用程序,将现有的恶意应用检测方法分为静态检测和动态检测.其中,静态检测的效率和代码覆盖率均优于动态检测,Drebin等静态检测工具取得了广泛应用.为此,系统调研了Android恶意应用静态检测领域的研究进展,并进行了分析和总结.首先,介绍了Android应用静态特征;然后,根据静态特征的不同,分别对基于权限、应用程序编程接口(applicationprogramminginterface,API)和操作码等不同静态特征的Android恶意应用检测方法进行了分析,并总结了常用的Android应用数据集和评价Android恶意应用检测性能的常用指标;最后,对Android恶意应用静态检测技术的发展进行了总结和展望,以期为该领域的研究人员提供参考.
  • 安全关键的信息物理系统中时序行为的组合与精化
    陈博,李曦,周学海,
    信息物理系统(cyberphysicalsystems,CPS)通常被应用于安全关键的场景中,需要进行实时监控,并计算反馈信息,实现对外部环境的自动控制与管理.基于模型驱动的开发方法是针对实时的、异构的CPS进行开发的,而模型的可组合性是其中的核心关键点.针对时序行为的可组合问题,首先通过时序约束语言(clockconstraintspecificationlanguage,CCSL)建立系统的时序行为需求模型,在此基础上通过迁移系统描述CCSL的时序行为语义,并给出其组合操作方法及可组合性的形式化定义.进一步地,对时序行为进行精化操作,给出从时序行为需求模型到任务执行模型的转换方法.同时,基于L*方法对模型行为进行学习,实现组合验证以缓解状态爆炸问题,并验证精化后模型的可组合性.最后通过仿真实验及主从智能小车实例对精化与验证方法进行评估.相关数据显示,精化与组合验证方法在处理时间和内存使用上具有一定的性能优势.
  • ADFuzz:使用异常检测筛选低频路径高效模糊测试
    李航宇,方浩然,曲彦文,郭帆,
    基于覆盖率引导的模糊测试(Fuzzing)是当前最有效的漏洞自动挖掘技术.目前大部分的模糊测试工具对于新产生的测试用例实施全追踪策略.但是随着时间的流逝,模糊工具生成的测试用例都集中在程序的高频路径,使能够产生新覆盖的测试用例远少于已生成测试用例的总数,以至于全追踪策略花费了大量无意义的时间成本和运行开销.因此提出基于异常检测模型的模糊测试工具ADFuzz,筛选低频路径以减少高频路径的执行次数,从而加速模糊测试,持续引导模糊测试朝着低频路径方向变异运行,并扩大程序覆盖.通过ADFuzz,AFL,Untracer在12个真实程序上运行24h的实验结果显示,相比AFL,ADFuzz平均速度提升23.8%,平均覆盖率增加11.78%,最高增加25.8%;相比Untracer,ADFuzz平均速度降低较少,但是漏洞数量和覆盖率都有较大提升.
计算机研究与发展封面

中文名称:计算机研究与发展

杂志社官网:https://crad.ict.ac.cn/

英文名称:Journal of Computer Research and Development

语言:中文

类别:自动化技术、计算机技术

主 编:徐志伟

创刊时间:1958

出版周期:月刊

国内刊号:11-1777/TP

国际刊号:1000-1239

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京中关村科学院南路6号
  • 电话:(010)62620696
  • E-mail:crad@ict.ac.cn