计算机研究与发展杂志

计算机研究与发展杂志2025年第9期

  • 基于强化学习的科学数据特征生成算法
    肖濛,周骏丰,周园春,
    特征生成(featuregeneration,FG)的目标是通过构建高阶特征组合并去除冗余特征,提升原始数据的预测潜力.针对表格型科学数据,特征生成是提高下游机器学习模型性能的重要预处理环节.然而,传统方法在处理科学数据特征生成问题时面临以下两方面挑战:首先,针对科学数据生成有效的高阶特征组合通常需要深入且广泛的领域知识;其次,随着特征组合阶数的增加,组合搜索空间呈指数级扩张,导致人工探索成本过高.近年来,以数据为核心的人工智能(data-centricartificialintelligence,DCAI)范式的兴起为自动化特征生成过程提供了新的可能性.受此启发,重新审视了传统特征生成工作流程,并提出了一种多智能体特征生成(multi-agentfeaturegeneration,MAFG)框架.具体而言,在迭代探索阶段,多个智能体协作构建数学变换算式,识别并合成具有高信息含量的特征组合,最后通过强化学习机制实现策略的自适应演化.探索阶段结束后,MAFG框架引入大语言模型(largelanguagemodels,LLMs),针对探索过程中的每个关键模型性能突破点,解释性评估该步骤新生成的特征.实验结果和具体案例研究表明,MAFG框架能够有效地实现特征生成过程的自动化,并能显著提升下游多个科学数据挖掘任务的效果.
  • 基于合成数据预训练基础模型的表格数据聚类方法
    李培文,李飞江,王婕婷,钱宇华,
    随着数据采集与数据存储技术的飞速发展,各行业收集并存储了大量无标记的表格数据.聚类分析是挖掘这类数据潜在分组结构的重要方法.目前,处理表格数据的聚类方法多数仍然是传统聚类算法.深度学习技术和大模型技术主要用于处理非结构化的图像、文本、语音等数据类型,其强大的表示能力和推理能力在结构化的表格数据处理中仍难以发挥优势.2025年,《Nature》刊发的TabPFN是一种可用于高效处理分类和回归任务的表格数据基础模型,为表格数据学习提供了新的基础.受此启发,提出了一种基于合成数据预训练基础模型的表格数据聚类方法,主要包括预训练阶段和迭代推理阶段.其中,预训练阶段基于传统数据聚类算法和TabPFN模型获得无标记表格数据的初始伪标签,迭代推理阶段基于微调后的TabPFN模型循环更新伪标签以得到聚类结果.在基准数据集上的大量实验分析表明,改进方法显著提高了7种代表性聚类算法的性能.
  • 面向作答序列数据的情境自适应学习推荐方法
    陈泽君,张所娟,陈卫卫,崔静,龙佳琪,陈恩红,
    学习推荐作为智能教育领域的核心研究任务,目的是根据学习者的认知状态,提供个性化的学习资源.现有的学习推荐方法依赖于学习者对知识概念的掌握程度,缺少对作答序列数据中情境信息的充分挖掘,无法有效提高学习者的知识迁移能力.提出了面向作答序列数据的情境自适应学习推荐方法.该方法构建包括知识概念情境和习题情境的学习情境感知表征模块,融合时序大语言模型的认知状态表征模块,实现基于知识图谱的情境自适应学习推荐模块,将习题、知识概念和学习者特征进行动态关联,依据学习情境特征实现自适应精准推荐,解决了学习情境自适应推荐难的问题,提高了模型的情境感知和自适应能力,在保证学习效果的同时,增强了学习过程的新颖性以及学习推荐系统的效率和准确度.在AAAI2023和NeurIPS_t34数据集上的比较和消融实验表明,所提模型的准确率和新颖性均优于基线模型.
  • 置信引导的多模态数据测试时适应框架
    尹小龙,詹德川,姜远,
    测试时适应(testtimeadaptation,TTA)旨在在模型部署后的测试阶段,通过无标注或少量标注的在线微调策略来动态校正模型,以应对由于分布偏移、传感器噪声、光照变化等引发的性能退化问题,并在自动驾驶、远程医疗、视频监控等对实时性和鲁棒性要求极高的领域展现出广泛应用价值.然而,现有多模态TTA方法往往忽视各视图数据的质量差异,容易因低质量或故障视图引入有害梯度,且缺乏对视图内部动态变化的刻画,难以保持时序特征的一致性和稳定性.为解决上述挑战,提出了一种置信度引导的视图裁剪与时序对比注意力(confidence-guidedviewpruningandtemporalcontrastiveattention,CVPTA)框架.该框架包含三大模块:首先,基于模型预测分布计算视图不确定性,自适应削弱低置信度视图数据对特征融合的干扰;其次,视图裁剪策略利用Laplacian方差与亮度直方图偏度评估图像质量,丢弃质量分数低于阈值的视图数据,并结合相邻高质量视图重采样,显著降低噪声累积风险;最后,时序对比自监督任务将同一样本的不同视图视为正样本而非同一样本视图视为负样本,通过对比损失强化时序特征一致性.在Kinetics-50-C与VGGSound-C两个公开多模态扰动基准上,沿用先前实验配置进行在线更新评测.结果显示,CVPTA在2组基准上分别将Top-1准确率提升约2.3个百分点和0.7个百分点,在极端噪声场景中依然保持超过0.2%的性能增益;消融研究进一步验证了各模块的独立贡献与协同效应.该方法无需额外标注,可无缝集成现有多模态系统,兼具高效性与鲁棒性,具有重要的理论意义与工程应用前景.
  • 面向复杂噪声数据的鲁棒文本-图像行人检索方法
    胡冰玉,徐艺心,余珊,赵巨峰,杨宇翔,
    文本-图像行人检索(text-basedpersonretrieval)作为多模态智能监控系统的核心任务,旨在通过自由形式的文本描述从大规模数据库中识别目标行人图像,在公共安全与视频取证领域具有关键应用价值,如刑事侦查中的嫌疑人追踪及跨摄像头取证分析.传统方法通常基于图像-文本对完美对齐的理想化假设,忽视了实际场景中普遍存在的复杂噪声数据问题,即视觉实例与其文本标注间因人工标注偏差、网络爬取噪声,或局部视觉属性与全局文本语境间的语义粒度失配而产生的错误或歧义性关联.为弥补这一缺陷,提出了一种语义感知噪声关联学习框架,通过双重创新机制系统性地实现噪声辨识与鲁棒学习.首先,语义感知噪声辨识准则融合模态内语义一致性与跨模态交互信号,基于自适应阈值判定精准区分噪声关联;其次,噪声鲁棒互补学习范式实施差异化优化策略:对于可靠子集采用对比损失进行正向学习以增强特征判别性,而对噪声子集则通过反向学习以抑制过拟合.在3个公开基准数据集上的大量实验表明,该方法在合成噪声数据与真实噪声数据场景中均展现出优越性能.
  • 渐进式认知引导的双域半监督人群计数
    余鹰,范在昌,曾康利,黄晓辉,苗夺谦,
    在人群计数任务中,高昂的数据标注成本严重制约了全监督方法的广泛应用.为显著降低对标注数据的依赖,利用大量未标注数据的半监督计数方法已成为当前研究的主流方向.然而,现有半监督方法通常依赖迭代生成伪标签进行训练,其性能深受2种不确定性因素的制约,其中认知不确定性来自模型自身对知识掌握的不足,易导致伪标签生成质量不稳定;任意不确定性源于数据固有的噪声和歧义,使得模型易受背景干扰和分布偏差的影响.为应对上述挑战,提出渐进式认知引导的双域半监督人群计数网络(PCDNet).该网络设计了渐进式认知引导的伪标签精炼机制,通过多粒度筛选,有效剔除低质量伪标签,缓解认知不确定性干扰;同时,提出联合频域和空间域的双域联合计数损失(dual-domainjointcountingloss,DDL),强制模型在空间域和频域学习一致且鲁棒的特征表达,有效约束由数据偏差引发的任意不确定性,增强模型对复杂场景的泛化能力.在4个主流人群计数数据集上的大量实验表明,PCDNet显著优于现有半监督方法,尤其在标注数据稀缺时优势更为明显.实验结果充分验证了该方法在应对认知与任意不确定性、生成高质量伪标签以及提升模型鲁棒性和泛化性能方面的有效性,为半监督人群计数提供了更优的解决方案.
  • 多模态视觉语言表征学习模型及其对抗样本攻防技术综述
    曾诚,葛云洁,赵令辰,王骞,
    随着计算机视觉、自然语言处理与深度学习技术的快速发展,多模态视觉语言表征学习模型在图像描述、文本生成图像、视觉问答等任务中展现出了卓越的性能,已成为当前学术界与工业界共同关注的研究热点.然而,这类模型的多模态特性和复杂性为攻击者提供了更加多样的攻击途径,攻击者可以通过对抗样本引导模型输出错误的、有害的或虚假的内容,使该类模型面临的安全威胁日益严峻.系统地梳理了多模态视觉语言模型的研究现状,同时,对近年来出现的针对该类模型的对抗样本攻击方法及其防御策略进行了分类总结,详细归纳了相关研究的基本原理、实施方法与研究结论.在此基础上,对多模态视觉语言表征学习的安全研究现状与未来方向进行了探讨,并展望了视觉语言表征学习技术在未来结合可解释性技术的应用前景.
  • 基于深度学习的不完整时序数据补全方法综述
    周立,吴洋洋,苗晓晔,
    时序数据广泛存在于工业、金融、交通、气象及医疗等领域,具有重要的分析应用价值.然而由于人为或偶发因素导致的缺失,时序数据的完整性经常遭到破坏,进而削弱基于其开展的分析与决策的准确性和可靠性.不完整时序数据通常包含复杂的时序依赖和变量间关系,为缺失值的有效补全带来较大挑战.深度学习方法具有强大的建模能力,是应对该挑战的有效技术,并日益成为研究热点.故系统综述基于深度学习的不完整时序数据补全方法的研究现状,首先介绍其相关概念和定义,进而对现有方法进行分类,归纳各类代表性方法的核心思想与特点.随后整理常用的开源数据集与评价指标,并设计全面系统的实验方案.实验从缺失场景、缺失率、变量数量、序列长度以及对下游任务的提升效果等多个角度,评估10种主流深度学习方法的补全质量与效率,最终总结实验结果并依据场景推荐合适的补全方法.最后,结合当前研究进展对该领域的未来发展趋势进行展望,并总结全文.
  • 数据治理中的隐私审计
    许婧楠,王雷霞,孟小峰,
    隐私审计是数据治理中的关键问题,旨在判断数据的隐私是否得到了有效保护.通常,学者们通过对数据添加噪声或扰动实现差分隐私,从而保护个人隐私.特别在机器学习场景下,出现越来越多的差分隐私算法,并且这些算法均声称自己可以达到较为严格的隐私保护水平.然而,即使这些算法在发布之前会经过严格的数学证明,其实际应用中的隐私保护程度亦难以确定.鉴于差分隐私理论本身的复杂性,隐私算法中证明的错误和编程实现的错误时有发生,使得这些算法无法达到其声称的隐私保护水平,导致隐私泄露.为了解决这一问题,隐私审计应运而生.隐私审计可以获取隐私算法的真实隐私保护水平,有助于算法设计者对算法进行改进.将综述隐私审计相关算法,从数据构建、数据测算、结果量化3个维度进行总结,并对隐私审计算法进行实验说明,最终提出隐私审计面临的挑战以及未来研究方向.
  • 云存储数据加密重删攻击与防御技术研究进展
    吴健,付印金,方艳梅,刘垚,付伟,操晓春,肖侬,
    重复数据删除作为一种面向大数据的高效缩减技术,已经被广泛应用于各种云存储系统和服务中,为了兼容数据重删和加密,通常采用收敛加密.然而,这种云服务商的外包存储方式以及确定性的加密方式会导致一系列数据安全问题.目前,数据加密重删技术已成为云存储领域的研究热点.首先介绍重复数据删除技术的概念、基础加密重删算法和云存储中数据加密重删的安全挑战.其次从攻击和防御的角度阐述当前云存储数据加密重删安全研究现状,攻击包括:蛮力攻击、频率攻击、侧信道攻击3种类型.围绕每种攻击类型,梳理对应的代表性防御方案,并总结各个方案的优势和缺陷.最后,针对当前数据加密重删防御方案存在的问题进行总结,并对未来的研究方向进行展望.
  • 基于语义图学习的恶意域名检测技术
    付豪,龙春,宫良一,魏金侠,黄潘,林延中,孙德刚,
    恶意域名检测是网络入侵检测系统中重要的组成部分,能够通过域名请求快速发现网络攻击.基于机器学习的恶意域名检测能够克服黑名单机制缺陷,提升对恶意域名的识别精度,然而由于域名构造差异性大,实际环境域名复杂多变,应用过程中检测效率低、鲁棒性差.为此,提出一种基于域名语义图学习的恶意域名检测技术,利用语义图关联分析来实现高效的恶意域名检测.具体而言,首先收集了中国科技网12个月的域名请求数据,共33.3亿访问记录,其中包括超过650万条恶意域名记录,涉及284个攻击类型.通过对不同类别域名的语义特征分析,发现不同类别域名之间具有明显的语义区分度,但存在较大的特征分布重叠区间,重叠的域名数据降低了分类器性能.因此,提出一种基于字符语义相似性的域名关联图模型,通过融合邻居域名特征增强重叠区间域名语义特征,进而提升检测性能.首先,通过分析域名结构的相似性过滤域名中吻合度较高的噪声字符以消除域名固有结构造成的检测干扰;其次通过提取域名字符的语义相似性特征构造域名语义图模型,进而通过在线聚合算法构建动态的域名语义图,以基于节点度权重抽样经验池获取的样本集为基础,训练得到基于样本语义权重的多头注意力消息传播图模型;最后使用多层神经网络分类器实现恶意域名检测.实验结果表明,提出的恶意域名检测技术在不同类型恶意域名的数据集上取得了平均0.96的精确率和0.97的召回率,并且该模型能够在线进行自演进,具有较高的识别率和鲁棒性.
  • 一种基于近似陷门采样的可搜索加密方案
    戚丽君,庄金成,
    格上的公钥可搜索加密在确保外包数据的隐私性、机密性和灵活性方面发挥着重要作用,同时能够抵抗量子攻击.大多数格上的公钥可搜索加密受限于底层原像采样算法,存在高存储开销或低效率的问题.为了解决上述问题,首先提出了一种优化的公钥可搜索加密方案.方案使用一种新的近似陷门采样算法提高计算效率,该算法能够输出一个近似的而不是精确的原像.然后,结合非球面高斯采样技术和理想可扩展输出函数来降低密钥和陷门的存储开销.进一步地,引入了具有前向安全和后向安全的扩展方案来解决基础方案中的更新和搜索操作泄露.为了避免新更新的密文与以前的陷门匹配,即前向安全,通过基于格的委托机制来定期更新密钥.为了防止后续搜索泄露有关已删除文件的信息,即后向安全,通过结合位图索引和格同态加密方案实现文件的添加和删除.理论分析和实验结果表明,相较于高效的可搜索加密方案,所提方案在公钥存储开销和陷门存储开销上分别降低了4.6%和50.1%.同时,该方案在加密、陷门生成以及搜索上的效率分别实现了11.11%,2.5%,26.15%的提升.
  • 基于NTRU格的密钥封装机制高效软件优化实现
    郑婕妤,宋振宇,朱浩亮,赵运磊,林璟锵,范晶,
    NTRU格是构建实用后量子格基密钥封装机制的重要选择.格密码的软件优化工程实现对于后量子密码后续的应用部署具有重要意义.CTRU是中国学者提出的基于NTRU格的格密码密钥封装机制.目前CTRU方案只有CTRU-768完成了C和AVX2实现,且有进一步的优化空间,并且CTRU-768的实现无法直接扩展到CTRU-512和CTRU-1024方案上.完成了CTRU-512和CTRU-1024及其变体CNTR-512和CNTR-1024的优化参考C实现和对应AVX2并行优化实现,并对已有的CTRU-768方案的参考实现和AVX2实现进行优化.采用混合基数论变换(NTT)加速多项式环乘法,并使用Karatsuba算法加速分解后的小度数多项式环乘法.此外,结合中心Barrett约减,提出在逆向NTT中进行基于索引的延迟约减.对于CTRU-1024下较为耗时的多项式求逆,引入了Bernstein快速求逆算法.进一步地,提供了更加高效的AVX2优化实现方案,利用Intel提出的单指令多数据(SIMD)指令集AVX2,加速了CTRU中的性能瓶颈.采用层融合和系数置乱技术减少实现过程中的存取指令.此外,对Bernstein快速多项式求逆算法进行了向量化优化实现.对耗时SHA-3哈希模块进行AVX2汇编实现.相较于最新的CTRU-768AVX2实现,AVX2优化实现性能提升了8%~11%.对于CTRU方案,与参考实现相比,AVX2优化实现在3个方案上的性能提升均非常显著.对于CTRU方案,与参考实现相比,提出的AVX2优化实现在CTRU-512,CTRU-768,CTRU-1024这3个方案上的性能提升均十分显著,密钥生成、密钥封装、密钥解封装的性能提升幅度分别为56%~91%,74%~90%,70%~83%.
  • LHG-VD: 一种可学习的层次化图表示漏洞检测方法
    胡菘,罗嘉驰,万文凯,闫阳,郭帆,曲彦文,
    软件漏洞严重威胁了计算机系统和软件的安全稳定运行,因此针对其自动检测的相关研究一直受到广泛关注.与传统静态漏洞检测工具采用人类专家提供的预定义规则进行代码分析不同,基于图神经网络(GNN)的漏洞检测方法通过自动学习易受攻击的代码模式,在一些数据集上的检测效果已经超越传统方法.然而,目前基于GNN的漏洞检测方法中,由于未结合代码自身特点对GNN模型进行设计,导致在真实漏洞代码数据集上检测效果较差.提出一种可学习的层次化图表示的漏洞检测方法LHG-VD,其特点是针对传统读出函数的局限提出一种可学习的读出函数,针对图池化过程中的代码局部结构信息保持问题设计了一种基于对比学习思想的跨粒度损失函数.在真实漏洞数据集的实验结果表明,LHG-VD的F1值为71.5%,与切片级检测方法DeepWukong相比提升4.9个百分点,与函数级检测方法AMPLE相比提升8.9个百分点.
  • 机载系统软件需求的建模与分时组合验证方法
    黄益柯,阮锟,陈小红,金芝,
    机载系统在航空航天领域起着至关重要的作用,其突出的安全性使得软件需求的形式化验证成为一个非常重要的问题.但是随着机载系统需求复杂度和设备数量的增加,其形式化验证中出现了状态空间爆炸的问题.为了缓解该问题,提出了一种机载系统需求的建模与分时组合验证方法.这种方法通过利用时间维度,将复杂的验证系统分解为相互独立的组件,实现了对各组件的独立验证,进而综合出整个系统的验证结果.通过实际的案例研究,证明了该方法的可行性.并通过评估说明该方法不但可以验证一些传统单体验证不能验证的系统,缓解状态空间爆炸,而且可以避免不考虑分时所造成的误报.这一方法为机载系统的软件需求验证提供了一种新的技术途径,有助于提高验证的准确性和效率,确保机载系统的安全性.
  • 一种异构系统下计算软件性能数据采集方法
    顾蓓蓓,邱霁岩,王宁,陈健,迟学斌,
    超级计算已从传统CPU集群向异构平台快速发展,随着硬件平台的类型转换,对于计算软件程序调优及性能测评等都面临着重大挑战.当前一些国际主流并行程序性能分析工具及软件普遍存在与国产超算异构系统处理器产品兼容性低、往往需要进行插桩及重编译代码的方式,且单节点性能数据采集准确度不高等问题.为了改进这些不足,提出了一种异构系统计算软件浮点性能数据采集方法.该方法基于国产超算系统验证平台对浮点性能采集原型进行开发及验证.目前已实现单节点和多节点性能指标数据的有效采集,且对原程序无侵入性,该方法无需修改需要被监控程序的代码,且无需采用插桩的方式进行监控,通用性强.最后,与rocHPL,Cannon,mixbench这3类程序进行对比实验分析,并针对人工智能(artificialintelligence,AI)计算,在残差网络(residualnetwork,ResNet)程序上开展了性能数据采集方面的监测研究.证明提出的采集方法准确度较高,采集效果达到实验预期,且对程序调优具有较好的参考价值,验证了该方法的有效性.
计算机研究与发展封面

中文名称:计算机研究与发展

杂志社官网:https://crad.ict.ac.cn/

英文名称:Journal of Computer Research and Development

语言:中文

类别:自动化技术、计算机技术

主 编:徐志伟

创刊时间:1958

出版周期:月刊

国内刊号:11-1777/TP

国际刊号:1000-1239

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京中关村科学院南路6号
  • 电话:(010)62620696
  • E-mail:crad@ict.ac.cn