计算机研究与发展杂志

计算机研究与发展杂志2024年第2期

  • DEALS——追踪代币转账信息不一致
    姜人楷,宋书玮,罗夏朴,陈厅,罗瑞杰,王炳森,乔翱,
    区块链使传统的交易所和借贷机构能够扩展到去中心化平台(decentralizedplatform,Depl),任何人都可以在没有中介机构帮助的情况下进行交易和借贷.大多数Depl都是作为运行在以太坊上的智能合约实现的,并与另一种智能合约、加密货币(即代币)交互,以实现各种功能.尽管Depl涉及价值超过350亿的美元,但人们对代币的实际转移是否如Depl预期的那样一致知之甚少.代币的实际转移与Depl期望的不一致被称为行为不一致,这种不一致的出现将导致财产的损失和用户的质疑.在这项工作中,我们迈出了调查Depl和代币之间的这种不一致的第一步.我们提出通过监控Depl和代币的核心数据结构变化,将实际的代币转移行为与Depl内部记录指示的行为进行比较,自动检测不一致.实验结果表明,在1012749笔交易中存在不一致行为,涉及2871对Depl和代币,与110个Depl和2544个代币相关.实验结果的精准度为98.0%.此外,还总结了导致不一致的10大原因,例如诈骗Depl、Depl与代币尺度不一致、锁币规则不明确等.
  • CodeScore-R:用于评估代码合成功能准确性的自动化鲁棒指标
    杨光,周宇,陈翔,张翔宇,
    评估指标在代码合成领域中至关重要.常用的代码评估指标可以分为3种类型:基于匹配、基于语义和基于执行.其中,基于执行的Pass@k指标通过执行测试用例,能够准确判断预测代码的功能准确性.然而,该指标的计算需要大量开销,因此亟需设计一种自动化评估指标,在无需测试用例时仍可评估预测代码的功能准确性.此外,好的评估指标应当具有鲁棒性,即预测代码发生微小改变时,评估指标仍能保持其准确性.为此,提出了一种基于UniXcoder和对比学习的自动化鲁棒指标CodeScore-R,用于评估代码合成的功能准确性.CodeScore-R采用草图化处理、语法等价转换和变异测试等技术手段,有效减轻了标识符、语法结构和运算符对评估结果的干扰.实验结果表明,在Java和Python语言上的代码生成和迁移任务中,CodeScore-R的表现优于其他无需测试用例的评估指标,且更接近Pass@k指标,并具有更强的鲁棒性.
  • 基于分层表示和上下文增强的类摘要生成技术
    陈豪伶,虞慧群,范贵生,李明辰,黄子杰,
    代码摘要是源代码的自然语言解释,高质量的代码摘要有助于提高开发人员程序理解效率.近年来,代码自动摘要的研究集中在为方法粒度的代码片段生成摘要.然而,对于面向对象的语言,例如Java,类才是项目的基本组成单元.基于上述问题,提出一种基于分层表示和上下文增强的类摘要生成方法HRCE(hierarchicalrepresentationandcontextenhancement),并构建了一个包含358992个\langleJava类,上下文,摘要\rangle数据对的类摘要数据集.HRCE使用代码精简策略去除类的非关键代码,从而缩短代码长度.然后,对类的层次结构,包括类签名、属性和方法分别进行建模,获得类的语义信息和层次结构信息.此外,从项目中抽取父类的签名及摘要来刻画类在项目中依赖的上下文.实验表明,基于分层表示和上下文增强的类摘要生成模型能够表征代码的语义和层次结构,并可以从目标类的内部和外部获取信息.HRCE在BLEU,METEOR,ROUGE-L等评估指标上超过了所有基准模型.
  • 基于扩散模型生成数据重构的客户流失预测
    杨斌,王正阳,程梓航,赵慧英,王鑫,管宇,程新洲,
    在数据挖掘领域普遍存在数据不平衡影响到模型预测精度的问题,同时还存在未考虑用户隐私保护的问题.生成伪造数据是一种重要的解决方法,但在以结构化数据为主的场景中,由于存在数据特征维度多且不相关等特点,生成高质量的数据存在挑战.考虑到扩散模型在图像生成等任务中被成功应用,以客户流失预测为典型应用场景,尝试将扩散模型应用到客户流失预测任务中.针对该场景数据中的数值型特征和类别型特征,通过高斯扩散模型和多项式扩散模型获得生成数据,并对模型预测效果和数据隐私保护能力进行研究和分析.在多个领域的客户流失数据上进行了大量实验,探索应用生成数据对真实数据融合重构的可能性.实验结果表明基于扩散模型可生成高质量数据,且对多种预测方法均有一定提升,可实现缓解数据不平衡问题.同时,基于扩散模型生成的数据分布更接近真实数据,具有应用于用户隐私保护的潜在价值.
  • ChatModeler:基于大语言模型的人机协作迭代式需求获取和建模方法
    靳东明,金芝,陈小红,王春晖,
    需求获取和建模是需求工程中的关键步骤,影响后续系统设计与实现.传统的需求获取和建模方法通常由需求提供者、需求分析师等多类干系人共同协作、反复迭代完成,需要耗费大量的人力.如何减轻需求提供者与需求分析师的负担、提高获取和建模的效率有着重要意义.现有工作中有的使用知识库来提供更多知识,以辅助获取或者建模,有的利用自然语言处理等技术对获取或者建模过程进行自动化,但是它们并没有减轻需求提供者的负担.利用大语言模型(largelanguagemodels,LLMs)的生成能力,提供了一种人机协作的迭代式需求获取和建模框架ChatModeler.具体来说,根据真实世界中需求团队的分工及协作关系,将部分需求提供者、需求分析师等角色的工作由大语言模型承担,而需求提供者只需要进行确认.为大语言模型扮演的各种角色进行了提示词设计,该提示词会随需求的元模型而变化.ChatModeler在7个需求案例上与3种需求模型的自动建模方法进行了14组对比实验,证明了ChatModeler在降低需求提供者的负担和生成高质量需求模型2个方面上的优越性.
  • 大型语言模型:原理、实现与发展
    舒文韬,李睿潇,孙天祥,黄萱菁,邱锡鹏,
    近年来,大型语言模型的出现和发展对自然语言处理和人工智能领域产生了变革性影响.随着不断增大模型参数量和训练数据量,语言模型的文本建模困惑度以可预测的形式降低,在各类自然语言处理任务上的表现也持续提升.因此,增加语言模型的参数和数据规模成为提升系统智能水平富有前景的途径.首先回顾了大型语言模型的基本定义,从模型表现和算力需求的角度给出了“大型”语言模型的界定标准.其次,从数据、算法、模型3个维度梳理了大型语言模型的发展历程及规律,展示了不同阶段各个维度的规模化如何推动语言模型的发展.接着,考察了大型语言模型所表现出的涌现能力,介绍了思维链、情景学习和指令遵循等关键涌现能力的相关研究和应用现状.最后,展望了大型语言模型的未来发展和技术挑战.
  • 超图神经网络综述
    林晶晶,冶忠林,赵海兴,李卓然,
    近年来,图神经网络借助大量数据和超强计算能力在推荐系统和自然语言处理等应用领域取得显著成效,它主要处理具有成对关系的图数据.但许多现实网络中的对象之间的关系是复杂的非成对关系,如科研合作网络、蛋白质网络等.若直接用图结构将这种复杂的关系表示为成对关系,会导致信息丢失.超图是一种灵活的建模工具,可以展现出图无法完整刻画的高阶关系,弥补了图的不足.鉴于此,研究者开始关心如何在超图上设计神经网络,并相继提出应用于下游任务的超图神经网络模型(hypergraphneuralnetwork,HGNNs).故对现有的超图神经网络模型进行综述,首先全面回顾超图神经网络在过去3年的研究历程;其次根据设计超图神经网络采用的方法不同对其进行分类,并详细地阐述代表性的模型;然后介绍了超图神经网络的应用领域;最后总结和探讨了超图神经网络未来的研究方向.
  • 在线社交网络中用户地理位置预测综述
    刘乐源,代雨柔,曹亚男,周帆,
    随着智能移动终端的日益普及,人们越来越多地利用社交网络平台(如Twitter、新浪微博等)获取信息、评论和交流.虽然全球卫星定位系统(GPS)设备能够精确获取位置信息,但是大量用户出于隐私和安全的考虑不会直接共享自己的位置信息.因此,如何获取在线用户的地理位置成为了一个前沿的研究领域以及学术界和工业界共同关注的重要课题,并且成为众多下游应用的基础,例如基于位置的定向广告投放、事件/地点的推荐、自然灾害或疾病预警和网络犯罪的追踪等.详细总结了预测社交网络用户地理位置的方法、数据、评价体系和基础算法.首先,归纳了不同的定位任务以及相应的评价指标;其次,针对不同的任务梳理所用的数据类型和数据融合方式,并且,详尽分析了已有的信息抽取和特征选择方式及其优缺点;再次,对现有定位模型和算法进行分类,从地名词典、传统机器学习和深度学习3个方面对用户定位方法进行阐述和分析;最后,总结了社交网络用户地理位置预测的难点和面临的挑战,并展望该领域的发展趋势和未来研究所需要关注的方向.
  • 基于机器学习的基数估计技术综述
    岳文静,屈稳稳,林宽,王晓玲,
    基数估计是数据库关系系统查询优化器的基础和核心.随着人工智能技术的发展,其在数据处理、提取数据之间的关系等方面显现出优越的性能.近年来,基于机器学习的基数估计技术取得了显著的进展,受到了学术界的广泛关注.首先总结了基于机器学习的技术估计技术的发展现状,其次给出了基数估计的相关概念及其特征编码技术.接着建立了基数估计技术的分类体系.在此基础上,进一步将基于机器学习的基数估计技术细分为查询驱动、数据驱动和混合模型这3类基数估计技术.然后重点分析了每一类技术的建模流程、典型技术和模型特点,并对其在SQL和NoSQL中的应用进行了分析和总结.最后讨论了基于机器学习的基数估计技术面临的挑战和未来的研究方向。
  • 基于ECA-CNN的混合指纹室内定位方法
    王正康,骆冰清,
    在指纹法的定位中,指纹特征和定位模型是影响定位精度的2个关键因素.在指纹特征的选取方面,可见光强度稳定性较高,但位置特征区分度低;无线信号强度区分度较高,但波动性较强.在定位模型的构建方面,基于卷积神经网络(convolutionalneuralnetwork,CNN)的定位模型在特征提取时不能有效地突出重要特征.针对上述问题,提出一种基于ECA-CNN的混合指纹室内定位方法(hybridfingerprintindoorlocalizationmethodbasedonECA-CNN,ECACon-HF).首先,利用可见光强度和低功耗蓝牙(Bluetoothlowenergy,BLE)接收信号强度指示(receivedsignalstrengthindication,RSSI)来构建混合指纹,降低BLE指纹不稳定的影响,并增强不同位置之间的区分度.同时,基于高效通道注意力(efficientchannelattention,ECA)模块改进CNN定位模型,ECA能够通过跨通道交互策略自适应地提取指纹中的重要信息,抑制指纹中的环境干扰,增强混合指纹特征表达能力,更有效地利用混合指纹优势.实验结果显示,ECACon-HF在构建的混合指纹库上可以达到0.316m的定位精度,高于在单一指纹上的精度;并且基于同一指纹库,ECACon-HF相比其他室内定位方法,定位精度具有明显优势.
  • Uni-LSDPM:基于预训练的统一在线学习会话退出预测模型
    陈芮,王占全,
    为了辅助学习者维持在线学习的连贯性以引导最优学习路径的执行,智能辅导系统(intelligenttutoringsystem,ITS)需要及时发现学习者退出学习的倾向,在合适的时间采取相应的干预措施,因此,在线学习会话退出预测研究十分必要.然而,与传统的课程辍学相比,会话退出发生的频率更高,单次学习时长更短,故需要在有限的行为数据中对学习会话退出状态进行准确预测.因此,学习行为的碎片性和预测结果的即时性、准确性是学习会话退出预测任务的挑战和难点.针对会话退出预测任务,提出了一种基于预训练-微调的统一在线学习会话退出预测模型(unifiedonlinelearningsessiondropoutpredictionmodel,Uni-LSDPM).该模型采用多层Transformer结构,分为预训练阶段和微调阶段.在预训练阶段,使用双向注意机制对学习者连续行为交互特征序列的特征表示进行学习.在微调阶段,应用序列到序列(sequence-to-sequence,Seq2Seq)的注意力机制对学习者连续行为交互特征序列与退出状态联合序列进行学习.基于EdNet公共数据集对模型进行预训练和微调,通过消融实验以获得最佳预测效果,并基于多个数据集进行了对比测试实验.实验结果表明,Uni-LSDPM在AUC和ACC方面优于现有的模型,并证明该模型具有一定的鲁棒性和扩展性.
  • 混合目标与搜索区域令牌的视觉目标跟踪
    薛万利,张智彬,裴生雷,张开华,陈胜勇,
    当前基于Transformer的主流跟踪框架在特征提取及融合方面存在3个问题:1)分开进行特征提取与融合,易产生次优模型训练结果;2)使用计算复杂度为O\left(N^2\right)的自注意力机制会降低跟踪算法效率;3)简单的目标模板选取策略难以自适应跟踪过程中目标表观的剧烈变化.为此,利用快速傅里叶变换对目标与搜索区域的令牌进行有效混合,提出一种新颖的基于Transformer的视觉目标跟踪方案.针对问题1提出一种高效端到端方式将特征提取与融合进行统一学习以获得最优模型.针对问题2采用快速傅里叶变换实现目标与搜索区域令牌之间的完全信息交互,该操作计算复杂度为O\left(N\mathrml\mathrmo\mathrmg\left(N\right)\right),有助于提升跟踪效率.针对问题3提出一种基于跟踪质量评估的目标模板记忆存储机制以快速自适应目标表观的剧烈变化.在3个标准数据集LaSOT,OTB100,UAV123上,所提方法与当前最优方法相比在效率和精度上均取得更好表现.
  • MOOCDR-VSI:一种融合视频字幕信息的MOOC资源动态推荐模型
    吴水秀,罗贤增,钟茂生,吴如萍,罗玮,
    学习者在面对浩如烟海的在线学习课程资源时往往存在“信息过载”和“信息迷航”等问题,基于学习者的学习记录,向学习者推荐与其知识偏好和学习需求相符的MOOC资源变得愈加重要.针对现有MOOC推荐方法没有充分利用MOOC视频中所蕴含的隐式信息,容易形成“蚕茧效应”以及难以捕获学习者动态变化的学习需求和兴趣等问题,提出了一种融合视频字幕信息的动态MOOC推荐模型MOOCDR-VSI,模型以BERT为编码器,通过融入多头注意力机制深度挖掘MOOC视频字幕文本的语义信息,采用基于LSTM架构的网络动态捕捉学习者随着学习不断变化的知识偏好状态,引入注意力机制挖掘MOOC视频之间的个性信息和共性信息,最后结合学习者的知识偏好状态推荐出召回概率TopN的MOOC视频.实验在真实学习场景下收集的数据集MOOCCube分析了MOOCDR-VSI的性能,结果表明,提出的模型在HR@5,HR@10,NDCG@5,NDCG@10,NDCG@20评价指标上比目前最优方法分别提高了2.35%,2.79%,0.69%,2.2%,3.32%.
  • 面向非稳态场景的生命体征监测优化方法
    邱杰凡,徐一帆,徐瑞吉,周栋利,池凯凯,
    使用基于调频连续波的毫米波雷达监测生命体征信息,具有无接触、隐私保护性好、高分辨率以及抗干扰性好等优势,逐渐成为研究热点.然而,目前研究者主要关注如何提高被测对象处于稳态(如静止)时的体征监测效果,但受制于肢体运动对雷达信号的干扰,使得该技术在非稳态场景中的应用受到限制.提出一种基于人体运动状态识别的非稳态场景体征监测方法,以best-effort方式实现了存在大幅度肢体动作的场景中对体征信息的监测,并且能够识别对应的动作类型.首先,根据运动特征计算出带有距离-主导速度信息的特征频谱图.其次,使用一种滑动窗口采样方法以采集连续样本.随后训练ResNet-18网络来识别运动状态以及分类运动类型.最后,基于运动状态分类结果,在运动间歇期提取信号的相位信息,采用变分模态分解算法进行呼吸速率和心率的提取.实验结果表明,训练后的网络可以精确地识别运动状态和运动类型,识别准确率接近97%,识别延迟小于1.1s.对呼吸和心率的监测结果的平均绝对误差(MAD)下降到1.7bpm和3.4bpm.
  • 一种有状态容器跨集群实时迁移方法
    吴宪,汤红波,赵宇,许明艳,
    虚拟容器的跨集群实时迁移技术是网络服务云化应用中的一项重要技术.容器实时迁移技术的优化能够达到缩短云端服务停机时间的目的,在实际应用中有重要的现实意义.目前针对跨集群容器实时迁移优化的研究相对较少,其中迭代迁移是一种能够有效缩短停机时间的迁移方式,但这项技术在实际应用中还存在很多需要解决的问题.针对跨集群场景中网络延迟对服务停机时间产生的影响提出了一种容器实时迁移方法,该方法着重考虑集群间的网络延迟,并据此建立了数学模型.通过数学模型理论分析了跨集群迁移过程中网络延迟对迁移性能的影响,确定了启用迭代迁移方法的起始条件和迭代过程的终止条件,并给出了计算满足终止条件迭代次数的方法.该模型充分考虑了网络延迟对跨集群容器实时迁移的影响.实验结果表明该方法能够有效缩短服务停机时间.
  • 硬件集合通信中聚合树构建方法
    陈淑平,尉红梅,王飞,李祎,何王全,漆锋滨,
    传统的MPI(messagepassinginterface)集合通信是基于点到点消息实现的,性能较低;而硬件集合通信具有性能高、CPU占用率低等优点,正受到越来越多的关注.硬件集合通信中,聚合树对集合通信性能具有至关重要的影响.研究了影响硬件集合通信性能的因素,提出了硬件集合通信开销模型,并以此为基础提出了构建硬件集合通信聚合树的方法.该方法主要包括3个部分:1)根据操作类型、聚合数据包大小等确定聚合树类型及聚合树宽度,从而在网络传输开销与数据计算开销之间取得平衡;2)提出了最小高度分层k项Ⅰ型聚合树构建方法,降低了跨组聚合包的个数;3)提出了构建最小代价Ⅱ型聚合树的方法,减少所使用的交换机数量.在神威互连网络中对聚合树构建方法进行了全面测试,当存在网络噪声的情况及分层k项Ⅰ型聚合树构建方法下的消息延迟相比传统构建方法下降了24%~89%;典型通信模式时,最小代价Ⅱ型聚合树使用的交换机聚合条目数相比优化前下降了约90%.
  • 基于时序图卷积的动态网络链路预测
    刘琳岚,冯振兴,舒坚,
    动态网络链路预测广泛的应用前景,使得其逐渐成为网络科学研究的热点.动态网络链路演化过程中具有复杂的空间相关性和时间依赖性,导致其链路预测任务极具挑战.提出一个基于时序图卷积的动态网络链路预测模型(dynamicnetworklinkpredictionbasedonsequentialgraphconvolution,DNLP-SGC).针对网络快照序列不能有效反映动态网络连续性的问题,采用边缘触发机制对原始网络权重矩阵进行修正,弥补了离散快照表示动态网络存在时序信息丢失的不足.从网络演化过程出发,综合考虑节点间的特征相似性以及历史交互信息,采用时序图卷积提取动态网络中节点的特征,该方法融合了节点时空依赖关系.进一步,采用因果卷积网络捕获网络演化过程中潜在的全局时序特征,实现动态网络链路预测.在2个真实的网络数据集上的实验结果表明,DNLP-SGC在precision,recall,AUC指标上均优于对比的基线模型.
  • 一种基于转发图的域内路由保护算法
    耿海军,孟卓,姚姗姗,杨静,池浩田,尹霞,
    业界提出利用路由保护算法来解决网络中的故障问题,然而已有的路由保护算法存在4个方面的问题:1)无法应对网络中所有可能的单故障情形;2)需要额外辅助机制的协助;3)不支持增量部署;4)每个结点存储多个到达目的地址的备份下一跳.提出一种基于转发图的域内路由保护算法(anintra-domainroutingprotectionalgorithmbasedonforwardinggraph,RPBFG)来解决这4个问题.首先建立了以最大化故障保护率为目标、以转发图包含反向最短路径树为约束条件的路由保护模型;然后提出了利用遗传算法构造满足上述目标的转发图;最后根据构造的转发图计算出所有结点到达目的结点的备份下一跳.在11个真实拓扑结构中比较了RPBFG,NPC,U-turn,MARA-MA,MARA-SPE在故障保护率和路径拉伸度的性能.实验结果表明,RPBFG可以应对网络中所有可能的单故障;在平均路径拉伸度方面,RPBFG比NPC,U-turn,MARA-MA,MARA-SPE分别降低了0.11%,0.72%,37.79%,36.26%.
计算机研究与发展封面

中文名称:计算机研究与发展

杂志社官网:https://crad.ict.ac.cn/

英文名称:Journal of Computer Research and Development

语言:中文

类别:自动化技术、计算机技术

主 编:徐志伟

创刊时间:1958

出版周期:月刊

国内刊号:11-1777/TP

国际刊号:1000-1239

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京中关村科学院南路6号
  • 电话:(010)62620696
  • E-mail:crad@ict.ac.cn