计算机研究与发展杂志2025年第12期
-
- 领域定制方法促进网络与计算发展的思考
- 苏金树,
- 以大语言模型为特征的智能计算成为计算机学科的发展焦点.大模型参数的指数级增长,给结点算力和互联网络同时带来极大挑战.在摩尔定律放缓时代,领域定制方法脱颖而出.本文根据30多年从事计算机系统结构研究的经验,对当前计算体系结构的发展,提出若干思考,报告初步实践结果,希望起到抛砖引玉的作用.
-
- 目标检测模型综述
- 李承烨,张震,梁哲恒,姚潮生,张金波,晏荣杰,吴鹏,
- 目标检测技术是计算机视觉领域的关键组成部分,它在各种实际应用中扮演着至关重要的角色.目标检测技术经历了几十年的发展,从早期依赖于手工特征提取的方法,到当前深度学习模型的广泛应用.目前在目标检测领域缺少以深度学习基础模型技术的改进为发展脉络的总结研究下,以人工智能领域基础模型的发展过程为线索,围绕不同种类基础模型概述了基于这些模型的不同目标检测模型的发展,同时对这些基于不同模型的目标检测算法进行了比较,并分析不同模型的优缺点以及制定不同模型的改进策略.概述了目标检测技术的评估指标以及不同阶段的技术,特别强调了深度学习如何推动目标检测性能的显著提升,讨论了目标检测在处理多样化场景以及提高实时性和准确性方面的挑战,并对未来可能的研究方向进行了深度探讨,包括但不限于模型的泛化能力、计算效率以及与更复杂任务的结合,为多个未来研究方向提出了可能的提高策略.旨在提供一个清晰的技术演进视角,以促进目标检测领域的进一步研究和应用.
-
- 视觉语言大模型的幻觉综述:成因、评估与治理
- 李煦,朱睿,陈小磊,伍瑾轩,郑毅,赖承杭,梁宇轩,李斌,薛向阳,
- 视觉语言大模型(largevision-languagemodels,LVLMs)代表了自然语言处理与计算机视觉交叉领域的一项重要进展.通过结合预训练的视觉编码器、视觉语言适配器和大语言模型,LVLMs能够同时理解图像与文本信息,并通过自然语言进行响应,适用于图像描述、视觉问答等多种视觉语言下游任务.然而,这类模型普遍存在幻觉现象,即模型对于图像内容进行了错误感知,制约了其在医学图像诊断、自动驾驶等高风险领域的赋能应用.旨在系统梳理并深入分析幻觉成因、评估方法及治理策略,为LVLMs的可靠性研究提供指导.首先,介绍LVLMs的基础概念及其幻觉现象的定义与分类;随后,从训练数据、训练任务、视觉编码、文本生成4方面分析LVLMs的幻觉成因,并讨论这些成因间的交互关系;接着,从任务形式、数据构建和评估指标3方面介绍LVLMs的幻觉评估策略;此外,从训练数据、视觉感知、训练策略、模型推理、事后修正5方面讨论LVLMs的幻觉治理技术;最后,为这类幻觉的成因分析、评估和治理3方面提供未来的研究方向.
-
- 基于大语言模型的知识库查询风格自适应转换
- 付钧渤,赵国帅,钱学明,
- 大语言模型(largelanguagemodels,LLMs)在知识存储方面不断增强的能力展示了其作为知识库的潜在效用.然而,任何给定的提示只能提供大语言模型所涵盖知识的下限估计.在语言模型即知识库(languagemodelsasknowledgebases,LMs-as-KBs)的场景中,先前的提示学习方法忽略了查询风格对模型表现的影响.揭示了大语言模型确实具有与查询风格相关的可学习偏好,并且利用大语言模型的这种特性引入了查询风格自适应转换(adaptivequerystyletransfer,ARES)方法,通过适应大语言模型的偏好来增强其知识查询的表现.ARES方法从构造查询候选集开始,通过改写实现多种表达风格的纳入.随后,ARES训练一个评估器来学习并识别大语言模型对查询风格的偏好,评估查询候选集并选择潜在最优查询.在多个数据集上进行的实验表明了该方法在提高大语言模型即知识库服务上查询准确率的有效性,增量对比原始模型与3个基线方法分别实现了平均2.26个百分点,1.68个百分点,1.19个百分点,1.17个百分点的提升,这表明ARES可以与其他方法有效地结合使用,从而实现多角度的查询表现增强.
-
- 基于多窗口划分集成学习的多维时间序列异常检测
- 王泽南,王意洁,周小晖,熊旭东,
- 大语言模型时代下,大语言模型的训练和推理需要算力资源的支撑,其中针对算力资源指标数据的异常检测能够有效保障大语言模型的正常训练和推理.随着大语言模型参数的增加,大语言模型使用的算力资源规模日益扩大,其中反映算力运行状态的多类指标数据随着时间推移呈现出更复杂的时序周期性变化.现有的多维时序异常检测方法通常采用预设的窗口大小对多维时序数据进行滑动切片,但忽略不同维度周期特性的统一窗口划分会截断部分维度时序数据的完整周期性模式,阻碍了异常检测模型对多维时序数据正常模式的学习,导致异常检测效果变差.为了解决这一问题,提出了一种基于多窗口划分集成学习的无监督多维时序异常检测方法SELAD.具体地,首先利用傅里叶变换提取多维时序数据中各维度的周期性模式,并鉴于此信息进行多窗口划分,以保留各维度数据的完整周期性模式.在模型训练过程中,大语言模型参数量巨大的特点可以解决传统模型在滑动窗口增大后出现记忆瓶颈导致的学习效果变差的问题.通过设计一种混合专家模型将保留完整周期划分的时序数据输入融合大模型和LSTM模型的集成学习框架进行训练,以学习并重构各维度的正常时序模式.最终,基于重构误差检测多维时间序列数据中的异常.通过在4个多维时间序列数据集上实验,SELAD在平均F1分数上相比现有方法提升了17.87~90.77个百分点.
-
- 面向信息系统设计的癌症阶段生物标志物识别
- 陈伯林,张劲雷,张建君,胡悠鹏,王腾,杨曼婷,卞军,尚学群,
- 癌症是一种复杂且动态变化的高异质性疾病.它的发生发展伴随着大量的基因突变与功能失调.识别癌症阶段相关的生物标志物,对于了解癌症的致病机理与发展机制至关重要.然而,现有的癌症生物标志物识别方法通常将各个基因看作是孤立的节点,且仅关注癌症的二分类效果,忽略了不同基因之间的交互关系变化以及不同病理阶段的显著差别.为解决上述问题,首先为癌症各阶段构建回归残差网络(regressionresidualnetwork,RRN),分析每个阶段RRN的节点和边,并结合生物通路进行多源数据挖掘,刻画了癌症随阶段演化的整个过程.通过对癌症的演化分析,分别获得癌症二分类和阶段多分类的网络生物标志物,并在GSE10072和GSE42171数据集上进行了验证.实验结果表明,仅使用2个基因ALDOA和NME1组成的生物标志物,可以在肺腺癌二分类问题上获得跟现有研究结果具有同样竞争力的预测准确度,而使用由17条边构成的阶段生物标志物,则可以在肺腺癌阶段多分类问题上获得比现有方法高出14.86个百分点的预测准确度.
-
- 基于多尺度边框融合的实体语义增强方法
- 吴灿,陈艳平,扈应,黄瑞章,秦永彬,
- 命名实体识别(namedentityrecognition,NER)是自然语言处理中的一项传统任务.基于跨度分类的方法是用来解决嵌套命名实体识别的主流方法.该方法通常是拼接实体边界的表示来获得跨度.然而,长实体容易导致2个实体边界之间的语义关联被弱化,并且单一尺度的跨度无法完整地捕捉实体在不同上下文中的表现.对此提出了一种基于多尺度边框融合的实体语义增强方法.该方法将跨度表示为带有边界位置信息的边框.首先,将通过融合不同尺度实体特征得到多尺度边框以增强边框中的语义特征,使边框的上下文依赖性更强.然后,通过基于位置权重的注意力机制进一步细化边框的边界位置使得边框信息更准确.最后,同时预测边框的实体类别和相对于真实实体的位置偏移量,有效支持嵌套命名实体的识别和定位.该方法在ACE2004英文数据集、ACE2005英文数据集和Weibo中文数据集上分别取得了88.63%,88.53%,73.86%的F1值,证明了模型的有效性.
-
- 基于长距离上下文的大语言模型预训练数据检测方法
- 张伟超,张儒清,郭嘉丰,范意兴,
- 预训练数据检测方法旨在大语言模型的预训练数据未公开时,检测某段给定的文本是否属于该模型的预训练数据,可用于审查大语言模型的预训练数据的使用过程是否符合法律法规.现有方法通常认为大语言模型对训练文本的词元概率在整体上比非训练文本的高,并基于此判定具有高预测概率的文本为训练文本.然而,由于训练文本和非训练文本之间存在着大量的短片段重叠现象,导致模型对非训练文本的词元概率也可能比较高,使得现有方法容易将非训练文本误检为训练文本.受大语言模型的记忆能力研究启发,通过对比给定全部上下文时的词元概率与给定短距离上下文时的词元概率之间的差异,计算得到长距离上下文对词元概率提升的贡献度,并认为贡献度越大的文本更可能是训练文本,进而缓解短片段重叠现象对检测的不利影响.其核心思想在于,大语言模型在预测训练文本中词元的概率时,距离当前词元较远的上下文对词元概率提升的贡献度,会比在预测非训练文本中词元的概率时的贡献度更大.在多个公开数据集上的实验结果表明该方法的有效性.
-
- 非独立同分布数据下层次化Sinkhorn距离聚类联邦学习算法
- 赵瑞,段小文,刘新,周睿,周庆国,
- 联邦学习作为一种边缘计算中的新兴分布式神经网络训练方法面临客户端数据异构性挑战,其中聚类联邦学习被认为是一种颇具潜力的解决方案,然而现有聚类联邦学习算法未深入探究量化客户端数据分布差异.针对该问题提出了一种新颖的层次化Sinkhorn距离聚类联邦学习算法(hierarchicalSinkhorndistance-basedclusteringfederatedlearningalgorithm,HS-CFA),采用最优传输代价衡量局部训练时客户端数据分布特性,提出层次化聚类策略动态调整全局模型聚合时的参与权重.具体而言,HS-CFA引入Sinkhorn距离量化客户端间的分布差异,提出使用基于密度的聚类算法在服务器端进行动态层次聚类.在多个基准数据集上的实验结果表明,相比传统算法,所提算法在高度数据分布异构性的场景中显著提升了全局模型的准确率和鲁棒性.
-
- 面向心理健康检测的心理支持异质图模型
- 刘德喜,张子靖,邹志峰,万齐智,刘喜平,廖国琼,朱廷劭,
- 在线心理健康论坛已经成为心理健康服务的重要载体,从海量帖子中检测出有心理健康问题的帖子是心理干预的基础.充分利用求助者的社交关系有利于判断其心理健康状态,然而,现有模型大都依赖显式的社交关系,没有关注医患(支持者和求助者)之间基于患者经历、症状成因、自我认知以及心理支持专长所形成的心理支持关系.以自杀意念为检测对象,提出帖子-用户交互心理支持异质图(post-userpsychologicalsupportheterogeneousgraph,PU-PSHG)来表示在线心理健康论坛中求助者和支持者发布的帖子语义和医患关系.基于PU-PSHG提出一种图增强的自杀意念检测(graph-enhancedsuicideideationdetection,GSID)模型.首先,基于心理支持关系定义用户对用户、用户对帖子的2种元路径语义,构建包含用户和帖子的PU-PSHG,并采用DeepWalk算法从PU-PSHG中学习医患关系或社群关系.然后,通过关系表征学习心理支持关系的表示,基于异质关系融合帖子语义和医患关系.最后根据帖子的表示进行自杀意念强度分类.在CLPsych2017共享任务上的实验结果表明,GSID模型与现有的方法相比具有更好的性能.在Non-greenF1,AllF1,AllAcc指标上相比于基准模型C-GraphSAGE提高7.8%,4.8%,1.4%.消融实验发现,去除PU-PSHG中帖子与帖子的回复关系、用户对帖子的心理支持关系、用户对用户的心理支持关系,Non-greenF1分别下降3.04%,3.80%,6.17%.
-
- 融合运动领域知识与自适应时空Transformer的人体骨架行为识别
- 梁成武,蒋松琪,杨杰,朱培旺,帖云,高磊,胡伟,郭文博,
- 现有人体骨架行为识别方法往往忽略运动学领域知识,造成模型内在人类可理解的逻辑决策解释性不足.基于此,提出一种融合领域知识与自适应时空片段Transformer的骨架行为识别方法,以提高骨架行为识别模型的性能和可解释性.首先,受短时运动领域知识启发,设计多时间分支结构用于学习和捕捉多时间尺度的短时子动作特征.其次,提出一种动态信息融合模块,学习不同时间分支的权重向量进而动态融合多时间分支、多尺度短时运动特征.最后,融合长时运动领域知识,提出多尺度时间卷积特征融合模块捕捉长时运动关联,用于学习不同子动作片段之间的关系并促进不同骨架关节点间的运动信息交互.在4个数据集上进行评估与实验,包括人体日常行为数据集NTURGB+D和NTURGB+D120、体育行为数据集FineGym,以及工业场景行为数据集InHARD.结果表明所提方法的行为识别性能,优于包括基准Transformer方法在内的多个先进方法,可有效提升骨架序列短时运动特征学习和关节点之间信息交互的建模能力,并具有一定可解释性.
-
- 支持端边云多运行时协同应用的网程系统
- 俞子舒,王一帆,曾琛,张星洲,彭晓晖,徐志伟,
- 研究人员针对不同的负载类型提出并实现了大量的运行时系统,帮助用户构建单机或分布式应用.在端边云协同场景中,由于应用各组件在保质要求、运行时环境和通信协议方面存在异构性,因此难以通过单一运行时构建性能出色且鲁棒的端边云协同应用.将应用的各个组件独立部署到不同的运行时会增加应用管理的难度,并且缺乏对性能和容错方面的统一支持.为解决上述问题,实现了网程系统,支持多种运行时的统一接入和使用.网程系统通过网元和网程抽象支持多运行时应用的统一管理,并基于所有权方法提供自定义容错和缩扩容策略的支持机制.实验表明,在端边云环境下,相比于使用Ray,Docker,Kubernetes等单一运行时,网程系统降低了31%~77%的平均端到端延迟、26%~78%的90百分位尾延迟、22%~78%的95百分位尾延迟.
-
- AdaptDNN:一个自适应可伸缩的大模型分布式训练系统
- 刘国栋,朱家祺,高梓源,包云岗,王卅,
- 随着深度学习模型参数量的不断增加,训练成本也在不断上升.为了减少训练成本,使用云服务厂商提供的弹性实例训练模型成为了一个可行的解决方案.弹性实例的价格仅为正常实例的30%,可以有效降低训练成本.虽然弹性实例价格低廉,但随时都有被回收的风险,对模型训练系统的稳定性提出了新的挑战.为了解决弹性实例场景下的容错问题,现有的工作主要有2类解决方案,分别是基于存盘点的容错和基于冗余性的容错.基于存盘点的方案开销较大,而基于冗余性的方案则对模型的并行策略有一定的限制,导致训练效率并非最优.AdaptDNN是一种自适应可伸缩的大模型分布式训练系统.在弹性实例训练场景,AdaptDNN利用弹性实例宽限期完成训练进度的备份,降低容错开销;并利用“瓶颈消除”思想调整模型并行策略,最大化利用集群可用资源,提升训练效率.实验结果表明,AdaptDNN既能实现低成本容错,又能保证模型训练效率,从而可以在弹性实例场景高效完成模型训练任务,降低模型训练成本.
-
- 基于水下物联网的多方密钥封装方案
- 徐明,张恩博,周日贵,
- 为了抵抗量子计算的攻击,保护水下节点的隐私与数据安全,利用NTRU密码体制的困难性假设提出了一种基于水下物联网的多方密钥封装方案SeaNTRU.首先,结合海洋传感器声波序列和水声声波因子生成设备序列号的伪身份并设计了一种可验证身份的海洋声波消息码.其次,利用正交频分复用(orthogonalfrequencydivisionmultiplexing,OFDM)频域过采样技术和数论变换(numbertheoretictransform,NTT)设计了一种适用于水声通信的密钥生成算法.在此基础上,利用身份绑定的混合加密和基于海洋噪声的混淆操作构造了具有选择明文攻击下的不可区分性和匿名性(indistinguishabilityandanonymityunderchosenplaintextattack,IND-Anon-CPA)安全的多方公钥加密算法.然后,提出了一种基于海洋噪声的SeaFO变换,并由此得到具有选择密文攻击下的不可区分性和匿名性(indistinguishabilityandanonymityunderchosenciphertextattack,IND-Anon-CCA)安全的多方密钥封装算法,该算法不需要执行全部的重加密过程.最后,设计了一种新的会话密钥更新机制.在该会话密钥更新机制中,水下自主机器人利用OFDM子载波提取密文分量并进行伪身份和时间标记有效性的检验,通过使用SeaFO变换解封装得到新的会话密钥,不仅实现了多方环境下的隐式拒绝,也防止了敌手对于SeaNTRU的自适应破坏.通过安全性分析,证明了SeaNTRU具有抗公钥替换攻击、抗重放攻击和抗中间人攻击的特性.实验结果表明,SeaNTRU比现有方案计算成本和通信开销小.
-
- 基于SM2的去中心化匿名凭证方案
- 赵陆天禹,王化群,
- 匿名凭证是一种在不透露持有者身份的前提下验证其资格或属性的隐私保护认证方式,广泛应用于数字身份管理系统、电子政务和数字银行等领域.符合国家商用密码标准的匿名凭证也备受关注.然而,现行匿名凭证方案多依赖于中心化的发行机构,这不仅限制了其在去中心化网络中的应用,还易因单点故障导致系统瘫痪和隐私泄露.为解决上述问题,提出了一种基于SM2商用密码的去中心化匿名凭证方案.该方案利用区块链网络替代传统凭证发行机构,通过零知识证明方案确保凭证分发的安全可靠.此外,该方案还允许用户根据需求选择性地披露属性,从而有效避免隐私信息的过度泄露.还探讨了国密化零知识证明方案的构造方法,并提出了基于SM2的集合成员关系证明方案,为SM2去中心化匿名凭证的设计提供了构造基础.安全性分析表明,基于SM2的去中心化匿名凭证方案满足不可伪造性和匿名性需求.性能实验进一步显示,该方案具备实际部署所需的效率.
-
- 车载自组织网络中基于格的无抽样条件隐私保护聚合认证
- 张静,杨志,崔杰,许艳,仲红,
- 车载自组织网络(vehicularadhocnetwork,VANET)是构建智能交通系统的基础,其能够有效提高交通效率以及增加道路安全性.但由于其自身无线通信环境的开放性,车载自组织网络中的边缘节点易遭受到各种外部攻击.为了兼顾隐私保护和可追溯性并确保安全认证,一种有效的方法是采用车联网条件隐私保护认证方案.虽然目前已有各种车联网条件隐私保护认证方案被相继提出,但这些方案的安全性几乎都依赖于传统数论困难假设,难以具备后量子安全特性.因此,针对现有基于格的车联网条件隐私保护认证方案的安全和效率问题,同时为解决密钥托管问题,利用结构化格上的环上带误差学习决策困难假设以及环上小整数解困难假设,并结合拒绝抽样技术,设计了一种车联网中基于格的无抽样条件隐私保护聚合认证方案,并在随机预言机模型下证明了所提方案能够达到适应性安全.此外,通过性能评估展示了该方案在计算开销方面优于基于一般格的聚合认证方案.
-
- 一种可动态伸缩的移动端深度计算图算优化方法
- 罗诗妍,刘思聪,郭斌,方程,王敏帆,郭赛,於志文,
- 近年来,将深度神经网络(deepneuralnetwork,DNN)引入移动设备成为一种趋势.智能手机、可穿戴设备和嵌入式设备上集成了许多便利生活的应用,如语音助手和活动识别.然而,在资源受限(如算力、存储和电池)移动终端部署计算密集型深度模型具有挑战.现有方法如手工设计的DNN压缩技术和自动化按需DNN压缩技术局限于优化模型结构,限制了DNN部署的性能优化上限,难以适应资源极度受限的终端设备.此外,已有静态预设计的优化方法未考虑移动应用部署环境的资源争用和动态需求特性,在动态环境下无法及时调整策略,从而导致次优精度-效率表现.为了解决这些挑战,提出了AdaInfer,一种在运行时可伸缩的DNN跨层优化方法.AdaInfer根据当前硬件资源限制及用户性能需求,自适应选择模型层、计算图层和内存层的最佳综合部署策略以优化多个性能指标,并随着场景变化及时调整最优策略.具体而言,设计了一种模型无关的可伸缩图算结构和对应的跨层优化策略,能够在异构设备上自动调整以最大化部署效率.随后,将算法-系统跨层优化策略的运行时调整问题建模为动态优化问题,并通过一组运行时变化的资源约束来建模动态环境.还提出了一种高效搜索策略,以提高本地在线搜索效率和质量.实验结果显示,在3种典型移动和边缘设备、5种模型和4种持续变化移动场景的评估中,AdaInfer与先前的工作相比,在不显著影响精度的前提下,将内存占用最多降低了42.35%,时延最多降低了73.89%.
