计算机研究与发展杂志

计算机研究与发展杂志2024年第4期

  • 从BERT到ChatGPT:大模型训练中的存储系统挑战与技术发展
    冯杨洋,汪庆,谢旻晖,舒继武,
    以ChatGPT为代表的大模型在文字生成、语义理解等任务上表现卓越,引起了工业界和学术界的广泛关注.大模型的参数量在3年内增长数万倍,且仍呈现增长的趋势.首先分析了大模型训练的存储挑战,指出大模型训练的存储需求大,且具有独特的计算模式、访存模式、数据特征,这使得针对互联网、大数据等应用的传统存储技术在处理大模型训练任务时效率低下,且容错开销大.然后分别阐述了针对大模型训练的3类存储加速技术与2类存储容错技术.针对大模型训练的存储加速技术包括:1)基于大模型计算模式的分布式显存管理技术,依据大模型计算任务的划分模式和计算任务间的依赖关系,设计模型数据在分布式集群中的划分、存储和传输策略;2)大模型训练访存感知的异构存储技术,借助大模型训练中的访存模式可预测的特性,设计异构设备中的数据预取和传输策略;3)大模型数据缩减技术,针对大模型数据的特征,对模型训练过程中的数据进行缩减.针对大模型训练的存储容错技术包括:1)参数检查点技术,将大模型参数存储至持久化存储介质;2)冗余计算技术,在多张GPU中重复计算相同版本的参数.最后给出了总结和展望.
  • 基于缓存访问模式的C-AMAT测量方法及其在图计算中的应用
    陈炳彰,刘伟,于萧钰,
    图应用是大数据领域的一个重要分支,尽管图分析在显示表示实体之间关系的能力相比传统的关系数据库具有更显著的性能优势,但图处理中大量的随机访问所导致的不规则访存模式破坏了访存的时间和空间局部性,从而对片外内存系统造成了很大的性能压力.因此如何正确度量图应用在内存系统中的性能,对于高效的图应用体系结构优化设计至关重要.并发式平均存储访问时间(concurrentaveragememoryaccesstime,C-AMAT)模型作为平均存储访问时间(averagememoryaccesstime,AMAT)的扩展,同时考虑了存储器访问的局部性和并发性,能够更准确地对现代处理器下图应用在存储系统中的性能进行评估分析.但C-AMAT模型忽略了处理器下级cache层串行访问的事实,这会导致计算的不准确性,同时由于计算所需参数纯粹缺失周期等难以获取的原因,也使得C-AMAT难以进行实际应用.为了使C-AMAT的计算模型与现代计算机中的存储器访问模式相匹配,基于C-AMAT提出了PC-AMAT(parallelC-AMAT),SC-AMAT(serialC-AMAT),其中PC-AMAT,SC-AMAT分别从cache的并行和串行访问模式对C-AMAT的计算模型进行了细粒度的扩展和表征,并在此基础上设计并实现了纯粹缺失周期的提取算法,避免直接测量带来的巨大硬件开销.实验结果表明,在单核和多核模式下,PC-AMAT和SC-AMAT与IPC之间的相关性比C-AMAT更强,最终利用PC-AMAT和SC-AMAT度量和分析了图应用的存储器性能并据此提出图应用访存优化策略.
  • RR-SC: 边缘设备中基于随机计算神经网络的运行时可重配置框架
    宋玉红,沙行勉,诸葛晴凤,许瑞,王寒,
    随着人工智能民主化的发展,深度神经网络已经被广泛地应用于移动嵌入式设备上,例如智能手机和自动驾驶领域等.随机计算作为一种新兴的、有前途的技术在执行机器学习任务时使用简单的逻辑门而不是复杂的二进制算术电路.它具有在资源(如能源、计算单元和存储单元等)受限的边缘设备上执行深度神经网络低能耗、低开销的优势.然而,之前的关于随机计算的工作都仅仅设计一组模型配置并在固定的硬件配置上实现,忽略了实际应用场景中硬件资源(如电池电量)的动态改变,这导致了低硬件效率和短电池使用时间.为了节省电池供电的边缘设备的能源,动态电压和频率调节技术被广泛用于硬件重配置以延长电池的使用时间.针对基于随机计算的深度神经网络,创新性地提出了一个运行时可重配置框架,即RR-SC,这个框架首次尝试将硬件和软件的重配置相结合以满足任务的时间约束并最大限度节省能源.RR-SC利用强化学习技术可以一次性生成多组模型配置,同时满足不同硬件配置(即不同的电压/频率等级)下的准确率要求.RR-SC得到的解具有最好的准确率和硬件效率权衡.同时,多个模型配置运行时在同一个主干网络上进行切换,从而实现轻量级的软件重配置.实验结果表明,RR-SC可以在110ms内进行模型配置的轻量级切换,以保证在不同硬件级别上所需的实时约束.同时,它最高可以实现7.6倍的模型推理次数提升,仅造成1%的准确率损失.
  • 基于图神经网络的小样本学习方法研究进展
    杨洁祎,董一鸿,钱江波,
    小样本学习(few-shotlearning,FSL)旨在利用少量样本学习得到解决问题的模型,为解决应用场景中样本量少或标注样本少的问题.图神经网络(graphneuralnetwork,GNN)由于其在许多应用中的卓越性能引起了极大的关注,许多学者开始尝试利用图神经网络进行小样本学习,基于图神经网络的方法在小样本领域取得了卓越的成绩.目前与基于图神经网络的小样本学习方法相关的综述性研究较少,缺乏该类方法的划分体系与介绍性工作,因此系统地梳理了当前基于图神经网络的小样本学习的相关工作:概括了小样本学习的图神经网络方法的概念,根据模型的基本思想将其划分为基于节点特征、基于边特征、基于节点对特征和基于类级特征的4类方法,介绍了这4类方法的研究进展;总结了目前常用的小样本数据集和代表性模型在这些数据集上的实验结果,归纳各类方法主要的研究内容和优劣势;最后概述了基于图神经网络的小样本学习方法的应用和面临的挑战,并展望其未发展方向.
  • Light-HGNN:用于圈层内容推荐的轻量同质超图神经网络
    李挺,金福生,李荣华,王国仁,段焕中,路彦雄,
    图神经网络和超图神经网络(hypergraphneuralnetwork,HGNN)已经成为协同过滤推荐领域的研究热点.然而实际场景中用户和项目的交互非常复杂,导致用户之间存在高阶的复杂关系,而普通图结构只能表达简单的成对关系,对网络结构的堆叠容易导致中间层表征的过度平滑,在稀疏场景下的用户建模、用户相似性发现与挖掘方面能力较弱;同时,异质超图神经网络的复杂结构使得模型的训练效率较低.在以微信“搜一搜”等内容平台为代表的高度稀疏数据场景中,对于基于用户所属群体画像的圈层内容推荐任务,现有模型推荐效果差、用户表示的可解释性弱.因此,针对该类任务,提出了一个新的轻量同质超图神经网络模型,该模型包含用户交互数据至超图的转化、卷积生成用户表征序列、用户表征计算过滤.模型首先将用户-项目交互数据转化为只含用户节点的同质超图并计算得到用户表征解耦序列初始值,随后根据超图拉普拉斯过滤矩阵进行信息传播与序列值的迭代生成,通过不使用激活层的卷积方法简化模型结构,并根据提出的均值差JK注意力机制为每个序列值生成权重矩阵.最终,通过对解耦序列加权求和、过滤实现对用户表示的编码,并在真实数据集上进行实验验证了所提模型的相对更优效果.
  • 基于多模态知识主动学习的视频问答方案
    刘明阳,王若梅,周凡,林格,
    视频问答是人工智能领域的一个热点研究问题.现有方法在特征提取方面缺乏针对视觉目标运动细节的获取,从而会导致错误因果关系的建立.此外,在数据融合与推理过程中,现有方法缺乏有效的主动学习能力,难以获取特征提取之外的先验知识,影响了模型对多模态内容的深度理解.针对这些问题,首先,设计了一种显性多模态特征提取模块,通过获取图像序列中视觉目标的语义关联以及与周围环境的动态关系来建立每个视觉目标的运动轨迹.进一步通过动态内容对静态内容的补充,为数据融合与推理提供了更加精准的视频特征表达.其次,提出了知识自增强多模态数据融合与推理模型,实现了多模态信息理解的自我完善和逻辑思维聚焦,增强了对多模态特征的深度理解,减少了对先验知识的依赖.最后,提出了一种基于多模态知识主动学习的视频问答方案.实验结果表明,该方案的性能优于现有最先进的视频问答算法,大量的消融和可视化实验也验证了方案的合理性.
  • 基于图核同构网络的图分类方法
    徐立祥,葛伟,陈恩红,罗斌,
    图表示学习已成为图深度学习领域的一个研究热点.大多数图神经网络存在过平滑现象,这类方法重点关注图节点特征,对图的结构特征关注度不高.为了提升对图结构特征的表征能力,提出了一种基于图核同构网络的图分类方法,即KerGIN.该方法首先通过图同构网络(graphisomorphismnetwork,GIN)对图进行节点特征编码,并使用图核方法对图进行结构编码,进一步利用Nystr?m方法降低图核矩阵的维度.其次借助MLP将图核矩阵与图特征矩阵对齐,通过注意力机制将图的特征编码和结构编码进行自适应加权融合,进而得到图的最终特征表示,提升了图结构特征信息的表达能力.最后在7个公开的图分类数据集上对模型进行了实验评估:与现有图表示模型相比,KerGIN模型能够在图分类准确度上有较大幅度提升,它可以增强GIN对图结构特征信息的表达能力.
  • 面向远程监督命名实体识别的噪声检测
    王嘉诚,王凯,王昊奋,杜渂,何之栋,阮彤,刘井平,
    针对远程监督命名实体识别(namedentityrecognition,NER)任务,目前有许多基于强化学习的方法,利用强化学习的强大决策能力,对远程监督生成的自动标注数据进行噪声过滤.然而,这些方法所使用的策略网络模型架构都较简单,识别噪声能力较弱,且都以完整的句子样本为单位进行识别,导致句子中的部分正确信息被丢弃.为解决上述问题,提出了一种新的基于强化学习的方法,称为RLTL-DSNER,该方法可以从远程监督生成的带噪数据中,以单词级别识别正确实例,减少噪声实例对远程监督NER的负面影响.具体来说,在策略网络模型中引入了标签置信函数来准确识别实例.此外,提出了一种新颖的NER模型预训练策略,使其能为强化学习的初始训练提供精准的状态表示和有效的奖励值,引导其向正确的方向更新.在4个数据集上的实验结果验证了RLTL-DSNER方法的优越性,在NEWS数据集上,相较于现有最先进的方法,获得了4.28%的F1提升.
  • 数据库索引调优技术综述
    赖思超,吴小莹,彭煜玮,彭智勇,
    索引调优是数据库调优的重要组成部分,一直受到广泛关注.由于索引调优问题的理论复杂性和大数据时代的到来,通过DBA手动调优的方案已经无法满足现代数据库的发展需求,调优方案逐渐开始向自动化、智能化的方向发展.随着机器学习技术的发展,越来越多的索引选择方案开始引入机器学习技术,并取得了一定的研究成果.将索引调优问题的解决方案归结为一种基于搜索的调优范式,归纳了其研究内容,阐述了其面临的挑战,对调优范式内的索引配置空间的生成、索引配置的评价以及索引配置的枚举与搜索3方面的研究成果进行了归纳、总结和对比.对动态工作负载下的索引选择问题(indexselectionproblem,ISP)所面临的新挑战进行了分析,并基于在线反馈控制回路框架对其解决方案进行梳理.讨论了索引调优工具的发展与现状,通过对现有研究的分析论述,为后来研究者提供参考和研究思路,并对索引选择方案的未来进行了展望.
  • 申威26010众核处理器上Winograd卷积算法的研究与优化
    武铮,金旭,安虹,
    卷积作为深度学习中被频繁使用的关键部分,其并行算法的研究已成为高性能计算领域中的热门话题.随着我国自主研发的申威26010众核处理器在人工智能领域的快速发展,对面向该处理器的高性能并行卷积算法提出了迫切的需求.针对申威26010处理器的架构特征以及Winograd卷积算法的计算特性,提出了一种高性能并行卷积算法——融合Winograd卷积算法.该算法不同于依赖官方GEMM(generalmatrixmultiplication)库接口的传统Winograd卷积算法,定制的矩阵乘实现使得该算法的执行过程变得可见,且能够更好地适应现实中常见卷积运算.整个算法由输入的Winograd变换、卷积核的Winograd变换、核心运算和输出的Winograd逆变换4部分构成,这4个部分并不是单独执行而是融合到一起执行.通过实时地为核心运算提供需要的变换后数据,并将计算结果及时地逆变换得到最终的输出数据,提高了算法执行过程中的数据局部性,极大地降低了整体的访存开销.同时,为该算法设计了合并的Winograd变换模式、DMA(directmemoryaccess)双缓冲、片上存储的强化使用、输出数据块的弹性处理以及指令重排等优化方案.最终的实验结果表明,在VGG网络模型的总体卷积测试中,该算法性能是传统Winograd卷积算法的7.8倍.同时,抽取典型卷积神经网络模型中的卷积进行测试,融合Winograd卷积算法能够在所有的卷积场景中发挥明显高于传统Winograd卷积算法的性能.其中,最大能够发挥申威26010处理器峰值性能的116.21%,平均能够发挥峰值性能的93.14%.
  • 基于弥散颗粒燃料的先进核反应堆大规模并行模拟与优化
    李睿涵,侯叶凡,李玉辉,刘召远,张海红,梁金刚,
    颗粒燃料是将核燃料制成颗粒并弥散在基体中的一种新型燃料构型,广泛应用于高温气冷堆、空间堆、氟盐冷却高温堆等先进堆型中.以高温气冷堆和空间堆为例,基于开源蒙特卡罗程序OpenMC研究了适用于颗粒燃料临界计算的虚拟网格模拟加速方法,并在山河超算平台开展了超10万核心的大规模并行测试.结果表明,高温气冷堆模型的有效增殖因数计算结果与石岛湾核电站实验数据符合较好,验证了程序及模型的准确性.在性能方面,虚拟网格方法与OpenMC此前的真实网格方法相比,在存储空间和计算速度上均有明显提升,高温气冷堆虚拟网格模型的内存和耗时分别为真实网格模型的0.2%和82%;此外,由于虚拟网格方法简化了模型几何,其间接实现了更好的负载均衡,使得程序拥有了更高的并行效率.对于强可扩展性,在10752核规模的测试中,虚拟网格的并行效率为83.4%,而真实网格为63.6%;对于弱可扩展性,虚拟网格模型在131600核并行效率为83.1%,而真实网格为66.1%.
  • 面向机器学习应用的可解释性需求分析框架
    裴忠一,刘璘,王晨,王建民,
    基于大数据机器学习的智能软件研发过程需要综合运用软件工程、数据与领域知识工程、机器学习等多方面的知识和工具,涉及的研究主题和人员角色众多,技术实现手段复杂、研发难度大.面向智能软件的需求工程需要面对领域知识、业务知识、数据科学交织带来的挑战.然而,如何将领域知识和端到端的机器学习技术恰当地融合到给定的业务流程之中,以及如何应对工业、医疗等高可信要求场景中的可解释性需求,仍是亟待探索的重要研究问题.调研了近年来面向机器学习应用的需求工程研究文献,对该领域的发展现状、核心问题和代表性方法进行综述.提出了面向机器学习应用的可解释性需求分析框架.基于该框架,通过一个工业智能应用案例分析了未来待研究的重要问题,展望了可行的研究路径.
  • 意外充分性引导的深度神经网络测试样本生成
    郭虹静,陶传奇,黄志球,
    由于深度神经网络(deepneuralnetwork,DNN)模型的复杂性和不确定性等属性,对模型的一般行为和边界行为进行充分的测试是保障模型质量的重要手段.当前的研究主要基于制定的覆盖准则,结合模糊测试技术生成衍生测试样本,从而提升测试充分性,但较少综合考虑测试样本的多样性及个体揭错能力.意外充分性指标量化测试样本与训练集在神经元输出方面的差异,是测试充分性评估的重要指标,目前缺乏基于此指标的测试样本生成方法.因此,提出了一种意外充分性引导的深度神经网络测试样本生成方法,首先,筛选对于决策结果贡献较大的重要神经元,以其输出值为特征,改进意外充分性指标;其次,基于测试样本的意外充分性度量筛选具有揭错能力的种子样本;最后,利用覆盖引导的模糊测试思想,将测试样本的意外充分性值和DNN模型预测的类别概率差异作为联合优化目标,利用梯度上升算法计算扰动,迭代生成测试样本.为了验证所提方法的有效性,选取5个DNN模型作为被测对象,涵盖4种不同的图像数据集,实验结果表明,改进的意外充分性指标能够有效捕捉异常的测试样本,同时减少计算时间开销.在测试样本生成方面,与方法DeepGini和RobOT相比,基于所提的种子样本选择策略生成的衍生测试集的意外覆盖率最高提升了5.9个百分比和15.9个百分比.相比于方法DLFuzz和DeepXplore,所提方法的意外覆盖率最高提升了26.5个百分比和33.7个百分比.
  • 能源区块链的跨链服务安全技术研究进展
    何云华,罗明顺,胡晴,吴槟,王超,肖珂,
    在“双碳”目标推动下,能源产业数字化转型势在必行.随着区块链在能源行业数字化转型应用和发展,能源区块链概念逐渐形成共识,它是区块链与能源互联网深度融合的产业新形态,可助力能源主体之间的高效协作,为绿色低碳等创新业务模式提供技术支撑与服务.能源区块链的规模化发展离不开多层次跨链技术的突破,但能源区块链的跨链服务还面临着许多问题.将目前能源区块链领域的研究现状分为5类,即能源区块链架构、智能合约应用、跨链技术、区块链节点管理和区块链隐私保护,针对这5个方向分别总结相关研究工作,详细梳理出各研究方案的原理、优势与不足;然后,为促进能源区块链的跨链服务安全技术的发展,根据能源区块链的现实需求,结合监管机制与共识机制提出多层次跨链协同监管的能源区块链架构;最后,总结出能源区块链跨链服务安全技术中亟待解决的问题,并提出区块链在能源领域的研究展望.
  • 新通用顶级域名解析行为分析与恶意域名检测方法
    杨东辉,曾彬,李振宇,
    自2013年ICANN发起新通用顶级域名(newgTLD)的授权以来,域名系统(domainnamesystem,DNS)中已增加了上千个newgTLD.已有工作表明newgTLD在为域名注册者带来了灵活性的同时,由于注册成本低等原因也经常被用于恶意行为,识别恶意newgTLD域名具有重要的意义.然而,由于newgTLD域名在域名长度等方面的独有特征,已有恶意域名识别方法应用于newgTLD恶意域名的识别时准确率低.针对这一问题,首先基于海量域名解析数据,从顶级域名对应二级域名(SLD)数量、查询量、查询失败率、内容复制和承载基础设施共享5个方面刻画了newgTLD域名解析行为.然后分析恶意域名的解析行为并发现其在内容承载基础设施集中性、SLD对应的完全限定域名(FQDN)数目、域名查询次数、请求用户网络空间分布、SLD长度分布等方面的特征.最后根据这些特征设计了一种基于随机森林的newgTLD恶意域名检测方法.实验结果表明,所提方法达到了94%的准确率,优于已有恶意域名检测方法.
  • NTRU格上高效紧凑密钥封装方案
    梁志闯,郑婕妤,赵运磊,
    基于NTRU格设计后量子密钥封装方案是格密码领域主流方向之一.为降低密文尺寸,现有方案会引入额外的困难性假设和使用纠错码来辅助压缩密文,但这会导致方案的假设过强和实现更复杂.为克服这些障碍,提出了一个仅基于NTRU单向困难性假设、不使用纠错码也能压缩密文的高效紧凑的密钥封装方案LTRU.给出一套性能均衡的LTRU参数集:具有128b量子安全强度、与之匹配且可忽略的错误率、较小的公钥尺寸和密文尺寸.LTRU基于NTT友好环构造,给出一种高效的混合基数论变换算法来计算该环上多项式运算还给出了LTRU的C实现和AVX2实现.与NIST第3轮决赛方案NTRU-HRSS相比,LTRU的经典安全强度和量子安全强度分别增强6b和5b,LTRU的公钥尺寸降低14.6%,密文尺寸降低26.0%,总带宽降低20.3%;在AVX2实现的密钥生成和解封装算法上分别快了10.9倍和1.7倍.
  • 支持等式测试及密码逆向防火墙的SM9标识加密方案
    熊虎,林烨,姚婷,
    支持等式测试的标识加密(identity-basedencryptionwithequalitytest,IBEET)体制解决了传统等式测试方案中证书管理的问题,得到了广泛的关注.但现有的IBEET体制难以抵抗渗透攻击,且都是基于国外密码算法设计,不具有自主知识产权.基于此,提出一种支持等式测试并具有密码逆向防火墙的SM9标识加密方案(SM9identity-basedencryptionschemewithequalitytestandcryptographicreversefirewalls,SM9-IBEET-CRF).该方案在用户与云服务器的上行信道间部署密码逆向防火墙(cryptographicreversefirewalls,CRF),对用户发出的信息执行重随机化以达到抵抗渗透攻击的作用.该方案拓展国密算法SM9至IBEET领域中,提升其运行效率并丰富国密算法在云计算领域的研究.给出了SM9-IBEET-CRF的形式化定义和安全模型,并在随机预言机模型中考虑2种不同的敌手将此方案在选择密文攻击下的不可区分性与单向性分别形式化地规约到BDH困难假设上.同时,该方案通过考虑第3种敌手证明CRF的部署为其带来维持功能性、保留安全性以及抵抗渗透性.实验仿真和分析结果展示了该方案的有效性.
计算机研究与发展封面

中文名称:计算机研究与发展

杂志社官网:https://crad.ict.ac.cn/

英文名称:Journal of Computer Research and Development

语言:中文

类别:自动化技术、计算机技术

主 编:徐志伟

创刊时间:1958

出版周期:月刊

国内刊号:11-1777/TP

国际刊号:1000-1239

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京中关村科学院南路6号
  • 电话:(010)62620696
  • E-mail:crad@ict.ac.cn