计算机研究与发展杂志2024年第7期
-
- 支持访问行为身份追踪的跨域密文共享方案
- 申远,宋伟,赵常胜,彭智勇,
- 作为在云环境下被广泛应用的密文数据授权访问机制,密文策略属性基加密(ciphertext-policyattribute-basedencryption,CP-ABE)具有细粒度、1对多和拥有者可控的特点.由于多个用户可能拥有相同属性集合,传统属性基加密机制难以追溯到滥用解密权限的恶意授权用户身份.虽然现有研究解决了恶意用户的特定解密权限滥用行为(白盒攻击与黑盒攻击)的身份追踪问题,但仍难以实现针对授权用户访问行为的身份追踪,这将导致潜在的安全风险和数据访问知情权合规性问题.为了在现实应用场景中实现密文数据访问行为身份追踪,方案基于密文策略属性基加密机制构造跨域密文共享方法,通过数字签名和交互式外包解密流程将可追踪密钥和授权用户访问行为绑定为访问请求,并利用区块链的不可篡改性实现访问请求的完整性保护.为了解决引入区块链所导致的访问行为身份追踪效率低下问题,方案引入加密倒排索引结构以优化区块遍历效率,并通过BLS签名和隐私集合交集思想实现索引查询的隐私保护.理论分析和实验验证表明所提方案是实用与高效的.
-
- 基于信息瓶颈理论的鲁棒少标签虚假信息检测
- 王吉宏,赵书庆,罗敏楠,刘欢,赵翔,郑庆华,
- 虚假信息检测对于维护网络舆情安全具有重要意义.研究表明,虚假信息在信息内容和传播结构上较真实信息具有显著不同.为此,近年来研究致力于挖掘信息内容和信息传播结构,提升虚假信息检测的精准性.然而,现实场景中虚假信息的标注往往需要大量地与官方报道等比照分析,代价较为昂贵,现有方法对标注信息的过分依赖限制了其实际应用.此外,虚假信息传播者可通过在评论区控评等手段恶意操纵虚假信息的传播,增加了虚假信息检测的难度.为此,基于信息瓶颈理论提出一种鲁棒少标签虚假信息检测方法,通过互信息最大化技术融合无标注样本信息,克服虚假信息检测对标签的过分依赖问题;并通过对抗训练的策略模拟虚假信息传播者的恶意操纵行为,基于信息瓶颈理论学习鲁棒的虚假信息表征,在高质量表征虚假信息的同时消除恶意操纵行为的影响.实验表明,该方法在少标签识别和鲁棒性2个方面均取得了优于基准方法的效果.
-
- 基于本地差分隐私的分布式图统计采集算法
- 傅培旺,丁红发,刘海,蒋合领,唐明丽,于莹莹,
- 社交网络、社交物联网等应用场景产生的海量分布式图结构数据,被应用服务商采集并以此提供各类以数据为驱动的服务,或将引发严重的隐私风险.在此背景下,如何针对具备强关联性的分布式图结构数据实现安全高效的采集,成为大规模图结构数据应用服务的瓶颈.面向分布式图结构数据隐私保护的节点或边本地差分隐私模型无法有效处理隐私保护效果和数据有效性之间的冲突关系.针对该问题,提出基于本地差分隐私的分布式图统计采集算法,同时实现度分布、三角计数序列和聚类系数3个不同统计指标采集,并适应不同有效性和隐私保护的需求.首先,采用分组机制及对称一元编码机制,设计具备高强度隐私保护的基于Node-LDP的度分布采集算法;其次,基于所提度分布采集算法获取阈值,引入剪枝算法缓解随机加噪的噪声边过多问题,并分别提出基于Node-LDP和Edge-LDP的三角计数序列采集算法;再次,在前述三角计数序列采集算法基础上引入拉普拉斯机制,从而分别提出基于Node-LDP和Edge-LDP的聚类系数采集算法,进而实现不同保护强度及数据效用需求下的分布式图结构多指标采集;最后,实验和对比结果表明,所提算法能同时提高隐私保护强度和数据效用,比现有单一或多统计指标采集算法更具优势.
-
- 基于半监督学习的未知异常检测方法
- 程渝栋,周昉,
- 异常检测旨在识别偏离预期行为模式的数据.虽然半监督异常检测方法可以充分利用有限的标签数据作为先验知识来提高检测准确性,但是收集到的标记异常(即已知异常)很难覆盖所有类型的异常并且在现实场景中往往存在着一些新型的异常(即未知异常),这些异常可能与已知异常表现出不同的特性,因此难以被现有的半监督异常检测方法识别.针对该问题,提出了一种基于半监督学习的未知异常检测(semi-supervisedunknownanomalydetection,SSUAD)方法,旨在同时识别已知异常和未知异常.该方法利用闭集分类器对已知异常和正常分类,利用未知异常检测器检测未知异常.此外,还考虑了异常场景中异常和正常极端不平衡的情况,设计了有效的数据增强方法来扩充异常样本的数量.在UNSW-NB15和KDDCUP99数据集以及一个真实数据集SQB上进行了实验,实验结果表明,相较于现有的异常检测方法,SSUAD在异常检测性能指标AUC-ROC(areaunderreceiveroperatingcharacteristiccurve)和AUC-PR(areaunderprecision-recallcurve)上都有明显的提升.证明了SSUAD的有效性和合理性.
-
- 大语言模型驱动的选址推荐系统
- 高云帆,郁董卿,王思琪,王昊奋,
- 选址作为商业决策和城市基础设施规划的核心环节,对实体店铺、城市基础设施能否发挥预期效用具有重要作用.现有的选址推荐系统数据服务编排较为固定,无法对不同用户需求系统做出及时调整,应用场景受限,人机交互的系统灵活性和可扩展性差.最近,以GPT-4为代表的大语言模型(largelanguagemodel,LLM)展现出了强大的意图理解、任务编排、代码生成和工具使用能力,能够完成传统推荐模型难以兼顾的任务,为重塑推荐流程、实现一体化的推荐服务提供了新的机遇.然而,一方面选址推荐兼具传统推荐共有的挑战;另一方面,由于其基于空间数据,具有独特的挑战.在这一背景下,提出了大语言模型驱动的选址推荐系统.首先,拓展了选址推荐的场景,提出了根据位置寻找合适店铺类型的场景推荐任务,结合了协同过滤算法和空间预训练模型.其次,构建了由大语言模型驱动的选址决策引擎.语言模型本身在处理空间相关的任务上存在诸多缺陷,例如缺少空间感知能力、无法理解具体位置、会虚构地名地址等.提出了一种在语言模型框架处理空间任务的机制,通过地理编码、逆编码、地名地址解析等工具提升模型的空间感知能力并避免地址虚构问题,结合选址推荐模型、场景推荐模型、外部知识库、地图可视化完成选址推荐中的多样化任务.实现选址任务的智能规划、执行与归因,提升了空间服务系统的交互体验,为未来人工智能驱动的选址推荐系统提供新的设计和实现思路.
-
- 面向信息系统推荐与决策的高阶张量分析方法
- 王贝伦,张嘉琦,蔡英豪,王兆阳,谈笑,沈典,
- 张量数据(或多维数组)在各个行业的信息系统中广泛存在,例如医疗系统中的功能性磁共振成像(fMRI)数据和商品数据信息系统中的用户-产品数据.将这些数据用以预测张量特征与单变量响应之间的关系,可以实现数据赋能,提供更精准的服务或解决方案,例如疾病决策诊断或商品推荐.然而,现有的张量回归方法存在2个主要问题:一是可能丢失了张量的空间信息,导致预测结果不准确;二是计算成本过高,导致服务或解决方案不及时.对于具有高阶结构的大规模数据而言,这2点则显得更为突出.因此为了实现数据赋能,即利用张量数据来提高信息服务或解决方案的质量和效率,提出了稀疏低秩张量回归模型(sparseandlow-ranktensorregressionmodel,SLTR).该模型通过对张量系数应用\mathscrl_1范数和张量核范数使得张量系数具有稀疏性和低秩性两大特点,这样既保留了张量的结构信息又可以方便地解释数据.利用近端梯度方法优化了混合正则化器,使得求解过程可扩展且高效.除此之外证明了SLTR的严格误差界.在多个模拟数据集和一个视频数据集上的实验结果表明,SLTR相比于之前的方法,在更短的时间内获得了更好的预测性能.
-
- 图卷积宽度跨域推荐系统
- 黄玲,黄镇伟,黄梓源,关灿荣,高月芳,王昌栋,
- 跨域推荐(cross-domainrecommendation,CDR)通过利用其他域的额外知识,有效缓解了传统推荐系统遭遇的数据稀疏性问题.但是当前的CDR方法忽略了用户-项交互图所蕴含的高阶信息.为此,提出了一个新的框架,称为图卷积宽度跨域推荐系统(graphconvolutionalbroadcross-domainrecommendersystem,GBCD).具体地,将传统的用户-项交互的2-部图扩展到一个(D+1)-部图,以建模每个域中用户和项之间的关系,然后使用公共用户作为源域和目标域之间的桥梁来传递信息.通过图卷积网络(graphconvolutionalnetwork,GCN)学习用户与项之间的高阶关系,以聚合领域信息.然而,由于GCN在大量节点下收敛速度非常慢,并倾向于吸收不可靠的交互噪声,导致鲁棒性较差.为此,将域聚合特征输入到宽度学习系统(broadlearningsystem,BLS),并利用BLS的随机映射特征增强了GCN的鲁棒性,进而获得了较好的推荐性能.在2个真实数据集上进行的实验结果表明,GBCD优于各种先进的跨域推荐方法.
-
- 基于对比学习的多兴趣感知序列推荐系统
- 赵容梅,孙思雨,鄢凡力,彭舰,琚生根,
- 序列推荐的近几年工作通过聚类历史交互物品或者利用图卷积神经网络获取交互的多层次关联信息来细化用户兴趣.然而,这些方法没有考虑具有相似行为模式的用户之间的相互影响以及交互序列中时间间隔不均匀对用户兴趣的影响.基于上述问题,提出一种基于对比学习的多兴趣感知序列推荐模型MIRec,一方面考虑了序列内部的物品依赖和位置依赖等局部偏好信息,另一方面通过图信息聚合机制获取相似用户之间的全局偏好信息;然后将融合局部偏好和全局偏好的用户表示输入胶囊网络中,学习用户交互序列中的多兴趣表示;最后通过对比学习使用户的历史交互序列靠近增强的交互序列,获得对时间间隔不敏感的用户多兴趣表示,为用户提供更准确的推荐.所提模型在2个真实数据集上进行了充分实验,实验结果验证了所提模型的有效性.
-
- 基于定位数据的全景超分辨图像交互可视化框架
- 王晨泽,沈雪豪,黄振立,王政霞,
- 超分辨定位成像和全景数字病理结合,为研究人员观察整个样本的亚细胞结构提供了有力工具,同时也带来了全景超分辨图像海量数据可视化的挑战.然而,现有的超分辨图像可视化方法无法处理大规模定位数据、不能提供高分辨全景图像和无法交互可视化全景图像.针对以上问题,提出了一个基于定位数据的全景超分辨图像交互可视化框架,称为PNanoViewer,旨在普通计算机上实现大规模定位数据的快速交互可视化.该框架基于随机采样策略构建定位数据的多分辨率层级结构,以交互方式可视化多尺度全景超分辨图像;同时采用分块策略和多线程并行策略,分批次处理大规模定位数据,既防止内存溢出又加快了处理速度.从数千万到数亿个定位点数据集上的实验结果表明,PNanoViewer框架能够可视化任意规模的定位数据.将该框架与目前3种流行的超分辨图像可视化方法PALMsiever,ThunderSTORM,QC-STORM从数据量、分辨率和速度3个方面进行对比,PNanoViewer都具有明显优势.同时也为大规模定位数据的可视化提供了一个有益的探索.
-
- 基于查询编译的SQL执行技术研究进展
- 潘青峰,徐辰,
- 信息系统通常会借助数据管理系统来进行数据管理,其中SQL凭借良好的易用性和灵活性一直作为数据管理的主流查询语言,用户将编写的SQL语句交由数据管理系统执行后便可得到查询结果.执行模型的高效与否决定了系统能否快速响应用户的查询请求,现有执行模型主要采用解释执行和编译执行2种方式.解释执行具有良好的拓展性、可维护性等因而被大多数系统采用.不同于解释执行,编译执行为原本需要解释执行的查询生成高效的定制化代码来加速查询,带来的显著性能提升吸引了一众数据管理系统开始实现相应技术.然而,如何针对查询生成其对应的定制化代码是一个复杂的过程,在实现时需要考虑诸多方面,甚至在某些情况下,采用编译执行的查询性能可能还不及传统的火山模型.从概念、技术等角度系统地综述了编译执行技术的研究进展.首先,概述了编译执行的基本概念,对相关术语和背景知识进行了介绍;其次,分别从中间代码生成、中间表示、机器码生成与运行3个角度介绍了相关技术;最后,结合当前数据管理系统的研究趋势以及近期研究工作展望了编译执行未来的发展方向.
-
- 基于空间位置关系的轨迹数据高效降维和查询算法
- 巢成,蒲非凡,许建秋,高云君,
- 由于新型信息技术的快速发展,社会处于数字化、信息化转型的关键时期,各行业对于以数据库技术为基础的信息系统的需求也日益凸显.基于位置的服务依赖于海量实时生成的轨迹数据,在处理亿万级随时间连续变化的轨迹数据时,降维算法和查询技术一直是研究的关键,通过降低轨迹数据的规模,减少查询操作时处理数据的时间,能有效提升查询的性能,而能否实现高质量、高效率查询对于数据库而言至关重要.提出了面向轨迹数据的均匀网格编码,并在进一步优化后提出非均匀网格降维算法,将轨迹数据的坐标转化为1维字符串存储,对不符合要求的网格进行合并处理;通过空间位置映射充分保留轨迹数据间复杂的相互关系,并采用范围查询与最近邻查询对降维后的数据进行性能测试.实验使用不同城市真实轨迹数据与模拟生成轨迹数据作为数据集,将提出的均匀网格算法、非均匀网格算法与3种基准方法进行对比.实验证明,优化后的非均匀网格算法降维后数据的空间位置关系相似度可高达82.50%,范围查询时间较其他查询时间提升了至少73.86%,最近邻查询时间提升了至少52.26%,与其他基准方法相比取得了更好的效果.
-
- 带拒绝推理的反绎学习方法
- 黄宇轩,姜远,
- 近年来,许多研究工作致力于将数据驱动的机器学习和知识驱动的逻辑推理相结合,以提高机器学习的性能.其中,不少工作尝试利用反绎推理,将机器学习与逻辑推理融合到一个框架中.这些方法通过机器学习模型生成伪标记,然后利用反绎推理来修正不一致的伪标记,以更新机器学习模型并多次迭代.然而,反绎中可能会存在错误标记,这些标记会对模型训练产生负面影响且难以被发现.因此提出一种带拒绝推理的反绎学习方法,它同时考虑反绎标记的模型不确定性和推理不确定性,从数据层面和知识层面综合评估反绎结果的可靠性,并通过拒绝部分反绎推理结果来避免不可靠的反绎标记对模型训练的负面影响.实验表明,提出的方法可以减少错误反绎标记的比例、加速反绎学习的训练并带来更好的性能.
-
- 面向不同类型概念漂移的两阶段自适应集成学习方法
- 郭虎升,张洋,王文剑,
- 大数据时代,流数据大量涌现.概念漂移作为流数据挖掘中最典型且困难的问题,受到了越来越广泛的关注.集成学习是处理流数据中概念漂移的常用方法,然而在漂移发生后,学习模型往往无法对流数据的分布变化做出及时响应,且不能有效处理不同类型概念漂移,导致模型泛化性能下降.针对这个问题,提出一种面向不同类型概念漂移的两阶段自适应集成学习方法(two-stageadaptiveensemblelearningmethodfordifferenttypesofconceptdrift,TAEL).该方法首先通过检测漂移跨度来判断概念漂移类型,然后根据不同漂移类型,提出“过滤-扩充”两阶段样本处理机制动态选择合适的样本处理策略.具体地,在过滤阶段,针对不同漂移类型,创建不同的非关键样本过滤器,提取历史样本块中的关键样本,使历史数据分布更接近最新数据分布,提高基学习器有效性;在扩充阶段,提出一种分块优先抽样方法,针对不同漂移类型设置合适的抽取规模,并根据历史关键样本所属类别在当前样本块上的规模占比设置抽样优先级,再由抽样优先级确定抽样概率,依据抽样概率从历史关键样本块中抽取关键样本子集扩充当前样本块,缓解样本扩充后的类别不平衡现象,解决当前基学习器欠拟合问题的同时增强其稳定性.实验结果表明,所提方法能够对不同类型的概念漂移做出及时响应,加快漂移发生后在线集成模型的收敛速度,提高模型的整体泛化性能.
-
- 融合角色心理画像的心理健康文本匹配模型
- 赵芸,刘德喜,万常选,刘喜平,廖国琼,
- 全球心理健康问题形势严峻,由于心理健康服务的从业人员不足,遭受心理健康困扰的人并不总是能获得专业的心理健康服务.检索式心理健康社区自动问答可以快速地为需要心理健康服务的人提供相应的信息自助服务.与传统检索式社区问答中的文本匹配不同,在匹配支持帖和求助帖时,需要考虑2种不同层面的匹配准则:语义层面和心理层面.为了解决该问题,提出融合角色心理画像的2阶段文本匹配模型(two-stagetextmatchingmodelintegratingcharacters’mentalportrait,T2CMP),该模型引入心理特征用于构建角色心理画像,从而辅助模型理解文本心理层面的内容和匹配关系.同时为了提升检索效率以及减少大量负样例带来的噪声问题,将文本匹配任务拆分为2阶段的序列型子任务.首先针对每条求助帖,使用基于语义的筛选模型甄别出候选支持帖;然后依据用户的角色心理画像,使用多层注意力机制将其与语义信息有效融合,提高模型的总体效果.在MHCQA数据集上的实验结果显示,T2CMP比现有优秀算法拥有更高的F1值.
-
- 完全图高阶关系驱动的链接预测
- 张惠鹃,黄钦阳,胡诗彦,杨青,张敬伟,
- 图卷积网络(graphconvolutionalnetwork,GCN)因其在处理图数据方面的独特优势而被广泛应用于推荐系统中,它通过利用图中节点之间的依赖关系传播节点属性信息,极大地提高了节点表示的准确度从而提升推荐性能.然而现有基于GCN的推荐方法仍因过平滑问题而难以进行更深层的建模,从而限制了用户与项目间高阶关系的表达.为此,提出了一种基于项目间关系的完全图高阶关系驱动的链接预测(linkpredictiondrivenbyhigh-orderrelationsincompletegraph,LinkCG)方法.LinkCG通过用户-项目交互图与项目间隐式关联关系全局图组成的异构图预测用户到项目的链接,跳过了中间的用户节点直接利用完全图建模每个用户历史交互的项目间的局部隐式关联关系,获得项目间的高阶关系从而缓解数据稀疏性问题;此外,不同于基于节点嵌入的推荐方法,LinkCG通过赋予项目间的链接权重来表示项目间关系的紧密程度,并根据紧密程度进行链接预测,优化了模型的训练过程.在3个公开数据集上的实验结果表明,LinkCG作为只包含2个超参数的非深度学习模型,与一些先进的基于深度学习的基线方法相比提供了更好的性能.在社交关系数据上的应用进一步表明LinkCG能够从用户历史交互项目中获取足够丰富的用户偏好信息.
-
- 一种基于特征导向解耦网络结构的滤波器修剪方法
- 施瑞文,李光辉,代成龙,张飞飞,
- 现有的很多深度神经网络模型剪枝方法需要修改损失函数或在网络中嵌入额外的变量,无法直接受益于预训练网络,而且复杂化了前向推理和训练过程.到目前为止,大部分特征导向的剪枝工作仅利用通道内信息分析滤波器的重要性,使得剪枝过程无法利用通道间的潜在联系.针对上述问题,基于特征导向从通道间的角度考虑滤波器修剪任务,使用几何距离度量通道间的潜在相关性,将滤波器修剪定义为一个优化问题,并引入贪婪策略寻求最优解的近似解.该方法实现了剪枝与网络、剪枝与训练的解耦,从而简化了修剪任务.大量的实验证明了该方法对于各种网络结构都有良好的性能,例如在CIFAR-10数据集上,将VGG-16的参数量和浮点运算量分别降低了87.1%和63.7%,并且达到93.81%的高精度.还使用轻量型网络MobileFaceNets和CASIA-WebFace数据集评估该方法的性能,结果显示使用该剪枝方法后,MobileFaceNets在参数量和浮点运算量分别降低58.0%和63.6%的情况下,在LFW上的测试精度仍然达到99.02%,而且推理精度几乎没有损失(源代码发布在:https://github.com/SSriven/FOAD).
-
- 基于随机块模型的社区隐藏统一框架
- 刘栋,刘侠,贾若雪,张文生,
- 社区检测是复杂网络分析的重要工具之一,可帮助深入了解网络的社区结构和节点间潜在的关系,但同时也带来了隐私泄露问题.社区隐藏作为社区检测的伴生问题,旨在以最小的边扰动代价破坏网络的社区结构,近年来受到越来越多学者的关注.但现有的社区隐藏方法忽略了网络的生成机制且缺少针对不同尺度隐藏的统一框架,因此提出了一种基于随机块模型的社区隐藏(communityhiding-stochasticblockmodel,HC-SBM)算法,该算法从网络生成机制角度构建了社区隐藏的统一框架,即实现微观(个体)、介观(社区)、宏观(网络)3个尺度上的社区检测算法攻击.其基本思想是基于随机块模型刻画网络的生成机制,特别是网络社区形成和分裂的规律和模式,挖掘生成过程中的关键性链接以及链接集合,最终通过最小代价扰动策略破坏网络社区结构.通过在真实网络上的大量实验,并与4种先进的基准算法进行比较,表明了提出的HC-SBM算法在社区隐藏效果更优.
