国内刊号:11-1777/TP
国际刊号:1000-1239
发布日期:
作者:张伟超,张儒清,郭嘉丰,范意兴,
关键词:大语言模型, 模型记忆能力, 训练数据版权, 成员推理攻击, 数据污染,
预训练数据检测方法旨在大语言模型的预训练数据未公开时,检测某段给定的文本是否属于该模型的预训练数据,可用于审查大语言模型的预训练数据的使用过程是否符合法律法规.现有方法通常认为大语言模型对训练文本的词元概率在整体上比非训练文本的高,并基于此判定具有高预测概率的文本为训练文本.然而,由于训练文本和非训练文本之间存在着大量的短片段重叠现象,导致模型对非训练文本的词元概率也可能比较高,使得现有方法容易将非训练文本误检为训练文本.受大语言模型的记忆能力研究启发,通过对比给定全部上下文时的词元概率与给定短距离上下文时的词元概率之间的差异,计算得到长距离上下文对词元概率提升的贡献度,并认为贡献度越大的文本更可能是训练文本,进而缓解短片段重叠现象对检测的不利影响.其核心思想在于,大语言模型在预测训练文本中词元的概率时,距离当前词元较远的上下文对词元概率提升的贡献度,会比在预测非训练文本中词元的概率时的贡献度更大.在多个公开数据集上的实验结果表明该方法的有效性.
来源:2025年第12期
《计算机研究与发展》期刊编辑部