RepoMark:代码大语言模型代码使用审计框架总结与翻译
一、文章主要内容总结
(一)研究背景
代码大语言模型(Code LLMs)凭借自动化编码任务的高效性,给软件开发带来变革,其训练数据多来源于GitHub等开源代码仓库。但这种数据使用方式引发了严重的伦理与法律问题,核心在于数据授权不明以及开源许可证合规性存疑,且模型训练数据收集缺乏透明度,开发者难以知晓自身代码仓库是否被用于模型训练。
(二)核心问题
现有数据审计方法无法同时满足代码领域所需的四个关键特性:语义保留(修改不改变代码原有语义)、不可感知性(标记难被模型训练者察觉并移除)、样本高效性(对仅含10-50个代码文件的小规模仓库仍能准确审计)、假阳性率(FDR)保证(错误指控模型训练者的概率可控)。
(三)RepoMark框架设计
- 通用数据标记框架
- 标记阶段:数据所有者为每个数据样本(代码文件)生成m个语义等效的变体,随机选择一个发布,其余私密保存。
- 检测阶段:对每个数据样本,计算发布版本在所有变体损失中的排名,通过对所有样本排名求和进行假设检验,判断模型是否使用该数据训练。若模型未训练过该数据,发布版本排名呈均匀分布;若训练过,排名倾向于较小值。
- 代码领域适配</
订阅专栏 解锁全文

850

被折叠的 条评论
为什么被折叠?



