RepoMark: A Code Usage Auditing Framework for Code Large Language Models

RepoMark:代码大语言模型代码使用审计框架总结与翻译

一、文章主要内容总结

(一)研究背景

代码大语言模型(Code LLMs)凭借自动化编码任务的高效性,给软件开发带来变革,其训练数据多来源于GitHub等开源代码仓库。但这种数据使用方式引发了严重的伦理与法律问题,核心在于数据授权不明以及开源许可证合规性存疑,且模型训练数据收集缺乏透明度,开发者难以知晓自身代码仓库是否被用于模型训练。

(二)核心问题

现有数据审计方法无法同时满足代码领域所需的四个关键特性:语义保留(修改不改变代码原有语义)、不可感知性(标记难被模型训练者察觉并移除)、样本高效性(对仅含10-50个代码文件的小规模仓库仍能准确审计)、假阳性率(FDR)保证(错误指控模型训练者的概率可控)。

(三)RepoMark框架设计

  1. 通用数据标记框架
    • 标记阶段:数据所有者为每个数据样本(代码文件)生成m个语义等效的变体,随机选择一个发布,其余私密保存。
    • 检测阶段:对每个数据样本,计算发布版本在所有变体损失中的排名,通过对所有样本排名求和进行假设检验,判断模型是否使用该数据训练。若模型未训练过该数据,发布版本排名呈均匀分布;若训练过,排名倾向于较小值。
  2. 代码领域适配</
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值