
一句话说清:拿一堆“提问—标准回答”的范例喂给模型,让它学会照着这种样子回答。
1. 它到底在说什么
SFT 是英文 Supervised Fine-Tuning 的缩写,中文叫“监督微调”,在有些语境里也叫“指令微调”(Instruction Tuning)。它指的是大模型训练管线里的一段“后训练”(post-training):先有一个在互联网海量文本上练好的通用底座,你不再从零教它认字和常识,而是用一批精心准备的“指令—回答”示范对接着训练它,让它学会用人类想要的那种样子去回应。
一个生活化类比:底座模型像一位读遍百科、能流畅续写任何文档的资深写手,但他不知道“你在公司里该怎么说话”。SFT 就是入职培训——给他看几百条“别人这样问,我们就这样答”的范例,他很快就能掌握你们公司的语气、格式与边界。注意,培训教的是“怎么回答”,不是“把哪些新知识背进脑子”。
2. 为什么现在这个词很热
SFT 的思想根植于“迁移学习”(Transfer Learning),在自然语言处理(NLP)里,把预训练模型接到具体任务上再练几层,自 2018 年 BERT 起就是标配。但“指令微调”作为一种范式被正式确立,关键在 2021 年。
其一是 FLAN(Wei 等,2021,arXiv:2109.01652):研究者把
订阅专栏 解锁全文
&spm=1001.2101.3001.5002&articleId=166094403&d=1&t=3&u=c558a7ef3062415fa5e4d751bd806a5f)
335

被折叠的 条评论
为什么被折叠?



