【AI黑话日日新】Day 038|SFT(监督微调)

在这里插入图片描述

一句话说清:拿一堆“提问—标准回答”的范例喂给模型,让它学会照着这种样子回答。

1. 它到底在说什么

SFT 是英文 Supervised Fine-Tuning 的缩写,中文叫“监督微调”,在有些语境里也叫“指令微调”(Instruction Tuning)。它指的是大模型训练管线里的一段“后训练”(post-training):先有一个在互联网海量文本上练好的通用底座,你不再从零教它认字和常识,而是用一批精心准备的“指令—回答”示范对接着训练它,让它学会用人类想要的那种样子去回应。

一个生活化类比:底座模型像一位读遍百科、能流畅续写任何文档的资深写手,但他不知道“你在公司里该怎么说话”。SFT 就是入职培训——给他看几百条“别人这样问,我们就这样答”的范例,他很快就能掌握你们公司的语气、格式与边界。注意,培训教的是“怎么回答”,不是“把哪些新知识背进脑子”。

2. 为什么现在这个词很热

SFT 的思想根植于“迁移学习”(Transfer Learning),在自然语言处理(NLP)里,把预训练模型接到具体任务上再练几层,自 2018 年 BERT 起就是标配。但“指令微调”作为一种范式被正式确立,关键在 2021 年。

其一是 FLAN(Wei 等,2021,arXiv:2109.01652):研究者把

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Andrew浮游会

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值