本文深入解析AI Agent的技能(Skills)机制,阐述其如何整合指令、脚本与模板,形成可复用能力包。文章重点介绍了Skills的三大核心优势:优化prompt复用、解决工具选择难题、管理复杂任务逻辑。同时,详细解析了Skills的文件结构、渐进式加载工作流及其与Prompt、Tool的区别与关系,旨在帮助开发者,尤其是初学者,理解和应用Skills构建高效AI Agent。
一、Skills是什么 解决了什么问题
Skills 的定义和特征
Agent Skill 是把「指令、脚本、模板」一体化打包成可复用能力包的机制。Agent 能自动发现它、按需加载它、在需要时调用里面的脚本和资源。
Skill 的核心特征:
-
1. 业务语义化:它的命名和描述是面向业务的,而不是面向技术的。
-
2. 复合性:一个 Skill 内部通常包含了一个或多个 Tool 的组合调用。
-
3. 按需加载:LLM只需要知道“这个 Skill 能做什么”以及“需要输入什么参数”,就能按照用户描述的场景自行匹配加载合适的skill工作。

Skill 是面向任务的可复用能力包
Skill 的出现是为了解决什么问题?
1. prompt复用的更优解
- 痛点:你一定遇到过这种情况:每次让 AI 帮你做代码审查,你都要贴一大段指令,告诉它「检查这几类问题、用这种格式输出、重点关注安全漏洞」。第一次贴的时候还好,第二次、第三次你就开始烦了。这还只是一个人的情况,如果是团队协作这个问题还会放大。
- Skill 的解法: Skill把那些你反复在用的指令、流程、模板,打包成一个标准化的模块,Agent 自己知道什么时候该用它、怎么用它,不再依赖你手动复制粘贴。
2. 业务维度组合工具,解决 LLM 的工具选择困难症
- 痛点:大模型的上下文窗口和注意力机制是有限的。如果你给 Agent 挂载了 100 个底层 Tool(如
get_user_id,get_order_list,calculate_sum等),LLM 在面对用户提问时,会在庞大的工具库中迷失,导致选错工具、参数填错、从而产生幻觉。 - Skill 的解法:一个Skill本质是应对一个业务/问题场景,Skill 对该场景所需的底层 Tool 进行了筛选和聚合。Agent 不需要面对 100 个底层 Tool,只需要面对能解决该场景问题的几个核心 Skill。这极大地降低了 LLM 的决策难度,提高了路由和选择的准确率。
3. 解决复杂任务的“状态管理”与“逻辑编排”
- 痛点:单个 Tool 是无状态的原子操作。但真实的业务场景往往是多步的、有状态的。比如“预订机票”:需要先查航班 -> 校验余额 -> 扣款 -> 出票 -> 发送通知。如果让 LLM 去一步步规划这些底层 Tool,不仅延迟极高,而且一旦中间某一步失败,LLM 很难进行全局的错误恢复。
- Skill 的解法(封装编排逻辑):Skill 内部可以包含复杂的控制流(If/Else、循环、并发)和状态管理。LLM 只需要调用一次“预订机票” Skill,Skill 内部的代码(可能是 Python/Java 写的)会稳健地执行完整个工作流,处理异常和重试,最后只返回一个“成功”或“失败及原因”的结果给 LLM。
二、Skill的存放和标准目录结构
Agent Skill 可以放在哪里?(存放位置)
Skills通常有以下四种存放策略:
- 1. 项目级本地目录(最常见)
- 路径:
./skills/、./agent_skills/或./plugins/ - 适用场景:与特定项目强绑定的 Agent。Skill 随项目代码一起进行 Git 版本控制。
- 2. 全局用户目录(跨项目复用)
- 路径:
~/.agent/skills/或~/.config/your_agent/skills/ - 适用场景:个人效率助手、CLI 终端 Agent。用户安装一次 Skill,即可在任何对话和项目中调用。
- 3. 远程技能仓库 / 注册中心(动态拉取)
- 路径:Git 仓库(如 GitHub / HuggingFace Hub)或内部的 Skill Registry API。
- 适用场景:企业级 Agent 平台。Agent 在启动或运行时,根据用户意图动态
git clone或通过 API 下载所需的 Skill 到本地缓存(Cache)中执行。
- 4. MCP (Model Context Protocol) 服务端
- 路径:作为独立的 MCP Server 运行在本地或远程 Docker 中。
- 适用场景:Agent 通过标准协议连接外部 Skill 服务,而
skill.md则作为该 Server 的说明文档和 Prompt 注入源。
一个 Skill 中包含哪些文件和目录?
一个功能完备的 Skill 不仅仅是提示词,它通常是一个微型的独立工程。标准的目录结构如下:
my_awesome_skill/
├── skill.md # 🧠 核心:Agent 读取的Skill目录,包含描述、Prompt、触发条件和参数定义
├── config.yaml # ⚙️ 配置(非必须):环境变量、API Keys、模型参数(如 temperature)、超时设置
├── scripts/ (或 src/) # 💻 执行层(非必须):具体的代码逻辑(Python, Node.js, Shell 等)
│ ├── main.py # 入口文件
│ └── utils.py # 辅助工具
├── requirements.txt # 📦 依赖(非必须):代码运行所需的第三方库(Agent 执行前会自动 pip install)
├── examples/ # 📚 示例(非必须):Few-shot 示例文件或测试用例,帮助 LLM 理解复杂调用
│ └── case_study.md
├── tests/ # 🧪 测试(非必须):单元测试,确保 Skill 代码逻辑的稳定性
│ └── test_main.py
└── assets/ # 🖼️ 资产(非必须):图标、本地知识库(RAG)文件、模板文件
├── icon.png
└── template.html

一个 Skill 是一个微型工程
三、skill.md 的结构包含什么?
skill.md 是 Agent 路由(Routing)和规划(Planning)的唯一依据。它的结构必须对 LLM 高度友好(通常采用 YAML Frontmatter + Markdown Body 的格式)。
一个优秀的 skill.md 应包含以下 7 个核心模块:
1. 元数据 (Metadata / Frontmatter)
使用 YAML 格式写在文件顶部,供 Agent 框架在不加载全文的情况下快速扫描、索引和过滤技能。
---
name: web_data_scraper
version: 1.2.0
tags: [web, scraping, data]
dependencies: ["beautifulsoup4", "requests"]
execution_type: python_script # 可选: prompt_only, python_script, api_call
---
2. 技能描述 (Description)
一句话说明。这是 Agent 在“思考”是否调用该工具时最先看到的内容,必须极其精准。
示例:
"用于抓取指定 URL 的网页正文内容,并自动清洗 HTML 标签,返回纯文本或 Markdown 格式。"
3. 触发条件 (When to Use / Trigger)
明确告诉 Agent 什么时候该用,以及什么时候绝对不能用(防幻觉和误调用)。
示例:
- ✅ Use when: 用户要求读取某个网页链接的内容、总结某篇文章、提取网页数据。
- ❌ Do NOT use when: 用户要求搜索互联网(应使用 search_skill)、或者要求读取本地 PDF 文件。
4. 输入参数 (Inputs / Arguments Schema)
使用类似 JSON Schema 的格式或清晰的 Markdown 表格,定义 Agent 需要提取并传递给代码的参数。
示例:
url(string, required): 需要抓取的目标网页 URL,必须包含http://或https://。max_length(integer, optional): 截断的最大字符数,默认 5000。format(enum: [“markdown”, “text”], optional): 输出格式,默认 “markdown”。
5. 输出与异常处理 (Outputs & Error Handling)
告诉 Agent 代码执行后会返回什么,以及遇到错误时 Agent 应该如何向用户解释。
示例:
- Success: 返回清洗后的 Markdown 字符串。
- Error: 如果返回
403 Forbidden,请告诉用户“该网站启用了反爬虫机制,无法直接读取”。
6. 工作流 / 思维链 (Workflow / CoT) (针对复杂技能)
如果该 Skill 包含多步操作,或者是一个纯 Prompt 技能(无代码),需要在这里规定 Agent 的执行步骤。
示例:
- 验证 URL 的合法性。
- 调用
scripts/main.py获取内容。
- 如果内容过长,调用
summarizer_skill进行摘要后再返回给用户。
7. Few-Shot 示例 (Examples)
提供 1-2 个真实的输入输出案例,这是提高 LLM 参数提取准确率最有效的方法。
### Example 1
User: "帮我读一下这个新闻 https://example.com/news/123 并总结"
Agent Action:
```json
{
"skill": "web_data_scraper",
"args": {
"url": "https://example.com/news/123",
"format": "markdown"
}
}
总结:普通 prompt 只是一段文字,用完就没了;而 Skill 是一个完整的文件夹,里面的指令、脚本、模板可以持续维护、版本管理。
四、Skills渐进式披露
什么是Skills渐进式披露
渐进式加载的核心思想是:“先看目录,再看正文;按需加载,用完即焚”。
该机制具体是指,Agent不是一次性把所有 Skill 的完整细节(代码、Few-shot、复杂逻辑)喂给大模型,而是分阶段、分粒度地将信息注入到 LLM 的上下文中。
为什么Skills需要渐进式披露
大模型的“注意力”下降问题
如果你把 50 个 Skill 的完整定义(包含参数、逻辑、示例)一次性喂给 LLM,上下文变得极其庞大,导致推理能力会显著下降,从而造成选错工具和产生幻觉(如把 A 工具的参数结构,强行套用在 B 工具上)的问题。
上下文窗口被打爆 物理与经济瓶颈被打破
-
1. 窗口溢出:即使是目前支持 128K 甚至 1M 上下文的模型,如果 Skill 数量达到几百个,全量加载也会瞬间撑爆上下文,导致系统直接报错。
-
2. 成本失控:每次对话都要重复输入几万个 Token 的工具定义,API 调用成本会呈指数级飙升。
渐进式加载的标准工作流(三阶段模型)
Skills的生命周期,或者说一个典型的渐进式加载流程分为三个严密的阶段:
阶段 1:全局索引与意图路由(粗粒度加载)
- 动作:Agent 框架在启动时,扫描所有 Skill 目录,仅提取每个
skill.md中的 Frontmatter(元数据) 和 一句话 Description。 - 注入:将这些轻量级的“技能目录”(Skill Registry)注入到 System Prompt 中。
- LLM 任务:LLM 根据用户的输入,在这个“目录”中进行思考和路由,决定需要调用哪个或哪几个 Skill,并输出 Skill 的
name或id。 - Token 消耗:极低(通常每个 Skill 只占 50-100 tokens)。
阶段 2:详情按需加载(细粒度加载)
- 动作:Agent 框架拦截到 LLM 输出的目标 Skill ID 后,动态读取该 Skill 完整的
skill.md文件(包含输入参数、Workflow、异常处理、Few-shot 示例等)。 - 注入:将完整的skill.md作为临时上下文(Context Injection) 追加到当前的对话历史中。
- LLM 任务:LLM 阅读完整的执行指令,提取参数,生成要调用的skill目录中的代码或 API 调用 payload。
- Token 消耗:中等(仅加载 1~3 个相关 Skill 的完整内容)。
阶段 3:执行、动态扩展与清理(闭环与复用)
- 动作:按需加载skill目录下的代码(scripts子目录下的文件)和资源(assets目录下的资源),获取结果。
- 扩展(Sub-loading):如果该 Skill 在执行过程中发现需要调用另一个 Skill,框架会再次触发阶段 2,加载其他skill.md文件的详情。
- 清理:当前对话轮次结束后,阶段 2 注入的“厚重详情”可以从 Context 中移除或压缩,只保留执行结果,为下一轮对话腾出空间。

Skills 渐进式披露:先看目录,再看正文
针对不同Skills数量的进阶加载策略
根据 Agent 拥有的 Skill 数量,渐进式加载会采用不同的底层策略:
1. 两阶段加载(Two-Stage Loading)
- 适用规模:10 ~ 50 个 Skill。
- 机制:如上文的“标准工作流”所述。直接将所有 Skill 的摘要放在 System Prompt 中,LLM 直接做选择题。
2. 基于 RAG 的语义检索加载(Retrieval-Augmented Skill Loading)
- 适用规模:50 ~ 500 个 Skill。
- 机制:当 Skills 数量一多,摘要本身也很大时,System Prompt 也放不下。此时将每个 Skill 的
Description和Tags进行向量化(Embedding) 存入向量数据库。 - 流程:用户提问 -> 将问题向量化 -> 在向量库中计算相似度 -> 召回 Top-K(如前 5 个)最相关的 Skill 摘要 -> 注入 Prompt 让 LLM 路由。
3. 层级/树状目录加载(Hierarchical Loading)
- 适用规模:500+ 个 Skill(大型企业内部 Agent)。
- 机制:模仿操作系统的文件系统。Skill 被组织在命名空间或分类目录下(如
finance/reports/,hr/onboarding/)。 - 流程:
-
1. 先加载一级目录(如:财务、人事、IT、行政)。
-
2. LLM 选择“财务”后,框架再加载二级目录(如:报销、报表、预算)。
-
3. LLM 选择“报表”后,框架最后加载具体的 Skill 详情。
渐进式披露小结
渐进式加载机制本质上是用“工程上的复杂度”换取“大模型推理的精准度与经济性”。它让 Agent 拥有了类似人类专家的工作方式:面对海量工具时,先在大脑中检索相关类别(阶段 1),锁定目标后,再翻阅具体的操作手册(阶段 2),从而在有限的“大脑容量”(Context Window)下,驾驭成百上千的复杂技能。
四、Skills/Prompt/Tool的区别和关系是什么
Skills/Prompt/Tool的核心区别
为了更直观地理解,我们可以从以下几个维度进行对比:
| 维度 | Prompt (提示词) | Tool (工具) | Skill (技能) |
|---|---|---|---|
| 抽象层级 | 最低(基础组件) | 较低(原子组件) | 最高(业务封装) |
| 核心职责 | 设定认知、逻辑、语气、规则 | 提供数据获取或动作执行的接口 | 封装解决特定复杂任务的完整能力 |
| 有无执行力 | 无(纯文本引导) | 有(执行代码/API) | 有(调度 Prompt 和 Tool 完成任务) |
| 粒度 | 细(一句话或一段指令) | 极细(如:获取某城市天气) | 粗(如:规划一次包含天气的旅行) |
| 状态与记忆 | 无状态(每次输入独立) | 通常无状态(纯函数) | 有状态 (可包含上下文、中间变量、工作流状态) |
| 面向对象 | 面向大模型(LLM) | 面向系统/代码(API/Function) | 面向业务场景/最终用户(User/Business) |
Skills/Prompt/Tool的内在关系
它们不是相互孤立的,而是层层递进、相互包含的关系。
1. 包含与组合关系(1 + 1 > 2)
- Skill = Prompt + Tools (+ Workflow/Knowledge)
- 一个 Skill 内部,必定有 Prompt 来指导大模型如何调用这些 Tools。
2. 动态绑定与路由关系
在渐进式加载机制中,这三者的关系体现得淋漓尽致:
- 当 Agent 决定使用某个 Skill 时,框架实际上是在做两件事:
-
1. 将该 Skill 专属的 Prompt 注入到 System Context 中。
-
2. 将该 Skill 绑定的 Tools 注册到当前的大模型可用函数列表中。
- 当 Skill 任务结束,框架会将这些 Prompt 和 Tools 从上下文中卸载,以节省 Token。
3. 降维与升维
- Tool 是降维:把复杂的系统能力(如操作数据库),降维成大模型能理解的几个参数(SQL 语句)。
- Skill 是升维:把零散的 Tools 和 Prompt,升维成用户能听懂的业务能力。

Skill、Prompt、Tool 的关系
Skills/Prompt/Tool的一句话总结
Tool让Agent能干活,Skill让Agent会干活,Prompt让Agent干这次活儿。
本篇总结
通过本章,我们知道了 Skill 是把「指令、脚本、模板」一体化的可复用能力包。
同时,我们深入探讨了 渐进式披露(Progressive Loading) 机制。通过“先看目录、再看正文、按需加载”的三阶段模型,我们成功用工程上的复杂度,换取了大模型推理的精准度与经济性,解决了全量加载Skills引发的 LLM “注意力迷失”和“上下文爆炸”难题。
最后介绍了Skills,Prompt 和 Tools的区别和联系。
Tool 让 Agent 能干活,Skill 让 Agent 会干活,Prompt 让 Agent 干好这次的活儿。
最后
2026年技术圈的分化愈发明显:降薪裁员潮持续蔓延,传统开发、测试等岗位大批缩水,不少从业者陷入职业焦虑;与之形成鲜明对比的是,AI大模型相关岗位迎来疯狂扩招,薪资逆势飙升150%,大厂更是直接开出70-100W年薪,疯抢具备实战能力的大模型人才,甚至放宽年龄限制,只求能快速落地技术、创造价值!
很多程序员、职场新人纷纷入局大模型领域,绝非盲目跟风,而是实实在在看到了不可替代的价值优势,这也是2026年最值得抓住的职业风口:
1、窗口期红利,入门门槛友好:不同于成熟赛道的“内卷式招聘”,2026年大模型人才缺口巨大,简历只要达标(掌握基础AI应用+具备简单项目经验),年龄、学历均非硬性要求,小白可快速入门,转行程序员也能无缝衔接;
2、技术可复用,上手速度翻倍:如果你有前后端开发、测试、数据分析等基础,在大模型落地、系统部署、Prompt工程等环节会更具优势,无需从零开始,复用原有技术能力就能快速进阶;
3、懂业务更吃香,竞争力翻倍:单纯懂技术已不够,2026年大厂更看重“技术+业务”的复合型人才,有垂直领域(金融、医疗、工业等)经验者,能精准定位模型落地痛点,薪资比纯技术岗高出30%以上;
更重要的是,即便没有转型需求,用AI大模型工具为工作赋能、提升效率,也已经成为80%企业的硬性要求——不会用大模型提效,未来很可能被行业淘汰!

那么2026年,小白/程序员该如何高效学习大模型?
很多人想入门大模型,却陷入两大困境:要么到处搜集零散资料,不成体系,越学越懵;要么被收费高昂的课程割韭菜,花了钱却学不到实战技能,白白浪费时间走弯路。
今天就给大家精心整理了一份2026年最新、免费、系统化的AI大模型学习资源包,覆盖从零基础入门到商业实战、从理论沉淀到面试通关的全流程,所有资料均已整理归档,无需拼凑,直接领取就能上手学习,小白可照做,程序员可进阶!

👇👇扫码免费领取全部内容👇👇

1、大模型系统化学习路线
这份学习路线结合2026年行业趋势和新手学习规律,由行业专家精心设计,从零基础到精通,每一步都有明确指引,帮你节省80%的无效学习时间,少走弯路、高效进阶,避免踩坑。

2、从0到进阶大模型学习视频教程
从入门到进阶这里都有,跟着老师学习事半功倍。

3、大模型学习书籍&电子文档
涵盖2026年最新技术要点,包括基础入门、Transformer核心原理、Prompt工程、RAG实战、模型微调与部署等内容

4、AI大模型最新行业报告
报告包含腾讯、阿里、甲子光年等权威机构发布的核心内容,还有2026年中文大模型基准测评报告、AI Agent行业研究报告等,帮你站在行业前沿,把握技术风口。

5、大模型项目实战&配套源码
项目包含Deepseek R1、GPT项目、MCP项目、RAG实战等热门方向,还有视频配套代码,手把手教你从0到1完成项目开发,既能练手提升技术,又能丰富简历,为求职和职业发展加分。

6、2026大模型大厂面试真题
2026年大模型面试已全面升级,不再单纯考察基础原理,而是转向侧重技术落地和业务结合的综合考察,很多程序员和新手因为缺乏针对性准备,明明技术不错,却在面试中失利。

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
-
硬件选型
-
带你了解全球大模型
-
使用国产大模型服务
-
搭建 OpenAI 代理
-
热身:基于阿里云 PAI 部署 Stable Diffusion
-
在本地计算机运行大模型
-
大模型的私有化部署
-
基于 vLLM 部署大模型
-
案例:如何优雅地在阿里云私有部署开源大模型
-
部署一套开源 LLM 项目
-
内容安全
-
互联网信息服务算法备案
-
…
👇👇扫码免费领取全部内容👇👇

7、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

学习指南,轻松构建智能应用&spm=1001.2101.3001.5002&articleId=163560578&d=1&t=3&u=3a0d45e16d4f4ae3977c77e23fe6c007)
2357

被折叠的 条评论
为什么被折叠?



