本文详细介绍了 Agent 工程师的学习路线,从编程与后端工程基础到生产级 Agent 系统的开发。内容涵盖了 LLM 基础、Prompt 与 Context 工程、Tool Calling、MCP、RAG、Memory、Workflow、Planning、Multi-Agent、Agent Framework 等核心技术点,并提供了 6 个月的学习计划和 5 个实践项目建议,帮助读者系统掌握 Agent 开发技能,逐步成长为高级 Agent 工程师。
一、Agent 工程师到底是做什么的?
Agent 工程师不是单纯的“Prompt 工程师”,也不是只会调用一次大模型 API。
一个完整的 Agent 系统,本质上是在解决:
让大模型能够理解目标 → 制定计划 → 调用工具 → 获取外部信息 → 执行动作 → 检查结果 → 根据结果继续决策,最终完成复杂任务。
典型链路可以抽象成:
用户目标
↓
LLM 理解意图
↓
任务规划 / Planning
↓
选择 Tool
↓
执行 Tool
↓
获取 Observation
↓
LLM 判断下一步
↓
继续执行 / 修正 / 重试
↓
最终结果
例如用户说:
帮我分析最近一周 AI 行业的重要新闻,并整理成周报。
普通 LLM 应用可能只是直接回答。
Agent 则可能执行:
理解任务
↓
搜索最近 7 天新闻
↓
抓取相关新闻
↓
去重
↓
判断新闻重要程度
↓
按照公司 / 模型 / 产品分类
↓
生成摘要
↓
生成 Markdown 周报
↓
保存文件
↓
发送到飞书
所以 Agent 工程师实际上需要具备:
Agent Engineer
├── 软件工程能力
├── LLM 基础
├── Prompt / Context Engineering
├── Tool Calling
├── RAG
├── Memory
├── Workflow
├── Planning
├── Multi-Agent
├── Agent Framework
├── MCP
├── Agent Runtime
├── Evaluation
├── Observability
└── AI Infra / Engineering
学习时不要一开始就陷入某个 Agent 框架,而应该先理解 Agent 的底层组成。
二、Agent 工程师完整学习路线
推荐按照下面 8 个阶段学习:
阶段 1:编程与后端工程基础
↓
阶段 2:LLM 基础与 API
↓
阶段 3:Prompt + Context Engineering
↓
阶段 4:Tool Calling + MCP
↓
阶段 5:RAG + Memory
↓
阶段 6:Agent 核心机制
↓
阶段 7:Agent Framework + Multi-Agent
↓
阶段 8:生产级 Agent Engineering
如果已经有 Java / Android / Spring Boot 等工程经验,可以大幅压缩第一阶段,把主要精力放在 Python + LLM + Agent Runtime 上。
三、阶段一:编程与工程基础
1. Python
Agent / AI 生态目前非常依赖 Python。
需要掌握:
Python 基础
├── list / dict / tuple / set
├── class
├── decorator
├── generator
├── typing
├── dataclass
├── Pydantic
├── context manager
├── exception
└── package management
尤其要掌握:
async
await
asyncio
因为 Agent 经常需要同时执行:
搜索
数据库查询
模型调用
MCP Tool
HTTP API
多个 Sub-Agent
因此异步编程非常重要。
2. HTTP / REST / SSE
至少理解:
HTTP
├── GET
├── POST
├── Header
├── Authorization
├── JSON
├── Streaming
├── SSE
├── Timeout
├── Retry
└── Connection Pool
重点理解 LLM 的 Streaming。
Client
│
POST /chat
↓
Agent Server
│
↓
LLM
│
Token
Token
Token
↓
SSE
↓
Client
3. 后端开发
推荐至少掌握一个:
FastAPI
Spring Boot
Node.js
如果目标是 Agent 工程师,建议补 FastAPI。
需要能够自己写:
POST /chat
POST /agent/run
GET /agent/task/{id}
POST /tools/register
POST /mcp/connect
4. 数据库
掌握:
MySQL / PostgreSQL
Redis
重点理解:
Conversation
Message
Agent
Task
Run
ToolCall
Memory
Checkpoint
TokenUsage
这些基本都是 Agent 平台常见的数据模型。
四、阶段二:LLM 基础
这一阶段非常重要。
不要只停留在“会调用 Chat API”。
需要理解:
LLM
├── Token
├── Context Window
├── System Prompt
├── User Message
├── Assistant Message
├── Temperature
├── Top-P
├── Structured Output
├── Tool Calling
├── Embedding
├── Streaming
└── Reasoning Model
五、必须理解 Transformer 基础
Agent 工程师一般不需要自己训练大模型,但是至少应该理解:
Transformer
├── Tokenization
├── Embedding
├── Attention
├── Self-Attention
├── Multi-Head Attention
├── Position Encoding
├── Transformer Block
├── KV Cache
└── Decoder
至少能够解释:
- 为什么 Context 越长成本越高?
- KV Cache 是什么?
- 为什么 Agent 很耗 Token?
Agent 往往需要处理:
Prompt
+
Conversation
+
Tool Schema
+
Tool Result
+
Memory
+
RAG Context
+
Agent Intermediate State
Context 很容易快速膨胀。
六、阶段三:Prompt Engineering
需要系统学习 Prompt,而不是只会:
你是一个专业的 XXX,请帮我……
重点学习:
Prompt
├── Role
├── Instruction
├── Context
├── Constraint
├── Few-shot
├── Output Format
├── Structured Output
└── Prompt Template
例如:
Role
你是一名专业基金分析师。
Task
分析下面基金最近一年的表现。
Constraints
1. **不允许虚构数据**
2. **必须引用数据来源**
3. **风险等级使用 1-5**
4. **不提供确定性收益承诺**
Output
{
"summary": "",
"risk": 3,
"reason": []
}
七、进一步学习 Context Engineering
现在 Agent 开发中,Context Engineering 的重要程度往往比单纯 Prompt Engineering 更高。
核心问题是:
到底应该把什么信息放进模型 Context?
需要学习:
Context
├── System Prompt
├── User Query
├── Conversation
├── Memory
├── RAG
├── Tool Description
├── Tool Result
├── Agent State
└── Environment
需要解决:
Context 太长
Context 冲突
历史信息污染
Tool Result 太大
RAG 信息重复
无关 Memory
进一步学习:
Context Compression
Context Pruning
Context Summarization
Dynamic Context
这是高级 Agent 工程师非常重要的能力。
八、阶段四:Structured Output
Agent 中不能总让 LLM 返回自然语言。
例如让模型返回:
{
"action": "search",
"query": "AI Agent latest news"
}
而不是:
我觉得我们应该先搜索一下相关新闻。
需要掌握:
JSON Schema
Pydantic
Structured Output
Output Parser
Schema Validation
Retry
Fallback
这是 Tool Calling 的基础。
九、Tool Calling
这是整个 Agent 学习路线中最核心的知识点之一。
假设存在三个工具:
search_news
get_weather
send_email
用户:
帮我查一下东京明天天气。
模型判断:
{
"tool": "get_weather",
"arguments": {
"city": "Tokyo"
}
}
系统执行:
get_weather("Tokyo")
得到:
{
"temperature": 28,
"weather": "rain"
}
完整流程:
User
↓
LLM
↓
Tool Call
↓
Tool Executor
↓
Observation
↓
LLM
↓
Final Answer
需要重点掌握:
Tool Definition
Tool Schema
Tool Selection
Arguments Validation
Tool Execution
Tool Result
Tool Error
Timeout
Retry
Permission
Tool Loop
十、阶段五:学习 MCP
MCP 已经成为 Agent 工程领域非常值得掌握的协议。
MCP:
Model Context Protocol
可以把它理解为:
Agent / LLM 连接外部工具和数据源的一套标准协议。
例如:
Agent
│
├── MCP Server:GitHub
│
├── MCP Server:Database
│
├── MCP Server:Filesystem
│
├── MCP Server:Slack
│
└── MCP Server:Browser
重点理解:
MCP
├── Client
├── Server
├── Tools
├── Resources
├── Prompts
├── Transport
├── stdio
└── Streamable HTTP
学习目标不是简单做到安装 MCP Server,而是能够自己:
实现 MCP Server
实现 MCP Client
注册 Tool
发现 Tool
调用 Tool
处理权限
建议自己实现一个 MySQL MCP Server,提供:
query_database
get_table_schema
list_tables
十一、阶段六:RAG
Agent 通常需要访问企业知识库。
所以必须掌握:
RAG
Retrieval-Augmented Generation
完整链路:
Document
↓
Chunk
↓
Embedding
↓
Vector Database
User Query
↓
Embedding
↓
Vector Search
↓
Top-K
↓
Context
↓
LLM
需要掌握:
Embedding
Chunking
Vector Search
Top-K
Metadata Filter
Hybrid Search
Rerank
Query Rewrite
Multi Query
Context Compression
十二、Vector Database
至少使用过一种:
Milvus
Qdrant
Weaviate
pgvector
Elasticsearch
初学推荐:
PostgreSQL + pgvector
企业项目可以继续研究:
Milvus
Elasticsearch
十三、RAG 进阶
不要停留在:
用户问题
↓
向量搜索
↓
Top 5
↓
LLM
高级 RAG 应该继续学习:
Query Rewrite
Multi Query
Hybrid Search
BM25 + Vector
Reranking
Parent Document Retrieval
Metadata Filtering
Contextual Retrieval
Graph RAG
Agentic RAG
尤其建议重点学习 Agentic RAG。
传统 RAG:
Query → Search → LLM
Agentic RAG:
Query
↓
Agent 判断是否需要搜索
↓
选择知识库
↓
生成搜索 Query
↓
Search
↓
判断结果质量
↓
不够 → 再次搜索
↓
Rerank
↓
Answer
十四、Memory
Agent 和普通 Chatbot 一个非常明显的区别就是长期状态。
需要理解:
Memory
├── Short-Term Memory
├── Long-Term Memory
├── Semantic Memory
├── Episodic Memory
└── User Profile
需要进一步考虑:
什么时候写 Memory?
什么时候读取 Memory?
Memory 是否过期?
Memory 是否冲突?
如何删除 Memory?
如何做 Memory Summarization?
十五、阶段七:真正学习 Agent
核心概念:
Agent
├── Goal
├── State
├── Planning
├── Reasoning
├── Tool
├── Observation
├── Memory
├── Reflection
└── Action
一个经典 Agent Loop:
while not finished:
context = build_context()
response = llm(context)
if response.tool_call:
result = execute_tool(response.tool_call)
save_observation(result)
else:
return response.answer
真正困难的是:
什么时候停止?
模型一直调用工具怎么办?
Tool 调用失败怎么办?
模型参数传错怎么办?
执行成本过高怎么办?
Context 爆炸怎么办?
执行到一半服务器挂了怎么办?
怎么恢复任务?
这些问题才是真正的 Agent Engineering。
十六、Planning
复杂任务不能只靠一次 Tool Calling。
需要理解:
Task Decomposition
Planning
Dynamic Planning
Plan Execution
Replanning
十七、Reflection
Agent 执行后检查自己的结果:
执行
↓
检查结果
↓
发现问题
↓
重新执行
这就是 Reflection / Critic 的基本思想。
十八、经典 Agent Pattern
建议掌握:
ReAct
Plan-and-Execute
Reflection
Router
Supervisor
Worker
Evaluator-Optimizer
Parallel Agents
Agentic RAG
其中最重要的是 ReAct、Router 和 Supervisor。
十九、阶段八:Agent Framework
理解底层之后再学习框架。
推荐优先级:
第一梯队
LangGraph
OpenAI Agents SDK
第二梯队
AutoGen
CrewAI
扩展学习
Semantic Kernel
LlamaIndex
正确顺序应该是:
自己实现 Agent Loop
↓
理解 Agent State
↓
理解 Tool Calling
↓
理解 Workflow
↓
理解 Checkpoint
↓
再学习 Framework
二十、重点学习 LangGraph
核心概念:
State
Node
Edge
Conditional Edge
Graph
Checkpoint
Human-in-the-loop
Persistence
二十一、Multi-Agent
重点研究:
Agent Communication
Task Delegation
Agent Routing
Shared Memory
Agent State
Context Isolation
Result Aggregation
Conflict Resolution
但是不要为了 Multi-Agent 而 Multi-Agent。
Agent 数量越多,往往意味着:
Token ↑
Latency ↑
Cost ↑
Debug Difficulty ↑
Uncertainty ↑
二十二、生产级 Agent:Checkpoint
需要学习:
State Persistence
Checkpoint
Resume
Retry
Idempotency
二十三、Human-in-the-loop
需要设计:
Permission
Approval
Audit
Risk Level
Confirmation
二十四、Agent Observability
需要记录:
Request
Agent Run
Prompt
LLM Call
Tool Call
Tool Result
Token
Latency
Error
Retry
State
Cost
进一步统计:
TTFT
Total Latency
Input Token
Output Token
Cost
Tool Success Rate
Agent Success Rate
Retry Rate
Average Steps
可以研究:
LangSmith
Langfuse
OpenTelemetry
二十五、Agent Evaluation
至少建立真实测试集,并统计:
Task Success Rate
Tool Selection Accuracy
Tool Argument Accuracy
Answer Accuracy
Hallucination Rate
Average Steps
Average Token
Latency
Cost
进一步研究:
LLM-as-a-Judge
Rule-based Eval
Human Eval
Regression Eval
二十六、安全
重点学习:
Prompt Injection
Indirect Prompt Injection
Tool Injection
Data Leakage
Privilege Escalation
Dangerous Tool Call
Sandbox
Permission
Secret Management
尤其需要理解:
网页内容 ≠ System Instruction
RAG Document ≠ System Instruction
Tool Result ≠ System Instruction
二十七、Agent Infra
如果目标是高级 Agent 工程师,还需要学习:
Agent Runtime
Agent Gateway
Model Gateway
Tool Gateway
Memory Service
RAG Service
Tracing
Evaluation Platform
企业级架构:
API Gateway
│
Agent Server
│
┌──────────┴──────────┐
│ │
Agent Runtime Model Gateway
│ │
┌───────┼───────┐ ┌─────┼─────┐
│ │ │ │ │ │
Memory RAG Tools OpenAI Claude Gemini
│ │ │
Redis VectorDB MCP
二十八、建议做的 5 个项目
项目一:Mini Agent
实现:
Python
+
LLM API
+
Tool Calling
目标:
Agent Loop
Tool Calling
Observation
Context
Stop Condition
项目二:个人知识库 Agent
技术栈:
FastAPI
LLM
Embedding
PostgreSQL
pgvector
RAG
增加:
Citation
Hybrid Search
Rerank
Query Rewrite
项目三:MCP Agent
自己开发:
Git MCP
MySQL MCP
Filesystem MCP
项目四:Coding Agent
实现一个 Mini Claude Code / Codex:
读取项目
↓
搜索代码
↓
分析问题
↓
生成修改方案
↓
修改代码
↓
执行测试
↓
读取 Error
↓
继续修改
项目五:企业级 Multi-Agent 平台
AI Agent Platform
├── Agent Management
├── Prompt Management
├── Model Management
├── MCP Management
├── Tool Management
├── RAG
├── Memory
├── Workflow
├── Multi-Agent
├── Evaluation
├── Tracing
└── Token / Cost
二十九、6 个月学习计划
第 1 月:LLM 应用开发
学习:
Python
FastAPI
LLM API
Token
Streaming
SSE
Prompt
Structured Output
Tool Calling
完成:
LLM Chat Server
第 2 月:RAG
学习:
Embedding
Chunk
Vector Database
pgvector
Hybrid Search
Rerank
Query Rewrite
完成:
Enterprise Knowledge Agent
第 3 月:Agent
重点:
Agent Loop
ReAct
Planning
Reflection
Memory
Tool
Workflow
State
完成:
Mini Agent Framework
第 4 月:MCP + LangGraph
学习:
MCP
MCP Server
MCP Client
LangGraph
State
Node
Edge
Checkpoint
Human-in-the-loop
完成:
MCP Agent
第 5 月:Coding Agent + Multi-Agent
学习:
Coding Agent
Supervisor
Router
Worker
Multi-Agent
Context Isolation
完成:
Mini Coding Agent
第 6 月:生产级 Agent
重点:
Agent Evaluation
Observability
Tracing
Security
Checkpoint
Retry
Fallback
Model Routing
Token Cost
Concurrency
Rate Limit
Sandbox
完成:
Production Agent Platform
三十、Agent 工程师知识树
Agent Engineer
│
├── Programming
│ ├── Python
│ ├── AsyncIO
│ ├── FastAPI
│ └── Database
│
├── LLM
│ ├── Transformer
│ ├── Token
│ ├── Context
│ ├── KV Cache
│ ├── Streaming
│ └── Structured Output
│
├── Prompt
│ ├── Prompt Engineering
│ ├── Few-shot
│ └── Context Engineering
│
├── Tool
│ ├── Function Calling
│ ├── Tool Schema
│ ├── Tool Execution
│ ├── Permission
│ └── MCP
│
├── RAG
│ ├── Embedding
│ ├── Vector DB
│ ├── Chunk
│ ├── Hybrid Search
│ ├── Rerank
│ └── Agentic RAG
│
├── Memory
│ ├── Short-term
│ ├── Long-term
│ ├── Semantic
│ └── Episodic
│
├── Agent
│ ├── ReAct
│ ├── Planning
│ ├── Reflection
│ ├── Router
│ └── Workflow
│
├── Multi-Agent
│ ├── Supervisor
│ ├── Worker
│ ├── Communication
│ └── Shared State
│
├── Framework
│ ├── LangGraph
│ ├── OpenAI Agents SDK
│ ├── AutoGen
│ └── CrewAI
│
├── Engineering
│ ├── Checkpoint
│ ├── Retry
│ ├── Idempotency
│ ├── Human-in-the-loop
│ └── Sandbox
│
├── Evaluation
│ ├── Dataset
│ ├── LLM Judge
│ ├── Regression
│ └── Success Rate
│
└── Observability
├── Trace
├── Token
├── Cost
├── Latency
└── Tool Success Rate
三十一、学习优先级
★★★★★ 必须掌握
★★★★ 重点掌握
★★★ 项目中掌握
★★ 了解
推荐:
★★★★★ Python
★★★★★ LLM API
★★★★★ Structured Output
★★★★★ Tool Calling
★★★★★ Agent Loop
★★★★★ Context Engineering
★★★★★ MCP
★★★★ RAG
★★★★ Memory
★★★★ LangGraph
★★★★ Planning
★★★★ Agent Evaluation
★★★★ Observability
★★★ Multi-Agent
★★★ Agentic RAG
★★★ Human-in-the-loop
★★★ Agent Security
★★ Transformer 数学细节
★★ Fine-tuning
★★ 模型训练
对于 Agent 应用工程师,没有必要一开始投入大量时间研究 CUDA、预训练和 Transformer 数学推导。
应该优先把:
LLM → Tool → MCP → RAG → Memory → Agent → Workflow → Eval → Production
这条主线彻底打通。
三十二、最终目标
会调用 LLM
↓
会 RAG + Tool Calling + MCP
↓
会设计 Agent Workflow
↓
会解决 Context / Memory / Planning / Tool
↓
会做 Evaluation / Observability / Security / Cost
↓
Agent Application Engineer
↓
Senior Agent Engineer
↓
Agent Platform Engineer
↓
AI Infrastructure Engineer
真正有竞争力的 Agent 工程师,不是简历上写:
熟悉 LangChain、LangGraph、MCP。
而是能够回答:
一个 Agent 为什么能稳定地完成任务?如果执行 20 步,中间失败、模型选错 Tool、Context 超长、服务重启、Tool 超时、模型幻觉、成本过高,你如何设计整个系统保证它最终可靠完成?
能够系统解决这些问题,才基本进入了生产级 Agent Engineering 的范畴。
最后
2026 年一晃已经过半,AI 大模型的热潮不仅没有降温,反而持续升温!
金融行业用大模型做风控、医疗依靠 AI 解析影像,电商、制造、教育各行各业,都在把 AI 融入日常业务。曾经热闹的 “百模大战”,早就告别单纯比拼模型参数,正式进入落地应用时代。
现在企业疯狂紧缺一类人才:懂业务、懂 AI、能做出可上线项目的大模型开发工程师,岗位缺口大,薪资待遇十分可观。

风口再好,不如手握高薪 offer 实在。行情火热,普通人、程序员该怎样从零入门大模型,抓住这波机会?
今天整理好【2026 最新版】AI 大模型全套免费学习资源,覆盖零基础入门、项目实战、理论知识、大厂面试,从基础一路进阶。所有资料分类归档,没有多余杂料,无套路免费分享给想要入局 AI 赛道的程序员与零基础小白!
👇👇扫码免费领取全部内容👇👇

1、大模型系统化完整学习路线

2、大模型经典书籍&文档

3、AI 大模型最新行业研究报告

4、企业级实战项目 + 完整配套源码

5、大厂大模型面试真题汇总

6、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】


314

被折叠的 条评论
为什么被折叠?



