LLM Zoomcamp 开源课程仓库全解析:10 周从零构建生产级 RAG 与 Agent 应用的完整路线

LLM Zoomcamp 开源课程仓库全解析:10 周从零构建生产级 RAG 与 Agent 应用的完整路线

【免费下载链接】llm-zoomcamp LLM Zoomcamp - a free online course about real-life applications of LLMs. In 10 weeks you will learn how to build an AI system that answers questions about your knowledge base. Register here 👇🏼 【免费下载链接】llm-zoomcamp 项目地址: https://gitcode.com/GitHub_Trending/ll/llm-zoomcamp

LLM Zoomcamp 是 DataTalks.Club 出品的一门免费开源实战课程,目标是在 10 周内带你从零搭建一个能回答自己知识库问题的 AI 系统。本篇以仓库根目录 README.md 为主体,结合 cohorts/2026/README.mdproject.mdcourse.yaml 及各模块目录的实际内容,梳理这门课程面向谁、需要哪些前置条件、七个模块分别解决什么问题,以及毕业项目(Capstone)的完整评分标准,帮你在动手学习前先建立一张可落地、可验证的全局路线图。

课程定位与目标受众

README.md 对课程的定位非常明确:学完你能把 RAG(Retrieval-Augmented Generation,检索增强生成)、向量搜索、Embeddings、AI Agent、Function Calling、评估、监控、混合搜索与重排这些技术串成一套完整的生产级 AI 应用能力。

课程强调"learn by doing"——学完后你拿到的不是笔记,而是一个可运行的代码库和动手经验。README 明确列出三类适配人群及其各自收益:

  • 软件工程师:为真实产品加上 LLM、RAG 与现代搜索能力;
  • 数据工程师:理解向量搜索、混合搜索与检索流水线如何嵌入生产系统;
  • ML 从业者:获得一套结构化的 LLM 应用评估与监控方法。

从仓库结构看,这一定位有直接印证:课程材料按模块组织在 cohorts/2026/ 目录下,每个模块都自带 code/ 代码目录、homework.md 作业与 module.yaml 元数据(如 cohorts/2026/01-agentic-rag/module.yaml),course.yamloutcome 字段也概括了课程产出——"Build, evaluate, and monitor production-style LLM applications"。

前置条件:门槛刻意压得很低

README 给出的前置要求如下,这是判断自己是否适合入门的关键依据:

| 项目 | 要求 | |-|-| | Python | 能自信地写代码 | | 命令行 | 熟悉终端操作 | | Docker | 基本了解即可 | | ML / LLM 背景 | 不要求 | | 硬件 | 普通笔记本即可,无需 GPU | | 费用 | 约 1–5 美元 API credits |

README 中有一句总结性的判断标准:只要你写得出一段 Python 函数、且听说过 ChatGPT,就具备了开课条件。这一点与 cohorts/2026/01-agentic-rag/02-environment.md 的环境准备章节一致:模块 1 的环境课只覆盖 Python、uv 包管理器与 OpenAI API 配置,不涉及任何本地模型部署或 GPU 环境。

如果你决定开始,获取仓库的官方方式(以仓库当前 Git 地址为准):

git clone https://gitcode.com/GitHub_Trending/ll/llm-zoomcamp

克隆后建议先看根目录的 cohorts/2026/README.md(2026 期课程导航)与 etc/chunking.md 等补充资料,再进入具体模块。

两种学习模式:Live Cohort 与 Self-Paced

README(README.md#L57-L79)提供了两种跟课方式的对比,这是很多学习者最容易误解的地方,值得原样保留:

| | Live Cohort | Self-Paced | |-|-|-| | 开始时间 | 按 cohort 排期(见课程管理平台) | 随时开始 | | 课程视频 | 预录制 | 预录制 | | 作业 | 有评分 | 可做但不计分 | | 排行榜 | 有 | 无 | | 同行评审 | 有 | 无 | | 证书 | 有 | 无 | | 费用 | 免费 | 免费 |

README 特别澄清了"Live cohort"并不等于直播课:所有讲解视频都是预录制的,"Live"的含义是与同学一起学、有截止日期、作业与项目被评分、参与 peer review,并最终获得证书。

自我学习(Self-Paced)路径只有三步:跟随 GitHub 仓库中的材料、在社区(Slack)提问与分享进度、完成作业并为自己构建一个作品集项目。

从仓库配置看,2026 期 cohort 的时间安排由 cohorts/2026/cohort.yaml 声明:start_date: 2026-06-08end_date: 2026-10-12。该文件同时以 flow 列表声明了整期课程的模块顺序与每个模块对应的 module.yamlhomework.yaml 路径——这从配置文件层面印证了"按模块推进 + 每模块有作业"的组织方式。

课程大纲:七个模块加 Capstone

README 的大纲章节列出了 2026 期的完整路线(对应 cohorts/2026/README.md 中的导航结构)。下面逐模块说明,并补充仓库中各模块 README 的课节级细节。

模块 1:Agentic RAG——从关键词搜索 RAG 到 Agent

模块目标是:先用关键词搜索搭一条 RAG 流水线,再让它"agentic"化——由 LLM 自己决定何时搜、搜什么,而不是跑固定流水线(见 cohorts/2026/01-agentic-rag/README.md)。

该模块分两部分、共 16 节:

Part 1:RAG(第 1–10 节)——从零搭一条关键词搜索 RAG:

  1. Introduction:要构建什么、为什么
  2. Environment Setup:Python、uv、OpenAI API
  3. What is RAG:LLM 为什么需要上下文、RAG 架构
  4. The Course FAQ Dataset:抓取并探索 FAQ 数据
  5. Search:用 minsearch 建搜索引擎
  6. Building a Prompt:把搜索结果拼进 prompt
  7. RAG Pipeline:串联搜索 + prompt + LLM
  8. RAG Helper:可复用的 RAGBase 类与数据加载
  9. Data Ingestion:用 sqlitesearch 做持久化搜索
  10. Wrap-up:后续方向

Part 2:Agents(第 11–16 节)——把搜索决策权交给 LLM: 11. Agents:为什么固定 RAG 流水线不够 12. Quick RAG Revision(可选,也可作为独立工作坊入口) 13. Function Calling:给 LLM 可调用工具 14. The Agentic Loop:循环执行直到模型不再调用工具 15. ToyAIKit:一个用于教学的 agent loop 框架 16. Other Frameworks:值得探索的生产级框架

代码位于 cohorts/2026/01-agentic-rag/code/,其中 rag_helper.py 即第 8 节的可复用 RAG 基类,ingest.pypersistent_rag_ingest.ipynb 对应第 9 节的持久化摄取。

模块 2:Vector Search——从 Embeddings 到持久化向量索引

模块 2 在模块 1 的 RAG 基础上引入向量搜索:按语义而非字面关键词匹配文档(见 cohorts/2026/02-vector-search/README.md)。10 节课覆盖:

  1. What is Vector Search:关键词 vs 向量搜索
  2. Embeddings:用 sentence-transformers 把文本变成向量
  3. Embedding Our Dataset:为 FAQ 数据集生成 embedding
  4. Vector Search:用 numpy 实现向量搜索
  5. Vector Search with minsearch:内存向量搜索
  6. RAG with Vector Search:在 RAG 流水线中替换搜索后端
  7. Vector Search with sqlitesearch:SQLite 支撑的持久化向量搜索
  8. Vector Search with PGVector:PostgreSQL + pgvector 的生产级向量搜索
  9. ONNX Embedder(可选):用 ONNX Runtime 替代 PyTorch 做 embedding,便于轻量部署
  10. Next Steps:何时该用向量搜索

代码在 cohorts/2026/02-vector-search/code/(含 vector_search.ipynbvector_search_persistent.ipynbvector_search_pgvector.ipynb),embedding 运行时代码独立放在 cohorts/2026/02-vector-search/embed/embedder.pydownload.py),与课节 9 的 ONNX 主题对应。

模块 3:Orchestration——用 Kestra 做 AI 编排

对应 cohorts/2026/03-orchestration/。该目录自带 docker-compose.yml 与一组 YAML 流程定义(flows/),从最简 1_chat_without_rag.yaml2_chat_with_rag.yaml 逐级演进到 3_rag_with_websearch.yaml4_simple_agent.yaml5_web_research_agent.yaml6_multi_agent_research.yaml。从这套流程文件的命名与递进结构看,模块主线是:无 RAG 聊天 → 带 RAG 聊天 → 加 Web 搜索检索器 → 单 Agent → 多 Agent 研究流水线,编排引擎用的是开源平台 Kestra(也是课程赞助商之一)。

工作坊:Data Ingestion(dlt)

README 大纲中单列了 cohorts/2026/workshops/dlt.md:用 dlt 构建摄取并分析 LLM traces 的流水线,覆盖文件系统与 REST API 两种数据源,结合 DuckDB 查询与 marimo 仪表盘。工作区代码见 cohorts/2026/workshops/dlt/code/filesystem_pipeline.pyrest_api_pipeline.py、两个 dashboard 脚本),另有 7 节 lessons(01-overview 到 07-where-to-go)与独立作业目录 cohorts/2026/workshops/dlt/homework/

模块 4:Evaluation——度量检索与回答质量

对应 cohorts/2026/04-evaluation/,目标是离线与在线两条线评估系统:检索指标(命中率、MRR 等)与 LLM-as-a-Judge 评判答案质量。该模块的 code/ 目录给出完整可运行的参考实现:01-data-gen.ipynb(生成评测数据)、02-search-eval.ipynb(搜索评估)、03-rag-evals.ipynb(RAG 评估)、04-llm-judge.ipynb(LLM 裁判),并配套 evaluation_utils.pyrag_helper.pydata/ 下的 ground-truth 与答案 CSV——这正是 Capstone 评分标准中"Retrieval evaluation"与"LLM evaluation"两项要求的教学版样板。

模块 5:Monitoring——用户反馈与系统健康度

对应 cohorts/2026/05-monitoring/。其 code/ 目录是一套完整的小项目:app.py(聊天应用)、db_init.py/db_save.py/db_query.py(PostgreSQL 会话存储)、metrics.pydashboard.py(Streamlit 监控)、judge.py(内置裁判)与 Makefile。从这套文件结构看,模块 5 教你把"查询、反馈、响应时间、token 用量"落库并做成实时仪表盘,与 README 大纲中"Monitor user feedback and system health / Live dashboards"一致。

模块 6:Best Practices——混合搜索、重排与 LangChain

对应 cohorts/2026/06-best-practices/,覆盖三个进阶主题:LangChain 接入、混合搜索(向量 + 关键词融合)、结果重排提升精度。目录内附 hybrid-search-langchain.ipynbhybrid-search-and-reranking-es.ipynb 两份实操 notebook,以及评估用的 documents-with-ids.jsonground-truth-data.csv。模块 6 的 Hybrid search、Re-ranking 两项恰好是 Capstone "Best practices" 加分项,学习路径与评分要求直接对齐。

模块 7:End-to-End Project——健身助手完整示例

对应 cohorts/2026/07-project-example/:一个完整的 fitness assistant 项目示例,按"评估检索(Hit Rate / MRR)→ 评估 RAG(LLM-as-a-Judge)→ 接口(API/摄取流水线)→ 监控(docker-compose + 可观测性)→ 总结"的章节顺序(01-intro 至 07-chunking)走了一遍交付全流程。

健身助手 RAG 项目示例

模块 7 的完整项目示例:一个基于 LLM 构建的健身助手(图源:仓库 cohorts/2026/07-project-example/images/

Capstone:从零交付你自己的项目

README 与 cohorts/2026/README.md 都指向同一份毕业项目规范:project.md。推荐的学习节奏是三步循环:看每个模块的视频 → 完成作业巩固概念 → 用 Capstone 把所学端到端地应用一遍。

历史期次:2024 与 2025 存档

仓库同时保留了完整历史材料:cohorts/2024/(含 open-source 模型、Elasticsearch 演示、Grafana 监控等)与 cohorts/2025/(含语义搜索、RAG 评估、MCP 客户端、dlt 工作坊等)。各模块 README 中的"Old content"段落都明确指向这两个存档,说明课程按年份迭代大纲、旧内容归档而非删除。

Capstone 项目要求与评分标准

project.md 是 README"Capstone Project"章节的展开,也是整个仓库中评分规则最具体的文件。

任务定义:构建一个端到端的 LLM 应用——RAG 应用、Agent 应用或两者结合。需要做到:

  1. 选定一个你感兴趣的数据集或 API 数据源;
  2. 把数据摄取进知识库,或接入提供数据的 API;
  3. 实现应用主流程:检索上下文 →(可选)调用工具 → 组装 prompt → 调用 LLM;
  4. 评估你的 RAG 或 Agent 流程;
  5. 为应用创建用户界面;
  6. 收集用户反馈并监控应用。

数据集限制:课程各模块与作业使用的 DataTalks.Club Zoomcamp FAQ 文档不能作为项目知识库,必须另选语料。可用数据集方向包括 DTC 自己的 Slack 导出/Wiki/Podcast 转录、任意 Wikipedia 子集、Notion 笔记、文章、播客与 YouTube 转录、书籍、幻灯片 OCR 与图片描述等(详见 project.md#L153-L185);数据不一定要 Q&A 形式,etc/chunking.md 专门讲了切块策略。

技术栈不设限:LLM 可用 OpenAI、Ollama、Groq、AWS Bedrock 等;知识库可为文本、关系型或向量数据库(含课程中的内存实现与 SQLite);监控可用 Grafana、Kibana、Streamlit、dash;界面可用 Streamlit、Flask、FastAPI、Django 等;摄取流水线可用 Kestra、dlt、Airflow、Prefect 或纯 Python 脚本。唯一要求:用了课程没讲过的工具,就要解释它做什么、怎么用。

评分标准project.md#L104-L151)逐项列在原文,摘要如下:

| 维度 | 0 分 | 1 分 | 2 分 | |-|-|-|-| | 问题描述 | 未描述 | 描述简略不清 | 描述清晰,明确解决什么问题 | | 检索流程 | 无知识库也无 LLM | 无知识库、直接问 LLM | 知识库 + LLM 完整流程 | | 检索评估 | 无 | 只评估一种检索方式 | 评估多种并用上最优者 | | LLM 评估 | 无 | 只评估一种方法(如单一 prompt) | 评估多种方法并选用最优 | | 界面 | 完全无法交互 | 命令行 / 脚本 / notebook | UI(Streamlit)、Web 应用或 API(FastAPI) | | 摄取流水线 | 无 | 半自动(notebook 或脚本) | 自动化工具(Kestra、dlt、Airflow、Prefect 等) | | 监控 | 无 | 收集用户反馈或有监控面板 | 两者兼有,且仪表盘至少 5 张图 | | 容器化 | 无 | 主应用有 Dockerfile 或依赖有 compose | 全部纳入 docker-compose | | 可复现性 | 无说明或数据缺失 | 说明不完整,或说明完整但缺数据 | 说明清晰、数据可访问、易运行、依赖版本齐全 |

加分项:混合搜索(至少评估过,1 分)、文档重排(1 分)、用户查询改写(1 分)、部署上云(2 分),以及最多 3 分的自由加分(需在评审反馈中说明理由)。

文档建议(对评审通过率影响很大):写给没上过课的人看;在 README 中明示评估标准;加 UI、监控面板、回答示例的截图;写清运行步骤(安装、依赖、配置、环境变量);给出输入输出示例或简短 walkthrough;可用 Streamlit 右上角录制应用预览视频;长文档拆成 setup.mdusage.md 等分文件;README 随项目保持更新。

Peer review 机制:想拿项目分数,需评审 3 个同学的项目,每次评审 +3 分。评审时你会拿到公开仓库链接与 commit-hash,推荐 git clonegit reset --hard {commit-hash} 固定代码状态再评审。项目共有两次提交机会;抄袭(包括直接搬运他人 notebook、跨课程复用旧项目、跨期复用旧项目)记 0 分,但复用课程中的部分代码是允许的。

证书获取条件

LLM Zoomcamp 结业证书

完成最终项目与同行评审后颁发的 LLM Zoomcamp 结业证书

README"Certificate"一节给出三条硬性条件:

  1. 完成最终项目:构建一个真实场景的 RAG 应用,覆盖课程全部核心概念;
  2. 评审 3 个同学的项目:给出书面反馈;
  3. 赶在 cohort 截止期前提交项目与评审。

证书在所有 peer review 完成后发放。README 同时说明:Self-paced 学习者没有证书资格,但完全可以自由构建作品集项目——这与"两种学习模式"表格中的设定一致。

社区支持与"公开学习"机制

README 的社区部分指向 DataTalks.Club 的 Slack(课程专用频道 #course-llm-zoomcamp)与 Telegram 公告频道,并要求提问时遵循官方提问指南与社区规范(完整外链见 README"Quick Links"表,此处按仓库规范不重复列出外部地址)。

一个值得注意的机制是 Learning in Public:课程鼓励你在 LinkedIn、X 或博客上公开发布学习进度,理由是——它帮你被行业看见、结识同行,并且能为作业与项目分数带来 bonus points。这与前面 Capstone 评分中"可复现性""文档质量"的高权重形成呼应:这门课把"把项目公开地写好"本身当作工程能力的一部分来考核。

课程由三位讲师负责(详见 README"Instructors"一节):Alexey Grigorev(DataTalks.Club 创始人、Zoomcamp 系列创建者)、Will Russell(Kestra Developer Relations,对应模块 3 的编排主题)、Timur Kamaliev(生产级 LLM 系统 / RAG 流水线工程师)。赞助商为 Kestra 与 dlt,分别对应模块 3 的编排工作坊与 dlt 数据摄取工作坊,这也解释了为什么这两个工具出现在免费课程的核心大纲里。

FAQ 要点:四条最常见的疑问

README 保留了四条 FAQ(完整版在其外链 FAQ 中),这里全部继承:

  • 课程真的免费吗? 是。所有视频、材料、作业免费;若自己跑代码,约花费 1–5 美元 OpenAI API credits。
  • 需要 GPU 吗? 不需要。所有练习都设计为在标准笔记本上用云端 API 运行。
  • "live cohort"有直播课吗? 没有必修直播。视频全部预录;"live"指截止日期、计分的作业、排行榜、peer review 与证书资格。
  • 可以 self-paced 吗?有证书吗? 可以随时候课;但证书要求你在 live cohort 期间完成最终项目与 peer review。

贡献指南与仓库组织约定

README 欢迎对课程材料的贡献,流程为标准三步:Fork 仓库 → 提交修复或改进 → 开一个描述清晰的 PR。

理解这个仓库的目录约定对定位资料很有帮助,从源码结构看有几条清晰规则:

  • 根目录的 01-agentic-rag/07-project-example/ 只是索引桩。例如 01-agentic-rag/README.md 全文仅说明"课节、作业与日程随 cohort 存放",并指向 cohorts/2026/01-agentic-rag/ 等真实内容目录。真正的课程材料永远在 cohorts/{年份}/{模块}/ 下;
  • 每期 cohort 由 YAML 驱动cohorts/2026/cohort.yaml 声明 start_date/end_date 与模块 flow,每个模块再挂 module.yaml + homework.yaml;根目录 course.yaml 则声明课程级元数据(slug、描述文件指向 SITE.md、发布状态);
  • 年份迭代归档:2024/2025 材料完整保留在 cohorts/2024/cohorts/2025/,各模块 README 的"Old content"段负责指路;
  • 补充资料etc/chunking.md(切块专题)、awesome-llms.md(LLM 资源清单)、after-sign-up.md(报名后的社区接入清单)、docs/(仓库 webhook 说明)分别服务不同场景。

小结:一条可验证的学习路径

把 README 的承诺放回仓库里核对,可以得到一条闭环路径:模块 1 用 minsearch 从零搭出关键词 RAG 并升级为 function-calling Agent(代码见 cohorts/2026/01-agentic-rag/code/)→ 模块 2 换成语义检索并落到 SQLite / PGVector 持久索引(cohorts/2026/02-vector-search/code/)→ 模块 3 用 Kestra 编排多 Agent 流程(cohorts/2026/03-orchestration/flows/)→ 模块 4–5 建立评估与监控基线(cohorts/2026/04-evaluation/code/cohorts/2026/05-monitoring/code/)→ 模块 6 用混合搜索与重排拉高精度(cohorts/2026/06-best-practices/hybrid-search-langchain.ipynb)→ 模块 7 以健身助手为样板走完全流程(cohorts/2026/07-project-example/)→ 最后按 project.md 的评分标准交付你自己的 Capstone。每个环节在仓库中都有对应的代码、数据与作业文件可以逐行验证,这正是这门课程"以做代讲"理念在仓库层面最直接的体现。

【免费下载链接】llm-zoomcamp LLM Zoomcamp - a free online course about real-life applications of LLMs. In 10 weeks you will learn how to build an AI system that answers questions about your knowledge base. Register here 👇🏼 【免费下载链接】llm-zoomcamp 项目地址: https://gitcode.com/GitHub_Trending/ll/llm-zoomcamp

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值