最近有个老表想做一个 Temu 商品素材采集自动化,需求很具体,搜索商品、保存原图、提取衣服印花、按日期整理文件夹。
我没有直接把工具给他,而是现场用 Codex 演示了一遍。
这篇文章记录一下这次自动化流程的设计思路、执行步骤、目录结构和一些实际踩到的问题。
本文仅作为 AI 自动化流程演示,实际使用时需要遵守目标网站规则、版权要求和数据使用边界。
一、需求背景
前两天,有个老表来找我。
他说他想搞一下 Temu 上面的商品素材采集,尤其是女装印花 T 恤这一类商品。
他的原始需求大概是这样:
- 打开 Temu
- 搜索关键词「女装印花t恤」
- 获取前 10 个商品图片
- 保存商品原图
- 提取衣服上的印花图案
- 原图和结果图按日期分别归档
- 整个过程尽量自动化
这个需求看起来不复杂。
但做过电商素材采集的人都知道,这里面最麻烦的不是技术难度,而是重复操作。
你要打开网页、搜索、点商品、保存图片、改文件名、上传抠图、保存结果、整理文件夹。
一两张图片还好。
几十张、几百张的时候,人就开始烦了。
所以这次我想验证的不是单点能力,而是一个完整流程:
自然语言需求
↓
Codex 操作浏览器
↓
采集商品图片
↓
保存原始图片
↓
调用 imagegen 提取印花
↓
按日期整理结果
二、实操演示视频
下面是这次完整流程的实操演示视频。
视频建议放在这里,也就是读者刚理解完需求之后。
这时候他们已经知道你要解决什么问题,再看视频会更容易理解整个自动化流程。
视频发布到视频号了
https://mp.weixin.qq.com/s/IwSXfDlXyDSAZIXqfHAt9Q
三、我给 Codex 的任务描述
这次没有写复杂的脚本入口,而是直接把目标描述给 Codex。
任务描述类似下面这样:
打开 temu 地址
搜索「女装印花t恤」
找到前 10 个商品
把原图片保存到 source_今天日期 文件夹
调用 imagegen 把衣服上的印花图像抠出来
保存到 yinhua_今天日期 文件夹
不要用 Python 代码处理图片
这里面有几个关键点:
- 目标网站是 Temu
- 搜索关键词是「女装印花t恤」
- 商品数量限制为前 10 个
- 原图和处理结果需要分目录保存
- 抠图交给 imagegen
- 不用本地 Python 图像处理
这个任务的核心不在于某一步有多难,而在于 Codex 能不能把这些步骤串成一个完整流程。
四、目录结构设计
为了方便后续整理,我让 Codex 按日期生成两个目录。
示例结构如下:
Temu-Product-Intelligence/
├── source_2026-07-20/
│ ├── product_01.jpg
│ ├── product_02.jpg
│ ├── product_03.jpg
│ └── ...
│
├── yinhua_2026-07-20/
│ ├── product_01.png
│ ├── product_02.png
│ ├── product_03.png
│ └── ...
│
└── products.json
其中:
| 目录或文件 | 作用 |
|---|---|
source_日期 | 保存 Temu 商品原始图片 |
yinhua_日期 | 保存提取出来的衣服印花图 |
products.json | 保存商品图片来源、序号等元数据 |
这样做的好处是比较明显的。
每天跑一次,就生成一组当天的数据。
后面如果要做趋势分析、素材库沉淀、重复图案检测,也更容易扩展。
五、自动化流程拆解
1. 打开网页并搜索关键词
Codex 会先打开 Temu 页面,然后在搜索框里输入目标关键词。
关键词:女装印花t恤
平台:Temu
目标数量:前 10 个商品
这一步看起来很简单,但它其实已经涉及浏览器控制、页面加载等待、搜索输入、结果页识别等动作。
2. 获取商品图片
搜索结果出来以后,Codex 需要识别页面里的商品图片,并选取前 10 个。
这里需要注意两个问题:
- 商品卡片可能是懒加载
- 页面结构可能变化
所以实际自动化里,不能只假设页面一次加载完所有内容。
更稳的做法是:
打开搜索结果页
↓
等待页面主要内容加载
↓
滚动页面触发图片加载
↓
提取商品图片地址
↓
去重
↓
截取前 10 个有效图片
3. 保存原始图片
拿到商品图片之后,先保存原图。
原图一定要保留。
原因很简单,后续如果抠图失败,还可以重新处理。
source_2026-07-20/product_01.jpg
source_2026-07-20/product_02.jpg
source_2026-07-20/product_03.jpg
4. 调用 imagegen 提取衣服印花
这一步不是用 Python 做图像处理,而是交给 imagegen。
目标不是把整件衣服抠出来,而是尽量提取衣服正面的印花图案。
可以理解成:
输入:商品原图
输出:衣服上的印花图案
理想结果是透明背景 PNG,方便后续做素材库、设计参考或二次整理。
5. 保存处理结果
处理后的图片保存到 yinhua_日期 目录。
yinhua_2026-07-20/product_01.png
yinhua_2026-07-20/product_02.png
yinhua_2026-07-20/product_03.png
原图和结果图使用相同编号,方便一一对应。
六、这次自动化真正有价值的地方
这次演示里,最有价值的点不是「抓图」本身。
也不是「抠图」本身。
真正有价值的是,Codex 把多个工具和多个动作串成了一条工作流。
以前这类流程大概是这样:
人打开网页
人搜索关键词
人下载图片
人上传到抠图工具
人保存结果
人整理文件夹
现在变成了:
人描述目标
Codex 拆解任务
Codex 操作浏览器
Codex 保存图片
Codex 调用 imagegen
Codex 整理结果
人检查结果
变化就在这里。
人从执行者,变成了流程设计者和结果审核者。
对于电商运营、素材分析、选品研究这类工作来说,这个变化很关键。
七、实际过程中会遇到的问题
这个流程不是完全没有问题。
真实跑起来,通常会遇到这些情况:
- 页面结构变化导致元素识别失败
- 图片懒加载导致采集不完整
- 商品图重复
- 图片质量不稳定
- 某些图片不适合提取印花
- imagegen 可能拒绝处理部分图片
- 结果需要人工抽查
所以这类自动化不应该一开始就追求 100% 完美。
更现实的目标是:
先跑通主流程
再补异常处理
再加日志和重试
再做批量化
最后沉淀成稳定工具
八、可以继续扩展的方向
这个案例只是一个很小的入口。
如果后续继续做,可以扩展成更完整的电商素材采集系统。
1. 多关键词批量采集
例如:
女装印花t恤
oversized graphic tee
summer printed t shirt
vintage print tee
每个关键词生成一个独立目录,方便后续对比。
2. 多平台采集
除了 Temu,也可以扩展到其他电商平台。
但不同平台的页面结构、加载方式和规则都不一样,需要单独适配。
3. 图案分类
提取出来的印花可以继续按类型分类。
例如:
- 字母印花
- 卡通图案
- 复古风格
- 花卉图案
- 动物图案
- 街头风格
- 节日主题
4. 趋势分析
如果每天都跑一次,就可以沉淀出一个素材数据库。
后面可以分析:
- 哪些图案重复出现
- 哪些颜色组合变多
- 哪些风格正在增长
- 哪些关键词下的商品变化更快
这时候它就不只是一个采集工具了,而是一个小型选品情报系统。
九、我的一点感受
这次演示之后,老表看完沉默了一下。
然后他说:
这东西就是我想要的,这个能不能每天自动跑?
我一听就知道,他理解了。
因为他已经不再关心「能不能抓图」。
他开始关心「能不能持续运行」。
这就是自动化真正有意思的地方。
只要一个流程能跑通一次,后面自然就会想到定时、批量、分类、分析、报表。
十、结论
这次案例可以总结成一句话:
一句自然语言需求,变成了一条真实可执行的工作流。
Codex 在这个场景里承担的不是单纯问答角色,而是任务执行角色。
它可以操作浏览器,可以整理文件,可以调用 imagegen,可以把原图和结果图按规则保存下来。
对于电商素材采集这类重复性工作来说,这类 AI 自动化已经有很强的实用价值。
当然,它还需要人工审核,也需要处理异常情况。
但方向已经很清楚了。
以后很多工作不会消失,而是会被重新拆分。
人负责定义目标、判断结果、做策略选择。
AI 负责执行那些重复、明确、耗时间的步骤。
这才是这个案例最值得记录的地方。

133

被折叠的 条评论
为什么被折叠?



