又一个神级 Agent Skill 诞生了!

AI Agent 刷网页,总是卡在最后一步?

很多人第一次用 AI Agent 做网页自动化时,都会遇到一个很尴尬的问题:看起来很聪明,真正打开网页就开始掉链子。

比如页面刚加载完,突然遇到 Cloudflare;表单填到一半,按钮点不动;登录成功后,跳转页面又丢了会话;跑了几分钟,最后只返回一句“任务失败”。

今天要介绍的这个 GitHub 开源项目 browser-act/skills,就是专门为了解决这些真实网页场景里的自动化难题。

项目地址:https://github.com/browser-act/skills

这个项目是干什么的?

BrowserAct Skills 可以理解成一套给 AI Agent 使用的浏览器技能库。

它的目标不是再造一个聊天机器人,而是让现有的 AI 编程工具、自动化 Agent、工作流系统,真正具备“操作真实网页”的能力。

根据项目介绍,它可以让 AI 完成浏览、点击、输入、截图、数据提取、会话管理等操作,并且重点针对真实网站中常见的反爬、验证码、重定向、登录状态失效等问题做了增强。项目目前在 GitHub 上约有 1.4k Star34 Fork,采用 MIT License,主语言为 Python

两个核心能力:实时操作和技能生成

这个仓库里最核心的能力可以分成两块:browser-act 和 browser-act-skill-forge

browser-act 更像是一个浏览器自动化命令行工具。它可以驱动真实的 Chrome 浏览器,让 AI 像人一样完成导航、点击、输入、截图、提取页面状态等动作。官方示例里提供了 navigatestateclickinputscreenshot 等命令,适合处理一次性的网页操作任务。

而 Skill Forge 则更有意思。它不是只执行一次任务,而是让 AI 先探索某个网站,然后自动生成一个可复用的技能包,包括 SKILL.md 和对应的 Python 脚本。也就是说,同一个网站、同一种数据抓取逻辑,不需要每次都让 Agent 从头摸索。

为什么它适合做网页数据抓取?

传统网页抓取经常依赖固定的 CSS Selector 或接口规则。一旦页面结构变了、登录流程变了、分页逻辑变了,脚本就容易失效。

BrowserAct Skills 的思路是把网页自动化拆成更稳定的“技能”。比如抓取电商商品信息、监控社交媒体、获取本地商家联系方式、提取 YouTube 字幕、追踪新闻热点等,都可以被封装成可复用的任务模块。

项目 README 中提到,它内置了一些可直接使用的场景技能,例如 Amazon ASIN Lookup SkillAmazon Best Selling Products FinderGoogle News API SkillGoogle Maps API SkillYouTube Transcript Extractor 等,覆盖电商、新闻、地图、本地商业信息和视频内容处理等场景。

对开发者来说有什么价值?

对开发者来说,这个项目最大的价值是降低了“让 AI 操作网页”的工程门槛。

以前你可能需要自己写 Playwright、处理浏览器指纹、维护登录状态、设计异常重试、清洗页面 HTML,再把结果喂给大模型。现在 BrowserAct Skills 把其中一部分复杂工作封装成了现成技能。

项目还强调了几个实用特性,比如 Anti-Detection Stealth、真实 Chrome 控制、并发浏览器执行、自动验证码处理、代理与隐私模式,以及减少传给大模型的无效 HTML 内容,从而降低 token 成本、提高执行速度。

可以和哪些 AI 工具配合?

BrowserAct Skills 的定位并不局限于某一个平台。官方说明中提到,它可以配合 Claude CodeCursorVS CodeOpenCodeOpenClawCodexGemini CLI 等工具使用。

安装方式也比较直接,例如使用:

npx skills add browser-act/skills --skill browser-act

如果想使用技能生成能力,则可以安装:

npx skills add browser-act/skills --skill browser-act-skill-forge

适合什么人关注?

如果你只是偶尔让 AI 总结网页内容,这个项目可能不是刚需。

但如果你经常做数据采集、竞品监控、线索挖掘、电商分析、新闻追踪,或者正在尝试把 AI Agent 接入真实业务流程,那么 BrowserAct Skills 就很值得关注。

它解决的不是“AI 会不会写代码”的问题,而是“AI 能不能稳定地在真实网页里完成任务”的问题。

总结

browser-act/skills 的出现,说明 AI Agent 正在从“能聊天、能写代码”,进一步走向“能真正操作工具、执行流程”。

网页世界一直很复杂:验证码、登录态、反爬、重定向、动态加载,都是自动化绕不开的坑。而 BrowserAct Skills 做的事情,就是把这些坑封装成可复用的浏览器技能,让 AI Agent 不再每次都从零开始摸索。

对于想把 AI 用到真实网页自动化场景里的开发者来说,这个项目值得收藏。

最后,更多优质的GitHub开源项目,推荐关注下面公众号

内容概要:本文以DVWA漏洞靶场中的命令注入漏洞为切入点,结合通信行业5G网管系统的实际应用场景,深入剖析了命令注入的攻击原理与防御机制。通过对比低别(Low)存在漏洞的代码与高别(Impossible)安全加固后的代码,详细展示了攻击者如何利用未过滤的用户输入执行恶意系统命令,并进一步提出白名单验证、输入拆分重组、输出编码等关键技术手段实现有效防护。文章强调在通信行业高度依赖自动化运维的背景下,此类漏洞可能导致核心网元被渗透、配置被篡改,因此必须采取代码层与系统层相结合的纵深防御策略。此外,文中还展望了未来在5G MEC、SDN等新技术环境下,零信任架构与AI驱动的安全审计将成为重要发展方向。; 适合人群:具备一定网络安全基础知识,从事通信行业网络运维、安全开发或系统架构工作的技术人员,以及关注Web安全与工业代码防护的研发人员。; 使用场景及目标:①理解命令注入漏洞在通信网管系统中的真实危害与攻击路径;②掌握工业安全编码实践,提升对输入验证、输出编码、权限控制等核心安全机制的应用能力;③为5G网络管理系统安全加固提供可落地的技术参考; 阅读建议:学习时应结合DVWA靶场动手复现文中案例,重点分析漏洞形成条件与防御代码的设计逻辑,并延伸思考如何将“最小权限原则”和“参数化执行”应用于自身业务系统中,强化安全开发意识。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

编程IT圈

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值