文章说明:本文是在学习一个网络爬虫课程时所做笔记,文章如有不对的地方,欢迎指出,积极讨论
针对动态页面抓取的两个思路
1.营造一个浏览器的环境,让它去运行js文件(PhantomJS+Selenium)
2.直接分析接口,通过接口拿到数据 (API)
一、使用Selenium + PhantomJS抓取
(一)PhantomJS:headless的类似于chrome的浏览器
(1)基于webkit的javasscript API。
开源的浏览器引擎
浏览器内核:浏览器最核心的部分‘RederingEngine’,可大概翻译为‘喧嚷引擎’。负责网页语法的解释并渲染网页,决定了浏览器如何显示网页的内容以及页面的信息。不同的浏览器内核对网页编写的语法的解释有所不同。
API:是一些预先定义的函数,目的是提供应用程序与开发人员基于某软件或硬件得以访问一组例程的能力,而又无需访问源码,或理解内部工作机制的细节。 类似于函数,编写一个DLL的时候,里面输出的函数就是这个DLL的例程。
DLL(DynamicLink Library)文件:动态链接库文件。
(2)它使用Qtwebkit作为它的核心浏览器功能,使用webkit来编译解释执行JavaScript代码。任何你可以在基于webkit做的事情,它都能做到。它不仅是一个隐形的浏览器,提供了诸如CSS选择器、支持Web标准、DOM操作、JSON、HTML5、Canvas、SVG等,同时也提供了处理I/O的操作,从而使你可以向操作系统读写文件等。
JSON:(JavaScript Object Notation)JS对

本文介绍了使用Selenium+PhantomJS抓取微博的方法,包括设置user-agent、模拟登录、提取用户列表和feed流。通过分析微博接口,展示了动态网页的抓取思路,如滚动加载、翻页策略。还提到了微博手机端接口的简单性和分析方法。

292

被折叠的 条评论
为什么被折叠?



