使用python爬取数据实测记录

开发者福利!热门AI工具限时免费用 购周边即赠Coding Plan Lite,Claude Code、Cursor等20+工具畅享,效率翻倍! 阅读详情

看了几天的小甲鱼视频学python基础,居然说要用scrapy才能做成目前想爬的...

换了个详细的scrapy视频教程看点击打开链接

1、爬取网页url数据返回301、302报错

class ModianSpider(scrapy.Spider):
    name = 'modian'
    allowed_domains = ['modian.com']
    start_urls = ['https://zhongchou.modian.com/search?key=%E9%BB%84%E5%A9%B7%E5%A9%B7']

    def parse(self, response):
        hrefs = response.xpath('//div[@class="myproject clearfix"]/ul/li/a/@href').extract()
        for href in hrefs:
            yield scrapy.Request(href, meta={'href': href}, callback=self.parse_pro_page)

    def parse_pro_page(self, response):
        item = ModianItem()

        item['id'] = response.xpath('//div/@data-pro_id').extract()
        item['title'] = response.xpath('//h3[@class="title"]/span/text()').extract()
        item['href'] = response.meta['href']

测试打印url,301/302报错部分提示get地址由https://zhongchou.modian.com/item/12355.html变成 https://m.modian.com/item/12355.html;

排查发现,settings中写的USER_AGENT_LIST(用于随机User-Agent)中加入了手机代理,导致抓取出的url形式变化。修改之后测试打印url和title均正常无报错。

2、爬取js动态数据

部分数据在浏览器“审查元素”中可以找到,“查看源代码”中无法获取,查询后了解这是动态数据。

查看动态数据方法:打开浏览器右键“审查元素”,切换到Network,选中HXR。刷新页面后,HXR中获取新链接。最终在某个链接的Preview/Response里找到目标数据——摩点某项目的集资金额。

找到目标数据后开始想办法抓取。

网上说用selenium模拟操作,会占用cpu之类的不推荐。那就直接用新的链接抓,链接地址通过Headers里查看:

多开几个项目比对一下,观察url样式大致是:

https://zhongchou.modian.com/realtime/get_simple_product?jsonpcallback=jQuery数字_数字&ids=数字&if_all=1&_=数字

其中,ids=数字,这里的数字值正好是之前抓到的项目id。尝试使用正则表达式抓取这个url。这里网上有说应该用python发送GET还是POST请求,没看懂,看到Request Method是GET,就用了requests.get

        get_data = {
            'jsonpcallback': 'jQuery\d+_\d+',
            'ids': item['id'],
            'if_all': '1',
            '_': '\d+'
        }
        return_data = requests.get("https://zhongchou.modian.com/realtime/get_simple_product", params=get_data)

        print(return_data.text)

打印结果确实把Response内的所有内容(包含目标数据)爬取到了,接下来要从中继续提取目标数据了。

 

使用python 通过接口爬取图书网站数据 为小白介绍,如何利用接口进行爬虫,简单案例 阅读详情

相关推荐

Python 爬虫实战,模拟登陆爬取数据

Python 爬虫实战,模拟登陆爬去数据 从0记录爬取某网站上的资源连接: 模拟登陆 爬取数据 保存到本地 结果演示: 源网站展示: 爬到的本地文件展示: 环境准备: python环境安装 略 安装requests库 使用以下命令安装requests库 #(如果使用的是anaconda 下虚拟环境里的python 请在虚拟环境里执行下边命令) pip install requests 安装bs4库 使用以下命令安装requests库 #(如果使用的是anaconda 下虚拟环境里的pyth

xianfishY的博客 9743

爬取异步请求(XHR/JS)数据方法

概述 之前在做爬虫的时候,比如在爬取到https://www.1688.com/?spm=a261p.8650866.0.0.2dfa36c3tjLrCQ网页的时候,发现很多内容明明在浏览器看得见,但是请求下来的内容却没有,于是打开F12查看Network发现,如下: 从这里我们就可以清楚的在xhr返回的header里面看到异步请求的url,这里我们直接访问该url(或者在preview里面可以看到返回的数据)可以看到返回的数据就是需要数据,也就是我们要爬的数据。接下来就是进行url格式分析,一般都会有

https://github.com/conanl5566 2181

python爬取微信聊天记录数据_[使用案例]python如何爬取微信好友信息?(上)

Python3如何爬取微信好友基本信息,并且进行数据清洗?下面跟着IP海带来的教程,我们一起看看具体的操作要怎么实现。1、登录获取好友基础信息:好友的获取方法为get_friends,将会返回完整的好友列表。其中每个好友为一个字典列表的第一项为本人的账号信息传入update键为True将可以更新好友列表并返回'''微信:Date:20180918Author:lizmDescription:爬取微...

weixin_39765625的博客 1万+

python抓取一个网页的xhr,python爬取网站数据代码

使用Python进行网页抓取时还有一些更高级功能的选项,这些将在最后概述,并提供一些使用上的建议。如果您选择了一个简单的目标,在大多数情况下,数据将以与上述示例类似的方式嵌套。由于从同一个类中获取数据只是意味着一个额外的列表,我们应该尝试从不同的类中提取数据,但同时保持我们表的结构。在之前的文章中我们介绍了怎么用C#和JAVA两种方法来抓取网页,这一期给大家介绍一种更容易,也是使用最广泛的一种抓取方法,那就是。我们的第二次搜索查找文档中的所有标签(被包括在内,而像这样的部分匹配则不被包括在内)。

yyyqqq_的博客 1477

【爬虫】爬取动态网页内容并储存到表格

爬虫的第一步就是要获取网站的请求url,在这里我们是在第一页,然后点击下一页跳转到第二页之后发现,网页左上角的网址是没有变的。既然这是个动态网页那我们想要的数据肯定不是在网页源代码里的了,所以我们直接右击检查打开开发者工具,然后点击网络,选择Fetch/XHR,刷新网页,查看左边的网页。在我们点进第二页后发现已经刷新出了一些新的数据,我们依次点击,然后查看预览发现第一个就是我们想要的数据,而且很明显可以看出我们想要的数据json数据。"后面的都是参数,接下来我们看一下参数情况,点击负载。

qq_55755280的博客 1495

Python 学习 02 —— Python如何爬取数据

文章目录系列文章二、Python爬虫1、任务介绍2、爬虫简介3、基本流程3.1、准备工作3.1.1、分析页面3.1.2、编码规范3.1.3、导入模块3.1.4、程序流程3.2、获取数据3.3、解析数据3.4、保存数据3.4.1、Excel表存储3.4.1、SQLite数据库保存 系列文章 Python 学习 01 —— Python基础 Python 库学习 —— urllib 学习 Python 库学习 —— BeautifulSoup4学习 Python 库学习 —— Re 正则表达式 Python

zcy的博客 1万+

Python爬虫超详细讲解(零基础入门,老年人都看的懂)!

注重版权,转载请注明原作者和原文链接 作者:码农BookSea 原文链接:https://blog.csdn.net/bookssea/article/details/107309591 先看后赞,养成习惯。 点赞收藏,人生辉煌。 讲解我们的爬虫之前,先概述关于爬虫的简单概念(毕竟是零基础教程) 爬虫 网络爬虫(又被称为网页蜘蛛,网络机器人)就是模拟浏览器发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序。 原则上,只要是浏览器(客户端)能做的事情,爬虫都能够做。

爬遍所有网站 3万+

Python爬虫】爬取猫眼电影票房

题记 本文旨在记录爬取猫眼电影国内票房榜单的过程,以及对脚本内字体文件反爬函数的说明。 环境 系统: Windows 10 Python版本: Python 3.7 爬取时间: 2019.3.19 难点说明 爬取猫眼电影的过程中,发现在票房数据出现了乱码,经百度搜索相关信息,阅读多篇文章,才知道爬虫的博大精深。 下载一个基本字体路径,找到它对应的数字及其编码 每一次爬取网页时,都要先下载该网页...

shenghaomail的专栏 7745

使用Python爬虫爬取淘宝商品并分析

使用Python分析数据1.数据获取和保存2.数据清洗和处理3.分析数据,并且使用tableau实现数据可视化 1.数据获取和保存 由于近年来淘宝的反爬措施逐渐完善,爬取难度变大,在爬取时必须要登录之后才能查看相关的商品信息,淘宝数据是通过动态加载的方式显示的,所以本文使用selenium模拟浏览器操作爬取商品页详情信息。 需要提取安装和selenuim和浏览器驱动chromedriver,由于chorme浏览器的自动更新,所以导致我的chrome浏览器版本和chromedriver版本不一致

weixin_44804615的博客 2万+

Python爬虫--爬取历史天气数据

写在前面:爬虫是老鼠屎在进入实验室后接触的第一个任务,当时刚刚接触代码的老鼠屎一下子迎来了地狱难度的爬微博签到数据。爬了一个多月毫无成果,所幸带我的师兄从未给我疾言厉色,他给与了我最大的包容与理解。尽管无功而返,但是那一个月也给了老鼠屎充足的学习时间,让老鼠屎对爬虫有了一点点的理解和执念。今天老鼠屎由于项目原因又需要爬天气数据,所以在这里把老鼠屎的一点经验写在这里,希望能给向曾经的我一样迷...

翻滚的老鼠屎 1万+

使用Python爬取招聘数据数据处理与可视化

通过爬取“51job”获取招聘信息(以计算机软件为例),根据所获取数据分析领域相关工作职位需求,并通过可视化的方式展示分析行业就业情况(例如平均月薪、工作地点等)。

盼小辉丶的博客 4万+

使用Python爬取分析政府采购网数据

       好久没写博客了,一直觉得之前写的都没啥技术性,这次分享个最近觉得很值得记录的一次操作吧~。         Leader临时分配给我个任务,要我爬取下政府采购网近一个月公开招标中二三甲医院的数据,这一下可把我难住了,要求还要用Python。        自己一直干的是Java开发,学校

叉叉不低头 1万+

b站直播消费记录爬取

基于python的Appium进行b站直播消费记录爬取 前情提要 因工作需要,需要爬取相关数据,之前是爬取网页数据,可以用python的requests和Selenium进行爬取。但b站的直播消费数据网页版不能显示,只能在手机上看到,所以就有了这篇文章。 之前看文章说fiddler也可以进行爬取,但尝试了一下没成功,这次选择appium进行爬取。类似的,可以运用爬取微信朋友圈和抖音等手机app相关数据 正文 #环境配置参考 前期工作准备,需要安装python、jdk、PyCharm、Appium-windo

mister1的博客 4012

数据集】Python爬取某国内所有航班记录

使用python通过时间爬取国内当天的航班数据,并处理爬取数据预处理到到excel中

m0_56233309的博客 7004

python爬取猫眼电影数据

每天一点点,记录学习每一步 python爬取猫眼电影top100榜数据 目标url = 猫眼电影top100榜网址 1:确定抓取的数据字段:排名,海报,电影名字,主演,上映时间,评分; 2:分析页面html标签结构,找到数据所在位置; 1:)排名所在html标签结构中的位置: index = html.xpath('//dd/i/text()') 2:)海报所在html标签结构中的位置: ...

YmeBtc的博客 3618

Python爬虫】爬取公共交通路网数据

程序来自于Github,以下这篇博客作为完整的学习记录,也callback上一篇爬取公共交通站点的博文。Bardbo/get_bus_lines_and_stations_data_from_gaode: 这个项目是基于高德开放平台和公交网获取公交线路及站点数据,并生成shp文件,代码相对粗糙,但简单可用。

HenryAnChen的博客 4323

利用Python爬取爬取APP上面的数据

​ 前言 在我们在爬取手机APP上面的数据的时候,都会借助Fidder来爬取。今天就教大家如何爬取手机APP上面的数据。 环境配置 1、Fidder的安装和配置 下载Fidder软件地址:https://www.telerik.com/download/fiddler 然后就是傻瓜式的安装,安装步骤很简单。在安装完成后,打开软件,进行如下设置: 默认的8888端口 为解决初学者学习上的困难,专门建立的Python学习扣QUN:⑧⑤⑤-④零⑧-⑧⑨③从零基础开始到Python各领域的项目实战教程、开发工具与.

python入门学习进阶教程 2824

使用python爬取网站数据并写入到excel中

提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档 文章目录前言一、使用python爬取网上数据并写入到excel中例子一:例子二:二、工具类总结 前言 记录一下使用python将网页上的数据写入到excel中 一、使用python爬取网上数据并写入到excel中 要爬取数据的网站: 例子一: https://ip.cn/yinhang.html (该网页有5个网页数据) 更多工具中查看页面源代码: 找到想要数据的位置 代码中: 例子二: 要爬取数据的网站: https://ww

m0_48325361的博客 2万+

python爬取微信小程序数据,python爬取小程序数据

最近需要获取微信小程序上的数据进行分析处理,第一时间想到的方式就是采用python爬虫爬取数据,尝试后发现诸多问题,比如无法获取目标网址、解析网址中存在指定参数的不确定性、加密问题等等,经过一番尝试,终于使用 Charles 抓取到指定微信小程序中的数据,本文进行记录并总结。电脑:Windows10,连接有线网手机:iPhone Xr,连接无线网注:有线网与无线网最好位于同一网段下学python什么书比较好python用海龟库画笑脸。

2401_86114424的博客 1974
下一篇: R语言教材资源共享
hxmon
博客等级 码龄16年 0粉丝 10原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值