【Python学习笔记2】Python网络爬虫的异常处理

本文介绍了Python网络爬虫中使用urllib.request库时可能遇到的URLError和HTTPError异常,包括它们的原因,并提供了测试代码示例进行异常处理。通过捕获这两种异常,可以帮助定位并解决爬虫程序的问题。

本文信息主要来源于韦玮老师的《精通python网络爬虫》,仅作为个人学习笔记。

通过python库函数urllib.request去爬取网页时,遇到的异常主要时URL类和网页类的错误,python已提供URLError类和HTTPError类来处理。

【URLError】可能原因:

1、链接不上服务器;2、远程URL不存在;3、无网络

【HTTPError】可能原因,可通过状态码分类:

状态码解释
200OK,一切正常
301Moved Permently 重定向到新的URL,永久性
302Found 重定向到临时的URL,非永久性
304Not Modified 请求的资源未更新
400Bad Request 非法请求
401Unauthorized  请求未经授权
403Forbidden  禁止访问。 伪装成浏览器是可能的解决办法
404Not Found 没有找到对应页面
500Internal Server Error  服务器内部出现错误
501Not Implemented  服务器不支持实现请求所需的功能

因此在爬虫程序中,最好捕捉这2类异常,方便定位问题。测试代码如下,2个网址可以分别构造URLError和HTTPError

如果不是这2个异常,会自动抛出系统异常的打印。

如果不想处理异常,可以通过pass关键字屏蔽异常。如下代码中最后一个except段,根据实际情况选择。

#!/usr/bin/python3
#-*- coding: utf-8 -*-

import urllib.request
import urllib.error

#访问一个禁止爬虫的网址
try:
    print("开始爬取 网页")
    #urllib.request.urlopen("https://www.ilovemoney.com/")
    urllib.request.urlopen("http://www.douyu.com/Jack_Cui.html")
    print("结束爬取 网页")

except urllib.error.HTTPError as e:
        print("进入HTTPError分支")
        print(e.code)
        print(e.reason)

except urllib.error.URLError as err:
        print("进入URLError分支")
        print(err.reason)

except:
        print("进入默认异常,如果没有这一级的except,自动抛出上一级父类的异常")
        pass

 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值