基于python实现的vip电影爬虫

该文章已生成可运行项目,

目录:

First and foremost:

电影资源常见解析类型

一.直接解析,另存为保存到本地(简单暴力下载)

小白食用,极度舒适。

二.可直接抓包的电影

比较简单的抓包

三.无加密的m3u8格式电影

第一步,打开右键打开检查,在network(网络)里找到m3u8文件

第二步,通过m3u8文件下载每一个小的ts文件,并完成合并

四.AES加密的的m3u8文件

基于第三种的基础,这里多了一个加密格式

first.我们需要下载每一的目录(m3u8文件)

second.我们需要从目录里提取AES秘钥和每个ts网址(正则)

last.用得到的秘钥解密每一个ts文件,开启多线程下载并合并文件

First and foremost**:**

本文文字叙述只是整理思路,辅助理解,真正的灵魂在代码,一定要认真看代码。

影视资源常见解析类型

适用人群:

1.纯小白,就是想白嫖电影的

2.初学者,emmm。。至少要会个requests和基本语法吧

3.较为高级一点的初学者,os,requests,time,基础re,基础concurrent,基础AES(为什么都是基础?因为我就这水平。。。。)

4.大佬(反正除了123就直接统称为大佬。。。鼠?)

一.直接解析,另存为保存到本地(简单暴力下载)

小白食用,极度舒适。

最简单没有之一的一种获取视频的方法,非常的香,无基础畅享!

解析地址https://jx.iiiv.vip/?url=

此网站实用于腾讯视频,爱奇艺,优酷,B站(非大会员)的解析观影

其中,腾讯视频直接鼠标两次右键另存为下载到本地。(注意格式是mp4,不是html)​

而除了腾讯视频其他的视频平台则不能直接右键下载。另,此网站不能直接抓包。

二.可直接抓包的电影

这个是仅次于**(一)**的简单,打开检查,选中media(媒体),然后解析播放(切记顺序不要乱),就会刷新出文件,双击点开文件,进入视频界面,直接下载。大电影用的比较少,下载也不慢,不妨一试。

呃,比如b站视频不能直接下载嘛不是,直接抓包就完了。

解析地址选用:90偶尔 - QQ群:1265608 (iiiv.vip)(非常好用)

三.无加密的m3u8格式电影

所用到模块:requests,os,time,concurrent(不必须)

最近在看罗小黑战记(时隔七年终于更新了),然鹅,居然只有某站大会员才能看,本着能白嫖绝不三连,呸,花钱,的思想,我找到了一个可以解析某站会员视频的网站:

解析地址挂路灯 (gualudeng.com)

顺便推荐这个很好地网站,里面东西非常多。(我当时用的时候还好好的,时隔半年,它现在要关注微信公众号才能顺利使用了·····,顺便一提,现在大多数资源都要关注公众号,而且理由都是恶意爬虫、恶意盗用接口等等,也不知道真的还是想恰个饭。。。。)

选择OK接口(当时了,现在不行的话随机应变自己找找吧)

此时就可以观看该电影,嗯,用过的应该知道,m3u8格式的视频不在大网站上的话,非常容易卡,十分影响观影体验,于是我们选择下载电影。那么,重点就来了。

对于m3u8格式,简单来说就是将一个大视频(几个小时)切割成上千个小的视频片段,后缀为ts,可以跟正常的MP4一样播放。然后你看视频的时候就一个个片段渲染,更详细的可以直接在CSDN或者百度搜搜,这里不赘述(其实是我也没有深入了解嘿嘿嘿)。

所以我们的思路就是:

**0.**在解析网站中获取m3u8文件(or php)

**1.**把所有的网址提取出来,剔除‘#’开头的没用数据

**2.**遍历获取每一个视频片段

**3.**然后将所有的视频片段合并成一个大的电影文件

**4.**删除下载的每一个视频片段

**#**补充

**5.**编写一个下载ts片段的函数,用于开创线程池,加快速度

**6.**下载过程可能会失败,所以一定要设置最长get时间,并且限定次数防止由于资源问题程序卡死

都是血与泪教训,一步一步探索出来的东西。

第一步,打开右键打开检查,在network(网络)里找到m3u8文件

打开检查,选中XHR,然后解析播放(切记顺序不要乱),就会刷新出许多文件

****

名称多为index.m3u8,没有的话就找后缀为m3u8的文件双击,就会下载到本地一个文档,打开之后就是这个样子的

大概有两千多行吧。。。。

嗯,这个文件能看到许多的https网址,就是每一个视频片段,ts格式的。

第二步,编写python代码

ok,思路清晰了以后,就开始编写代码了。话不多说上代码(也不算长)

#导入模块

import requests

import os

import time

from concurrent.futures import ThreadPoolExecutor

 

start = time.time()

#准备下载路径
m3u8 = \[\]

with open('play.php','r') as file:

    lst = file.readlines()

    for i in lst:

        i = i.strip()

        if i.startswith('#'):

            continue

        else:

            m3u8.append(i)

print(f'目标文件数共{len(m3u8)}个')

#下载一个ts文件的函数

def download\_ts(i):

    for \_ in range(10):

        try:

            with open(f'{i}.ts','wb') as file:

                  resp = requests.get(m3u8\[i\],timeout=15).content

                  file.write(resp)

            print(f'第{i}个ts片段已下载完成!')

            break

        except:

            print(f'第{i}个ts文件下载失败,重新下载!')

            continue

with ThreadPoolExecutor(100) as t:

    for i in range(len(m3u8)):

        t.submit(download\_ts,i)

    t.shutdown()

#补录程序
with ThreadPoolExecutor(50) as f:

    for i in range(len(m3u8)):

        with open(f'{i}.ts','rb+') as file:

            if file.read():

                continue

            else:

                f.submit(download\_ts,i)

    f.shutdown()

print('ts文件下载完毕')

#ts文件的合并

print('ts文件开始合并....')

with open('罗小黑战记.mp4','wb') as file:

    for i in range(len(m3u8)):

        with open(f'{i}.ts','rb') as f:

            f\_view = f.read()

            file.write(f\_view)

print('ts文件合并完毕!')

#ts文件的删除操作

print('开始删除ts文件....')

for i in range(len(m3u8)):

    try:

     os.remove(rf'C:\\Users\\我的电脑\\Desktop\\python学习\\python爬虫项目\\vip电影全解\\罗小黑战记番剧\\{i}.ts')

    except FileNotFoundError:

        continue

print('ts文件删除完毕!')

print('电影完美下载!')

end = time.time()

print('本次下载共耗时长:',end-start,'s')

headers****是反爬,在这里不加也没有影上面的程序开了线程池(ThreadPoolExecutor),所以一部电影三分钟就能下载下来,不开的话就非常的慢,遍历下载得一个多小时才行。

另外,由于网络爬虫可能存在各种错误,所以在downlaod函数和后续删除ts片段中都用try-except捕获异常,并且开了一个线程池做补录,下载第一次未能顺利下载下来的内容。

time模块用来反馈下载电影所用时间,也可以不用。​

在XHR里找m3u8,预览里一般都可以看到上千行的网址,如上图。

四.AES加密的的m3u8文件

所用到的模块:requests,re,AES,os,time,concurrent(非必须)

比较进阶一点的爬虫的(真的就是一点点)

在**(三)**中,我们学会了如何下载m3u8格式的视频,但并非所有的m3u8都是那么的纯洁,有些网站非常的狗,对文件设置了加密(我只见过AES加密的,but据说有其他加密模式反正我没见到),所以这里我们只讨论如何解决有AES加密的视频。

**1.**首先,我们需要判断是否有加密

**2.**其次,既然是加密,我们就需要秘钥(key),获取他

**3.**通过秘钥(key)来解析获取ts文件

**#**其实就是比(二)多了个解密模块嘛

我们这里选取B站会员(最难处理的就它了,傲娇的要死)的罗小黑战记(37-40集),作为范例。

**first.**我们需要下载每一集的目录(m3u8文件)

按照**(三)**中的方法下载就完了。

b站大会员选ok接口 (很显然,现如今如果变动了的话随机应变都是可以解决的)

#导入模块

import requests

import os

from Crypto.Cipher import AES     #AES解密模块

import time

from concurrent.futures import ThreadPoolExecutor

import re

 

start = time.time()

#准备下载路径
headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64'

                        'AppleWebKit/537.36 (KHTML, like Gecko) Chrome/92.0.4515.131 Safari/537.36 Edg/92.0.902.73'}

 

 

def download\_ts(i):

    for \_ in range(10):

        try:

            with open(f'{i}.ts', 'wb') as file:

                response = requests.get(m3u8\[i\], headers=headers, timeout=15).content

                cryptor = AES.new(key, AES.MODE\_CBC, key)

                file.write(cryptor.decrypt(response))

                print(f'第{i}个ts片段已下载完成!')

                break

        except:

            print(f'第{i}个ts文件下载失败,重新下载!')

            continue

for \_ in range(4):

    m3u8=\[\]

    with open(f'index ({\_+7}).m3u8','r+',encoding='utf-8') as file:

        r = file.read()

        obj = re.compile(r'URI="(?P<url>.\*?)"',re.S)

        keyurlx = obj.finditer(r)

        for x in keyurlx:

            keyurl = x.group('url')

        file.seek(0,0)

        lst = file.readlines()

        for i in lst:

            i = i.strip()

            if i.startswith('#'):

                continue

            else:

                m3u8.append(i)

    print(f'目标文件数共{len(m3u8)}个')

    respn = requests.get(keyurl,headers=headers)

    key = respn.text.encode('utf-8')

    with ThreadPoolExecutor(100) as t:

        for i in range(len(m3u8)):

            t.submit(download\_ts,i)

        t.shutdown()

    #补录程序
    with ThreadPoolExecutor(50) as f:

        for i in range(len(m3u8)):

            with open(f'{i}.ts','rb+') as file:

                if file.read():

                    continue

                else:

                    f.submit(download\_ts,i)

        f.shutdown()

    print('ts文件下载完毕')

    #ts文件的合并

    print('ts文件开始合并....')

    with open(f'实验vip电影{\_}.mp4','wb') as file:

        for i in range(len(m3u8)):

            with open(f'{i}.ts','rb') as f:

                f\_view = f.read()

                file.write(f\_view)

    print('ts文件合并完毕!')

    #ts文件的删除操作

    print('开始删除ts文件....')

    for i in range(len(m3u8)):

        try:

            os.remove(rf'C:\\Users\\我的电脑\\Desktop\\python学习\\python爬虫项目\\vip电影全解\\罗小黑战记番剧\\{i}.ts')

        except FileNotFoundError:

            continue

    print('ts文件删除完毕!')

    print('电影完美下载!')

    end = time.time()

    print('本次下载共耗时长:',end-start,'s')

 

#很显然,除了一下下载几集之外,唯一的不同点就是解密,直接套用解密模板就行了。

response = requests.get(m3u8\[i\], headers=headers, timeout=15).content

                cryptor = AES.new(key, AES.MODE\_CBC, key)

                file.write(cryptor.decrypt(response))

就像这样。

由于这个是几集,所以key我们选择从下载的m3u8文件里提取,这里就用到了一点点的re(正则表达式)内容,当然也可以手动提取粘贴到代码里,就是对于好几集的剧来说太麻烦了。不过正则在提取每个ts文件网址的时候还是要用的。emmm除非你跟我一样精,调用字符串startswich函数。。。。

key获取之后一定要编码成utf-8的格式,要不然程序会报错(python这个笨逼他读不懂其他编码格式的数据)

最后:关于Python技术储备
学好 Python 不论是就业还是做副业赚钱都不错,但要学会 Python 还是要有一个学习规划。最后给大家分享一份全套的 Python 学习资料,给那些想学习 Python 的小伙伴们一点帮助!
包括:Python激活码+安装包、Python web开发,Python爬虫,Python数据分析,人工智能、自动化办公等学习教程。带你从零基础系统性的学好Python!

点击领取 100%免费!

Python所有方向的学习路线
Python所有方向路线就是把Python常用的技术点做整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。(全套教程文末领取)
在这里插入图片描述
温馨提示:篇幅有限,已打包文件夹,获取方式在:文末
Python70个实战练手案例&源码
光学理论是没用的,要学会跟着一起敲,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。

在这里插入图片描述

Python副业兼职路线&方法
学好 Python 不论是就业还是做副业赚钱都不错,但要学会兼职接单还是要有一个学习规划。

在这里插入图片描述
在这里插入图片描述

本文章已经生成可运行项目
内容概要:本文系统阐述了企业在搭建官方知识库后如何通过“7步锚定法”实现GEO(生成式引擎优化)的落地,重点在于从知识库走向内容矩阵的战略升级。文章指出知识库仅为起点,真正的核心是让大模型“信任并推荐”企业内容。为此提出“一个主战场+多个品牌布局”的策略,强调需根据行业特性选择高商业流量的大模型(如豆包、文心一言、通义千问等),而非工具性模型(如ChatGPT、Claude)。通过业务场景画像、大模型流量测绘、采信逻辑拆解、内容架构设计、语义关键词埋点、信源建设与效果迭代七步,构建高质量、高可信度的内容体系,并警惕“全模型覆盖、内容堆砌、一套内容通用、忽视第三方平台”四大误区。最终指出GEO本质是一场认知战,比拼的是对大模型逻辑与客户需求的理解深度及长期主义投入。; 适合人群:已完成官方知识库搭建、希望提升AI引用率与获客效率的企业市场负责人、品牌运营、数字营销从业者及SEO/GEO优化相关人员。; 使用场景及目:①指导企业科学选择主攻大模型并制定差异化内容策略;②构建符合大模型采信逻辑的高质量内容矩阵;③避免常见GEO落地误区,提升AI搜索下的品牌曝光与转化效果;④建立可持续优化的数据反馈闭环。; 阅读建议:建议结合自身行业特征与客户决策路径,逐步实践“7步”,优先聚焦单一主战场打透,注重内容质量与第三方权威信源建设,坚持3-6个月持续投入以观察真实效果。
内容概要:本文针对考虑需求响应的微电网优化调度问题,提出了一种基于改进多目灰狼算(GWO)的优化方,并通过Matlab代码实现了完整的仿真验证。研究在传统灰狼算基础上引入改进机制,有效提升了算的收敛速度、全局搜索能力和Pareto前沿分布质量,用于求解包含经济运行成本、碳排放水平、可再生能源利用率等多重目的微电网调度模型。模型充分融合用户侧需求响应机制,利用分时电价等激励手段引导负荷转移与削峰填谷,从而增强系统对光伏、风电等间歇性能源的消纳能力,降低综合运行成本与环境影响。文中系统阐述了多目优化建模过程、算改进策略、约束处理方及仿真结果对比分析,验证了该方在获取高质量非劣解集和辅助决策方面的优越性。; 适合人群:适用于电力系统、能源互联网、自动化控制、智能优化算等相关领域的硕士/博士研究生、科研人员,以及从事微电网能量管理、综合能源系统优化、低碳调度等工作的工程技术人员。; 使用场景及目:①应用于微电网能量管理系统(EMS)中实现多目协同优化调度;②为基于电价激励的需求响应项目提供负荷调控策略与量化分析工具;③作为智能计算算在能源系统优化中应用的教学案例与科研参考,支持进一步拓展至多能互补、多微网互联等复杂场景的研究。; 阅读建议:建议读者结合提供的Matlab代码深入理解算实现细节,重点关注目函数构造、约束条件处理、多目适应度评估及决策者偏好选择机制;可尝试将该框架迁移至含氢能储能、电动汽车集群等新型设备的综合能源系统中进行性能测试与算改进。
内容概要:本文深入分析了洞察时空在2026年世界人工智能大会上提出的“数算一体AI星座”项目,该星座由576颗低轨及超低轨卫星构成,旨在实现“一天一次全球扫描”的高频对地观测能力,为AI Agent提供准化的“地球真值”数据,弥补大模型在物理世界认知中的预测偏差。项目创新性地提出“数算一体”范式,通过天地一体算力协同、星上边缘计算与多模态数据融合,构建以“地球状态变量”为核心的智能认知系统,推动天基基础设施从数据采集向智能服务跃迁。报告系统梳理了当前研究现状,指出现有遥感系统在时效性、一致性与AI适配性上的不足,提出涵盖星座组网、星上AI推理、数据准化等关键技术路径,并剖析了星上算力限制、数据一致性保障、物理可解释性等核心挑战,给出了芯片研发、开放准、跨学科协作等未来发展方向。洞察时空作为主导企业,具备航天与AI复合背景,已获政策与资本支持,计划2030年完成全星座部署。; 适合人群:从事商业航天、人工智能、遥感技术、地球系统科学及相关交叉领域的科研人员、技术研发人员、政策制定者与产业投资者。; 使用场景及目:①理解AI与天基系统融合的前沿趋势与技术架构;②探索“数算一体”在星地协同计算、多模态数据产品准化中的实现路径;③评估高频地球观测数据对AI Agent、气候建模、灾害预警等应用的支撑潜力; 阅读建议:本报告兼具战略高度与技术深度,建议结合商业航天发展动态与AI在科学发现中的应用案例进行延伸阅读,重点关注天地算力调度机制与“地球状态变量”的定义演化,以把握下一代天基智能基础设施的发展方向。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值