# coding=utf-8
# 1.先设置编码,utf-8可支持中英文,如上,一般放在第一行
# 2.注释:包括记录创建时间,创建人,项目名称。
'''
Created on 2019-11-25
@author:
Project: python+ selenium-打开和关闭浏览器
'''
# 3.导入模块
from selenium import webdriver
from selenium.webdriver.firefox.options import Options
# options = Options()
# options.headless = True
class Film:
def __init__(self, name, link):
self.name = name
self.link = link
def parse_news_content(url, index):
print("parse_news_content url is : " + url + " ,index " + str(index))
if url.startswith("http") and index < 10 :
Fi_driver.get(url)
elements = Fi_driver.find_elements('xpath',"//td[@width='250']/a")
# 打印所有元素的标签名
for element in elements:
print("text is : " + element.text)
href = element.get_attribute("href")
print("href is : " + href)
film = Film(element.text, href)
filmList.append(film)
index = index + 1
links = Fi_driver.find_elements('xpath',"//td[@height='30']/a")
for link in links:
print("link text is : " + link.text)
if link.text == "下一页" :
href = link.get_attribute("href")
if href is None:
href = ""
if href is not None :
print("link href is : " + href)
parse_news_content(href, index)
break
options = webdriver.FirefoxOptions()
# options.add_argument('--headless') # 设置为无头
options.binary_location = "C:\\develop\\firefox\\firefox.exe"
options.driver_path= "C:\\develop\\geckodriver\\geckodriver.exe"
Fi_driver = webdriver.Firefox(options= options)
url = "https://www.dygang.tv/ys/"
res = Fi_driver.get(url)
Fi_driver.find_element('xpath','/html/head/title')
print(Fi_driver.title)
# Fi_driver.quit()
filmList = []
parse_news_content(url, 1)
for element in filmList:
print(element.name + " , " + element.link)
Fi_driver.close()
python简单爬虫firefox selenium geckodriver
于 2024-06-30 13:02:09 首次发布

1万+

被折叠的 条评论
为什么被折叠?



