package creeper.part1.capturepage;
import java.io.IOException;
import org.apache.http.HttpEntity;
import org.apache.http.HttpResponse;
import org.apache.http.client.ClientProtocolException;
import org.apache.http.client.ResponseHandler;
import org.apache.http.client.methods.HttpGet;
import org.apache.http.impl.client.CloseableHttpClient;
import org.apache.http.impl.client.HttpClients;
import org.apache.http.util.EntityUtils;
//爬虫技术(1)--抓取网页
@SuppressWarnings("unused")
public class capturePage {
public static void main(String[] args) throws Exception {
//声明一个HttpClient客户端,相当于打开一个浏览器(4.3以后都是CloseableHttpClient以前的已经过时)
CloseableHttpClient httpClient=HttpClients.createDefault();
//创建代理,省略...
try {
//get方法,相当于打开了一个网页
String url="http://www.baidu.com";
HttpGet get=new HttpGet(url);
System.out.println("---------URI----------");
System.out.println(get.getURI());
//创建响应处理器处理响应内容
ResponseHandler<String> handler=new ResponseHandler<String>(){
@Override
public String handleResponse(HttpResponse response)
throws ClientProtocolException, IOException {
int status=response.getStatusLine().getStatusCode();//获取响应状态码
//对状态码进行判断处理
if(status>=200 && status<300 ){
HttpEntity entity=response.getEntity();//获取响应的数据
return entity==null?null:EntityUtils.toString(entity);
}else{
throw new ClientProtocolException("status:"+status);
}
}
};
//发送请求,相当于敲个回车
String responseBody=httpClient.execute(get, handler);
System.out.println("----------------responseBody-----------------");
System.out.println(responseBody);
System.out.println("----------------responseBody-----------------");
} catch (Exception e) {
}finally{
httpClient.close();
}
}
}
相关推荐
爬虫实战:一个简易 Java 爬虫程序的实现
完整的 Java 爬虫实现
Java 实例 - 网页抓取
3. **选择链接**:使用 `doc.select("a[href]")` 选择所有带有 `href` 属性的 `` 标签。1. **连接到网页**:使用 `Jsoup.connect(url).get()` 方法获取网页的 `Document` 对象。4. **打印链接**:遍历 `Elements` 对象,打印每个链接的 URL 和文本。- 确保遵循网站的 **robots.txt** 文件和使用条款,合法抓取网页内容。2. **获取标题**:使用 `doc.title()` 获取网页的标题。
教你如何使用Java代码从网页中爬取数据到数据库中——网络爬虫精华篇
文章目录1:网络爬虫介绍2:HttpClients类介绍2.1 HttpGet参数问题2.2 HttpPost参数问题2.3 连接池技术问题3:Jsoup介绍4:动手实践如何抓取网页上数据并保存到自己数据库中 有一句话说的好,只要精神不滑坡,办法总比困难多——阿俊(这句话可以形容我这三天学习知识的态度) 就在前天,我的一个项目进入到了省赛,想下定决心把自己的一部分未完成的功能完善起来(想爬取网页上的各种数据到自己的所对应的页面上显示),这个问题在我脑子里回旋许久,于是打开电脑就在网上查阅各种资料,而我第一次
Java程序获取网页源代码
import java.io.BufferedOutputStream; import java.io.BufferedReader; import java.io.BufferedWriter; import java.io.FileNotFoundException; import java.io.FileOutputStream; import java.io.IOException; im
java 爬虫基本代码
1、httpclient4.3.4 读取网页内容 特别说明:StreamUtils 只是做了简单的关闭流操作,这个类可有自己写,或者直接调用流关闭操作 谢谢 package com.haokuaisheng.https; import java.io.ByteArrayOutputStream; import java.io.InputStream; import java.util.
JAVA简单小爬虫 & 《JAVA2核心技术卷1:基本知识(原书第7版)》源代码
简单爬虫 这段代码源自《JAVA2核心技术卷1:基本知识(原书第7版)》例12-10: import java.io.*; import java.net.*; import java.util.regex.*; public class HrefMatch { public } ...
Java实现网络爬虫-Java入门|Java基础课程
目标 网络爬虫的是做什么的? 手动写一个简单的网络爬虫; 1. 网络爬虫 1.1. 名称 网络爬虫(又被称为网页蜘蛛,网络机器人),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚 本。 另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。 1.2. 简述 网络爬虫是通过网页的链接地址来寻找网页,从网站某一个页面(通常是首页)开始,读取网页的内容,找到 在网页中的其它...
网络爬虫之Selenium(可视化)爬虫
前言:今天跟大家分享pathoy之爬虫,pathoy之爬虫技术的用处范围非常广泛以及非常强大的一门技术。在介绍爬虫之前,可以先跟大家讲讲pathoy这一门技术。 一、Pathoy的简介 二、pathoy之爬虫介绍 三、爬虫具体案例: ...
Java网络爬虫
网络(Web crawler),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本创建Maven工程itcast-crawler-first并给pom.加入依赖加入log4j.properties网络爬虫就是用程序帮助我们访问网络上的资源,我们一直以来都是使用HTTP协议访问互联网的网页,网络爬虫需要编写程序,在这里使用同样的HTTP协议访问网页。这里我们使用Java的HTTP协议客户端 HttpClient这个技术,来实现抓取网页数据。
Java--实现网络爬虫抓取RSS新闻(1)网络爬虫详解
网络爬虫定义 网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。 可以更形象的理解:网络相当于一个巨大的蜘蛛网,每个蜘蛛丝的交叉点就是一个资源(URI),爬虫这张巨大的网上爬取需要的资源后,通过一定的机制和容器进行存储。 网络爬虫原理 网络爬虫的基本原理可以用一张经典的图概括:
Java网络爬虫:网页数据抓取与处理指南
网络爬虫是一种自动化提取网页数据的脚本程序,它模仿人类用户对网页的浏览行为,通过HTTP协议请求网页,然后解析和提取网页中的信息。爬虫广泛应用于搜索引擎、数据挖掘、监控分析等领域。在技术层面,网络爬虫主要关注如何高效、稳定地从网站获取数据,并将获取的数据用于各种分析和处理。Apache HttpClient是一个功能丰富的HTTP客户端库,它支持HTTP协议的所有版本和各种HTTP特性,如连接管理、重定向处理、自动压缩、代理支持、SSL/TLS连接等。
Java网络爬虫技术大全:从基础到实战
本文还有配套的精品资源,点击获取 简介:网络爬虫是自动化网页信息抓取工具,本套资料专注于Java语言实现的网络爬虫技术,详细介绍了网络爬虫的基础概念、Java爬虫框架、网络请求与响应、网页解析、分布式爬虫、反爬与应对策略、数据存储与处理以及实战项目。资料旨在帮助用户掌握Java进行高效、稳定的网页抓取,并提供实战项目,是提升技能的宝贵资源。 1. 网络爬虫基础概念...
Java网络爬虫实战:从网页抓取到数据解析
爬虫,又称网络蜘蛛或网络机器人,是一种自动抓取网页信息的程序或脚本。它广泛应用于搜索引擎、数据分析、市场监测和信息采集等领域。通过编写爬虫程序,可以高效地收集互联网上大量的数据,为用户提供价值或为机器学习等高级应用提供丰富的训练样本。通过本章节的介绍,我们了解了网页抓取的原理,包括HTTP协议的基础知识和爬虫的工作机制。另外,我们还探讨了进行网页抓取前的准备工作,这包括目标网站分析和选择合适的爬虫框架。在下一章节中,我们将深入探讨数据解析方法,并对DOM和XPath解析技术进行实际应用上的分析。
网络爬虫使用教程
网络爬虫 网络爬虫(Web crawler),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。 爬虫入门小程序 环境搭建 JDK1.8 IntelliJ IDEA IDEA自带的Maven (1)创建Maven工程itcast-crawler-first并给pom.xml加入依赖 <dependencies> <!-- HttpClient --> ...
Java爬虫技术的原理:详细剖析网页数据抓取过程
Java爬虫技术是一种强大的工具,可以帮助我们自动化地抓取网页数据,并为我们的业务提供更多的数据资源。通过深入了解Java爬虫技术的实现原理,并运用具体的代码示例,我们可以更好地利用爬虫技术来完成一系列的数据处理任务。本文将深入解析Java爬虫技术的实现原理,并提供具体的代码示例。爬虫技术(Web Crawling)又称为网络蜘蛛、网络机器人,是模拟人的行为,自动地浏览互联网并抓取信息的一种技术。通过爬虫技术,我们可以自动化地抓取网页上的数据,并进行进一步的分析和处理。二、Java爬虫技术的实现原理。
Java-网络爬虫(一)
在大数据时代,信息采集是一项重要的工作,而互联网中的数据是海量的,如果单纯靠人力进行信息获取,不仅低效繁琐,而且搜集的成本也会提高,如何自动高效地获取互联网中的数据是一个重要的问题,而爬虫技术就是针对这些问题而生的。网络爬虫(Web crawler)又称为网络蜘蛛或网络机器人,是一种自动化程序,用于在互联网上浏览和抓取信息,是互联网时代一项普遍运用的网络信息搜集技术。该项技术最早应用于搜索引擎领域,是搜索引擎获取数据来源的支撑性技术之一。
java jsoup 网络爬虫 学习例子(四)抓取网页连接插入mysql数据库
java jsoup 网络爬虫 学习例子(四) 抓取网页连接插入mysql数据库 package com.iteye.injavawetrust.jsoup; import java.io.IOException; import java.util.Iterator; import org.jsoup.Jsoup; import org.jsoup.nodes.Document; i...
通过网络爬虫采集大数据
网络数据采集是指通过网络爬虫或网站公开 API 等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。 在互联网时代,网络爬虫主要是为搜索引擎提供最全面和最新的数据。 在大数据时代,网络爬虫更是从互联网上采集数据的有利工具。目前已经知道的各种网络爬虫工具已经有上...
Java实现网络爬虫:HttpClient抓取https协议页面
Java实现网络爬虫 HttpClient: 爬虫介绍, 爬虫的抓取环节, 使用HttpClient发送get请求, 使用HttpClient发送post请求, HttpClient连接池, HttpClient抓取https协议页面。
1万+




被折叠的 条评论
为什么被折叠?



