热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

【Java】基于jsoup爬虫实现(从智联获取工作信息)

这几天在学习Java解析xml,突然想到Dom能不能解析html,结果试了半天行不通,然后就去查了一些资料,发现很多人都在用

这几天在学习Java解析xml,突然想到Dom能不能解析html,结果试了半天行不通,然后就去查了一些资料,发现很多人都在用Jsoup解析html文件,然后研究了一下,写了一个简单的实例,感觉还有很多地方需要润色,在这里分享一下我的实例,欢迎交流指教!后续想通过Java把数据导入到Excel或者生成一个报表!

import java.io.IOException;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;/**从智联招聘获取招聘信息* &#64;url 智联招聘网站链接&#xff08;建议不要更改&#xff09;* &#64;city 搜索工作的城市* &#64;keywrods 搜索工作的相关关键字*/public class JsoupHtml {private String url&#61;"http://sou.zhaopin.com/jobs/searchresult.ashx?jl&#61;"; //智联招聘网站private String city&#61;"西安"; //搜索工作的城市private String keywords&#61;"java"; //搜索工作的关键字public JsoupHtml(String city,String keywords){ this.city&#61;city;this.keywords &#61;keywords;}public void getZhiLianWork(){try {for (int i&#61;0;i<10;i&#43;&#43;) {System.out.println("*********开始遍历第"&#43;(i&#43;1)&#43;"页的求职信息*********");Document doc &#61; Jsoup.connect(url&#43;city&#43;"&kw&#61;"&#43;keywords&#43;"&p&#61;"&#43;(i&#43;1)&#43;"&isadv&#61;0").get(); Element content &#61; doc.getElementById("newlist_list_content_table"); Elements zwmcEls &#61; content.getElementsByClass("zwmc");Elements gsmcEls &#61; content.getElementsByClass("gsmc"); Elements zwyxEls &#61; content.getElementsByClass("zwyx"); Elements gzddEls &#61; content.getElementsByClass("gzdd"); Elements gxsjEls &#61; content.getElementsByClass("gxsj");for(int j &#61; 0;j

更新源代码&#xff0c;支持生成html表格&#xff1a;

import java.io.BufferedWriter;
import java.io.File;
import java.io.FileOutputStream;
import java.io.IOException;
import java.io.OutputStreamWriter;import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;public class JsoupHtml {public static void main(String[] args) { try {String url &#61;"http://sou.zhaopin.com/jobs/searchresult.ashx?";String city &#61;"西安";String keywords &#61; "java";BufferedWriter bWriter &#61; new BufferedWriter(new OutputStreamWriter(new FileOutputStream("output.html"),"utf-8"));bWriter.write("");File input &#61; new File("input.html");Document doc2 &#61; Jsoup.parse(input, "UTF-8", "");Element table &#61; doc2.getElementById("workinfo");table.text("");Element theader &#61; table.appendElement("tr");theader.appendElement("th").text("序号");theader.appendElement("th").text("职位名称");theader.appendElement("th").text("公司名称");theader.appendElement("th").text("职位月薪");theader.appendElement("th").text("工作地点");theader.appendElement("th").text("发布日期"); for(int page&#61;0;page<10;page&#43;&#43;){ Document doc &#61; Jsoup.connect(url&#43;city&#43;"&kw&#61;"&#43;keywords&#43;"&p&#61;"&#43;page).get(); Element content &#61; doc.getElementById("newlist_list_content_table"); Elements zwmcEls &#61; content.getElementsByClass("zwmc");Elements gsmcEls &#61; content.getElementsByClass("gsmc"); Elements zwyxEls &#61; content.getElementsByClass("zwyx"); Elements gzddEls &#61; content.getElementsByClass("gzdd"); Elements gxsjEls &#61; content.getElementsByClass("gxsj");for(int i &#61; 1;i

output.html模板&#xff1a;


智联工作信息
版权所有 翻版必究&#64;2018 Joker

 


推荐阅读
  • 本文详细解析了Python中的os和sys模块,介绍了它们的功能、常用方法及其在实际编程中的应用。 ... [详细]
  • 本文详细介绍了Java中org.neo4j.helpers.collection.Iterators.single()方法的功能、使用场景及代码示例,帮助开发者更好地理解和应用该方法。 ... [详细]
  • 优化ListView性能
    本文深入探讨了如何通过多种技术手段优化ListView的性能,包括视图复用、ViewHolder模式、分批加载数据、图片优化及内存管理等。这些方法能够显著提升应用的响应速度和用户体验。 ... [详细]
  • 技术分享:从动态网站提取站点密钥的解决方案
    本文探讨了如何从动态网站中提取站点密钥,特别是针对验证码(reCAPTCHA)的处理方法。通过结合Selenium和requests库,提供了详细的代码示例和优化建议。 ... [详细]
  • 1:有如下一段程序:packagea.b.c;publicclassTest{privatestaticinti0;publicintgetNext(){return ... [详细]
  • 本文介绍了Java并发库中的阻塞队列(BlockingQueue)及其典型应用场景。通过具体实例,展示了如何利用LinkedBlockingQueue实现线程间高效、安全的数据传递,并结合线程池和原子类优化性能。 ... [详细]
  • 1.如何在运行状态查看源代码?查看函数的源代码,我们通常会使用IDE来完成。比如在PyCharm中,你可以Ctrl+鼠标点击进入函数的源代码。那如果没有IDE呢?当我们想使用一个函 ... [详细]
  • 主要用了2个类来实现的,话不多说,直接看运行结果,然后在奉上源代码1.Index.javaimportjava.awt.Color;im ... [详细]
  • 本文详细介绍了Akka中的BackoffSupervisor机制,探讨其在处理持久化失败和Actor重启时的应用。通过具体示例,展示了如何配置和使用BackoffSupervisor以实现更细粒度的异常处理。 ... [详细]
  • 本文详细介绍了Java编程语言中的核心概念和常见面试问题,包括集合类、数据结构、线程处理、Java虚拟机(JVM)、HTTP协议以及Git操作等方面的内容。通过深入分析每个主题,帮助读者更好地理解Java的关键特性和最佳实践。 ... [详细]
  • Python自动化处理:从Word文档提取内容并生成带水印的PDF
    本文介绍如何利用Python实现从特定网站下载Word文档,去除水印并添加自定义水印,最终将文档转换为PDF格式。该方法适用于批量处理和自动化需求。 ... [详细]
  • 将Web服务部署到Tomcat
    本文介绍了如何在JDeveloper 12c中创建一个Java项目,并将其打包为Web服务,然后部署到Tomcat服务器。内容涵盖从项目创建、编写Web服务代码、配置相关XML文件到最终的本地部署和验证。 ... [详细]
  • XNA 3.0 游戏编程:从 XML 文件加载数据
    本文介绍如何在 XNA 3.0 游戏项目中从 XML 文件加载数据。我们将探讨如何将 XML 数据序列化为二进制文件,并通过内容管道加载到游戏中。此外,还会涉及自定义类型读取器和写入器的实现。 ... [详细]
  • RecyclerView初步学习(一)
    RecyclerView初步学习(一)ReCyclerView提供了一种插件式的编程模式,除了提供ViewHolder缓存模式,还可以自定义动画,分割符,布局样式,相比于传统的ListVi ... [详细]
  • 掌握远程执行Linux脚本和命令的技巧
    本文将详细介绍如何利用Python的Paramiko库实现远程执行Linux脚本和命令,帮助读者快速掌握这一实用技能。通过具体的示例和详尽的解释,让初学者也能轻松上手。 ... [详细]
author-avatar
mobiledu2502886187
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有