python爬取技术中的ip自动代理实例

作者：mobiledu2502884843 | 来源：互联网 | 2017-05-14 02:44

最近为了考试打算抓取网上的软考试题，在抓取中遇到一些问题，下面这篇文章主要介绍的是利用python爬取软考试题之ip自动代理的相关资料，文中介绍的非常详细，需要的朋友们下面来一起看看吧。

前言

最近有个软件专业等级考试，以下简称软考，为了更好的复习备考，我打算抓取www.rkpass.cn网上的软考试题。

首先讲述一下我爬取软考试题的故（keng）事(shi)。现在我已经能自动抓取某一个模块的所有题目了，如下图：

2、第二种方法是通过设置代理IP等手段，突破反爬虫机制继续高频率抓取。但是这样需要多个稳定的代理IP。

话不多书，直接上代码：

# IP地址取自国内髙匿代理IP网站：www.xicidaili.com/nn/
# 仅仅爬取首页IP地址就足够一般使用
from bs4 import BeautifulSoup
import requests
import random

#获取当前页面上的ip
def get_ip_list(url, headers):
 web_data = requests.get(url, headers=headers)
 soup = BeautifulSoup(web_data.text)
 ips = soup.find_all(&＃39;tr&＃39;)
 ip_list = []
 for i in range(1, len(ips)):
 ip_info = ips[i]
 tds = ip_info.find_all(&＃39;td&＃39;)
 ip_list.append(tds[1].text + &＃39;:&＃39; + tds[2].text)
 return ip_list

#从抓取到的Ip中随机获取一个ip
def get_random_ip(ip_list):
 proxy_list = []
 for ip in ip_list:
 proxy_list.append(&＃39;http://&＃39; + ip)
 proxy_ip = random.choice(proxy_list)
 proxies = {&＃39;http&＃39;: proxy_ip}
 return proxies

#国内高匿代理IP网主地址
url = &＃39;http://www.xicidaili.com/nn/&＃39;
#请求头
headers = {&＃39;User-Agent&＃39;: &＃39;Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.143 Safari/537.36&＃39;}
#计数器，根据计数器来循环抓取所有页面的ip
num = 0
#创建一个数组，将捕捉到的ip存放到数组
ip_array = []
while num <1537:
 num += 1
 ip_list = get_ip_list(url+str(num), headers=headers)
 ip_array.append(ip_list)
for ip in ip_array:
 print(ip)
#创建随机数，随机取到一个ip
# proxies = get_random_ip(ip_list)
# print(proxies)

运行结果截图：

这样，在爬虫请求的时候，把请求ip设置为自动ip，就能有效的躲过反爬虫机制中简单的封锁固定ip这个手段。

-------------------------------------------------------------------------------------------------------------------------------------

为了网站的稳定，爬虫的速度大家还是控制下，毕竟站长也都不容易。本文测试只抓取了17页ip。

总结

以上就是python爬取技术中的ip自动代理实例的详细内容，更多请关注第一PHP社区其它相关文章！

推荐阅读

ip
自己用过的一些比较有用的css3新属性【HTML】

web前端|html教程自己用过的一些比较用的css3新属性web前端-html教程css3刚推出不久，虽然大多数的css3属性在很多流行的浏览器中不支持，但我个人觉得还是要尽量开 ... [详细]

蜡笔小新 2024-12-24 19:26:54
jsp
一个登陆界面

预览截图html部分123456789101112用户登入1314邮箱名称邮箱为空15密码密码为空16登 ... [详细]

蜡笔小新 2024-12-20 09:57:07
jsp
Scrapy：强大的Python爬虫框架

Scrapy是一个基于Python的高效网页爬取框架，利用Twisted异步网络库实现高效的网络通信。其架构设计精巧，包括核心组件如引擎、调度器、下载器等，旨在简化大规模数据抓取过程。 ... [详细]

蜡笔小新 2024-12-16 20:49:07
header
Python爬虫实战：豆瓣电影Top250数据抓取

本文详细介绍了如何使用Python编写爬虫程序，从豆瓣电影Top250页面抓取电影信息。文章涵盖了从基础的网页请求到处理反爬虫机制，再到多页数据抓取的全过程，并提供了完整的代码示例。 ... [详细]

蜡笔小新 2024-12-27 16:55:07
ip
Python学习笔记：使用pydoc工具查询文档

本文介绍了在Windows环境下使用pydoc工具的方法，并详细解释了如何通过命令行和浏览器查看Python内置函数的文档。此外，还提供了关于raw_input和open函数的具体用法和功能说明。 ... [详细]

蜡笔小新 2024-12-26 17:05:56
ip
使用JS、HTML5和C3创建自定义弹出窗口

本文介绍如何结合JavaScript、HTML5和C3.js来实现一个功能丰富的自定义弹出窗口。通过具体的代码示例，详细讲解了实现过程中的关键步骤和技术要点。 ... [详细]

蜡笔小新 2024-12-20 21:22:27
ip
推荐几款高效测量图片像素的工具

本文介绍了几款适用于Web前端开发的工具，这些工具可以帮助用户在图片上绘制线条并精确测量其像素长度。对于需要进行图像处理或设计工作的开发者来说非常实用。 ... [详细]

蜡笔小新 2024-12-20 19:17:07
ip
Python3 中使用 lxml 模块解析 XPath 数据详解

XPath 是一种用于在 XML 文档中查找信息的路径语言，同样适用于 HTML 文件的搜索。本文将详细介绍如何利用 Python 的 lxml 模块通过 XPath 技术高效地解析和抓取网页数据。 ... [详细]

蜡笔小新 2024-12-20 11:23:22
jsp
使用URLConnection进行网页抓取与解析

本文介绍了如何利用Java中的URLConnection类来实现基本的网络爬虫功能，包括向目标网站发送请求、接收HTML响应、解析HTML以提取所需信息，并处理可能存在的递归爬取需求。 ... [详细]

蜡笔小新 2024-12-18 19:40:22
export
探讨HTML中的DIV样式难题

本文深入分析了HTML中常见的DIV样式问题，并提供了有效的解决策略。适合所有对Web前端开发感兴趣的读者。 ... [详细]

蜡笔小新 2024-12-17 15:26:54
c语言
PHP 中 preg_match 函数的 isU 修饰符详解

本文详细解析 PHP 中 preg_match 函数中 isU 修饰符的具体含义及其应用场景，帮助开发者更好地理解和使用正则表达式。 ... [详细]

蜡笔小新 2024-12-17 13:35:59
jsp
Linux 系统启动故障排除指南：MBR 和 GRUB 问题

本文详细介绍了 Linux 系统启动过程中常见的 MBR 扇区和 GRUB 引导程序故障及其解决方案，涵盖从备份、模拟故障到恢复的具体步骤。 ... [详细]

蜡笔小新 2024-12-27 20:40:29
jsp
通过类型和标签选择元素

本文介绍了如何使用jQuery根据元素的类型（如复选框）和标签名（如段落）来获取DOM对象。这有助于更高效地操作网页中的特定元素。 ... [详细]

蜡笔小新 2024-12-27 19:44:14
jsp
JSON 解析失败问题排查

在PHP后端开发中遇到一个难题：通过第三方类文件发送短信功能返回的JSON字符串无法解析。本文将探讨可能的原因并提供解决方案。 ... [详细]

蜡笔小新 2024-12-21 18:39:23
jsp
前端开发中的代码注释实践与规范

本文探讨了前端开发过程中代码注释的重要性，不仅有助于个人清晰地回顾自己的编程思路，还能促进团队成员之间的有效沟通。文章将详细介绍HTML、CSS及JavaScript中的注释使用方法，并提出一套实用的注释规范。 ... [详细]

蜡笔小新 2024-12-17 10:55:06

mobiledu2502884843

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章