python实现三种随机请求头方式_python

作者：LISA_W186 | 来源：互联网 | 2023-08-22 13:19

这篇文章主要介绍了python实现三种随机请求头方式，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着

相信大家在爬虫中都设置过请求头 user-agent 这个参数吧？在请求的时候，加入这个参数，就可以一定程度的伪装成浏览器，就不会被服务器直接识别为spider.demo.code ，据我了解的，我很多读者每次都是直接从network 中去复制 user-agent 然后把他粘贴到代码中，这样获取的user-agent 没有错，可以用，但是如果网站反爬措施强一点，用固定的请求头可能就有点问题，所以我们就需要设置一个随机请求头，在这里，我分享一下我自己一般用的三种设置随机请求头方式

思路介绍:

其实要达到随机的效果，很大程度上我们可以利用随机函数库random 这个来实现，可以调用random.choice([user-agent]) 随机pick数组中一个就可以了，这是我的一种方式。

python作为一个拥有众多第三方包的语言，自然就有可以生成随机请求头的包咯，没错，就是fake-useragent 这个第三方库了，稍后我们介绍一下这个函数库的简单使用。

既然别人可以写第三方库，自然自己也可以实现一个这样的功能，大部分情况下，我很多代码都是直接调用我自己实现的一个GetUserAgentCS 类，直接就可以获取一个随机请求头了，直接写函数库，才牛逼舒服，这个我也会在下面介绍如何编写函数库。

自己编写第三方库：

不知道你们写代码的框架是怎样的，面向过程还是面向对象？对于一次性的代码，就简单的编码就行了，如果你觉得这个代码它可以会在很多的地方用得到，可以重复使用，那么你就可以使用类的方式，去编写这个代码，那么在其他的文件中，你就可以直接调用你的写这个文件，直接调用你写的class类中的各种方法，而我也是这样实现的一个随机请求头的一个第三方库，如下：

import random
import csv
class GetUserAgentCS(object):
  """
  调用本地请求头文件， 返回请求头
  """

  def __init__(self):
    with open('D://pyth//scrapy 项目//setting//useragent.csv', 'r') as fr:
      fr_csv = csv.reader(fr)
      self.user_agent = [str(i[1]) for i in fr_csv]

  def get_user(self):
    return random.choice(self.user_agent)

useragent文件如下：

1,"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.93 Safari/537.36"
2,"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/30.0.1599.17 Safari/537.36"
3,"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (X11; NetBSD) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.116 Safari/537.36"
4,"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (X11; CrOS i686 3912.101.0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.116 Safari/537.36"
5,"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_5) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.93 Safari/537.36"
-------
------- # too much 
100...

代码很简单的，读取本地的csv文件，然后random一个出去就行了，那现在就有人问我，你这个文件怎么来的, 很简单啊，自然就有方法了，待会在下一个模块我会讲到，在这里，我们只需要编写一个GetUserAgentCS类就可以，代码可以直接抄我上面的，然后保存为get_useragent.py 就可以了，然后你把这个包文件放在你自己爬虫文件夹的地方，然后这样调用:

from get_useragent import GetUserAgentCS
headers = {}
ua = GetUserAgentCS().get_user()
headers['user-agent'] = ua
return headers

如果你在这个调用GetUserAgentCS 不成功，或者底下会出现红色的波浪线，那么就是你没有设置当前工作环境，你只需要这么设置（设置你的爬虫文件夹）：

在这里插入图片描述

你需要点击 Sources Root 就可以了！

使用第三方库 fake-useragent：

这是一个别人已经写好的第三方库，你需要安装然后调用API 就可以了，它可以获取各种的请求头，唯一的缺点就是请求不稳定，有的时候网络波动就可能导致获取不成功，用于Scrapy中，不是很舒服，所以我在这个包的基础上，编写了如上我自己的包，至于请求头的数据怎么来的，就是在这个包运行正常时候，一直更改user-agent，然后不断的请求 http://httpbin.org/user-agent 然后不断的保存数据，写入本地文件就可以了。

我们还是讲一讲这个包的使用方式吧！

安装

pip install fake-useragent

你可以 pip list 查看一下是否安装成功

使用方式

from fake_useragent import UserAgent
headers= {'User-Agent':str(UserAgent().random)}
r = requests.get(url, headers=headers)

UserAgent().random 可以获取任意浏览器的请求头
UserAgent().Chrome 可以获取谷歌浏览器的请求头
UserAgent().firefox 可以获取火狐浏览器的请求头

这个时候，直接用random就可以了，简单。

读取内存数组：

这个时候就有很多人说，我就换个请求头而已，需要这么麻烦吗? 当然，自然有简单的方式，只不过每次都需要复制来用，不是很方法，具体如下：

ua = ["Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.93 Safari/537.36"
"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/30.0.1599.17 Safari/537.36"
"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.129 Safari/537.36,Mozilla/5.0 (X11; NetBSD) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.116 Safari/537.36"]

预先把请求头放入数组里面，然后用就可以了。

import random
ua = [.....]
r = requests.get(url, headers={"user-agent":random.choice(ua)})

以上就是我关于请求头的几种设置方式了，有需要补充的可以评论区留言。

教你用三种方式设置随机请求头，爬虫设置请求头(user-agent)是必然的，那如何生成一个随机请求头这个也是我们爬虫必须掌握的，读完本篇文章你就可以轻松掌握 !

推荐阅读

js
深入解析浏览器内核与版本的发展历程

浏览器作为我们日常不可或缺的软件工具，其背后的运作机制却鲜为人知。本文将深入探讨浏览器内核及其版本的演变历程，帮助读者更好地理解这一关键技术组件，揭示其内部运作的奥秘。 ... [详细]

蜡笔小新 2024-11-11 13:34:37
js
深入解析：Synchronized 关键字在 Java 中对 int 和 Integer 对象的作用与影响

深入探讨了 `Synchronized` 关键字在 Java 中对 `int` 和 `Integer` 对象的影响。尽管初看此题似乎简单，但其实质在于理解对象的概念。根据《Java编程思想》第二章的观点，一切皆为对象。本文详细分析了 `Synchronized` 关键字在不同数据类型上的作用机制，特别是对基本数据类型 `int` 和包装类 `Integer` 的区别处理，帮助读者深入理解 Java 中的同步机制及其在多线程环境中的应用。 ... [详细]

蜡笔小新 2024-11-11 13:13:17
import
使用 ListView 浏览安卓系统中的回收站文件

使用 ListView 浏览安卓系统中的回收站文件 ... [详细]

蜡笔小新 2024-11-09 16:34:55
js
【Python 实战：汇率转换器 v1.02】

本项目通过Python编程实现了一个简单的汇率转换器v1.02。主要内容包括：1. Python的基本语法元素：（1）缩进：用于表示代码的层次结构，是Python中定义程序框架的唯一方式；（2）注释：提供开发者说明信息，不参与实际运行，通常每个代码块添加一个注释；（3）常量和变量：用于存储和操作数据，是程序执行过程中的重要组成部分。此外，项目还涉及了函数定义、用户输入处理和异常捕获等高级特性，以确保程序的健壮性和易用性。 ... [详细]

蜡笔小新 2024-11-11 16:34:26
js
您的数据库配置是否安全？DBSAT工具助您一臂之力！

本文探讨了Oracle提供的免费工具DBSAT，该工具能够有效协助用户检测和优化数据库配置的安全性。通过全面的分析和报告，DBSAT帮助用户识别潜在的安全漏洞，并提供针对性的改进建议，确保数据库系统的稳定性和安全性。 ... [详细]

蜡笔小新 2024-11-11 14:44:47
get
如何将TS文件转换为M3U8直播流：HLS与M3U8格式详解

在视频传输领域，MP4虽然常见，但在直播场景中直接使用MP4格式存在诸多问题。例如，MP4文件的头部信息（如ftyp、moov）较大，导致初始加载时间较长，影响用户体验。相比之下，HLS（HTTP Live Streaming）协议及其M3U8格式更具优势。HLS通过将视频切分成多个小片段，并生成一个M3U8播放列表文件，实现低延迟和高稳定性。本文详细介绍了如何将TS文件转换为M3U8直播流，包括技术原理和具体操作步骤，帮助读者更好地理解和应用这一技术。 ... [详细]

蜡笔小新 2024-11-11 12:12:04
get
HTML布局问题：设置top:0%和left:0%，但浏览器中仍出现空白填充

在HTML布局中，即使将 `top: 0%` 和 `left: 0%` 设置为元素的定位属性，浏览器中仍然会出现空白填充。这个问题通常与默认的浏览器样式、盒模型或父元素的定位方式有关。为了消除这些空白，可以考虑重置浏览器的默认样式，确保父元素的定位方式正确，并检查是否有其他CSS规则影响了元素的位置。 ... [详细]

蜡笔小新 2024-11-11 11:54:15
get
WordPress Duplicator 0.4.4 版本存在跨站脚本攻击漏洞分析

在对WordPress Duplicator插件0.4.4版本的安全评估中，发现其存在跨站脚本（XSS）攻击漏洞。此漏洞可能被利用进行恶意操作，建议用户及时更新至最新版本以确保系统安全。测试方法仅限于安全研究和教学目的，使用时需自行承担风险。漏洞编号：HTB23162。 ... [详细]

蜡笔小新 2024-11-10 13:16:43
js
如何在Conda环境中高效配置并安装PyTorch与TensorFlow GPU版

在Conda环境中高效配置并安装PyTorch和TensorFlow GPU版的方法如下：首先，创建一个新的Conda环境以避免与基础环境发生冲突，例如使用 `conda create -n pytorch_gpu python=3.7` 命令。接着，激活该环境，确保所有依赖项都正确安装。此外，建议在安装过程中指定CUDA版本，以确保与GPU兼容性。通过这些步骤，可以确保PyTorch和TensorFlow GPU版的顺利安装和运行。 ... [详细]

蜡笔小新 2024-11-10 10:49:24
js
深入解析Java虚拟机的内存分区与管理机制

Java虚拟机的内存分区与管理机制复杂且精细。其中，某些内存区域在虚拟机启动时即创建并持续存在，而另一些则随用户线程的生命周期动态创建和销毁。例如，每个线程都拥有一个独立的程序计数器，确保线程切换后能够准确恢复到之前的执行位置。这种设计不仅提高了多线程环境下的执行效率，还增强了系统的稳定性和可靠性。 ... [详细]

蜡笔小新 2024-11-09 19:53:02
include
XAMPP 遇到 404 错误：无法找到请求的对象

在使用 XAMPP 时遇到 404 错误，表示请求的对象未找到。通过详细分析发现，该问题可能由以下原因引起：1. `httpd-vhosts.conf` 文件中的配置路径错误；2. `public` 目录下缺少 `.htaccess` 文件。建议检查并修正这些配置，以确保服务器能够正确识别和访问所需的文件路径。 ... [详细]

蜡笔小新 2024-11-11 18:20:00
char
如何在PHP中获取数组中特定元素的索引位置

在PHP中获取数组中特定元素的索引位置有多种方法。首先，可以使用 `array_search()` 函数，其语法为 `array_search(目标值, $array)`，该函数将返回匹配元素的第一个键名（即下标）。其次，也可以利用 `array_keys()` 函数，通过 `array_keys($array, 目标值)` 语法来获取所有匹配元素的键名列表。这两种方法都能有效解决数组元素定位的问题，具体选择取决于实际需求和性能考虑。 ... [详细]

蜡笔小新 2024-11-11 17:25:16
js
深入解析JDK 8 HashMap源代码：put方法详解及capacity、size、loadFactor和红黑树转换阈值的设定原理

本文深入解析了JDK 8中HashMap的源代码，重点探讨了put方法的工作机制及其内部参数的设定原理。HashMap允许键和值为null，但键为null的情况只能出现一次，因为null键在内部通过索引0进行存储。文章详细分析了capacity（容量）、size（大小）、loadFactor（加载因子）以及红黑树转换阈值的设定原则，帮助读者更好地理解HashMap的高效实现和性能优化策略。 ... [详细]

蜡笔小新 2024-11-10 14:10:53
js
Unity3D 中 AsyncOperation 实现异步场景加载及进度显示优化技巧

在Unity3D中，通过使用`AsyncOperation`可以实现高效的异步场景加载，并结合进度条显示来提升用户体验。本文详细介绍了如何利用`AsyncOperation`进行异步加载，并提供了优化技巧，包括进度条的动态更新和加载过程中的性能优化方法。此外，还探讨了如何处理加载过程中可能出现的异常情况，确保加载过程的稳定性和可靠性。 ... [详细]

蜡笔小新 2024-11-10 11:22:38
js
LeetCode 1137: 计算第 N 个泰波那契数的高效算法解析

泰波那契数列与斐波那契数列类似，但其计算方法有所不同。本文详细解析了如何高效计算第 N 个泰波那契数，并提供了一种基于动态规划的优化算法。通过使用数组记录中间结果，避免了重复计算，显著提高了算法的执行效率。代码示例展示了具体的实现方法，帮助读者更好地理解和应用这一算法。 ... [详细]

蜡笔小新 2024-11-10 11:06:50

LISA_W186

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章