热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

python自动登陆网页原理

有些网站设置了权限,只有在登录了之后才能爬取网站的内容,如何模拟登录,目前的方法主要是利用浏览器cookie模拟登录。浏览器访问服务器的过程在用户访问网页时,不论是通过URL输入域名或I

有些网站设置了权限,只有在登录了之后才能爬取网站的内容,如何模拟登录,目前的方法主要是利用浏览器COOKIE模拟登录。 

浏览器访问服务器的过程


在用户访问网页时,不论是通过URL输入域名或IP,还是点击链接,浏览器向WEB服务器发出了一个HTTP请求(Http Request),WEB服务器接收到客户端浏览器的请求之后,响应客户端的请求,发回相应的响应信息(Http Response),浏览器解析引擎,排版引擎分析返回的内容,呈现给用户。WEB应用程序在于服务器交互的过程中,HTTP请求和响应时发送的都是一个消息结构。 

\



Http消息


当浏览器向服务器发送请求的时候,发出http请求消息报文,服务器返回数据时,发出http响应消息报文,这两种类型的消息都是由一个起始行,消息头,一个指示消息头结束的空行和可选的消息体组成。http请求消息中,起始行包括请求方法,请求的资源, HTTP协议的版本号,消息头包含各种属性,消息体包含数据,GET请求并没有消息主体,因此在消息头后的空白行中没有其他数据。Http响应消息中,起始行包括HTTP协议版本,http状态码和状态,消息头包含各种属性,消息体包含服务器返回的数据内容。 
\

如下图从fiddler抓取的http请求和http响应,GET请求内容为空,故消息头之后的空行和消息体都为空。 
\

服务器发送的响应消息如下,浏览器正常接收到服务器发回的http报文 \
\

从上可以看到,COOKIE在http请求和http响应的头信息中,COOKIE是消息头的一种很重要的属性。 

什么是COOKIE?

   当用户通过浏览器首次访问一个域名时,访问的WEB服务器会给客户端发送数据,以保持WEB服务器与客户端之间的状态保持,这些数据就是COOKIE,它是 Internet 站点创建的 ,为了辨别用户身份而储存在用户本地终端上的数据,COOKIE中的信息一般都是经过加密的,COOKIE存在缓存中或者硬盘中,在硬盘中的是一些小文本文件,当你访问该网站时,就会读取对应网站的COOKIE信息,COOKIE有效地提升了我们的上网体验。一般而言,一旦将 COOKIE 保存在计算机上,则只有创建该 COOKIE 的网站才能读取它。 
\

为什么需要COOKIE


Http协议是一个无状态的面向连接的协议,Http协议是基于tcp/ip协议层之上的协议,当客户端与服务器建立连接之后,它们之间的TCP连接一直都是保持的,至于保持的时间是多久,是通过服务器端来设置的,当客户端再一次访问该服务器时,会继续使用上一次建立的连接,但是,由于Http协议是无状态的,WEB服务器并不知道这两个请求是否同一个客户端,这两次请求之间是独立的。 为了解决这个问题, Web程序引入了COOKIE机制来维护状态.COOKIE可以记录用户的登录状态,通常web服务器会在用户登录成功后下发一个签名来标记session的有效性,这样免去了用户多次认证和登录网站。记录用户的访问状态。 

COOKIE的种类


会话COOKIE(Session COOKIE):这个类型的COOKIE只在会话期间内有效,保存在浏览器的缓存之中,用户访问网站时,会话COOKIE被创建,当关闭浏览器的时候,它会被浏览器删除。 持久COOKIE(Persistent COOKIE): 这个类型的COOKIE长期在用户会话中生效。当你设置COOKIE的属性Max-Age为1个月的话,那么在这个月里每个相关URL的http请求中都会带有这个COOKIE。所以它可以记录很多用户初始化或自定义化的信息,比如什么时候第一次登录及弱登录态等。 Secure COOKIE:安全COOKIE是在https访问下的COOKIE形态,以确保COOKIE在从客户端传递到Server的过程中始终加密的。 HttpOnly COOKIE :这个类型的COOKIE只能在http(https)请求上传递,对客户端脚本语言无效,从而有效避免了跨站攻击。 第三方COOKIE: 第一方COOKIE是当前访问的域名或子域名下的生成的COOKIE。 第三方COOKIE:第三方COOKIE是第三方域名创建的COOKIE。 

COOKIE的构成


COOKIE是http消息头中的一种属性,包括:COOKIE名字(Name)COOKIE的值(Value),COOKIE的过期时间(Expires / Max-Age),COOKIE作用路径(Path),COOKIE所在域名(Domain),使用COOKIE进行安全连接(Secure)。 前两个参数是COOKIE应用的必要条件,另外,还包括COOKIE大小(Size,不同浏览器对COOKIE个数及大小限制是有差异的)。 

python模拟登录


设置一个COOKIE处理对象,它负责 将COOKIE添加到http请求中,并能从http响应中得到COOKIE , 向网站登录页面发送一个请求Request, 包括登录url,POST请求的数据,Http header 利用urllib2.urlopen发送请求,接收WEB服务器的Response。 首先我们查看登陆页面源码 
\

当我们使用urllib处理url的时候,实际上是通过urllib2.OpenerDirector实例进行工作,他会自己调用资源进行各种操作如通过协议、打开url、处理COOKIE等。而urlopen方法使用的是默认的opener来处理问题,基本的urlopen()函数不支持验证、COOKIE或其他的HTTP高级功能。要支持这些功能,必须使用build_opener()函数来创建自己的自定义Opener对象。 
COOKIElib模块定义了自动处理HTTP COOKIEs的类,用来访问那些需要COOKIE数据的网站,COOKIElib模块包括COOKIEJar,FileCOOKIEJar,COOKIEPolicy,DefaultCOOKIEPolicy,COOKIE及FileCOOKIEJar的子类MozillaCOOKIEJar和LWPCOOKIEJar,COOKIEJar对象可以管理HTTP COOKIEs,将COOKIE添加到http请求中,并能从http响应中得到COOKIE,FileCOOKIEJar对象主要是从文件中读取COOKIE或创建COOKIE,其中,MozillaCOOKIEJar是为了创建与Mozilla浏览器COOKIEs.txt兼容的FileCOOKIEJar实例,LWPCOOKIEJar是为了创建与libwww-perl的Set-COOKIE3文件格式兼容的FileCOOKIEJar实例,用LWPCOOKIEJar保存的COOKIE文件易于人类阅读。默认的是FileCOOKIEJar没有save函数,而MozillaCOOKIEJar或LWPCOOKIEJar都已经实现了。 所以可以用MozillaCOOKIEJar或LWPCOOKIEJar,去自动实现COOKIE的save。

示例:

#! /usr/bin/env python#coding:utf-8
 
import sys
import re
import urllib2
import urllib
import requests
import COOKIElib
 
## 这段代码是用于解决中文报错的问题  
reload(sys)  
sys.setdefaultencoding("utf8")  
#####################################################
#登录人人
loginurl = 'http://www.renren.com/PLogin.do'
logindomain = 'renren.com'
 
class Login(object):
     
    def __init__(self):
        self.name = ''
        self.passwprd = ''
        self.domain = ''
 
        self.cj = COOKIElib.LWPCOOKIEJar()            
        self.opener = urllib2.build_opener(urllib2.HTTPCOOKIEProcessor(self.cj)) 
        urllib2.install_opener(self.opener)    
     
    def setLoginInfo(self,username,password,domain):
        '''设置用户登录信息'''
        self.name = username
        self.pwd = password
        self.domain = domain
 
    def login(self):
        '''登录网站'''
        loginparams = {'domain':self.domain,'email':self.name, 'password':self.pwd}
        headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/31.0.1650.57 Safari/537.36'}
        req = urllib2.Request(loginurl, urllib.urlencode(loginparams),headers=headers)  
        response = urllib2.urlopen(req)
        self.operate = self.opener.open(req)
        thePage = response.read()        
         
if __name__ == '__main__':   
    userlogin = Login()
    username = 'username'
    password = 'password'
    domain = logindomain
    userlogin.setLoginInfo(username,password,domain)
    userlogin.login()




推荐阅读
  • Spring Security核心概念与应用实践
    本文详细介绍了Spring Security的核心机制,包括其作为一系列过滤器的工作原理,如何实现用户认证与授权,以及常见的配置方法和高级特性如CSRF防护。 ... [详细]
  • 深入解析 Apache Shiro 安全框架架构
    本文详细介绍了 Apache Shiro,一个强大且灵活的开源安全框架。Shiro 专注于简化身份验证、授权、会话管理和加密等复杂的安全操作,使开发者能够更轻松地保护应用程序。其核心目标是提供易于使用和理解的API,同时确保高度的安全性和灵活性。 ... [详细]
  • 尽管PHP是一种强大且灵活的Web开发语言,但开发者在使用过程中常会陷入一些典型的陷阱。本文旨在列出PHP开发中最为常见的10种错误,并提供相应的预防建议。 ... [详细]
  • 深入解析 Spring Security 用户认证机制
    本文将详细介绍 Spring Security 中用户登录认证的核心流程,重点分析 AbstractAuthenticationProcessingFilter 和 AuthenticationManager 的工作原理。通过理解这些组件的实现,读者可以更好地掌握 Spring Security 的认证机制。 ... [详细]
  • 本文介绍了多个关于JavaScript的书籍资源、实用工具和编程实例,涵盖从入门到进阶的各个阶段,帮助读者全面提升JavaScript编程能力。 ... [详细]
  • 本文深入探讨了HTTP请求和响应对象的使用,详细介绍了如何通过响应对象向客户端发送数据、处理中文乱码问题以及常见的HTTP状态码。此外,还涵盖了文件下载、请求重定向、请求转发等高级功能。 ... [详细]
  • PHP 过滤器详解
    本文深入探讨了 PHP 中的过滤器机制,包括常见的 $_SERVER 变量、filter_has_var() 函数、filter_id() 函数、filter_input() 函数及其数组形式、filter_list() 函数以及 filter_var() 和其数组形式。同时,详细介绍了各种过滤器的用途和用法。 ... [详细]
  • 本文详细探讨了HTML表单中GET和POST请求的区别,包括它们的工作原理、数据传输方式、安全性及适用场景。同时,通过实例展示了如何在Servlet中处理这两种请求。 ... [详细]
  • 解决FCKeditor应用主题后上传问题及优化配置
    本文介绍了在Freetextbox收费后选择FCKeditor作为替代方案时遇到的上传问题及其解决方案。通过调整配置文件和调试工具,最终解决了上传失败的问题,并对相关配置进行了优化。 ... [详细]
  • 本文详细探讨了在微服务架构中,使用Feign进行远程调用时出现的请求头丢失问题,并提供了具体的解决方案。重点讨论了单线程和异步调用两种场景下的处理方法。 ... [详细]
  • 采用IKE方式建立IPsec安全隧道
    一、【组网和实验环境】按如上的接口ip先作配置,再作ipsec的相关配置,配置文本见文章最后本文实验采用的交换机是H3C模拟器,下载地址如 ... [详细]
  • 深入理解 .NET 中的中间件
    中间件是插入到应用程序请求处理管道中的组件,用于处理传入的HTTP请求和响应。它在ASP.NET Core中扮演着至关重要的角色,能够灵活地扩展和自定义应用程序的行为。 ... [详细]
  • Python技巧:利用Cookie实现自动登录绕过验证码
    本文详细介绍了如何通过Python和Selenium库利用浏览器Cookie实现自动登录,从而绕过验证码验证。文章提供了具体的操作步骤,并附有代码示例,帮助读者理解和实践。 ... [详细]
  • 本文探讨了在Django项目中,如何在对象详情页面添加前后导航链接,以提升用户体验。文章详细描述了遇到的问题及解决方案。 ... [详细]
  • 探讨了在使用客户端JavaScript时,确保其完整性和来源可靠性的方法,特别是在安全性要求较高的应用中。 ... [详细]
author-avatar
强毛
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有