作者: | 来源:互联网 | 2023-08-20 10:54
12306自动刷票下单-登录前言上篇写了12306登录,隔了快一个月了,才准备动手写下单篇,真的要非常感谢博客园的Asimple朋友,如果不是看到你的留言,我几乎都忘了要写下篇了,这一点在简书上就不
12306自动刷票下单-登录
前言
上篇写了12306登录,隔了快一个月了,才准备动手写下单篇,真的要非常感谢博客园的 Asimple朋友,如果不是看到你的留言,我几乎都忘了要写下篇了,这一点在简书上就不好,都没人看/(ㄒoㄒ)/~~,刚开始写博客,真的需要大家的鼓励,看的人多了自然有动力写更多的,所以这一篇要给那些看过我上篇的同学们,尤其是这位Asimple同学,就是为你而写,没错就是这个原因。因为你让我知道了有人在看,而且用心的在看。发了这么多感慨,其实我不是这么爱感慨的人(✿◡‿◡),直入主题吧。
图片.png
还得说一下这次我用的是Firefox浏览器,在上篇中说了Chrome浏览器的一个问题,在抓取的请求过多的情况下,前面的请求就可能看不到请求信息,最后搞得我不得不搞了个虚拟机,装了xp,用Fiddler去查看请求信息,后来就换了Firefox,最新版的Firefox没有Firebug可用,但是自带的开发者工具足够用了。当然Chrome我也没卸载,因为Chrome上有个很赞的功能,在元素界面查找元素的时候可以用css和xpath,可不是右键copy里面的css和xpath哦
图片.png
在这个查找框里你就可以写自己的css和xpath,看实时效果,这个真是太棒了,不用装额外的插件。Firefox上暂时还没有发现这个功能,也不知道有没有类似的插件,如果有人知道的话,麻烦回复一下,先谢过了。鼠标左键还坏了,只能把右键设置一下暂时用着,一波三折呀!这次真的要进入主题了。
图片.png
卧了一个槽,忽略我上面说的吧,要写博客了,有一个请求Firefox竟然不给显示了,还是虚拟机吧
后记
后记为什么要加载前言后面,而不是在文章最后,我怕你不看。在这次分析中我基本没有添加什么代码,因为基本上每一个请求就是定义一个字典、一个url,然后发送请求,获取数据,然后继续下一个。另一方面就是我并没有做代码优化和整理。我们都应该知道对于没有反爬措施的网站,基本上看两个小时的爬虫教程就能写的出来,对于有反爬的网站,最难得地方是分析阶段,而不是发送请求。最后一点就是做这个也是一时兴起,积累一下经验,最主要是开始写一写博客。同时给像我一样初学爬虫的朋友一个例子、一个思路。
查票
图片.png
车票预订界面的url:https://kyfw.12306.cn/otn/leftTicket/init,选好票以后点击查询
图片.png
多了一下两个请求,第一个请求我没用,没有任何影响,我们就不用去管它,直接看第二个请求
https://kyfw.12306.cn/otn/leftTicket/query?leftTicketDTO.train_date=2017-12-25&leftTicketDTO.from_station=BJP&leftTicketDTO.to_station=SHH&purpose_codes=ADULT
图片.png
看一下参数和返回数据,太乱了,稍微仔细看一下,预订、有、G5,好像还是有些有用信息的,可以按|拆分一下看看
图片.png
图片.png
看到了车次G101,8、9是开车时间和到达时间,10是历时,商务座特等座9张余票,32行显示9,一等二等座都是有票,对应30、31,就不能具体确定了,暂时先不管,至少我们确定了这个请求是查询出我们需要的车票信息了,那么再看一下请求参数,第一个是时间很容易理解,第四个好像是票的类型,成人票,翻译一下单词就知道了,反正每次都一样,不用管了,中间两个出发站、目的地,不过这些字母是啥意思,应该是站名对应的编码,在这个请求之前肯定是有对应关系的,
图片.png
https://kyfw.12306.cn/otn/resources/js/framework/station_name.js?station_version=1.9034
一个js的请求@bjb|北京北|VAP|beijingbei|bjb|0,拆分以后可以看到站名和编号
建议看完所有的分析在看代码
def query_ticket_info(date, info):
js_info = json.loads(info)
if js_info.get("status") != True:
print("查询余票失败")
return
result = js_info.get("data").get("result")
for i in result:
lst = i.split('|')
if lst[11] != "Y":
图片.png
这个函数需要解释一下,主要是这些站点信息是怎么找到的,说一下思路
预订
点击预订后看一下请求,记住我上一遍说过的,一般是看xhr和document请求,
https://kyfw.12306.cn/otn/login/checkUser
图片.png
看起来很简单,参数也只有一个_json_att,值为空
重头戏来了https://kyfw.12306.cn/otn/leftTicket/submitOrderRequest
图片.png
看请求参数secretStr,其他的请求几次发现没啥变化,重点就在这个secretStr上了,太乱了,咦,我上面好像说过这三个字,对他们有关系。怎么去理解呢,这里是发了一个post请求,而这个secretStr是作为参数发送给服务器的,那么它必定是在我们本地产生的,在这个请求之前应该能找到。看一下特征:+wOQuwrBzvR6e...。是不是能发现查票那个请求里返回的数据第一个%2BwOQuwrBzvR6e,相似度很高啊,肯定是进行了编码或解码。Fiddler这点很好
图片.png
点击查票请求的第一条数据,右键->Send to TextWizare...
图片.png
哇哦,So Beautiful,这下就相等了,是使用了urldecode,这里支持很多种编码解码方式,非常方便,真相已经出来了,secretStr是我们上面输出的第0行字符串的urldecode解码值,python3中是parse.unquote。
train_date:订哪一天的票,back_train_date:今天的时间,还有出发站和目的地。
12306自动刷票下单-下单