热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

第二十三节:scrapy爬虫识别验证码(一)字母数字组合验证码识别

图片验证码基本上是有数字和字母或者数字或者字母组成的字符串,然后通过一些干扰线的绘制而形成图片验证码。例如:知网的注册就有图片验证码首先我们需要获取验证

图片验证码基本上是有数字和字母或者数字或者字母组成的字符串,然后通过一些干扰线的绘制而形成图片验证码。

例如:知网的注册就有图片验证码

 

首先我们需要获取验证码图片,通过开发者工具我们可以得到验证码url链接

 

其次就是通过Pillow类库和tesserocr进行识别,代码如下:

1 # -*- coding:utf-8 -*-
2 import tesserocr
3 from PIL import Image
4 import requests
5
6 # 通过url链接获取验证码图片,并写入本地文件夹里
7 def get_image(path,url):
8 """
9 :param path: 文件夹路径
10 :param url: 验证码url链接
11 """
12 respon = requests.get(url=url) # 请求验证码url
13 with open(path,"wb") as file:
14 file.write(respon.content) # 将验证码写到本地
15
16
17 # 由于验证码图片太小,需要对验证码图片放大处理,以便识别
18 def reset_image_size(image_path):
19 """
20 :param image_path: 图片所在的路径
21 :return:
22 """
23 image = Image.open(fp=image_path) # 打开图片
24 pic_resize = 5 # 设置图片放大或者缩小倍数
25 (x, y) = image.size # 获取图片的大小
26 x_s = int(x * pic_resize) # 放大5倍(可调)
27 y_s = int(y * pic_resize) # 放大5倍(可调)
28 out = image.resize((x_s, y_s), Image.ANTIALIAS) # ANTIALIAS表示高质量图片
29 out.save(image_path)
30
31
32 # 读取验证码图片文本
33 def read_image(image_path):
34 """
35 :param image_path: 验证码图片路径
36 :return:
37 """
38 image = Image.open(fp=image_path) # 打开验证码图片
39 image = image.convert('L') # 将验证码图片转换为灰度图(L表示灰度图)
40 threshold = 127 # 设置灰度图二值化阈值
41 table = []
42 for i in range(256): # 像素为256
43 if i < threshold:
44 table.append(0)
45 else:
46 table.append(1)
47 image &#61; image.point(table, &#39;1&#39;) # 二值化处理后的副本(1表示二值化)
48 image.show()
49 result &#61; tesserocr.image_to_text(image) # 验证码图片转换为文本
50 return result
51
52
53 # 验证码识别信息脏数据处理
54 def VerifInfo(result):
55 """
56 :param result: 验证码图片通过初步识别后得到的脏数据
57 :return:
58 """
59 verif_str &#61; "abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ1234567890"
60 verif_list &#61; []
61 for i in result:
62 if i in verif_str:
63 verif_list.append(i)
64 return "".join(verif_list)
65
66
67
68 if __name__ &#61;&#61; &#39;__main__&#39;:
69 img_path &#61; "D:\photo\image" # 文件夹目录
70 img_path &#61; img_path &#43; "\VerificationCode.png" # 验证码图片所在的目录及名称
71 img_url &#61; "http://my.cnki.net/elibregister/CheckCode.aspx" # 验证码url
72 get_image(img_path,img_url) # 获取验证码图片
73 reset_image_size(img_path) # 调整验证码图片大小
74 result &#61; read_image(img_path) # 读取验证码图片内容
75 verif_info &#61; VerifInfo(result) # 验证码内容数据处理
76 verif_len &#61; len(verif_info) # 验证码识别长度
77 if verif_len &#61;&#61; 4 and verif_info:
78 print(verif_info)
79 else:
80 pass

图片字母数字验证码识别

最后就是看看识别的效果吧。前者为原始验证码图片&#xff0c;后者是经过二值化处理的图片。

 

输出的结果为&#xff1a;FZug

显然使用tesserocr识别还是有误差的&#xff0c;以后可以用深度学习的方式训练处一个模型&#xff0c;可以提高识别效率&#xff0c;后期会跟进实现的。

转:https://www.cnblogs.com/zhaco/p/10960339.html



推荐阅读
  • 1.如何在运行状态查看源代码?查看函数的源代码,我们通常会使用IDE来完成。比如在PyCharm中,你可以Ctrl+鼠标点击进入函数的源代码。那如果没有IDE呢?当我们想使用一个函 ... [详细]
  • 2023年京东Android面试真题解析与经验分享
    本文由一位拥有6年Android开发经验的工程师撰写,详细解析了京东面试中常见的技术问题。涵盖引用传递、Handler机制、ListView优化、多线程控制及ANR处理等核心知识点。 ... [详细]
  • 本文介绍如何使用Python进行文本处理,包括分词和生成词云图。通过整合多个文本文件、去除停用词并生成词云图,展示文本数据的可视化分析方法。 ... [详细]
  • 毕业设计:基于机器学习与深度学习的垃圾邮件(短信)分类算法实现
    本文详细介绍了如何使用机器学习和深度学习技术对垃圾邮件和短信进行分类。内容涵盖从数据集介绍、预处理、特征提取到模型训练与评估的完整流程,并提供了具体的代码示例和实验结果。 ... [详细]
  • 本文介绍如何使用 Android 的 Canvas 和 View 组件创建一个简单的绘图板应用程序,支持触摸绘画和保存图片功能。 ... [详细]
  • 优化ListView性能
    本文深入探讨了如何通过多种技术手段优化ListView的性能,包括视图复用、ViewHolder模式、分批加载数据、图片优化及内存管理等。这些方法能够显著提升应用的响应速度和用户体验。 ... [详细]
  • Python自动化处理:从Word文档提取内容并生成带水印的PDF
    本文介绍如何利用Python实现从特定网站下载Word文档,去除水印并添加自定义水印,最终将文档转换为PDF格式。该方法适用于批量处理和自动化需求。 ... [详细]
  • 从 .NET 转 Java 的自学之路:IO 流基础篇
    本文详细介绍了 Java 中的 IO 流,包括字节流和字符流的基本概念及其操作方式。探讨了如何处理不同类型的文件数据,并结合编码机制确保字符数据的正确读写。同时,文中还涵盖了装饰设计模式的应用,以及多种常见的 IO 操作实例。 ... [详细]
  • 根据最新发布的《互联网人才趋势报告》,尽管大量IT从业者已转向Python开发,但随着人工智能和大数据领域的迅猛发展,仍存在巨大的人才缺口。本文将详细介绍如何使用Python编写一个简单的爬虫程序,并提供完整的代码示例。 ... [详细]
  • 本文介绍如何使用布局文件在Android应用中排列多行TextView和Button,使其占据屏幕的特定比例,并提供示例代码以帮助理解和实现。 ... [详细]
  • 自己用过的一些比较有用的css3新属性【HTML】
    web前端|html教程自己用过的一些比较用的css3新属性web前端-html教程css3刚推出不久,虽然大多数的css3属性在很多流行的浏览器中不支持,但我个人觉得还是要尽量开 ... [详细]
  • 开发笔记:2020 BJDCTF Re encode
    开发笔记:2020 BJDCTF Re encode ... [详细]
  • 在PHP后端开发中遇到一个难题:通过第三方类文件发送短信功能返回的JSON字符串无法解析。本文将探讨可能的原因并提供解决方案。 ... [详细]
  • 深入解析Spring启动过程
    本文详细介绍了Spring框架的启动流程,帮助开发者理解其内部机制。通过具体示例和代码片段,解释了Bean定义、工厂类、读取器以及条件评估等关键概念,使读者能够更全面地掌握Spring的初始化过程。 ... [详细]
  • 并发编程 12—— 任务取消与关闭 之 shutdownNow 的局限性
    Java并发编程实践目录并发编程01——ThreadLocal并发编程02——ConcurrentHashMap并发编程03——阻塞队列和生产者-消费者模式并发编程04——闭锁Co ... [详细]
author-avatar
卫宇欢试试
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有