热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

php短连接解析,php短链接算法收集与分析

短链接就不说了,大家已经都清楚了,如下所示就是短链接:新浪微博http:t.cnSVpONM腾讯微博http:url.cn302yorYu

短链接就不说了,大家已经都清楚了,如下所示就是短链接:

新浪微博 http://t.cn/SVpONM

腾讯微博 http://url.cn/302yor

Yun.io http://d.yun.io/PNri2v

短链接的好处:1、内容需要;2、用户友好;3、便于管理。

如何实现呢,大概有三个步骤:

1、定义一个URL映射算法,可以将长的URL映射成短字符串;

2、使用一个存储(数据库?NoSQL?)来存储完成的映射;

3、实现自己的URL映射算法;

一般来说,第三步是我们比较头疼的,如何将一个长的URL字符串,映射成一个较短的字符串呢。我总结了三种办法:

普通实现

我想以前大家学习过十进制和二进制的互相转换,或者十进制和十六进制的互相转换,那么为了更短,我们可以使用62进制,对于一个数字ID进行转码,转换成一个短字符串。

这种做法的缺点是没有办法保证所有链接都是固定的位数的长度,而且在高并发的情况下,如何保证能够快速分发是个问题。

具体实现方法:

/**

* 利用62进制对数字ID进行短链接编码,缺点不能保证每个短链接是固定长度

*

* @author wanshiqiang

* @param integer $integer

* @param string $base

*/

private function getShortenedURLFromID ($integer, $base = ALLOWED_CHARS)

{

$length = strlen($base);

while($integer > $length - 1)

{

$out = $base[fmod($integer, $length)] . $out;

$integer = floor( $integer / $length );

}

return $base[$integer] . $out;

}

/**

* 对62进制编码的短链接进行解码

*

* @author wangshiqiang

* @param string $string

* @param string $base

*/

private function getIDFromShortenedURL ($string, $base = ALLOWED_CHARS)

{

$length = strlen($base);

$size = strlen($string) - 1;

$string = str_split($string);

$out = strpos($base, array_pop($string));

foreach($string as $i => $char)

{

$out += strpos($base, $char) * pow($length, $size - $i);

}

return $out;

}

文艺实现

算法描述:使用6个字符来表示短链接,我们使用ASCII字符中的'a'-'z','0'-'5',共计32个字符做为集合。每个字符有32种状态,六个字符就可以表示32^6(1073741824),那么如何得到这六个字符,描述如下:

对传入的长URL进行Md5,得到一个32位的字符串,这个字符串变化很多,是16的32次方,基本上可以保证唯一性。将这32位分成四份,每一份8个字符,这时机率变成了16的8次方,是4294967296,这个数字碰撞的机率也比较小啦,关键是后面的一次处理。我们将这个8位的字符认为是16进制整数,也就是1*('0x'.$val),然后取0-30位,每5个一组,算出他的整数值,然后映射到我们准备的32个字符中,最后就能够得到一个6位的短链接地址。

PHP实现如下:

function shorten( $long_url )

{

$base32 = "abcdefghijklmnopqrstuvwxyz012345";

$hex = md5( $long_url );

$hexLen = strlen( $hex );

$subHexLen = $hexLen / 8;

$output = array();

for( $i &#61; 0; $i <$subHexLen; $i&#43;&#43; )

{

$subHex &#61; substr( $hex, $i * 8, 8 );

$subHex &#61; 0x3FFFFFFF & ( 1 * (&#39;0x&#39; . $subHex ) );

$out &#61; &#39;&#39;;

for( $j &#61; 0; $j <6; $j&#43;&#43; )

{

$val &#61; 0x0000001F & $int;

$out .&#61; $base32[$val];

$int &#61; $int >> 5;

}

$output[] &#61; $out;

}

return $output;

}

二逼实现

下面这个函数使用了纯随机的方式来生成一个短链接&#xff0c;虽然我们可以通过查询操作来确保不重复使用短链接&#xff0c;可是... 这样真的靠谱吗~~

function random($length, $pool &#61; &#39;&#39;) {

$random &#61; &#39;&#39;;

if (empty($pool)) { $pool &#61; &#39;abcdefghkmnpqrstuvwxyz&#39;; $pool .&#61;

&#39;23456789&#39;; }

srand ((double)microtime()*1000000);

for($i &#61; 0; $i <$length; $i&#43;&#43;) { $random .&#61;

substr($pool,(rand()%(strlen ($pool))), 1); }

return $random;

}

Technorati 标签: 短链接,Short Url,映射,哈希

参考资料&#xff1a;



推荐阅读
  • 本文作者分享了在阿里巴巴获得实习offer的经历,包括五轮面试的详细内容和经验总结。其中四轮为技术面试,一轮为HR面试,涵盖了大量的Java技术和项目实践经验。 ... [详细]
  • 利用决策树预测NBA比赛胜负的Python数据挖掘实践
    本文通过使用2013-14赛季NBA赛程与结果数据集以及2013年NBA排名数据,结合《Python数据挖掘入门与实践》一书中的方法,展示如何应用决策树算法进行比赛胜负预测。我们将详细讲解数据预处理、特征工程及模型评估等关键步骤。 ... [详细]
  • 本教程详细介绍了如何使用 TensorFlow 2.0 构建和训练多层感知机(MLP)网络,涵盖回归和分类任务。通过具体示例和代码实现,帮助初学者快速掌握 TensorFlow 的核心概念和操作。 ... [详细]
  • 本文详细介绍了优化DB2数据库性能的多种方法,涵盖统计信息更新、缓冲池调整、日志缓冲区配置、应用程序堆大小设置、排序堆参数调整、代理程序管理、锁机制优化、活动应用程序限制、页清除程序配置、I/O服务器数量设定以及编入组提交数调整等方面。通过这些技术手段,可以显著提升数据库的运行效率和响应速度。 ... [详细]
  • 本文探讨了使用C#在SQL Server和Access数据库中批量插入多条数据的性能差异。通过具体代码示例,详细分析了两种数据库的执行效率,并提供了优化建议。 ... [详细]
  • 对象自省自省在计算机编程领域里,是指在运行时判断一个对象的类型和能力。dir能够返回一个列表,列举了一个对象所拥有的属性和方法。my_list[ ... [详细]
  • 方法:1 配置数据库basediros.path.abspath(os.path.dirname(__file__))  #获取当前文件的绝对路径appFlask(__name__ ... [详细]
  • Netflix利用Druid实现高效实时数据分析
    本文探讨了全球领先的在线娱乐公司Netflix如何通过采用Apache Druid,实现了高效的数据采集、处理和实时分析,从而显著提升了用户体验和业务决策的准确性。文章详细介绍了Netflix在系统架构、数据摄取、管理和查询方面的实践,并展示了Druid在大规模数据处理中的卓越性能。 ... [详细]
  • 丽江客栈选择问题
    本文介绍了一道经典的算法题,题目涉及在丽江河边的n家特色客栈中选择住宿方案。两位游客希望住在色调相同的两家客栈,并在晚上选择一家最低消费不超过p元的咖啡店小聚。我们将详细探讨如何计算满足条件的住宿方案总数。 ... [详细]
  • 利用Selenium与ChromeDriver实现豆瓣网页全屏截图
    本文介绍了一种使用Selenium和ChromeDriver结合Python代码,轻松实现对豆瓣网站进行完整页面截图的方法。该方法不仅简单易行,而且解决了新版Selenium不再支持PhantomJS的问题。 ... [详细]
  • 本文深入探讨了SQL数据库中常见的面试问题,包括如何获取自增字段的当前值、防止SQL注入的方法、游标的作用与使用、索引的形式及其优缺点,以及事务和存储过程的概念。通过详细的解答和示例,帮助读者更好地理解和应对这些技术问题。 ... [详细]
  • 本文介绍如何使用MFC和ADO技术调用SQL Server中的存储过程,以查询指定小区在特定时间段内的通话统计数据。通过用户界面选择小区ID、开始时间和结束时间,系统将计算并展示小时级的通话量、拥塞率及半速率通话比例。 ... [详细]
  • 在高并发需求的C++项目中,我们最初选择了JsonCpp进行JSON解析和序列化。然而,在处理大数据量时,JsonCpp频繁抛出异常,尤其是在多线程环境下问题更为突出。通过分析发现,旧版本的JsonCpp存在多线程安全性和性能瓶颈。经过评估,我们最终选择了RapidJSON作为替代方案,并实现了显著的性能提升。 ... [详细]
  • 并发编程 12—— 任务取消与关闭 之 shutdownNow 的局限性
    Java并发编程实践目录并发编程01——ThreadLocal并发编程02——ConcurrentHashMap并发编程03——阻塞队列和生产者-消费者模式并发编程04——闭锁Co ... [详细]
  • Java多线程实现:从1到100分段求和并汇总结果
    本文介绍如何使用Java编写一个程序,通过10个线程分别计算不同区间的和,并最终汇总所有线程的结果。每个线程负责计算一段连续的整数之和,最后将所有线程的结果相加。 ... [详细]
author-avatar
yema狂想曲
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有