面试精选集,快快前往领取吧!offer.liangsonghua.me/。关注微信公众号:松花皮蛋的黑板报,获取更多精彩!
web
微博和Twitter都有140字数的限制,若是分享一个长网址,很容易就超出限制,发布出去。短网址服务能够把一个长网址变成短网址,方便在社交网络上传播。面试
很显然,要尽量的短。长度设计为多少才合适呢?算法
当前互联网上的网页总数大概是 45亿(参考 短网址_短网址资讯mrw.so
),45亿 超过了 2^{32}=4294967296232=4294967296
,但远远小于64位整数的上限值,那么用一个64位整数足够了。微博的短网址服务用的是长度为 7
的字符串,这个字符串能够看作是62进制的数,那么最大能表示{62}^7=3521614606208627=3521614606208
个网址,远远大于 45亿。因此长度为7就足够了。一个64位整数如何转化为字符串呢?,假设咱们只是用大小写字母加数字,那么能够看作是62进制数,log_{62{(2^{64}-1)=10.7log62(264−1)=10.7
,即字符串最长11就足够了。实际生产中,还能够再短一点,好比新浪微博采用的长度就是7,由于 62^7=3521614606208627=3521614606208,这个量级远远超过互联网上的URL总数了,绝对够用了。现代的web服务器(例如Apache, Nginx)大部分都区分URL里的大小写了,因此用大小写字母来区分不一样的URL是没问题的。所以,正确答案:长度不超过7的字符串,由大小写字母加数字共62个字母组成。数据库
一个长网址,对应一个短网址,仍是能够对应多个短网址? 这也是个重大选择问题。通常而言,一个长网址,在不一样的地点,不一样的用户等状况下,生成的短网址应该不同,这样,在后端数据库中,能够更好的进行数据分析。若是一个长网址与一个短网址一一对应,那么在数据库中,仅有一行数据,没法区分不一样的来源,就没法作数据分析了。后端
以这个7位长度的短网址做为惟一ID,这个ID下能够挂各类信息,好比生成该网址的用户名,所在网站,HTTP头部的 User Agent等信息,收集了这些信息,才有可能在后面作大数据分析,挖掘数据的价值。短网址服务商的一大盈利来源就是这些数据。浏览器
正确答案:一对多缓存
如今咱们设定了短网址是一个长度为7的字符串,如何计算获得这个短网址呢?服务器
最容易想到的办法是哈希,先hash获得一个64位整数,将它转化为62进制整,截取低7位便可。可是哈希算法会有冲突,如何处理冲突呢,又是一个麻烦。这个方法只是转移了矛盾,没有解决矛盾,抛弃。微信
正确答案:分布式发号器(Distributed ID Generator
)网络
若是存储短网址和长网址的对应关系?以短网址为 primary key
, 长网址为value
, 能够用传统的关系数据库存起来,例如MySQL,PostgreSQL
,也能够用任意一个分布式 KV 数据库,例如Redis, LevelDB
。
这也是一个有意思的问题。这个问题主要是考察你对301和302的理解,以及浏览器缓存机制的理解。
301是永久重定向,302是临时重定向。短地址一经生成就不会变化,因此用301是符合http语义的。可是若是用了301, Google
,百度
等搜索引擎,搜索的时候会直接展现真实地址,那咱们就没法统计到短地址被点击的次数了,也没法收集用户的Cookie
, User Agent
等信息,这些信息能够用来作不少有意思的大数据分析,也是短网址服务商的主要盈利来源。
因此,正确答案是302重定向。
能够抓包看看mrw.so的短网址是怎么作的,使用 Chrome 浏览器,访问这个URL http://mrw.so/4UD39p
,是我事先发微博自动生成的短网址。来抓包看看返回的结果是啥,可见新浪微博用的就是302临时重定向。
文章来源:www.liangsonghua.me
做者介绍:京东资深工程师-梁松华,在稳定性保障、敏捷开发、JAVA高级、微服务架构方面有深刻的理解
关注微信公众号:松花皮蛋的黑板报,获取更多精彩!