小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

朱小五 凹凸数据
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析
看到标题,
啪的一下你就进来了吧!html

若是有常常刷B站的小伙伴,确定都知道B站鬼畜如今的顶流是谁?web

印度:没错正是在下json

那必须是当代大师浑元形意太极拳掌门人「马保国」先生啊!
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析api

实话讲,马保国走进你们视野仍是他5月份PK被人连续KO三次。app

不过如今他在鬼畜区的主要素材倒是马保国更早时候的一些视频。
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析ide

好比2020年一月份,右眼被蹭了一下的马老师面带微笑,为咱们生动形象地讲述了健身房里的年轻人是如何不讲武德,偷袭他的故事。url

小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析
在视频里,他控诉踢馆的年轻人 “ 不讲武德 ” ,劝他 “ 耗子尾汁 ” 。能够做为B站入站题目,建议全文背诵。3d

B站这个小机灵鬼,甚至还给马老师专门开了专栏,这为咱们后续爬取数据也带来了便利。
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析code

跟平时爬取B站不太同样,在B站的马保国专栏下,F12能够轻松找到接口。视频

https://api.bilibili.com/x/web-interface/web/channel/multiple/list?channel_id=3503796&sort_type=hot&page_size=30

解析JSON后咱们须要的数据均可以得到。

小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析
其中要提到一点,url中的offest从解析上一个url的json中获取,如以下图所示。

小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析
经过简短的爬虫代码,

很快啊,很快就爬取了1.4万条马保国先生的视频数据。

def get_data(url,headers):
    data_m = pd.DataFrame(columns=['id','name','view_count','like_count','duration','author_name','author_id','bvid'])
    html = requests.get(url,headers=headers).content
    data = json.loads(html.decode('utf-8'))
    offset = data['data']['offset']
    print(offset)
    for j in range(30):
        data_m = data_m.append({'id':data['data']['list'][j]['id'],'name':data['data']['list'][j]['name'],
                            'view_count':data['data']['list'][j]['view_count'],'like_count':data['data']['list'][j]['like_count'],
                            'duration':data['data']['list'][j]['duration'],'author_name':data['data']['list'][j]['author_name'],
                            'author_id':data['data']['list'][j]['author_id'],'bvid':data['data']['list'][j]['bvid']},ignore_index=True)
    return(offset,data_m)

小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析
1.4万条数据预览
咱们先进行简单的数据整理(播放量有的是万为单位)后,将1.4万个视频按照播放量和点赞量制做了一个散点图。
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

能够看到什么才是“顶流”的话题,播放量几百万,点赞量几十万的相关视频特别多。

按照播放量排序一下。
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

第一名就是今年一月份相声泰斗马老师经典单口相声!!!
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

那按照点赞量呢?
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析
第一名是来自鬼畜up主的伊丽莎白鼠“武 林 高 手”!

而懂王与马老师的联动表现也很优秀!

其中几个特效向的表现更是突出!
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

因为马老师的语录太过经典,我决定再补充爬一下它的弹幕。
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

# 绘制词云图
stylecloud.gen_stylecloud(text=' '.join(text1), 
                          collocations=False,
                          font_path=r'‪C:\Windows\Fonts\msyh.ttc',
                          icon_name='fas fa-play-circle',
                          size=653,
                          output_name='马保国词云图.png')

Image(filename='马保国词云图.png')

小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

耗子尾汁真是门面担当!

婷婷、英国大理石、塔门说也夹杂其中。
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

最后小五想推荐几个视频:

一、比较喜欢的人力VOCALOID
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

二、技术向的标杆,重点是小芃授人以渔!
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

三、最后观察者网的视频给你们呈现了一个更多元的,“三维立体浑元”的马老师,甚至还发掘出了一些闪光点,而非一味的玩梗。
小伙子不讲武德,竟用Python爬取了B站上1.4w条马老师视频数据来分析

相关文章
相关标签/搜索