斯坦福研究人员让AI看了100部好莱坞大片,培养出了一个“吻戏识别大师”


编辑:大明算法

【导读】斯坦福大学研究人员给AI模型看了100部好莱坞电影,让AI看懂了什么是接吻,并从视频片断中分割识别出接吻的镜头场景,并且把接吻和性爱场景区分开来。嗯,想开车的朋友可能要等等,但想看吻戏的朋友这回能够一次看个够了。

和大多数没有接过吻的人同样,AI学接吻这件事最开始也是经过观看爱情电影片断进行的。AI经过看电影来了解关于接吻的基本知识,尤为是看看那些好莱坞明星的嘴唇动做到底是什么样的。数据库

研究人员对熟练掌握识别面部识别和目标识别的深度学习算法进行了训练,识别由专业演员戏剧化的热吻场景,这代表,AI系统已经可以更深刻地了解最亲密的人类“交流”活动。服务器

电影《泰坦尼克号》中男女主角著名的“船头接吻”镜头性能

这项研究来自Netflix的高级数据科学家Amir Ziai,他正在斯坦福大学攻读AI专业研究生。Ziai从过去一个世纪的好莱坞电影数据库中挑选了100部电影的表明性片断。而后手动将不一样的电影片断标记为接吻/非接吻场景,并使用来自这些片断的静止图像帧和声音片断来训练深度学习算法,以检测影片中亲吻的场景和声音。学习

寻找非交叉接吻动做分割片断的算法伪代码测试

不过请不要误会,目前还不清楚这个测吻的方法是否能够用于亲吻以外的进一步性爱场景的识别。对此,Ziai 表示:“在个人训练数据集中有意远离了过分的性爱场景,以确保模型不会混淆接吻和性爱”。人工智能

Ziai目前的雇主Netflix没有参与斯坦福大学的这项研究,该研究一发表在预印本服务器arXiv上。Ziai还没有研究该技术在Netflix上的可否得到一些应用前景。但不难想象,这类视频识别技术可能会让Netflix或其余公司(如YouTube,Facebook,Instagram和TikTok)很感兴趣,由此技术开发出的商业应用能够处理大量流媒体或存储视频。spa

2019年4月,谷歌宣布其Pixel智能手机已经可以接收Photobooth功能更新,能够在智能手机摄像头拍摄的视频中检测到接吻时进行自动拍照。Ziai展现了与视频有关的接吻检测技术,将来的应用能够对视频内容进行自动分类,为用户打造个性化的视频推荐列表,甚至可能充当在线视频审核的部分做用,对某些内容的视频进行筛选。视频

“这是一个很好的例子,说明现代计算机视觉技术如何可以至关容易地开发特定的'感知和响应'软件,提示定性/非结构化的东西(如场景中的接吻),”OpenAI策略与转播主管杰克·克拉克说,他的导入人工智能新闻通信,最近突出了亲吻检测研究。“我认为这是AI改变我的软件开发方面,将来受关注潜力最高的领域之一。”资源

目前对亲吻场景识别最成功的深度学习模型是ResNet-18,这是一种图像分类算法,已经基于ImageNet数据库中的超过一百万张图像进行了预训练。为了可以正确识别接吻的声音,使用名为VGGish的深度学习模型,利用每一个接吻场景的一秒钟片断的后960毫秒的音频进行了训练。

使用这种左右开弓的训练方式,AI模型处理接吻的图像和音频的方式,让整个模型得到了高达的0.95的F1分数 - 这一分数用于衡量算法(对于误报和假阴性的)精度的加权平均值。

可是,面对一些电影场景中视频编辑过多,以及和摄像机角度问题时,模型可能会无能为力。拍摄演员接吻的远景镜头有时会骗过算法,由于这种状况下,大部分相机镜框内都是风景背景。快节奏的视频剪辑和不包括两个演员的镜头也证实是具备挑战性的。

要弄清到底是AI模型到底是根据哪些特定数据模式进行预测是比较困难的事情。人类尝试理解AI逻辑的一种方法是使用显着性图来突出显示在分析过程当中受到AI最多关注的数据。在好莱坞电影中的亲吻场景中,深度学习模型彷佛更加关注与演员面部相关的图像像素。

Ziai说,一些“有限的实验”也代表,AI模型更依赖视觉特征,而不是音频特征来识别接吻场景。实验代表,利用更加“精心调整的数据集”会更有利于接吻探测系统的性能发挥,而且可能利用更多的背景信息,而不只仅是靠静止图像来识别接吻场景。

帕特里克·斯维泽和黛米·摩尔在1990年的电影《幽灵》中的接吻画面,该影片是数据科学家用于训练AI模型识别接吻场景选取的100部电影之一

目前还不清楚AI模型在所有100部好莱坞电影中的识别表现如何,如《安娜·卡列尼娜》(1935),《幽灵》(1990)和《皇家赌场》(2006)将在更大的电影数据集中发挥做用。可是,在训练数据集超过80个视频后,该模型仅仅出现了“边际化的性能提高”,Ziai说。好莱坞电影数据集和一些计算资源由斯坦福大学计算机科学助理教授Kayvon Fatahalian实验室提供。

另外一个问题是,这种接吻AI识别模型是否可以在检测社交媒体上常见的视频中的接吻场景时表现出至关的精度。这一挑战可能须要对更大的视频数据集进行额外的训练。尽管如此,一些初步测试仍然代表,这种方式有望诞生更普遍的AI接吻检测应用。

“这项研究的尝试是使用多样化的数据集,让模型不会过分适应任何特定类型的电影,”Ziai说。“有趣的是,它彷佛在我发现的一些YouTube视频上的性能表现至关不错。”

相关文章
相关标签/搜索