顶会最强的前20%!电影情感效应预测论文拿下ACMMM Oral收录!

本文内容出自阿里文娱AI大脑北斗星团队,研究成果已发表在ACMMM 2022

论文名:Enlarging the Long-time Dependencies via RL-based Memory Network in Movie Affective Analysis

作者:张杰、赵寅、钱凯

背景

三流的导演拍故事,一流的导演拍情绪。纵观古往今外,经典的高分电影之所以经久不衰,无一不是因为引发了观众心理上的共情。尤其是在快节奏、高压力的现代生活中,观众观看影视剧的主要目的就是为了寻求情感上的满足与释放。因此,综合视听语言等因素,搭建一条合适的“情感线”是电影成功的关键。那么,如果我们可以在电影上线之前,提前预测电影对于观众的情感效应,刻画出这条“情感线”,对于电影的评估定级、剪辑优化等方面无疑有着巨大的帮助。为此,我们展开了电影情感效应预测方面的研究工作。

简介

电影情感效应分析旨在预测观众在观看电影时所产生的情感,其在电影内容理解、高潮检测、质量评估、情感多媒体检索等方面有着重要的应用。在情感计算领域,情感的标签可以分为两种:1是离散的情感标签,如开心、伤心等等;2是连续的情感模型,如使用最多的二维VA情感模型(如图1所示),其中Valence代表的是情感的正负,Arousal代表的是情感的强度,两者的取值均在-1到1之间。相比于离散的标签,连续的情感模型可以更细致全面地描述情感的各个维度,在学术界和工业界有着更加广泛的应用。因此,我们采用了VA情感模型,主要目标就是根据影视剧的内容,预测观众的VA情感。

图1 VA情感模型

要正确地预测观众的情感,上下文信息十分关键,同样的一段场景在不同的情景下可能会产生不同的情感效应,比如同样一段打斗的画面,在犯罪剧中是令人紧张的,在喜剧中则可能是幽默风趣的。因此,有效地建模上下文信息对于电影的情感效应预测至关重要。

为了建模上下文信息,最常用的经典模型可以分为两种:循环神经网络(如LSTM[1]等)和Transformer[2]。然而,在面对电影这种动辄几千秒的长序列时,这些时序模型存在着一定的缺陷:

a. 循环神经网络的记忆能力有限,难以建模长时依赖

b. 循环神经网络采用的BPTT的更新方式存在梯度消失和爆炸的问题,此外其需要存储大量的中间变量,不适用于特别长的序列

c. Transformer的计算量随着时序的增加呈平方级增加,同样不适用于特别长的序列

受限于常用时序模型的这些缺陷,目前大部分的方案都是将电影切分成小片段,然后独立地去预测每个片段的情感。然而这种方式忽略了片段之间的联系,无法建模长时序的上下文信息,对于正确理解电影内容、判断电影情感的整体走势有着一定的阻碍。

为了解决这些问题,我们提出了基于强化学习的记忆网络,其核心在于利用记忆模块存储历史信息,并利用强化学习得到记忆模块的更新策略。如图2所示,我们方法存在以下优势:

a. 通过记忆模块提升了模型的记忆能力

b. 利用强化学习的时序差分法,减小了计算量和存储量,避免了梯度消失和爆炸的问题

c. 利用强化学习中的价值网络和策略网络,有效捕捉长时序依赖

图2 基于强化学习的记忆网络优势示意图

为了验证我们方法的有效性,我们在多种任务的多个数据集上进行了实验,结果均达到了SOTA。

下面我们将对所提方案展开详细的介绍。

方案

模型的整体框架如图3所示:给定一个电影,我们将其划分成连续的片段C=c1,ct,⋯,cTC={c_1,c_t,⋯,c_T}C=c1,ct,,cT,对于一个电影片段ctc_tct,我们提取多模态特征,并将这些特征编码成向量表征ete_tet。然后向量表征ete_tet和历史记忆信息mt−1m_{t-1}mt1组成状态输入到策略网络μ中去,产生一系列的动作ata_tat,这些动作会用来选择性的更新记忆模块中的内容。然后基于更新后的记忆模块mt和向量表征ete_tet,作出最终的预测yty_tyt。预测结果的误差会作为奖励rtr_trt,指导价值网络Q学习未来的期望奖励,价值网络则会用来指导策略网络学习长时序依赖。


图3 模型整体框架

下面我们将对模型中的特征提取模块、基于强化学习的记忆网络部分、以及模型训练相关的内容进行详细的介绍

特征提取

为了得到富含情感信息的表征,我们提取了5种模态的特征:利用VGGish[3]提取音频特征;利用背景音乐情感模型提取bgm情感特征;利用在Places365[4]上预训练的VGG16[5]提取场景特征;利用OpenPose[6]的主干部分提取人物姿态特征;利用在RAF[7]上预训练的Xception[8]提取人物表情特征。我们将这些模态的特征在时间维度上对齐并做concat操作,然后利用LSTM来融合时序信息,并取最后一个时间步的隐藏状态作为电影片段的向量表征。

K代表的是每个电影片段的帧数,M代表的是模态的总数,f1:k:mtf_{1:k:m}^tf1:k:mt ∈ $R^{K×d_m} 代表的是提取的第m个模态的特征,[⋯]代表的是concat操作,代表的是提取的第m个模态的特征,[⋯]代表的是concat操作,代表的是提取的第m个模态的特征,[]代表的是concat操作,LSTM_{−1}$代表的是取LSTM最后一个时间步的隐藏状态。

基于强化学习的记忆网络

基于特征提取部分得到的电影片段的向量表征,我们利用记忆模块和基于强化学习的更新策略来捕获长期依赖。

记忆模块

记忆模块是一个可读可写的矩阵

相关推荐

优酷质量保障系列(二)—客户端自动化测试基础能力建设

文娱妹导读自动化测试能力建设过程中,自动化框架选型、框架设计核心和思路、自动化能力平台接入,是自动化测试能力建设过程中重要环节。文章分享优酷APP自动化测试能力建设过程中的经验本系列文章将陆续发布,感兴趣的朋友持续关注!前言随着移动端版本迭代的加快,快速测试,快速反馈已经是一个常态化的流程,周期内版本发布频率的增加,各项测试的时间正在急剧缩短,且回归性的任务不断充斥当中,各个阶段都需要回归测试的介入来确保集成之后各个模块的正确性。在当前回归测试中主要集中以下几个痛点问题:测试回归主次模糊,.

阿里文娱技术 896

优酷质量保障系列(一)——服务端稳定性保障实践

文娱妹导读:质量保障贯穿全部研发流程,测试作为质量的构建者和守护者,需要保障的不仅仅是提测后的功能质量,而是整个研发过程的质量和效率。分享优酷通过质量保障建设提升研发效率和质量的实践过程。仔细阅读本文预计需10分钟,开始充电吧!服务端质量保障做什么?回答这个问题之前,先要看看影响服务端质量的因素有哪些?从当前服务端研发流程来看一个需求上线的全部阶段以及每个阶段的主要活动:可以看到质量相关的活动贯穿全部研发流程,测试作为质量的构建者和守护者,需要保障的不仅仅是提测后的功能质量,而是整个研发过程的.

阿里文娱技术 1682

行业首发:响应式优酷快速适配新Mac

优酷响应式是一套代码、一个App支持多尺寸、多终端设备的显示,针对不同的屏幕尺寸能够动态调整页面布局、容器布局,充分利用整个屏幕,为用户显示更多的内容,提供更好的体验,提升App的开发运营效率,保障多端业务同步发展。

阿里文娱技术 1621

GaiaX开源解读 | 表达式作为逻辑动态化的基础,我们是如何设计的

GaiaX跨端模板引擎,是在阿里优酷、淘票票、大麦内广泛使用的Native动态化方案,其核心优势是性能、稳定和易用。本系列文章《GaiaX开源解读》,带大家看看过去三年GaiaX的发展过程。

阿里文娱技术 892

GaiaX开源解读 | 给Stretch(Rust编写的Flexbox布局引擎)新增特性,我掉了好多头发

GaiaX(盖亚),是在阿里文娱内广泛使用的Native动态化方案,其核心优势是性能、稳定和易用。本系列文章《GaiaX开源解读》,带大家看看过去三年GaiaX的发展过程。

阿里文娱技术 1219

GaiaX开源解读 | 跨端动态化模板引擎详解,看完你也能写一个

本篇中将进一步深入GaiaX的各个细节,深度解读GaiaX团队同学是如何进行方案落地的,看完本篇内容相信你一定会有所收获。

阿里文娱技术 2029

GaiaX开源解读 | 基于优酷业务特色的跨平台技术

文章会从优酷的业务特色、客户端研发效能的瓶颈问题、提出解决研发效能问题的思路这三个方面分别来进行介绍,带大家进一步了解GaiaX的起源。

阿里文娱技术 1682

数据如何指导决策:优酷主客APP播转率的C端优化

播放转化率,是一个平台重要指标。本文关注从数据分析角度,实现C端的播转率优化。

阿里文娱技术 785

优酷 Android 包瘦身治理思路全解

本文聚焦于整体治理思路,以治理实践为依托,讲述瘦身技术、治理模式、治理策略,以及背后的思考与取舍。

阿里文娱技术 729

跨平台多媒体渲染引擎OPR简介

跨平台的多媒体渲染引擎OPR的架构设计、基于native UI的弹幕渲染、音视频渲染等技术内容

阿里文娱技术 2206

优酷弹幕穿人「渲染技术」揭秘

本文主要聚焦在优酷弹幕穿人渲染相关技术介绍,包括弹幕渲染流程、弹幕穿人渲染实现及工程上的优化实践等相关方面。

阿里文娱技术 1万+

优酷端侧弹幕穿人技术实战之:PixelAI移动端实时人像分割

弹幕穿人功能服务端分割功能稳定,识别精度高,但存在一定的存储和带宽成本,且无法满足实时的特效,特别是爆款视频,时效性要求特别高。因此,优酷视频弹幕穿人业务对移动端的人像分割技术有强烈的需求。...

阿里文娱技术 2110

优酷移动端弹幕穿人架构设计与工程实战总结

弹幕穿人方案主要分为两类:“云端离线人体分割+端侧渲染”和“移动端端侧实时人体分割+端侧渲染”。在这里我们分别简称为云端方案和端侧方案。本系列文章主要聚焦在优酷端侧弹幕穿人的技术实战上,主要包括优酷跨平台多媒体渲染引擎OPR简介、优酷端侧弹幕穿人架构设计与工程实战、淘系端智能PixelAI移动端实时人像分割技术、以及优酷弹幕渲染及弹幕穿人渲染技术的方方面面。...

阿里文娱技术 1296

优酷老片修复算法,超高清重温童年回忆

《大闹天宫》、《黑猫警长》、《舒克和贝塔》……这些儿时的“小伙伴”陪伴我们一起度过难忘的童年时光,让我们看看,如何用【高清修复算法】,让他们的清晰度翻倍,重焕新光彩!

阿里文娱技术 1693

已开源 优酷动态模板研发体系为分发提效30%

概述优酷是一个多屏、多端,以内容分发及内容消费为主体的文娱生态综合体。 在内容分发场景,存在大量的客户端开发需求,包括视觉升级、各场景的业务需求迭代、大小屏设备需求同步等,为了降低研发在跨端场景中组件重复开发的技术成本,优酷技术团队于2019年底开始探索跨端动态化研发提效解决方案,经过2年多时间的努力,目前跨端动态化能力已经在优酷各业务场景落地,帮助研发团队在分发业务上实现提效30%左右。动态模板技术体系以跨端动态化SDK为中心,通过在设计阶段、研发阶段、联调阶段降低对接、开发、调试等核心工作的技术成

阿里文娱技术 3273

全自研客户端技术方案:优酷跨端动态模板引擎优酷跨端动态模板引擎

前言优酷客户端是一个多平台【Phone、Pad、OTT、MacPC】的文娱生态综合体,为了降低多端产品迭代的开发成本,并提供给用户高性能、一致的产品体验,优酷技术团队在19年底启动了跨平台动态模板引擎技术方案的攻坚。作为内容分发的主体,优酷客户端在产品展现层的主要特点是组件设计的规范化和卡片化。优酷动态模板引擎在问题定义上将组件作为了我们的问题空间模型,不仅很好的规避了如Weex、React Native等技术方案的复杂度和工程量,让我们可以快速实验及工程化。其次也在根本上让技术方案脱离JS Bridg

阿里文娱技术 3062

《这就是街舞》自由视角沉浸式体验黑科技

《这!就是街舞》第四季大家看了吗?不知道有没有小伙伴跟笔者一样,“DNA”都要跟着舞动了起来。除了炸裂的舞台,堪比跨次元的真实观影体验,让用户在自由视角视频体验效果下身临其境:是不是觉得很炫酷,so 还不赶快上优酷体验一把!自由视角视频作为优酷内一种新颖的观看模式,给用户带来了全新的观影体验,在对外的众多合作中作为优酷的亮点内容也引起了较高的关注度。然而随着产品声量的不断扩大,当前自由视角在整体的播放体验及投放链路上还有很多诸如,播放不流畅、内容不清晰、设备覆盖较低等问题需要优化解决。基于此,优酷技

阿里文娱技术 1215

逻辑编排在优酷可视化搭建中的实践(四) - 编排通用性方向探索

之前的文章讲过YOHO平台是因营销搭建平台的需求而诞生的,而后我们有了让它能够服务到更多平台的想法。三月底的时候,直播业务的同学找到我们,希望能够借助我们的平台实现编排。彼时的YOHO还不足以承接外来业务,所以在4月份开始了通用性的改造。G6到X6YOHO早前是基于G6开发的,逻辑编排对图形编辑的要求比较高,而G6更加侧重于图形展示、数据可视化,以及基于canvas的高性能。团队的小伙伴最初通过G6实现了一版编排,能力都没问题。后来想要不断优化画布能力的时候,就比较累心了。无论是对齐还是连接线路径计

阿里文娱技术 2563

逻辑编排在优酷可视化搭建中的实践(三) - 元件与平台

前言前一篇文章里讲解了逻辑与Runtime&DSL,也提到了逻辑编排三板斧:元件 + 编排器 + Runtime,我在本篇将主要聊一聊元件设计以及YOHO的平台化。元件元件在我们的设计中,分为基础元件和业务元件,业务元件就是我们需要创建仓库、编写源码、提交发布的的元件,它是逻辑片段的实体;除它以外的都是基础元件,我们在设计给好莱坞使用的编排方案中。基础元件只有开始元件和结束元件,只是为了降低非研发人员的使用成本,元件越少越好。虽然分成了基础元件和业务元件,但业务元件实质上是一种特殊类型的基础

阿里文娱技术 1424

逻辑编排在优酷可视化搭建中的实践(二) - 编排器与业务

背景与价值说到逻辑编排大家应该都不陌生了,目前我们集团有多面向后端的逻辑编排技术专项,且没有统一的标准、沉淀通用的方案。也有前端逻辑编排项目,但均面向前端开发提效的逻辑编排,而我们是要打造一个面向非研发人员,可让他们根据图形化组件搭建出逻辑的平台。为什么要做这个呢,围绕我们团队的好莱坞搭建平台来说,随着页面可视化搭建的蓬勃发展,互动营销类的页面/组件需求日益增长,为了提高开发效率,研发侧不断地沉淀通用的基础库,与服务端商定标准化的接口,以此来减少维护成本,但现有的可视化搭建效率和研发效率都已经达到瓶颈了

阿里文娱技术 1810

逻辑编排在优酷可视化搭建中的实践(一) - 逻辑与Runtime

从可视化搭建说起页面可视化搭建系统从16年开始如雨后春笋般涌现而出,从活动页搭建到中后台搭建,有开源有仅公司内部使用的,都致力于将前端从繁复的体力劳动中解脱出来,提高页面生产效率。优酷内部也有一套营销活动搭建系统,每年生产2K+活动页;能够满足这么多页面的需求,除了沉淀了大量可复用的组件外,围绕着搭建系统的前端研发每天都在不停地维护升级老的组件,同时生产新的组件。痛点页面生产能力上去了,研发还是一直埋头在组件开发需求中。这些需要都是从哪里来的呢?其实上面也有提到,就是两点:老的组件需要添加新的能力,

阿里文娱技术 1460

优酷播放体验优化实战(四)--“三高”音频渲染引擎设计

一. 背景随着高清在用户观影过程中的深度普及,人们已经不仅仅满足于视的享受,更需要听的保证。如何稳定保障音质,甚至增加更多的音效玩法需要一套强大的系统将数据传输、音频实时处理技术、音频输出有效地整合起来;而作为一个可以商业化应用的系统,其应具有高性能、高复用、高可靠的特点,在本文我们将探讨如何打造一套具备这些特性的音频渲染引擎。二.化繁为简的高复用考虑高复用的一个基本出发点是基于我们面临的问题的复杂性,如图所示:如果想覆盖市面基本的用户群体,我们至少需要支持5种操作系统的6种渲染接口;以更少的改动

阿里文娱技术 2366

ABF平台设计(一)-新一代标准化中后台研发平台

“中后台系统”一般是指各种互联网公司研发的面向内部或者ToB用户的运营管理类平台,如各种CMS系统、CRM系统等,它们的特点是交互复杂度高(大量复杂表单、表格、弹框)、碎片化严重(随着业务的发展补全功能,早期的顶层设计缺失)、交互体验相对较低(尤期是对内系统,在性能、卡顿方面要求较低)、迭代频繁(随着业务的诉求随时变动)。前端在中后台系统的业务支撑中往往面临着人少事多、碎片化,需要经常补位支撑的情况。​优酷的运营中后台系统就是具备这些特点的一系列系统,随着用户需求和竞争环境的改变,需要制定灵活的内容和用

阿里文娱技术 1140

ABF平台设计(二)-流水线的配置器

ABF平台的配置中心又可以称之为渲染中心,负责所有应用的渲染数据与渲染功能配置。在中后台研发的过程中,我们发现中后台系统存在着普遍性的原则。多个系统在渲染的功能上存在几乎100%的可复用性。例如常见的中后台的页面就是搜索展示表格、表格内容新增、编辑表格内容、删除表格内容等针对不同业务的相同形式页面。所以配置中心的目标就是作为“中后台工厂流水线”的配置器,完成业务系统的高效开发。那么,流水线应该有哪些配置呢?1. 应用配置——大门与钥匙不同于toB与toC的项目,绝大多数中后台项目面向对象都是内部人员

阿里文娱技术 916

ABF平台设计(三)-优酷中后台低代码开发方案

背景我们团队绝大多数工作都是在开发各种中后台应用,也一直在探索如何提升中后台应用开发的效率。为此我们建设了ABF平台,能在ABF平台上一站式完成应用创建、权限控制、开发、部署等,这篇文章将介绍ABF平台中非常重要的一部分——搭建中心。顾名思义,搭建中心是一套中后台低代码开发的解决方案,主要有这些功能:● 可以通过拖入组件、修改配置的可视化交互方式来开发页面● 在编辑器里可以随时拖入物料中心的物料,无需提前确定依赖● 可以搭建页面也可以搭建物料,能通过搭建反向补充物料中心● 对于复杂场景,支持“代

阿里文娱技术 1538

ABF平台设计(四):体验黑科技-结构化的体验数据平台

你是否遇到过下面的场景?场景1:新接收了一个项目,想了解一下当前的用户使用习惯和反馈,却没有一个全面、权威的数据支撑来帮助你深入了解,只能从用户口中了解到一些零散的信息;场景2:在讨论产品方案时,产品、开发在一起各抒己见,每个人都感觉自己代表用户,到底谁代表用户?场景3:系统经过多年的迭代,各种热门功能和僵尸功能混在一起,变得十分臃肿,你想精简一下系统功能和代码,却因为不了解哪些功能还在使用、哪些已经废弃,而不敢“轻举妄动”;场景4:用户报了一个线上的BUG,自己操作复现不出来,想知道用户当

阿里文娱技术 910

ABF平台设计(五)-物料中心/脚手架

概念● 广义上的物料是指与产品生产有关的所有物品,但对于前端开发来讲,物料(或前端物料)就是指组成页面并能够使其能够正常运转所需的元素(如一个按钮、一组按钮等),这里将这些元素统称为前端物料。● 前端物料不是简单的前端展示元素,而是内置了特定的UI展示、约定的行为动作、个性的业务属性、…,正是因为有了这些与业务特色紧密关联的内容,才使得开发内容看上去更像是积木的拼接,而无需大量代码(甚至无需代码)就完成业务诉求,这样不仅前端专业人员可以进行前端开发,也能使非前端人员可以进行“前端开发”。背景● 近几

阿里文娱技术 1129

ABF平台设计(六)微前端渲染框架-YseraMicroServer

前言YseraMicroServer 是基于qiankun的微前端平台化解决方案。他基于qiankun的沙箱能力、重新定义的通信机制和接入方式以及ui快照等能力,提供一种微前端快速接入的解决方案。本文将从业务背景、实现思路、运行机制等方面进行阐述。背景在业务中,我们会遇到2种情况: 第一种是要把多个平台整合成一个入口,由于前期平台能力的拆分,或则团队的不同,完整链路上的能力被拆分在不同的平台中,这对于运营来说是低效(需要切换不同的平台),而整合成一个入口,可以有效的降低平台切换的成本;第二种是要将平台

阿里文娱技术 373

优酷播放体验优化实战(三)--低延时直播

一、前言5G到来后用户的网络速度逐渐提高,同时用户对直播延迟等播放体验的要求也越来越高,在此背景下,优酷技术团队结合业内主流的直播技术架构提出了两种基于HLS(HTTP Live Streaming)的低延迟直播方案(Low Latency HLS),并且正式应用到了优酷直播业务。业内当前主流直播低延时方案优缺点对比如下:1、RTMP(Real-Time Messaging Protocol)优点:1)专门为流媒体开发的协议,对FLASH的支持较好;2)延迟较低,一般在1-3秒;缺点:1)基

阿里文娱技术 866

再下一城!阿里文娱AI大脑北斗星团队论文入选NIPS 2021

文娱妹导读NIPS (Conference and Workshop on Neural Information Processing System)神经信息处理系统大会是机器学习领域的顶级会议。在NIPS 2021,阿里巴巴文娱AI大脑北斗星团队有一文入选,研究成果属于视觉分类领域。Reducing the Covariate Shift by Mirror Samples in Cross Domain Alignment- 作者王敏全赵寅蔡龙军(作者均来自阿里巴巴阿里文娱AI大脑北斗星

阿里文娱技术 602
上一篇: GaiaX开源解读 | 基于优酷业务特色的跨平台技术
下一篇: GaiaX开源解读 | 跨端动态化模板引擎详解,看完你也能写一个
阿里巴巴文娱技术
阿里巴巴文娱技术 企业官方账号 企业官方账号
博客等级 码龄7年 787粉丝 115原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值