公司动态
【论文精读】《IEMOCAP》:早在2008年ERC领域便迎来了高质量多模态数据集
提示该精读文章纯手搓无AI就是为了以人能看懂的视角讲清楚论文有问题或质疑尽情反馈文章内引用基本都来源于原论文结构清晰的目录~ ヾ(≧▽≦*o论文相关信息1. 对于ERC该论文为什么值得一看就瞅一眼 o(〃▽〃)o 1.1 对于当时来说1.2 对于现在来说2. WHY为什么在ERC领域有这么一个数据集诞生了2.1 实验中的情绪表达方式过于单一2.2 实验中的情绪不够真实2.3 对话回合比较少甚至没有语境 (_)2.4 实验对话参与者数量与语料规模都太小2.5 仅靠视频提供的视觉信息精度对于模型来说不够2.6 直接拿目标情绪当标签的标注方式不靠谱2.7 离散型数据本身会缺少连续属性维度2.8 问题小结3. WHAT不妨看看IEMOCAP数据集3.1 IEMOCAP数据集到底是什么3.2 它要用来解决什么问题3.3 本节小结4. HOW那IEMOCAP又是如何制作的4.1 第一道工序现场录制4.2 第二道工序后期处理5. PERFORMANCE?最后来看看它的表现如何5.1 直接做标准流程5.2 离散标注的质检报告一致性还行但仍不可能达到绝对完美5.3 意外发现演员居然不认识自己的情绪6. 补充6.1 把头部移动信息从表情信息里剥离区分开SVD到底做了什么详解4.27. 术语表论文相关信息项目内容英文题目IEMOCAP:Interactive emotional dyadic motion capture database中文参考译名IEMOCAP互动情感双人动作捕捉数据库作者Carlos Busso, Murtaza Bulut, Chi-Chun Lee, Abe Kazemzadeh, Emily Mower, Samuel Kim, Jeannette N. Chang, Sungbok Lee, Shrikanth S. Narayanan南加州大学语音分析与解读实验室SAIL洛杉矶加利福尼亚州年份2008论文链接正式发表的期刊 原PDF版主要数据集IEMOCAP Database数据半公开需要申请作者已经申请到了1. 对于ERC该论文为什么值得一看就瞅一眼 o(〃▽〃)o 1.1 对于当时来说弥补了数据部分空缺所有老库都存在各种各样的问题接下来会讲而IEMOCAP 是第一个把真人双人交互 剧本/即兴 ‘诱发’ 动作捕捉 音频 主客观双重标注 12小时规模凑齐的库。它证明了多模态同步记录和在语境中诱发情绪是可行且可复制的。提供了一套质检思路Fleiss’ Kappa、混淆矩阵、Cronbach’s α、自评vs他评的对比——告诉后人标注不一致不一定是失败可以用这些指标量化描述。1.2 对于现在来说IEMOCAP 甚至到今天仍是情绪识别尤其多模态、对话情感的一大基准数据集仍有许多论文用它做实验。因此在用它时得先懂它。在当下再制作新的多模态数据集库它仍是一个值得被参考的数据集包括它的取舍逻辑。总的来说论文本身不具备实验结论但它定义的标准数据仍是当前领域可参考的事实标准阅读它不是为了学新方法而是为了正确使用这个老工具以及理解学术语料的根本性问题。2. WHY为什么在ERC领域有这么一个数据集诞生了很显然在当时研究者对当时及之前的数据集表示不足因为对于ERC领域ERC领域综述的研究本身就十分复杂需要用人工智能去“理解”识别人类都难以解释的情绪情感。而写该篇论文的一批研究者便结合其他现有数据集的不足重新制作了一套更复杂更具有训练价值的数据集——IEMOCAP Database那么需要先理清楚在 IEMOCAP Database 诞生前到底有哪些问题当然有些不足IEMOCAP数据集依然没能解决2.1 实验中的情绪表达方式过于单一原文“In this context, one of the major limitations in the study of emotion expression is the lack of databases with genuine interaction that comprise integrated information from most of these channels.”在生活中情绪是由多中方式共同表达出来的比如语气、面部表情、动作姿势、手势、眼神目光等这些只是我们平时表面上所看到的或许深层更复杂。然而当时的数据库没有把真实自然的交互genuine interaction和各表达方式整合数据结合起来。有的要么虽然有交互场景但只录了声音有的要么有多模态但只是一个人对着镜头独白。这就使得数据集模态本身十分单一。2.2 实验中的情绪不够真实原文“Douglas-Cowie et al. analyzed some of the existing emotional databases [28], and concluded that in most of the corpora the subjects were asked to simulate (“act”) specific emotions. While desirable from the viewpoint of providing controlled elicitation, these simplifications in data collection, however, discarded important information observed in real life scenarios [29].”我们日常中的聊天是收放自如且情绪是真实吐露的。然而实验中却不是如此当时数据集中的语料基本都是让演员演出某一种特定的情绪感觉就像演员 (っ °Д °;)っ当然好处是情绪类别干净、易于调整和控制因为研究中时常对情绪离散划分为了几个基本且固定的类别但代价就是丢弃了真实生活中情绪的真实样子比如情绪的混合、表达的强度、非基本情绪。2.3 对话回合比较少甚至没有语境 (_)原文“Another limitation of existing corpora is that the recorded materials often consist of isolated utterances or dialogs with few turns [28]. This setting neglects important effects of contextualization, which play a crucial role in how we perceive [19] and express emotions [29].”你和路人随便聊点话题都可以聊一段时间更不用说你和你的好bro们聊天简直就是长篇大论作为人应该是很容易感受到在长篇交谈中情绪情感的转变和表达虽然很难解释清楚是如何感知的你或许也只会说只是一种感觉。然而当时的数据集提供的对话的回合轮次少有些甚至没有提供上下文语境。而且直觉都清楚情绪的理解是强烈依赖前后语境的比如bro对你说“你真神了”是夸还是讽刺完全取决于你们聊过的内容才能推断所以孤立的语料所能传达的情绪和推理因素都是相对微弱的。2.4 实验对话参与者数量与语料规模都太小原文“Other limitations of current emotional databases are the limited number of subjects, and the small size of the databases [29].”一个人的一生不可能只跟一个人只说几句话毋庸置疑吧首先这与少轮次和语境不是一个概念。这是一个样本量少的问题人少对话量少数据量自然也少也就导致了模型的鲁棒性训练表现不佳的问题更谈不上个体差异的研究。鲁棒性模型面对异常输入或噪声数据时仍能稳定运行就比如“你看一篇小学生作文其中的个别错别字根本不会影响你阅读整篇作文” []~ (▽)~ *2.5 仅靠视频提供的视觉信息精度对于模型来说不够原文“Although there are automatic platforms to track salience features in the face using images (e.g., [21]), the level of the detailed facial information provided by motion capture data is not presently achievable using the state of art in video processing. This is especially notable in the cheek area, in which there are no salience feature points.”当人看清视频中远距离人物面部表情时都有可能因为像素不足或缺失导致误判。而当时甚至连高清视频的普及率都不高且多模态语料如GEMEP用的是视频特征点跟踪使得当时的视频方法给不出细粒度的面部特征信息——特别是脸颊区域压根没有显著的特征点可用来跟踪。2.6 直接拿目标情绪当标签的标注方式不靠谱原文“In most of the previous emotional corpus collections, the subjects are asked to express a given emotion, which is later used as the emotional label. A drawback of this approach is that it is not guaranteed that the recorded utterances reflect the target emotions. Additionally, a given display can elicit different emotional percepts.”我想人表达情绪肯定都不是别人固定让你表达某种情绪而是自发的且只有你最清楚最能感知。然而先前的实验中并非如此他们更多的是给“演员”已经带有情绪标签的剧本并让其表演表达出来并作为视频数据。但问题也很明显很致命如果演员压根就没有表演出目标情绪状态呢目标情绪可能是愤怒比生气更高一级但演员却可能演成了生气是不是数据就不够干净了就容易被模型误判了夸张点说你在开心的笑而训练出来的模型还以为你是悲伤。2.7 离散型数据本身会缺少连续属性维度原文“Categorical levels do not provide information about the intensity level of the emotions. In fact, emotional displays that are labeled with the same emotional category can present patterns that are significantly different.”一个人生气的时候并不是靠直接说出来我生气了或者我很生气。而是通过一系列的表达方式间接说明了一个人的情绪及其程度。但研究中主流方法是将情绪以离散化方式划分为了固定的集中基本情绪类别。这就难免会丢失很多情绪本身和情绪间的连续变化的信息或程度信息。只能让模型判断是否生气但到底有多生气并不清楚。2.8 问题小结大致便是这些不足与缺陷间接导致了哪怕ERC领域里设计或假设的模型再厉害也没有相关的数据足以支撑或用于训练该模型。也正是因为如此负责IEMOCAP数据集的研究团队便从中不断思考与完善构建了一套更优质的多模态数据集——IEMOCAP Database。3. WHAT不妨看看IEMOCAP数据集3.1 IEMOCAP数据集到底是什么简单地说IEMOCAP(Interactive Emotional Dyadic Motion Capture Database)是一个由 USC 的 Busso 团队在2007年左右采集于2008年发布的两个人面对面吵架/聊天时的情绪数据集。具体的构成10个演员(5男5女,其中7个专业演员3个表演系高年级学生)。一共5个录制日并且每次一男一女一对每场进行约6小时后戴标记的两人轮换。采用两种诱发方式剧本类型(scripted):挑了三部有情绪起伏的10分钟话剧,让演员背台词演——情绪内容可控。即兴类型(spontaneous):给出假想情景让他们当场聊,比如你在车管所排了一小时队被拒了“你朋友车祸去世了”“通知闺蜜你要结婚了等场景——情绪更真”。表一所示表一其中“Subject n”即为两种诱发方式采集方式2支麦克风48kHz声音2台高清摄像机正面半脸视频3D动作捕捉VICON 8相机、120帧/秒包括脸53个marker头带2个手腕4个手各1个全部同步。规模总约12小时共约10000个对话轮次逐句转写。标注每个轮次由标注者看视频听音频和结合上下文标注——离散情绪类别愤怒/悲伤/快乐/沮丧/中性/恐惧/厌恶/惊讶/兴奋,允许混合以及连续3维愉悦度、激活度、支配度还给“演员自评 vs 外人评价”做了对比。3.2 它要用来解决什么问题核心问题当时的情绪识别的地基数据仍然不够好。以前的库都不及格(上小结所讨论的内容):要么全是演员朗读单句话的假情绪,要么是孤立话、只有音频、人太少规模太小;真自然的对话情绪却又不可控。因此它正是要要修复这些不足原先存在的问题IEMOCAP 的解法情绪是演的、不真实双人对话即兴情景诱发让情绪在交互中自然发生虽然仍是半自然没语境、孤立语句平均5分钟的连续对话情绪在剧情/话题中展开只有音频、没有画面音、视频、动捕三路同步连脸颊细微表情、头动、手势都能拿到人少、数据少10人、12小时、1万多个对话轮次甚至提供了情绪标签应该怎么定的方法原先采用的是可能产生偏离的演员演了什么情绪就标什么情绪标注方式而IEMOCAP采用多人主观评估、投票、可打混合标签、带连续维度,并量化一致性。3.3 本节小结因此这篇论文的核心问题不是简单地判断一句话中有没有积极或消极词语更是给情感计算、多模态人机交互领域准备的第一个能在真实世界场景下训练情绪识别模型的标准化数据库。4. HOW那IEMOCAP又是如何制作的4.1 第一道工序现场录制准备道具61个反光小球基本不影响对话者说话减小识别误差脸上贴53个直径4毫米的小球位置尽量按MPEG-4标准定义的面部特征点来排而且故意拉开间距因为贴太近后期反三角计算轨迹时误差可能会大。头带2个不随脸部运动变形专门用来算头部转了多少、两个手腕带各2个、每只手再加1个共61个。图一所示图一实际上也有一些问题论文作者自身也表明手部精度不够每只手就3个点数不了手指只能给个大概手在动的信号。布局场景场景与设备摆放8台VICON相机、120帧/秒离被贴点的人约1米。声音用2支Schoeps枪麦48kHz画面用2台Sony摄像机拍半张正脸。图二所示图二其中的部分要求原文“the subjects were asked to be seated during the recording”“gesture as naturally as possible”只能坐着录因为站起来手势容易出相机的共同视野范围但允许他们尽可能自然地做手势只是不准用手挡脸。两个人隔了3米没贴点的那个坐出VICON视野外面两人隔着大约3米对话同时作者论证这在Hall定义的社交距离之内不会影响自然互动。原文“the VICOM cameras are sensitive to any reflected material in their field of view. Therefore, it is technically difficult to locate the additional equipments in the room without affecting the motion capture recording”一次只贴一个人原来想两人同时动捕的但因为受到场地限制对于额外安装设备十分困难所以改为全套贴完再换人重新录一遍。原文“At the beginning of each recording session, the actors were asked to display a neutral pose of the face for approximately two seconds. This information can be used to define a neutral pose of the markers.”一开场先拍2秒中性脸相当于给每场录制留了个基准线。4.2 第二道工序后期处理剪辑裁切轮次、转写内容、对齐原文“After the sessions were recorded, the dialogs were manually segmented at the dialog turn level (speaker turn), defined as continuous segments in which one of the actors was actively speaking… Short turns showing active listening such as “mmhh” were not segmented.”人工按谁在说话裁切对话轮次并指出mmhh这种应答不算剧本部分提前按句子切好当参考。最终产出约10000个对话轮次剧本类型轮次数量5000多即兴类型轮次数量接近5000平均4.5秒/轮、11.4词/轮表二所示。作者还特意拿来跟 Switchboard-1、Fisher 对比证明我们这个虽说是剧本/表演但对话节奏和真人自然语料差不多。表二而转写的工作外包给了其他公司。原文“Then, forced alignment was used to estimate the word and phoneme boundaries. Conventional acoustic speech models were trained with over 360 hours of neutral speech, using the Sphinx-III speech recognition system (version 3.0.6) [40].”用360小时中性语音训练 Sphinx-III一个老款的开源的语音识别系统 做强制对齐把听出来的文本文字与录音波形时间上对齐把每个词、每个音素的起止时间标出来其中our preliminary screening suggests that the boundaries are accurate即作者自己承认没严格评测过但初步看挺准。完善数据原文“Cubic interpolation was used to fill gaps when the number of consecutive missing frames for each marker was less than 30 frames (0.25 second)”需要对小球进行三维轨迹重建因为摄像机只能把小球的位置信息投影成屏幕的二维信息而无法获得“距离深度”信息且只能半自动。对于视频检测连续丢不到30帧0.25秒就三次插值“糊弄一下”丢太多的就只能放弃补救眼睑marker丢失率高达13.5%因为眨眼时被眼皮盖住手则是因为可能双手互相遮挡。图三所示图三原文“After the motion data were captured, all the facial markers were translated to make a nose marker at the local coordinate center of each frame, removing any translation effect. After that, the frames were multiplied by a rotational matrix, which compensates for rotational effects. The technique is based on Singular value Decomposition (SVD) and was originally proposed by Arun et al. [3].”最后一步是把头部运动信息从表情信息里区分开先平移拿鼻子marker当地心去掉平移分量再每帧求一个旋转矩阵把它转回标准姿势用 SVD 算出R t V U T R_t VU^TRtVUT。这样剩下的运动就是纯粹的脸部表情不会因为头向左歪而误判了某些表情变化。这里可能会有点难懂但没关系有我在必须讲清楚感兴趣的可以移步到第六部分的补充章节5. PERFORMANCE?最后来看看它的表现如何前面罗列了那么多设计巧思数据真做出来了但质量到底过不过关论文还专门做了套质检主要验两件事情绪标注客不客观、数据本身抗不抗打顺带还被作者自曝了几个小坑。5.1 直接做标准流程标注员6名USC的英语母语学生每轮turn3人并行评估看视频、听音频、结合上文语境顺序标。图三所示情绪类别愤怒/悲伤/快乐/沮丧/中性 以及 恐惧/厌恶/惊讶/兴奋一共9类允许混合标签认不出来就选other写备注。图四5.2 离散标注的质检报告一致性还行但仍不可能达到绝对完美原文“the evaluators reached agreement in 74.6% of the turns (scripted session: 66.9%; spontaneous sessions: 83.1%)”大部分话轮三人投票达成一致。亮点是即兴比剧本更容易达成一致83.1% vs 66.9%原理在论文里讲得很细剧本是按剧情走的情绪一段接一段流动夹杂一堆又气又无奈的模糊情绪“a wider range of ambiguous emotion manifestations”即兴场景是一个场景对应一个目标情绪相对更干净。图四所示图五Fleiss’ Kappa 一致性统计量全库κ0.27达成一致的部分κ0.40表三所示合并相近类别后κ0.48——论文原文坦白这些都是可接受的但expected since people have different perception and interpretation of the emotions即人之常情标注不一致本来就是情绪研究的下限也不算翻车。表三混淆矩阵平均分类率约72%表四所示。最典型的坑是沮丧成了垃圾桶——中性、愤怒、厌恶、惊讶都被它污染还有快乐和兴奋互相纠缠——这正好印证了前面情绪边界本身就很模糊的问题。表四5.3 意外发现演员居然不认识自己的情绪论文还让6位参演演员自己回来看自己演的即兴片段表五所示跟未参与对话的群众的评价对比表五原文“Surprisingly, the results show significant differences between the emotional perceptions between naïve evaluators and the actors.”说明表达和感知是不对称的演员觉得自己演得普普通通甚至没到位观众却读出了更强的情绪而且作者说把演员自评混进一致性计算里kappa值反而还会变低“the kappa value decreased when the self-evaluations were included”——因为演员熟悉拍摄套路和情绪标尺他们标注极其挑剔跟普通观众的基准对不上。也间接告诉了我们真值往往不存在大众点评永远是折中方案。6. 补充6.1 把头部移动信息从表情信息里剥离区分开SVD到底做了什么详解4.2简单且好理解的说相机录到的原始数据 表情 头姿的叠加演员点头、歪头、往前探身所有marker的坐标都会一起变。后期必须把头的姿态摘出去剩下的才是纯表情。第一步平移清零原文“all the facial markers were translated to make a nose marker at the local coordinate center of each frame, removing any translation effect.”把鼻尖marker设成每帧的坐标系原点即所有点做p ′ p − p n o s e p p − p_{nose}p′p−pnose。这样演员身体前后挪动、左右偏转都不影响数据。第二步旋转归位SVD登场原文“The main advantage of this approach is that the 3D geometry of every marker is used to estimate the best alignment between the frames and a reference frame. It is robust against markers’ noise…”为什么不用头带那两个静态marker直接测头转作者的理由是用全部53个点的3D结构整体对齐更稳——少数的marker点贴偏、丢失或者表情本身的形变都会被最小二乘平均掉最后拟合出的刚体姿态主要就是头部在动。算法材料取开场录的2秒中性脸当参考帧把53个点的三维坐标排成矩阵M r e f M_{ref}Mref53×3每行一个marker当前帧同样排成M t M_tMt。然后计算 3×3 矩阵M r e f T ⋅ M t M_refᵀ · M_tMrefT⋅Mt装着两个点集各方向上的相关强度对它做奇异值分解M r e f T M t U D V T M_{ref}^{T}\,M_{t} U\,D\,V^{T}MrefTMtUDVT最优旋转矩阵取R t V U T R_{t} V\,U^{T}RtVUT数学内在逻辑这是一个正交Procrustes问题——求旋转R让Σ ‖ p r e f , i − R ⋅ p t , i ‖ 2 Σ‖p_{ref},i − R·p_t,i‖²Σ‖pref,i−R⋅pt,i‖2最小。展开等价于让t r ( R T ⋅ M r e f T ⋅ M t ) tr(Rᵀ·M_{ref}ᵀ·M_t)tr(RT⋅MrefT⋅Mt)最大而SVD的正交性保证了R V U T R VUᵀRVUT时恰好取到最大值。SVD把两个点集差异拆成旋转→缩放→旋转我们只需要旋转。第三步剩下的就是表情原文“After compensating for the translation and rotation effects, the remaining motion between frames corresponds to local displacements of the markers, which largely define the subject’s facial expressions.”平移没了、头动没了每帧marker剩下的局部位移 真正的面部表情。另外头带marker也不是没用原文“The markers from the headband were used to ensure good accuracy in the head motion estimation.”SVD是主力干活头带marker主要当质检员验证头动估计得准不准。7. 术语表术语中文说明ERC对话中的情绪识别双人交互dyadic interaction两个人面对面聊天的交互形式情绪诱发elicitation有目的地通过设计让被测者产生目标情绪动作捕捉motion capture多相机观测反光球位置重构三维运动轨迹标记点marker贴在被测目标上的反光小球话轮turn对话中一名说话者持续发言的最小单位离散情绪类别用有限、分立的标签描述情绪连续属性维度用连续坐标轴描述情绪愉悦度/激活度/支配度半自然semi-natural由演员表演但尽量逼近自然生活状态的折中Fleiss’ Kappa多名标注者一致性的统计指标混淆矩阵交叉表展示真实类别vs判定类别的错判分布Cronbach’s α衡量标注内部一致性的信度系数强制对齐forced alignment让语音波形与文本逐字、逐音素对齐奇异值分解SVD将矩阵分解为 U·D·Vᵀ 的线性代数工具中性脸neutral pose无明显情绪的面部基准姿态