亚马逊Alexa AI通过语音分析情绪
日期:2020.01.02   来源:湖南检信智能
检信ALLEMOTION


       亚马逊的Alexa AI团队目前正在尝试探测幸福和悲伤等情绪的方法,这些工作已于今年早些时候在研究中发表。据彭博社报道,亚马逊正在开发一种用于情绪检测的可穿戴设备,人们可以用它来了解周围人的感受。

该项目已经开展多年了,在2017年,亚马逊已经开始探索情绪识别AI,但只能感知用户的声音中的沮丧,“谈论它将如何应用还为时过早,我们已经在线下探索如何使用它进行数据选择,但是在这一点上没有任何内容可以分享。”

模型如何运作

亚马逊对情绪检测的野心在最近几个月发表的两篇论文中可见一斑。两个项目都使用南加州大学(USC)的数据集训练模型,这些数据集包括演员约12小时的对话。然后注释10000个句子的数据集以反映情绪。

“Multimodal and Multi-view Models for Emotion Recognition”检测到六大情绪:愤怒,厌恶,恐惧,快乐,悲伤和惊讶。

情绪可以通过三个维度的数值直接描述:效价,即谈论情绪的积极性或消极性,激活水平,这是情绪的能量,然后是支配、控制的影响。

多模式方法分析来自音频的声学和词汇信号,以检测情绪。亚马逊Alexa高级应用科学家Viktor Rozgic解释说,声学研究语音和语音特性,词汇研究单词序列。

Wang表示,“声学特征或多或少地描述了你如何说话的风格,而词汇特征正在描述内容。如示例所示,它们对于情感联系都很重要。因此,在提取特征之后,它们被输入模型,在我们的例子中,这将是不同的神经网络架构,然后最终做出预测,在这种情况下是愤怒,悲伤和中性情绪状态。”

亚马逊最近分享的另一篇论文“Improving Emotion Classification through Variational Inference of Latent Variables”解释了一种实现微观改善效果以预测情绪的方法。

为了从音频记录中提取情感,将语音记录中的人类交互映射到一系列光谱向量,馈送到递归神经网络,然后用作分类器来预测愤怒,快乐,悲伤和中性状态。

“我们正在将声学特征提供给编码器,编码器正在将这些特征转换为较低维度的表示,解码器可以重建原始音频特征并预测情绪状态,”Rozgic说,“在这种情况下,它的价值有三个层次:消极,中立和积极,而对抗性学习的作用是以特定的方式规范学习过程,使学习的表现更好。”

情绪和机器智能

除了提供有关亚马逊情绪检测野心的详细信息外,re:Mars的一次会议探讨了情绪识别和情绪表征理论的历史,机器学习,信号处理和支持向量机等分类器的进步也推动了工作的进展。

该技术的应用范围从测量反应到视频游戏设计,商业广告等营销材料,寻找道路愤怒或疲劳的动力汽车安全系统,甚至帮助学生使用计算机辅助学习。该技术还可用于帮助人们更好地了解他人的情绪。

论文:

arxiv.org/abs/1906.10198

developer.amazon.com/zh/blogs/alexa/post/2d8c2128-eec9-44cc-9274-444940eb0a4d/using-adversarial-training-to-recognize-speakers-emotions

End


相关推荐
  • 从V2.4.0到V3.0.0-linux ALLEMOTION OS的十六周冲刺与信创蓝图
    导语:随着Linux部署包V2.4.0落地,ALLEMOTION OS进入16周冲刺期。按计划,V3.0.0-linux正式版将于年内发布,同步推进信创适配认证。16周路线图涵盖:摄像头V4L2适配(已完成)、服务化与打包、跨平台GUI客户端、麒麟V10/UOS双平台测试、飞腾/鲲鹏ARM64验证,以及文档与渠道发布。正式版发布物包括V3.0.0-linux、国产OS部署手册与DEB/RPM安装包,并计划登陆麒麟软件商店、统信应用商店等渠道。产品定位清晰:以“30-60秒多维度情绪识别”为核心能力,面向政务、医疗、公共安全与公共服务四大行业市场。认证方面,项目组拟在第二阶段里程碑完成后,向工信部、电子标准院申报信创适配认证。检信方面表示,国产化不是简单的“能跑起来”,而是要在性能、数据一致性与运维体验上全面对标——ALLEMOTION OS将以“核心算法零修改、接口协议零变化、部署运维零门槛”为目标,向信创市场交付一款经得起检验的情绪识别引擎。
    2026-08-18
  • 开放接口,快速集成 ALLEMOTION OS的三种打开方式
    导语:对集成商与行业软件厂商而言,ALLEMOTION OS提供了三种交付形态:单一ELF可执行文件、Docker容器与源码构建,并配套标准化WebSocket API。安装脚本一键完成部署:引擎落盘/opt/allemo,自动注册systemd服务,开机自启、异常自动重启,运维门槛低。接口层与Windows版完全一致:8893端口WebSocket API、8000端口MJPEG视频流,存量业务系统可无缝切换至国产OS环境。检测流程标准化:AC_ME建立会话、RUN@发起检测、TM@实时数据流(4Hz)、RST@/EMO12@/FH256@报告依次下发,二次开发文档齐备。Docker方案支持摄像头设备透传与端口映射,适合云端与容器化集群环境。项目组表示,将保持接口协议长期稳定,为合作伙伴的业务连续性提供保障。
    2026-08-18
  • 边检、安检、应急 ALLEMOTION OS的安全场景应用图景
    导语:在边检口岸、安检通道与应急指挥等场景,快速、无感、可量化的情绪识别正在成为辅助研判的新工具,ALLEMOTION OS为此提供了国产化技术底座。安全场景对检测速度要求苛刻。ALLEMOTION OS支持30秒短时检测(RUN@30),快速输出风险等级与情绪画像,适配高人流场景节奏。攻击性、压力等12维情绪指标与风险等级联动,为现场人员提供直观的预警提示。微表情256帧直方图支持事后回溯分析,为研判留痕提供数据支撑。系统支持多客户端并发连接(默认5路),可通过WebSocket接口对接现有安检信息平台。基于国产OS与国产硬件的部署能力,确保安全敏感场景的技术供应链自主可控。
    2026-08-18