2026.07.20
本文字数:1638,阅读时长大约3分钟
作者 |第一财经 陈杨园
AI没有情绪,但AI正在获取、感受人的情绪。对着麦克风讲一段话,AI便暗自从人类的语速、节奏、语气和情绪中分析,生成了一张“声音人格卡”;戴上一枚AI戒指,AI开始检测用户的情绪健康,将人的情绪状态转化为数字化反馈;根据对人类情绪的判断,AI硬件、智能体们还会悄悄调整自己的说话方式······
当机器人走向物理世界成为业界关注的重心时,回顾2026年人工智能大会的众多展品,多模态情感识别也正成为大模型技术发展的一个方向。人的情绪,这座物理世界深处的迷宫,AI正在叩门。
本届大会上,众多厂商的技术突破与此相关。模思智能首次亮相 WAIC,展出了基于 MOSS-TTS Family 语音合成模型等技术推出的声音人格测试机,在识别、理解复杂声音的基础上,模型不仅要听清说了什么,也要尽可能理解语气、情绪、节奏和上下文。以社交为核心的Soul展出自研的SoulX——基于情绪感知、语音为先、面向多模态的交互大模型,面向具身智能、内容演绎等行业输出情绪感知与交互决策方案。昆仑万维发布Mureka v9.5&O3 音乐大模型,强调要把普通人模糊的灵感变成有情绪的歌,做“最没有AI味的AI音乐模型”。
在这背后,随着多模态大模型的发展,除了获取信息,大模型对人类情绪的识别和理解能力正被视为影响下一代人机交互质量的要素,试图让模型从图像、视频、语音、文本乃至会话上下文中认识人的情绪的多模态情感识别技术成为新兴赛道,尽管相关技术仍在相对初期,但AI硬件、智能体们正从场景端推动这一需求。
“除了稳定完成一节课,未来AI学习智能体也要能陪伴学习者长期成长。”在WAIC展台,记者体验爱学AI学习智能体发现,将学习者的认知状态、情绪波动与跨课时记忆作为教学决策输入,改变教学话术和节奏正在成为AI学习智能体进化的方向。与爱为舞联合创始人、技术负责人王琳介绍,这主要来自于企业自研爱学大模型等核心技术的升级,通过自研“声学+语义”双VAD(语音活动检测),实时捕捉学习者状态。
“情绪感知是‘懂学生’ 的重要一环”,王琳告诉记者,她认为多模态感知一定会是AI教育智能体进化的主流方向,在强调“状态交互”而非 "信息传递"的教学场景下,AI 要真正成为学习伙伴,必须能听懂语气、看懂反应、感知状态,这是问答工具升级为智能体的必经之路。
在AI硬件方面,心言机器人等人形陪伴机器人正在加快融合情感大模型,大量AI耳机、AI玩具乃至AI眼镜也纷纷接入语音模型,MiniMax声音实验室展台的工作人员告诉记者,优化人机对话的语气情绪、融合情绪化语音反馈与实体具身智能互动等,正在成为AI硬件市场的一大需求。
模思智能CMO路瀚程告诉记者,在多模态情感识别方面,公司已经看到了广阔的商业空间。无论是AI客服等传统场景的服务质量,还是当大模型进入智能体、机器人、智能座舱、陪伴设备和更多现实终端时,对用户情绪的感知和情境的理解都在影响着AI进入物理世界的天花板。
不过,多模态情感识别技术仍处在发展初期,记者发现,大会现场声音的复杂、受访者偶发的表达状态等都会影响AI理解人类情绪的稳定性和准确性,多模态情感识别技术仍需大量的数据支撑和垂直场景的深度优化。而与一般数据不同,情感数据很难大规模高质量标注的特性等也将进一步成为行业的挑战。
“就像AI眼镜投入眼动追踪技术这么多年,大家都看得到趋势,但可能直到近两年,它才走向成熟。”谈起多模态情感识别技术在AI硬件上的落地可能,一位AI眼镜行业人士对记者表示。
“AI‘最后一公里’,不在于人或者机器任何一方,而在于我们怎么去想象,并且构建一种人机之间真正健康的,并且生成性的这样一种关系。”作家兼制片人陈楸帆在知乎Tech Club新知科技大会如此表示。另一方面,伴随着AI与人的边界不断突破,未来,对人机交互健康模式的探索也是一个重要命题。
WAIC的热闹里,人们对更优质人机交互的需求,正在凸显多模态情感识别的产业价值。但从“看得到趋势”到“真正走入日常”,行业仍有一段路要走。
微信编辑| 格蕾丝
:bianjibu@yicai.com
:business@yicai.com