公司动态

3D超短焦投影赋能人形机器人:爱湫如何用‘表情’突破恐怖谷?

📅 2026/9/1 7:18:54
3D超短焦投影赋能人形机器人:爱湫如何用‘表情’突破恐怖谷?
2024 年世界机器人大会WRC期间四川展台上一位叫“爱湫”的本土人形机器人吸引了大量目光。它没有像很多同行那样把重心放在运动控制参数、关节扭矩、自由度数量上而是选择了一个非常特别的切入点用一套 3D 超短焦投影系统在脸部“投”出一张会变的脸。现场演示时爱湫可以根据对话内容切换表情从开心、惊讶到害羞脸部变化非常自然。这个方向让我很感兴趣。过去我们聊人形机器人习惯性关注电机、减速器、传感器、大模型参数却很少讨论一件事当机器人站在你面前时你愿不愿意把它当成一个“可交流的对象”。爱湫想解决的正是这个问题。这篇文章不准备写成新闻稿也不准备堆参数。我会从技术角度拆解“3D 超短焦投影面部”到底是怎么实现的情感交互在工程上需要哪些模块配合以及为什么“不卷参数”反而可能是一条更务实的路线。1. 理解“会变脸”的人形机器人在解决什么问题1.1 人形机器人的“恐怖谷”与情感缺口人形机器人领域有一个绕不开的概念叫“恐怖谷效应”。当机器人外观越来越像人但表情、动作、皮肤质感仍然有明显机械感时用户会产生排斥和不适。过去很多机器人厂商把精力放在提升自由度、关节响应速度、步态稳定性上这当然很重要但用户面对面交流时真正决定体验的往往是“表情是否自然”“眼神是否有交流”“对话节奏是否舒服”。爱湫的定位很明确不卷参数专攻情感交互。它不需要像 Atlas 那样完成后空翻也不需要在复杂地形上奔跑它要做的是在展厅、服务台、教育场景里成为一个人愿意主动对话的“伙伴”。而要让人愿意对话第一关就是面部表达。1.2 为什么选择“投影面部”而不是“屏幕面部”目前市面上人形机器人脸部方案大致有三类方案类型实现方式优点缺点固定面具注塑或 3D 打印的固定面部特征成本低、结构简单表情单一无法变化屏幕显示在头部嵌入 LCD/OLED 屏幕显示清晰、内容灵活平面感强缺乏立体感和真实感投影面部用投影设备将人脸图像投射到立体面具有立体感表情动态自然对光环境敏感结构复杂爱湫采用的 3D 超短焦投影方案本质上是把屏幕搬到了“半透明立体面具”上。超短焦投影仪可以在很短的距离内投射出较大画面因此投影模组可以藏在机器人头部内部不会像普通投影仪那样需要 1 到 2 米的投射距离。面具本身带有立体轮廓当投影图像覆盖上去后人眼会同时接收到“立体结构”和“光影变化”大脑会把它感知为一张有体积感、会动的脸。这个思路其实借鉴了舞台道具和主题乐园里的“幻影成像”技术只不过爱湫把它小型化、轻量化并与人形机器人的头部运动、语音对话系统做了联动。1.3 “会变脸”的本质是动态材质映射“变脸”听起来很玄本质上就是把不同的表情纹理、面部贴图、光影信息映射到同一个立体面具上。如果你在计算机图形学里做过 UV 贴图就很容易理解面具的 3D 模型有一个固定的 UV 展开图。每个表情对应一张或多张纹理贴图。通过切换贴图或插值混合贴图实现表情过渡。当投影仪把这张纹理投射到物理面具表面时面具表面的凹凸结构会改变光的反射方向从而产生“表情是长在脸上的”效果而不是一块平面屏幕在播放视频。2. 爱湫机器人的技术架构与关键模块2.1 整体系统分层从我看到的公开展示信息来看爱湫作为一个面向情感交互的人形机器人大致可以拆成以下几个层次感知层麦克风阵列、摄像头用于捕捉用户面部表情和姿态、触觉传感器。决策层语音识别ASR、大语言模型/对话管理、情感状态机、情绪识别算法。表达层3D 超短焦投影面部系统、语音合成TTS、头部/颈部舵机、手臂简单动作。支撑层电池管理、主控板、网络通信、散热系统。这里面比较有意思的是表达层和决策层之间的联动关系。传统机器人可能是“用户说话 - 识别 - 检索答案 - 播报”而爱湫的链路更像是“用户说话 用户表情 对话情绪 - 识别 - 生成回应内容 生成表情状态 - 投影面部 语音播报”。2.2 3D 超短焦投影模组的工程挑战超短焦投影仪在办公和教育场景已经很常见但放到机器人头部内部有几个工程挑战是展厅演示时不容易注意到的第一是散热。投影仪 LED 或激光光源在工作时会产生大量热量而机器人头部空间非常有限。如果散热设计不好不仅影响投影亮度还会导致面具材料变形。所以爱湫的头部内部肯定设计了独立的散热风道甚至可能把投影模组的热量引导到机身背部。第二是亮度与环境光。投影面部在暗光环境下效果最好但实际使用场景往往是室内灯光充足。要保证表情可见投影亮度需要做到 1000 ANSI 流明以上同时面具材料需要有一定透光性和漫反射特性。太透了会看到内部结构太暗了投影亮度不够这个平衡需要反复调参。第三是投影畸变。超短焦投影本身存在明显的梯形畸变和桶形畸变因为投射角度大画面边缘会被拉伸。在办公场景里可以用软件矫正但在机器人头部这种复杂曲面面具上畸变矫正要结合面具模型做逐像素映射不能直接用通用矫正参数。第四是延迟。面部表情必须和语音、动作保持同步如果投影刷新率跟不上对话节奏人脸会显得“慢半拍”情感体验会大幅下降。因此投影控制模块和数据总线需要低延迟通信通常会把表情帧率控制在 30fps 以上。2.3 面部表情生成系统的工作流程为了便于理解我把爱湫的面部表情生成流程拆成 5 步采集用户状态摄像头捕获用户面部表情麦克风采集语音内容。意图与情绪识别通过情绪识别模型判断用户当前情绪开心、困惑、平静、惊讶等同时从语音内容中提取语义意图。生成机器人情绪状态决策模块根据“用户情绪 对话上下文 当前任务”决定机器人应该表现出什么情绪。合成面部纹理根据情绪状态从表情库中选取对应的 3D 面部纹理和动画参数必要时做混合插值。投影与联动控制将生成的纹理发送到投影模组同时控制头部舵机、语音播报形成多模态输出。这五步在演示中看起来一气呵成但工程上每一步都有独立的算法模型和通信协议。3. 情感交互为什么“不卷参数”反而更聪明3.1 对话能力不等于情感能力现在很多大模型机器人强调自己的参数规模动辄百亿千亿参数能回答各种知识问题。但“能回答”和“会交流”是两回事。举个例子当用户说“我有点累”时一个参数规模很大的知识型模型可能会给出“建议你早点休息保证充足睡眠”的标准答案。这个回答没有错但它没有情绪温度。如果机器人这时候能先用同情的表情看着用户放慢语速说“听起来你今天确实挺辛苦的”然后再补充建议用户的感受会完全不同。爱湫在情感交互上的打磨在于它把表情、语音语调、语气词、头部微动这些“非语言信息”作为核心体验来设计而不是把大模型的知识回答能力当作卖点。它做的是一种“轻参数、重体验”的技术路线。3.2 表情状态机的设计思路在工程上机器人的情绪不能直接交给大模型自由发挥否则表情会不可控。更稳妥的做法是设计一个“情绪状态机”基础情绪平静、开心、疑惑、难过、惊讶、害羞。情绪迁移条件当用户情绪识别为“开心”且对话内容为正面时机器人进入“开心”状态。情绪平滑过渡表情不能瞬间跳变需要通过插值或动画状态机做 200ms 到 500ms 的过渡。伪代码思路如下class EmotionFSM: def __init__(self): self.current_emotion neutral self.transition_times { neutral_to_happy: 300, neutral_to_surprised: 200, ... } def update(self, user_emotion, dialogue_sentiment): target_emotion self.decide_emotion(user_emotion, dialogue_sentiment) if target_emotion ! self.current_emotion: self.play_transition(self.current_emotion, target_emotion) self.current_emotion target_emotion return self.current_emotion这里我没法确认爱湫内部代码的具体实现但状态机平滑过渡是这类情感交互系统的通用做法直接丢给大模型一个“你猜我现在该是什么表情”的开放式问题在实时交互中很容易失控。3.3 多模态信息融合文字不是唯一输入爱湫的情感感知并不只依赖语音识别还依赖摄像头捕捉的用户表情。试想一个场景用户嘴上说“我没事”但眉头紧锁、语气低沉。这时候单看文字系统会认为情绪正常但多模态融合会把视觉表情、语音音调都作为输入综合判断出用户可能并不开心然后机器人会表达出关切的表情和语气。这种多模态融合的工程实现通常会在前端做特征提取然后把特征向量拼接后输入到一个轻量级分类器或打分模型。与全功能大模型相比这种方案延迟更低更适合实时的面对面交流。4. 落地场景与产业价值从“玩具”到“服务入口”4.1 展厅与品牌体验场景爱湫这种类型的人形机器人目前最容易落地的场景是做品牌展馆、科技馆、商场导览。传统展厅机器人往往是一个平板加一个轮式底座导览时用户看屏幕机器人像“带轮子的显示器”。爱湫把表情和语音联动起来以后体验完全不一样当它介绍某个展项时会因为内容“兴奋起来”表情有变化头部会微微转动用户会觉得是在和一个“人”交流而不是在听语音播报。这里有一个关键点在公共空间里人形机器人需要具备吸引注意力的能力。投影面部在暗光展区里非常醒目动态表情天然比静态屏幕更容易建立情感连接。4.2 教育陪伴场景教育机器人一直面临“孩子玩三天就腻”的问题。原因是很多教育机器人只是把故事机嵌进一个塑料壳里交互模式单一。爱湫的表情系统可以让孩子感知到“机器人有情绪反应”从而更容易产生长期陪伴动机。比如孩子读英语时机器人会因为孩子读得准确而露出开心的表情孩子回答错误时机器人做出疑惑的表情鼓励孩子再试一次。这种反馈如果用纯语音实现效果会差很多因为人类对视觉信息的敏感度远高于听觉。4.3 面向老年人与特殊群体的适老化交互有一个容易被忽略的价值点是情感交互机器人对老年人群体的意义。很多老年人不习惯触屏操作但对“人形”和“表情”有天生的接受度。一个会通过表情表达关心、能放慢语速的机器人比一个功能复杂但冷冰冰的智能音箱更好上手。这就涉及到设计理念爱湫把交互做“轻”降低用户理解成本。用户不需要学习指令不需要知道技能列表只需要像和人说话一样和它交流。4.4 数据积累的长远价值“不卷参数”并不等于没有技术含量。爱湫在做的事情实际上是在采集真实的人机情感交互数据用户在什么表情下说了什么话机器人做出什么表情用户如何反馈。这些数据在短期可能看不出价值但长期来看是训练下一代情感计算模型的重要资产。在同样的参数规模下拥有高质量情感交互数据的产品会比只堆参数但缺乏反馈数据的产品更有竞争力。5. 资源受限场景下的工程折中方案5.1 为什么不能直接上最强硬件很多开发者会问既然要识别情绪、生成表情为什么不直接在机器人头部装一块高刷屏幕再配一台高性能 GPU 服务器原因是成本、功耗、体积三者相互制约。爱湫作为一款要实际落地的产品需要控制整机成本在合理范围同时保证连续工作数小时。投影模组相比大尺寸屏幕在相同显示面积下功耗更低边缘端芯片只运行轻量级模型大部分复杂推理放到云端或本地服务器这样机器人头部才不需要背一个硕大的散热器。5.2 模型小型化与端云协同情感交互机器人对延迟很敏感。如果每次表情切换都要等云端返回用户会明显感觉到卡顿。因此更合理的方案是本地负责人脸检测、表情分类、语音活动检测、表情动画切换。云端负责语义理解、长对话管理、知识问答。折中方案把意图分类和情绪分类的小模型量化后部署到边缘设备只将复杂的自由对话请求发送到云端。那在工程上可以先做一个轻量的情绪识别模型用类似下面的结构import torch import torch.nn as nn class EmotionClassifier(nn.Module): def __init__(self, input_dim512, hidden_dim128, num_classes7): super().__init__() self.fc1 nn.Linear(input_dim, hidden_dim) self.relu nn.ReLU() self.fc2 nn.Linear(hidden_dim, num_classes) def forward(self, x): x self.relu(self.fc1(x)) x self.fc2(x) return x这里 input_dim 是前端语音/视觉特征向量的维度。实际部署中模型会被转换成 ONNX 或 TensorRT 格式并做 INT8 量化把推理延迟控制在 50ms 以内。6. 从“技术参数”到“交互体验”的评测维度6.1 用“无参数指标”评估情感机器人爱湫的出现给行业提了一个醒不是所有机器人都需要靠参数证明自己。评估情感交互机器人可能需要一套完全不同的指标体系维度传统指标情感交互指标运动能力自由度、关节扭矩头部转向是否自然、呼吸感模拟交互能力唤醒率、意图识别准确率表情切换是否符合语境用户感受任务完成率用户主动对话时长、二次对话率系统效率推理延迟表情与语音同步误差这些指标没有统一标准但已经有一些可量化的方向比如“表情切换与语音内容的同步延迟”“用户微笑反馈的比例”“用户目光停留时间”。未来可能会出现一套专门面向情感交互机器人的评测基准。6.2 通用人形机器人平台与垂直品类的分野爱湫展示出的差异化路线也说明人形机器人正在从“通用平台”向“垂直品类”分化。通用人形机器人追求高自由度、高负载、强运动能力面向工业替代。垂直情感交互机器人追求表情表现力、对话温度、场景亲和力面向公共服务和家庭陪伴。这两种路线并不冲突但资源投入方向完全不同。如果要做一个“情感陪伴机器人”照搬工业机器人的高扭矩关节是浪费如果要做一个“搬运机器人”花大量精力打磨表情也是舍本逐末。7. 行业影响与发展展望7.1 四川具身科技的本土化意义这次爱湫以“四川本土人形机器人”的身份亮相 WRC背后反映的是中国具身智能产业“多点开花”的趋势。过去我们关注的人形机器人企业多集中在北上广深和杭州四川在机器人硬件制造、高校科研资源、军工电子产业上有深厚积累爱湫选择从情感交互切入是以差异化破局的方式。7.2 3D 投影面部技术的外溢效应3D 超短焦投影面部机器人如果成熟这项技术本身也有很强的外溢价值。比如虚拟数字人直播、展览展示、文创文旅、影视特效道具都可以复用这套“投影 立体面具 表情驱动”的技术栈。它本质上是一套软硬一体的“表情显示方案”不只是机器人专用。在这个方向上未来可能会出现独立的“表情系统供应商”专门为不同形态的机器人、雕塑、玩偶提供表情模组。这就像早期智能手机的屏幕供应商独立于整机厂商一样。7.3 情感交互需要更多真实场景验证最后我想说爱湫目前展示的更多是技术可行性和产品方向真正的情感交互能力还需要在大量真实场景里打磨。比如在嘈杂环境下的情绪识别准确率、多人对话时的注意力切换、长时间运行后的表情一致性这些都是展厅里看不到的问题。但方向是对的。人形机器人最终要走入家庭、展厅、医院、学校它需要的不仅仅是更强的身体还需要一张会表情达意的“脸”。爱湫用3D超短焦投影给出了一个很有想象空间的答案。而“从参数竞争中跳出来回到用户体验本身”这可能是人形机器人行业最需要的思路转换。