Galbot日前发布RoboGesture框架,旨在提升人形机器人在对话中的非语言表达能力。该系统根据实时语音生成匹配的手势,使机器人交流更自然。相关研究由Galbot联合清华大学、北京大学、北京理工大学、哈尔滨工业大学和上海启智研究院完成,将在ECCV 2026展示。
RoboGesture的语义-声学处理模块直接处理原始音频,捕获音高、重音、节奏和语调等信息,而非依赖文本转录。系统使用Mimi编解码器将语音转为音频令牌,在多层次上提取特征,结合300个手势类别生成动作。基于扩散变换器的运动模型在连续空间中生成手势,使动作间自然过渡。
系统采用Anti-Inertia方法解决“模态遮蔽”问题,避免模型过度依赖历史运动而忽视新语音。AI生成的动作经模型预测控制安全过滤器校验后执行,自碰撞帧率从4.16%降至0.13%。
系统已在搭载BrainCo灵巧手的宇树G1人形机器人上测试,完整流程包括语音识别、语言模型、语音合成、手势生成和安全过滤。RoboGesture旨在提升人形机器人在面对面交互中的表现力与响应能力。
35 0
登陆后参与评论
2026-09-08 08:44:52
2026-09-08 08:44:14
2026-09-07 09:14:32
2026-09-04 09:04:22
2026-09-04 09:02:27
2026-09-04 08:50:38
2026-09-03 08:52:17
2026-09-03 08:50:32
2026-09-03 08:42:26
2026-09-02 09:52:29
2026-09-02 09:47:40
2026-09-02 09:46:37