学校首页

综合新闻

当前位置: 学校首页 - 综合新闻 - 正文

人工智能与计算机学院数据科学系举办语音模型在具身智能中的应用专题讲座

时间:2026-09-23
来源:人工智能与计算机学院
供稿:
浏览:
字体:
分享:

2026年9月21日上午,人工智能与计算机学院数据科学系邀请北京智源人工智能研究院王雨阳,为学院研究生及本科生作题为“语音模型在具身智能中的应用”的专题讲座。讲座围绕语音模型如何从信息交互入口走向物理世界,结合机器人演示、系统架构和长期记忆等问题,介绍语音技术在具身智能系统中的作用与发展方向。

1.png

王雨阳首先从大模型交互入口出发,分析语音模型进入具身场景后面临的新要求。与纯文本对话不同,机器人需要在开放环境中持续感知并及时回应,既要准确识别和生成内容,还要处理用户插话、实时打断与自然轮转,实现更接近人类交流方式的原生全双工交互。她通过现场演示说明,一次看似简单的“接住插话”,背后涉及流式语音感知、对话状态判断、生成控制和机器人动作协调等多个环节。

围绕“从大模型交互入口到具身交互还差什么”这一问题,她梳理了多模态交互、理解与推理、具身场景适配、长期与终身记忆、真实环境抗干扰以及部署友好度等关键能力。具身智能需要把语音、视觉和文本放在同一任务过程中理解,在噪声、远场和多说话人等条件下保持稳定,同时兼顾时延、成本与隐私等端侧部署约束。

在记忆机制部分,她区分了与时间、地点和个人经历相关的情景记忆,以及承载事实、概念与一般知识的语义记忆。当前文本记忆技术已相对成熟,但物理世界中的多模态记忆、多用户和多说话人终身记忆仍有较大提升空间。未来系统需要融合视觉、听觉与文本检索,主动识别声源和交互对象,并从连续经历中调取相关历史信息。她还介绍了参数化端到端记忆思路,即通过参数化读写、超网络或在线参数更新,将情景记忆与语义记忆逐步沉淀到系统中。

本次讲座将语音模型、具身交互和长期记忆等前沿方向贯通起来,帮助同学们把对语音技术的理解从识别与生成环节拓展到完整的物理世界交互系统,也为多模态大模型、机器人交互和端侧智能研究提供了新的思路。

2.png

王雨阳于2020年至2024年在波士顿大学攻读计算机科学本科,2024年至2026年在伊利诺伊大学香槟分校攻读计算机科学硕士,期间曾参与美国国家航空航天局(NASA)相关的卫星数据处理项目。现任北京智源人工智能研究院专家。

北京智源人工智能研究院成立于2018年,是中国人工智能领域具有重要影响力的非营利性新型研发机构。研究院先后推出“悟道”大模型、BGE、Emu3和RoboBrain等代表性成果,在大模型与具身智能研究方面处于国内前列。智谱AI等知名大模型企业的核心创始人曾在该研究院开展研究,使其被业内誉为“中国大模型的黄埔军校”。

编辑:刘曼利

扫码分享