演讲嘉宾:刘昊(视启未来联合创始人,世界模型与具身智能负责人)
所属大会:2026 奇点智能技术大会 · 北京
一、引言:从"看"到"做"的 AI 进化
在人工智能的发展历程中,“理解世界"与"改变世界"一直是两个相对独立的研究方向。计算机视觉让机器能够"看见”,自然语言处理让机器能够"理解",而具身智能(Embodied AI)则让机器能够"行动"。视启未来(Visionary Future)作为一家专注于世界模型与具身智能的创业公司,正在推动这两个方向的深度融合。
2026 年 11 月,视启未来联合创始人刘昊将出席奇点智能技术大会,分享他在世界模型与具身智能领域的最新研究成果和工程实践。
二、世界模型:让 AI 理解物理世界
2.1 什么是世界模型
世界模型(World Model)是指 AI 系统对物理世界的内部表征和预测能力。一个完善的世界模型能够:
- 感知当前状态:通过视觉、触觉、本体感觉等传感器获取环境信息
- 预测未来状态:基于当前动作预测环境的下一步变化
- 模拟反事实:想象"如果采取不同行动,结果会怎样"
# 世界模型核心接口示意classWorldModel:def__init__(self,perception_net,dynamics_net,reward_net):self.perception=perception_net# 感知编码器self.dynamics=dynamics_net# 动力学预测器self.reward=reward_net# 奖励预测器defencode(self,observation):"""将原始观测编码为隐状态"""returnself.perception(observation)defpredict(self,state,action):"""预测下一状态和奖励"""next_state=self.dynamics(state,action)reward=self.reward(state,action)returnnext_state,rewarddefimagine(self,initial_state,action_sequence):"""想象一条动作序列的未来轨迹"""trajectory=[initial_state]foractioninaction_sequence:next_state,_=self.predict(trajectory[-1],action)trajectory.append(next_state)returntrajectory2.2 世界模型的三代演进
| 代际 | 代表工作 | 核心特点 | 局限 |
|---|---|---|---|
| 第一代 | Ha & Schmidhuber (2018) | 变分自编码器 + RNN | 视觉简单、泛化差 |
| 第二代 | DreamerV2/V3 (2020-2023) | 离散隐变量 + RSSM | 复杂场景建模不足 |
| 第三代 | Sora/GAIA-1 (2024) | 扩散模型 + Transformer | 计算成本高、可控性差 |
| 第四代 | 视启未来方案 (2025) | 神经辐射场 + 物理约束 | 正在探索中 |
2.3 视觉感知的世界模型
刘昊团队的核心创新在于将视觉感知深度融入世界模型。传统世界模型通常使用低维状态表示(如位置、速度),而视启未来的方案直接从高维视觉输入(RGB-D 图像、点云)中学习世界模型。
关键技术挑战:
- 高维状态空间:视觉数据的维度远高于传统状态向量,需要高效的压缩表征
- 部分可观测性:单视角图像无法完整描述三维场景,需要多视角融合
- 动态物体:场景中可能存在多个运动物体,需要实例级跟踪
# 视觉世界模型:基于 NeRF 的场景表征classNeuralWorldModel:def__init__(self):self.nerf=NeRFNetwork()# 神经辐射场self.dynamics=TransformerDynamics()# 动力学预测defrender(self,camera_pose,time_step):"""从任意视角渲染场景"""scene_repr=self.nerf.encode_scene(time_step)returnself.nerf.volume_render(scene_repr,camera_pose)defstep(self,action):"""执行动作并更新世界状态"""self.dynamics.predict_next_state(action)returnself.get_current_observation()三、具身智能:从仿真到现实
3.1 具身智能的三层架构
视启未来的具身智能系统采用三层架构设计:
┌─────────────────────────────────────────┐ │ 决策层:大语言模型 + 任务规划器 │ │ 输入:自然语言指令 │ │ 输出:子任务序列 + 目标状态描述 │ ├─────────────────────────────────────────┤ │ 技能层:视觉运动策略网络 │ │ 输入:视觉观测 + 目标状态 │ │ 输出:末端执行器轨迹 / 关节角度序列 │ ├─────────────────────────────────────────┤ │ 控制层:低层控制器 + 安全监控 │ │ 输入:期望轨迹 + 实时传感器反馈 │ │ 输出:电机力矩指令 │ └─────────────────────────────────────────┘3.2 Sim-to-Real 迁移的工程实践
从仿真环境训练到真实机器人部署,是具身智能面临的最大工程挑战之一。刘昊团队在实践中总结出以下关键经验:
1. 域随机化(Domain Randomization)
在仿真中引入大量随机扰动,使策略对真实环境的变化具有鲁棒性:
# 域随机化配置示例randomization_config={"visual":{"lighting":{"intensity":(0.5,1.5),"color_temp":(3000,7000)},"texture":{"randomize":True,"pool_size":1000},"camera":{"position_noise":0.02,"fov_range":(50,70)}},"dynamics":{"friction":{"range":(0.3,1.2)},"mass":{"scale_range":(0.8,1.2)},"joint_damping":{"range":(0.01,0.1)}},"action":{"latency":{"range_ms":(0,100)},"noise":{"std":0.05}}}2. 系统辨识与参数适配
在部署前对真实机器人进行系统辨识,获取准确的动力学参数,并据此微调仿真环境:
| 辨识参数 | 方法 | 精度要求 |
|---|---|---|
| 关节摩擦 | 恒速运动测试 | ±5% |
| 质量分布 | 摆动实验 | ±3% |
| 刚度矩阵 | 力控接触实验 | ±10% |
| 执行器延迟 | 阶跃响应测试 | ±10ms |
3. 渐进式部署策略
不直接将在仿真中训练的策略部署到真实机器人,而是采用渐进式策略:
- 仿真验证:在多种仿真环境中验证策略鲁棒性
- 硬件在环:将真实传感器接入仿真循环,验证感知模块
- 受限真实环境:在简化真实场景(固定物体、已知光照)中测试
- 完整真实环境:逐步增加场景复杂度,最终部署
3.3 世界模型驱动的机器人学习
视启未来的核心创新是用世界模型替代传统强化学习中的环境交互。传统 RL 需要机器人在真实环境中进行大量试错,成本高、风险大。而世界模型允许机器人在"想象"中学习:
# 世界模型驱动的强化学习classWorldModelRL:def__init__(self,world_model,policy_network):self.world_model=world_model self.policy=policy_networkdeftrain_in_imagination(self,initial_states,num_episodes):"""在世界模型中训练策略"""forepisodeinrange(num_episodes):state=random.choice(initial_states)trajectory=[]forstepinrange(self.max_steps):action=self.policy.sample(state)next_state,reward=self.world_model.predict(state,action)trajectory.append((state,action,reward,next_state))state=next_state# 基于想象轨迹更新策略self.policy.update(trajectory)defdeploy_to_real(self,real_robot):"""将训练好的策略部署到真实机器人"""# 仅需少量真实环境微调real_trajectories=real_robot.collect(100)self.policy.finetune(real_trajectories)四、技术挑战与解决方案
4.1 视觉泛化
真实世界的视觉多样性远超仿真环境。视启未来采用以下策略提升视觉泛化能力:
- 多模态融合:结合 RGB、深度、触觉等多模态信息
- 自监督预训练:在大规模无标注视频数据上预训练视觉编码器
- 持续学习:部署后持续收集数据,在线更新视觉模型
4.2 长程任务规划
复杂任务(如"整理房间")需要多步规划和错误恢复能力。解决方案包括:
- 分层强化学习:高层策略负责任务分解,低层策略负责具体执行
- 大语言模型规划:利用 LLM 的常识推理能力生成任务计划
- 重规划机制:当执行失败时,基于当前状态重新生成计划
4.3 安全与可靠性
机器人与物理世界交互必须保证安全:
| 安全层级 | 机制 | 响应时间 |
|---|---|---|
| 硬件急停 | 物理按钮 / 力矩限制 | < 1ms |
| 控制层安全 | 碰撞检测 / 速度限制 | < 10ms |
| 策略层安全 | 危险动作过滤 | < 50ms |
| 任务层安全 | 人工监督 / 任务边界 | < 1s |
五、应用场景与商业化路径
5.1 工业质检
世界模型可以预测产品的正常外观,通过对比实际观测与预测结果的差异检测缺陷。相比传统视觉检测,世界模型能够处理更复杂的缺陷类型和光照变化。
5.2 家庭服务机器人
具身智能的终极场景之一是家庭服务机器人。世界模型让机器人能够理解家庭环境的三维结构,预测物体运动,规划安全高效的行动路径。
5.3 自动驾驶
世界模型在自动驾驶中的应用包括:
- 场景理解:从多视角图像构建三维场景表征
- 轨迹预测:预测其他交通参与者的未来行为
- 决策规划:基于世界模型进行反事实推理,选择最优驾驶策略
六、总结与展望
刘昊在视启未来的工作展示了世界模型与具身智能融合的巨大潜力。从仿真到现实,从感知到行动,这一技术路线正在推动 AI 从"数字世界"走向"物理世界"。
2026 年 11 月,奇点智能技术大会,聆听刘昊分享世界模型与具身智能的最新突破。
大会信息
2026 奇点智能技术大会 + C++ 及系统软件技术大会
时间:2026 年 11 月 20-21 日
地点:中国·北京万达文华酒店
参会报名:https://boolan.com/enroll/c1051/event/1162?channel=seo
立即报名,探索世界模型与具身智能的融合未来!