老董的视界深处

· Bernstein · 公司/行业基本面

伯恩斯坦 人形机器人:皇帝的新脑与AlphaGo时刻——塑造未来三年的四大预测

摘要公开阅读;PDF 仅限有效会员阅读与下载,所有会员权限相同。 邮件登录

摘要

伯恩斯坦以贝叶斯式更新方法研究人形机器人这一早期技术,把三年前的初始观点更新为关于技术前沿(大脑模型、数据与训练技术)、产品和行业结构的最新预测,并由此推导行业规模(何种ROI下机器人能做什么)与未来赢家。 模型层的核心突破是“会想象”:World Model在规划动作时先想象结果,而非VLA式从指令到动作的线性翻译,报告判断真正路径是二者融合(如π0.7),并预测未来三年同时想象动作及其环境效果的World Action Model(WAM)将被广泛采用,但视觉真实不等于物理正确,2026年最强的World Model在综合“物理理解”评测中仅得22%。 记忆被预期为大脑的下一次重大突破,而非视频的物理数据仍是机器人区别于其他AI应用的独特挑战,传感器与UMI创业潮只是开端。 数据层,业内常言采集数据仅10%可用,报告预测Physical Intelligence式的模型-数据一体化开发将形成可持续护城河,其π0.6 with MEM已能跟踪最长15分钟的任务并纠错,π0.7引入世界模型生成的视觉子目标并实现跨本体迁移。 产品层,2026年行业焦点从运动演示快速转向商业落地,仓库拣放、工厂物料搬运与巡检、城市与工业巡逻、最后一段门到门配送四大场景合计约占2031年100万台年出货预测的一半;借鉴电动车与电池行业产量翻倍成本降15-18%的规律,回本周期有望很快跌破2.5年这一“卢比孔河”式阈值。 报告预测SKU爆炸式扩张将持续,未来三年行业不太可能整合玩家,但出货量将向面向工厂与仓库物料搬运、每臂10-15kg持续负载的少数杀手级SKU和平台级硬件集中。 行业层,“技能”(如分拣包裹、装载洗碗机)是拼图中缺失的一块,不应与大脑模型混为一谈。 覆盖标的上,Cognex、HDSI、汇川、发那科、基恩士、禾赛、拓普、双环获Outperform评级,埃斯顿与三花为Market-Perform,鸣志电器为Underperform。

主要观点

  • 报告主张用贝叶斯方法研究人形机器人这类早期技术,随新证据更新假设,由此形成关于技术前沿(大脑模型、数据与训练技术)、产品和行业结构的最新预测,并支撑对行业规模(何种ROI下机器人能做什么)与未来赢家(价值与差异化的驱动因素)的判断。
  • 大脑模型的突破在于“想象力”:World Model在动作规划与确定时先想象结果,而非传统VLA从指令到动作的线性翻译;“VLA已死、World Model万岁”式的说法具有误导性,真正路径是两者融合(如π0.7的示例),关键在模型想象结果的能力而非名称标签。
  • 预测一(模型):未来三年,同时想象动作及其对环境效果并同时输出两者的World Action Model(WAM)将被广泛采用,用于追求长时程自主与跨任务、跨本体泛化。
  • 物理理解仍是短板:过去两年的一条重要研究结论是视觉真实不等于物理正确,2026年最好的World Model在综合“物理理解”评测中仅得22%,这一挑战三年后可能依然存在。
  • 预测二(记忆):今天机器人大脑几乎没有记忆功能,同样的指令在同样环境中会采取同样动作;把记忆注入机器人大脑已是研究新前沿,报告预期这将是下一次重大突破(可跟踪30分钟任务进度、基于失败原因调整动作仍是愿景)。
  • 预测三(多模态数据):18个月前《The hierarchy of infinities》已预测非视频的物理数据是机器人区别于其他AI应用的独特挑战,如今兑现为传感器与UMI(Universal Manipulation Interface)创业公司的突然爆发,但这只是好的开端——物理数据的种类仍远远不足。
  • 预测四(数据护城河建在大脑里):不同模型对数据的偏好各不相同,业内常说采集数据只有10%可用,最有效的应对是按模型特点定制数据采集;报告预测Physical Intelligence式的模型-数据一体化开发将成为可持续护城河。
  • Physical Intelligence的模型-数据一体化迭代路径(Exhibit 3):π0(10/31/2024)使用当时最大的多任务多机器人交互数据集,含互联网级视觉-语言预训练(30亿参数)、Open X-Embodiment开源数据集和来自八台机器人的1万小时演示;π0.5(4/22/2025)加入400小时移动操作数据实现对新环境的泛化;π0.5+EGO(12/16/2025)用人类自我中心数据在数据稀缺任务上带来2倍提升;π0.6 with MEM(3/3/2026)实现多模态记忆,可跟踪最长15分钟任务并纠错;π0.7(4/16/2026)加入世界模型生成的视觉子目标与多样化上下文,能执行训练数据中从未见过的任务并实现跨本体迁移。
  • 产品层“渡过卢比孔河”:2026年人形机器人的特征是焦点从运动演示快速转向商业落地;未来五年四大落地场景为仓库拣放、工厂物料搬运与巡检、城市与工业巡逻、最后一段门到门配送,合计约占2031年100万台年出货预测的一半。
  • 回本周期缩短主要由机器人降价驱动,而降价是销量的函数:电动车与电池行业经验显示产量翻倍时成本 typically 下降15-18%,小销量阶段曲线更陡;跨过2.5年回本阈值后采用将决定性加速——2.5年并非魔幻数字而是平均阈值,大型成熟企业可容忍最长5年,动态行业的小公司则要求短至1年。
  • 预测(产品结构):行业正经历SKU爆炸式扩张(WRC 2025与2026年产品与新品数量激增,Exhibit 4),趋势将延续;未来三年行业不太可能出现玩家整合,但出货量将向少数杀手级SKU集中——面向工厂与仓库物料搬运优化、每臂10-15kg持续负载;升至平台级硬件地位可带来采购与生产规模经济,模型开发者也会围绕平台硬件设计模型形成正循环,而一致性/可靠性这一OEM差异化层被普遍低估。
  • 行业层的“缺失拼图”:人脑、眼、手、关节在人形机器人中都有对应物,但“技能”的对应物是什么?机器人技能(如“分拣包裹”“装载洗碗机”)常与大脑模型混淆,人形机器人公司也据此被评估。

论述逻辑

  • 早期技术只适合贝叶斯式更新研究 → 三年证据积累后形成四大预测 → 模型层:World Model证明“想象结果”优于VLA线性翻译,但物理理解仅22%、记忆缺失,故预测VLA与World Model融合的WAM三年内广泛采用、记忆成下一突破 → 数据层:仅10%采集数据可用且各模型偏好不同,故模型-数据一体化开发成为护城河 → 产品层:焦点转向商业落地,EV/电池经验曲线(量翻倍成本降15-18%)推动降价 → 回本跌破2.5年触发采用决定性加速 → 四大场景支撑2031年100万台年出货预测的一半 → 出货向杀手级SKU与平台硬件集中,OEM差异在被低估的一致性/可靠性 → 行业层:玩家不整合、“技能”是缺失拼图 → 由此推导行业规模(何种ROI下机器人能做什么)与未来赢家(价值与差异化驱动因素)。

关键展望

  • 未来三年:World Action Model(WAM)将在长时程自主与跨任务、跨本体泛化追求中被广泛采用——报告给出明确三年时间窗口。
  • 记忆注入被预期为机器人大脑的下一次重大突破,是报告明确的下一个验证点。
  • 物理理解短板或持续:2026年最好模型仅22%的物理理解得分,这一挑战三年后可能仍然存在。
  • 四大应用场景回本周期有望很快跌破2.5年,跨过后采用决定性加速;大型企业可容忍至5年,动态行业小公司要求短至1年。
  • 出货量验证点:2031年人形机器人年出货预测100万台,四大应用场景合计约占一半。
  • 未来三年行业格局:不太可能出现玩家整合,但出货量将向少数杀手级SKU集中。
  • 评级时间窗口:Bernstein品牌股票评级基于12个月期限(截至2026年9月2日收盘价与目标价)。

推荐标的

  • Outperform(跑赢)评级——中国上市标的:汇川技术300124.CH目标价82.00元(现价60.15);拓普集团601689.CH目标价75.00元(现价47.83);双环传动002472.CH目标价60.00元(现价35.42);禾赛港股2525.HK目标价29.00(现价17.12港元)。
  • Underperform(跑输)评级:鸣志电器688017.CH目标价115.00元,显著低于现价290.41元(TTM相对回报58.3%)。
  • “选赢家”部分提及的公司多为私营、无评级:Physical Intelligence、Figure AI、Dyna Robotics、Rhoda AI、Agibot、Galbot、Robotera、LimX、PaXini、Tashan Technology为私营公司;Unitree与Mech-Mind已上市但伯恩斯坦未覆盖;Agility已同意通过与SPAC合并上市(未覆盖);英伟达由伯恩斯坦美国半导体团队覆盖、谷歌由美国互联网团队覆盖、波士顿动力大股东现代汽车由韩国汽车团队覆盖。

查找相关研报 →