机器人打球刷屏的真相:眼睛是借的,大脑是“假”的
日期:2026-09-16 15:00:27 / 人气:1

今年,机器人打球成为展示“自主能力”的热门Demo。高速飞来的乒乓球,机器人自主移动、跨步挥拍,部分演示可以和真人连续对打几十拍甚至上百拍。极具冲击力的画面,很容易给公众造成一种错觉:机器人已经进化出可以处理动态现实世界的智能大脑。
但剥开热闹的演示外壳,这类场景可以概括为三个关键词:“瞎子”、“木偶”、“假大脑”。很多本该由机器人本体完成的感知、运动测算工作,实际是由场地外部一套价值上百万元的高精度设备代为完成。相当于外部系统临时给机器人装上了外置“眼睛”与“大脑”。
本质上接近一套巨型设备下的间接遥操作:机器人自身并没有独立看见飞来的球;外部多台标定相机追踪带有反光涂层的球体,计算出球的轨迹、落点,再下发指令告诉机器人“球即将到达,现在击球”。
这和人类打球逻辑完全不同。人不需要对环境做毫米级预先标定,依靠自身双眼观察对手、球速、方向,在信息不完全精确的条件下持续动态预判。当然,演示本身并非全无技术含量。在接收外部位置目标之后,机器人需要极短时间完成迈步、姿态调整、平衡维持、挥拍回球,证明机器人的“小脑”,也就是全身运动控制能力,已经取得显著进步。可小脑强大,不等于具备真正自主的大脑。
这个观点来自化名林知远的行业从业者。他曾是百度自动驾驶资深工程师、萝卜快跑创始成员,拥有十年工程落地经验,如今投身具身智能研究,重点研究机器人如何依靠端侧推理完成感知、校验、故障恢复,在真实物理世界长期运行,实现真正意义上的自进化。他评价机器人Demo的核心标尺,不是对打多少回合,而是:感知、判断、执行、结果反馈,究竟有多少闭环真正发生在机器人本体之上。顺着这一视角,当下机器人大脑想要实现真正自主,至少需要跨过三道门槛。
一、会打球,不等于实现真正自主
1、无人遥控≠机器人独立完成任务
不少演示视频中看不到人为手持遥控器操作,但“没有实时人为操控”和“机器人依靠自身能力独立完成任务”是两套完全不同的标准。前者只要求整套系统自动跑通流程;后者要求机器人凭借自身搭载的感知与计算单元,观察环境、理解任务、生成动作,同时核验动作带来的现实结果。
打球Demo就把两者的鸿沟暴露出来:运动控制、整套流程自动运行是真实的,但“机器人自己看见球、解算球体运动”并没有在本体上独立完成。林知远将其类比自动驾驶时代的高精地图。高精地图能够提前录入道路信息辅助车辆行驶;但当自动驾驶走向开放复杂道路,行业逐渐意识到,依赖提前预制好的静态世界,和车辆实时自主理解千变万化的真实世界,属于两类问题。
放到机器人领域同理,如果一项能力必须仰仗提前标定的场地、固定机位相机、物体表面特殊反光标记才能实现,就必须追问一个关键问题:撤去全部演示专属条件之后,还能保留多少能力。
2、好看的Demo,也可能让研发团队走弯路
林知远并不否定Demo的价值。技术早期,精彩演示可以对外证明能力存在,帮助团队拿到关注度、资金与研发资源,科研上也可以拆分难题,优先攻克运动控制,后续补齐感知短板。但当代AI研发有一个显著变化:能力迭代高度依赖真实世界的反馈。
如果演示做完,既不能落地真实业务场景,也无法产出真实的成功、失败、纠偏数据,那么这场演示和下一轮技术迭代之间的关联就会越来越微弱。现实场景不可能到处架设外部追踪设备,也不可能给每一件物体涂抹反光标记。若团队长期围绕演示效果做开发,甚至会跑偏三到六个月,内部也清楚自己只是在做演示套路(trick)。
评判Demo好坏的分界线,不在于视觉效果多惊艳,而在于:这次成功,是否缩短机器人走向真实世界的距离。真正的自主,要求能力脱离展台布景,放到陌生环境依旧成立。即便未来机器人可以靠自身视觉看清球体,问题也只解决一半——看见,不等于它知道自己做得对不对。
二、模型愈发强大,不等于大脑已经完整
1、最危险的失败:机器人出错了,自己却浑然不知
现实任务的失败远比“有没有抓住物体”复杂。例如机器人接到指令把杯子放到桌面,抓取、移动、放置整套动作全部走完,杯子却倾斜漏水,这就不能算作任务完成。工业场景更是如此,油漆完成涂刷不等于涂刷均匀;巡检走完路线不等于排查全部隐患;多步骤任务里微小误差持续累积,最终就会完全偏离目标。
长程任务中最危险的状况,就是机器人已经偏离目标,但自身毫无察觉。机器人大脑不只是用来生成下一步动作,还要判断动作是否过度、结果是否达标,预判继续执行会不会放大故障。一旦识别异常,要在重试、局部修正、重新规划、降级运行、请求人工介入之间做出选择。
“它知道自己不行,知道自己失败。”主动求助人类,并不等同于不自主。系统抵达能力边界却不会停止,反而是更不成熟、更危险的表现。
2、模型可以融合,但责任边界不能消失
具身智能领域一直有热烈讨论:随着VLA、世界模型、端到端模型能力提升,未来是否一个大模型就可以取代机器人全部分层模块、监督校验与安全系统?结合自动驾驶十年演进经验,他认可模型不断融合的大趋势,但模块合并之后,状态检查、安全校验、故障处置的责任不会凭空消失,只是转化为规则、后台服务或者人机协同机制。
模型边界持续合并,但责任边界不会消失。端到端关注模型内部如何运算;闭环系统关注机器人如何对现实结果负责。用户不在乎逻辑放在模型还是其他组件,可落地工作的机器人绝不能出现模型越来越强,却识别不出任务已经做错的情况。
3、大模型可以慢慢思考,但现实世界不会等待
现实物理事件的发生有严格时间约束。物体滑落、机械臂即将碰撞的瞬间,现实不会停下等待大模型慢慢推理。所以大小脑的命题,不是大模型彻底吃掉小模型,而是分清:哪些任务需要慢而强大的推理,哪些任务需要快而确定的响应,两套体系的经验如何互通汇合。
4、自动驾驶的启示:不要笃信当前技术表达就是终极形态
自动驾驶每隔两到三年就会迎来范式革新,高精地图、环境表征方案持续迭代。真正的突破,很多时候不是在原有模型上堆叠参数,而是重新定义对世界的输入输出表达方式。
以此视角审视当下火热的VLA,它未必是最终架构,突出痛点是运行速度偏慢,算力消耗巨大却达不到预期智能水平,更像是技术演进的中间状态,其中动作(Action)部分最未定型。未来执行器、材料、控制方式迭代,动作的表达范式也可能重构。
对于世界模型也是同理,不否认长期它可以参与直接控制,但现阶段更适合用于预测推演、仿真、生成训练数据、策略验证,充当高级仿真器。当下急于判定VLA和世界模型孰胜孰负为时过早,真正值得观察的是,哪一种架构能够让机器人更快、更稳定地走进更多真实场景。
三、一次演示成功,不等于具备生产力
1、少看单次成功率,要看连续替代人的时长
抛开参数、发布会、剪辑过的演示视频,如果只保留一个指标衡量机器人能否成为生产力,那就是:真实任务当中,机器人能够连续替代人类工作多久。该指标把任务价值、稳定性、异常恢复、人工介入频率、最终结果质量绑定在一起,很难靠剪辑和表演美化。
机器人落地真实生产,还可以获取实验室很难得到的财富——现实反馈。实验室可以人为定义何为成功;生产现场不会。涂刷不均、巡检漏检,都会产生实实在在的业务后果。真实生产本身就是一套天然评测与数据系统。现实世界最珍贵的不只是数据,而是能不断告诉机器人:你这里做错了。
2、跨过60分之后,依旧是数据之争,只是标准改变
行业普遍说法:60分之前靠模型与数据,60分以后靠工程。林知远并不完全认同。步入生产场景之后,依旧是数据竞争,只是对数据质量、类型提出更高要求。
原型阶段可以容忍偶发故障;进入生产环境,标准变得严苛具体。训练数据需要附带任务结果、故障位置、失败诱因、修复策略。简单的“失败四次,第五次成功”不能等同于自进化。真正的能力进化,要经过时序验证、跨场景迁移、跨硬件本体迁移,还要做能力退化回滚测试。如果一台会刷马桶的机器人,补充少量数据就可以胜任刷油漆,才算是获得可迁移能力。每一条有效经验,都要包含结果、失败记录和纠偏过程。
3、机器人很难复制汽车行业的数据红利
自动驾驶汽车海量销售,亿万用户在道路行驶,自发形成庞大的数据采集网络。但几乎没有客户愿意花二十万元购置机器人,长期无偿替企业产出训练数据。如果每落地一个新场景,都要大规模真机采集,成本很难规模化。更可行路径是:依靠基础模型与仿真预生成部分能力,再部署到真实场景验证;针对仿真与现实的差距、真实发生的故障,定向补充数据。
4、早期机会藏在传统自动化的非标死角
尚不完美的机器人,最佳落地场景并非高度成熟的自动化工厂。成熟产线追求稳定,接入还在迭代的机器人,会带来效率损失、安全风险,不少场景甚至需要企业付费,工厂才愿意开放测试,机器人进场更像是“去添乱”。
反观地下管网、密闭舱室、船舱喷涂焊接这类不那么光鲜的领域反而更适合早期落地:工作环境危险,人类不愿介入,任务目标清晰可验收。传统自动化机械臂在平整钢板上喷漆可以做到极致,面对船体内部形态多变的隔板、折角、异形结构就束手无策。传统自动化更像“瞎子”,只能够复现预设坐标点位,无法感知环境发生了哪些改变。
这一轮具身智能希望解决的核心命题,正是从“固定坐标重复动作”升级为“环境发生变化,依旧可靠完成任务”。第一批真正产出生产力的机器人,大概率会诞生在传统自动化长久未能攻克的非标死角。
5、机器人大脑的两道终极考题:越做越久,越换越便宜
机器人大脑的竞争,不止是完成单次任务,还要识别故障、自主恢复、懂得求助,另一核心维度则是迁移能力。可以用两条坐标轴看待机器人大脑:时间轴,单次成功能否变成长期稳定运行,故障可以被发现、修复、继续作业;空间轴,离开原有环境、任务、硬件本体之后,能力还剩下多少,需要额外投入多少工程与数据。
只解决时间维度,企业可以把单一项目打磨稳定,换一个场景就要从头再来;只解决迁移,模型样样略懂,却没有任务可以长期稳定运行。一套具备平台价值的机器人大脑,最终要回答两道很难作弊的问题:能不能越做越久?能不能越换越便宜?
回到刷屏的打球机器人,流畅击球证明运动控制的进步值得肯定,但自主大脑是更硬核的考验。机器人不光要完成动作,还要判断结果是否达标,把单次演示成功,转化为可长期运行、跨环境复用的能力。
所以区分表演和真正智能的分水岭,不在于会不会完成一个酷炫动作,而在于能否对输出结果负责,将单次成功沉淀为长期、可迁移的能力。从“会表演”到“会工作”,中间横亘的,正是这道鸿沟。
(注:原文文末为虎嗅AI100闭门会推广信息,已做删减)
作者:盛煌娱乐
新闻资讯 News
- 监管铁拳落定,携程能“轻装上阵...09-16
- 投胎真的是个技术活09-16
- 机器人打球刷屏的真相:眼睛是借...09-16
- 卷低价和同质化之外,入境游还能...09-16

