大脑的认知觉醒与小脑的GPT时刻——人形机器人智能进化的双引擎
2026年8月20日,北京亦庄,世界机器人大会。
北京人形机器人创新中心发布大一统模型Pelican-Unify,推动技术路线从模块化迈向端到端。所谓端到端,并非简单地把多个模块拼接在一起,而是实现共享表示、相互增强、协同进化——文字、图片、视频、动作编码等多维度输入被统一对齐到共享表征空间,进行统一推理并完成规划,最后端到端地生成视频和动作,使理解、推理、规划、行动成为闭环。
同一天,银河通用在展台上让观众亲眼目睹了一场人机网球对决。机器人不仅能全程维持身体平衡、精准控制腕部动作,还能通过左右吊球、前后吊球等战术击败人类对手。银河通用创始人王鹤在现场解释:这是大脑的决策规划与小脑的运动控制深度协同的结果。
两件事指向同一个信号:人形机器人的智能进化,正在从肢体竞赛全面转向大小脑竞赛。
要理解这场竞赛,先要弄清楚人形机器人的大脑和小脑到底在做什么。
浙江大学熊蓉教授打了一个通俗的比方:大脑给出全力冲刺的指令,小脑对每一块肌肉实现瞬时调节。翻译成技术语言:大脑负责理解世界、规划任务、做出决策;小脑负责将决策转化为实际动作,在毫秒级时间内协调全身数十个自由度关节运动,包括平衡控制、步态调整、外力干扰补偿及精细动作执行。前者回答做什么,后者回答怎么做。缺一不可。
大脑层的技术突破,是2026年人形机器人领域最引人注目的故事线。
智慧芽发布的2026年具身智能技术发展报告提供了宏观视角:全球具身智能专利累计数量已近20万件,其中高达89.7%为发明专利。来自中国的研发机构贡献约10.3万件,占全球总量的53.3%。
更关键的是结构变化。报告显示,大脑层专利年复合增长率达27.2%,显著高于小脑层的15.5%和肢体层的12.2%。2025年,大脑层与小脑层专利数量合计占比已达76.5%,肢体层专利降至不足25%。具身智能的创新重心,正在从肢体牵引转向大小脑驱动。中国已成为全球具身智能大脑层最主要的创新来源国,相关专利占比接近76%。
具体到大脑层的技术方向,世界模型与场景建模的专利占比已超越传统视觉感知,成为全球大脑层占比最高的技术方向。这标志着大脑层的研发逻辑正从静态环境感知转向动态世界建模与未来状态推演。世界模型能力正在成为机器人完成叠衣服、炒菜等长时序复杂任务的重要基础。
北京人形的大一统模型Pelican-Unify正是这一趋势的典型代表。它将多维输入统一对齐到共享表征空间,集成视觉理解、动作操控和世界模型三项能力,将理解、推理、预演、执行整合在同一模型闭环中。让机器人从看懂世界走向预演未来、精准执行。其同步推出的具身大脑模型Pelican-VL 2.0,在长程任务与工具调用等具身关键能力上实现显著提升,真正做到不仅看得懂,而且做得到。
银河通用则发布了全球首个通用大脑基座模型AstraBrain WAM 0.5,其核心技术路线世界-动作模型全球首次实现了虚实共融、人机混合等多源数据的统一有效利用,统一了VLA与世界模型两大技术路径。银河通用创始人王鹤表示:具身智能同样需要先在足够复杂的任务上突破专精,再走向通用。行业已经开始收敛,Scaling law效应在具身智能领域显现。
如果说大脑层的突破在于想得更远,小脑层的突破则在于动得更稳。
2026年6月19日,银河通用推出全球首个面向人形机器人的通用小脑基础模型AstraBrain-WBC 0.5。这是全球首个达到GPT-1量级的人形机器人全身实时运动控制大模型。
模型的数字令人印象深刻:8040万参数,超过2万小时人类动作数据训练,累计训练数据超过20亿帧。它首次采用GPT风格的因果Transformer架构,将全身运动控制重新定义为连续序列预测问题——机器人根据过去的动作历史,预测未来的运动状态与控制策略。
更重要的是,银河通用首次在人形机器人运动控制领域验证了类似GPT模型的规模定律效应。随着训练数据从200万帧增加至20亿帧,模型任务成功率由83.26%提升至92.58%,零样本运动追踪误差持续下降。这意味着机器人运控模型与大型语言模型一样,能通过持续增加数据量及模型规模来获得性能提升,而非依赖大量人工规则设计。
实测中,AstraBrain-WBC 0.5已能稳定执行训练集中完全未见的高动态动作——篮球运控、拳击出招、多风格舞蹈、自主翻身起立、双机协同搬运。零样本泛化全新动作的成功率从传统MLP架构的76.89%跃升至92.58%,推理延迟仅0.39毫秒。
行业对小脑的重视正在快速升温。智慧芽报告显示,小脑层中步态与平衡控制技术占比稳居首位,占58.3%。在具身智能尤其是人形机器人向非结构化场景渗透的过程中,如何应对复杂地形、实现动态稳定平衡,是全行业公认的最难且最亟需解决的问题。早期的步态专利多集中在基于物理模型的离线规划,而近两年的趋势是向实时感知—反应式步态转变。机器人不再按照预设轨迹走步,而是通过小脑层对视觉和触觉反馈的毫秒级响应,在行走过程中实时调整重心。
小脑层累计已有5.5万件专利,2025年申请量7967件,核心解决机器人走得稳、动得准的问题。有意思的是,中国小脑层专利江苏反超广东,因为苏州无锡有绿的谐波等精密减速器集群。
2026世界机器人大会上,大小脑协同的产业信号进一步密集释放。
众擎机器人全球首发了仿人脑具身智能引擎EngineAI Awaken。它并非单一AI模型,而是一套仿人脑的五层体系架构——从S1本能反射层到S2动作规划生成层、S3认知推理层,再延伸至S4和S5自我成长层,构建起本能反射、运动决策、认知推理、自我成长的完整链路。众擎CTO李力耘表示:物理AI的Scaling Law,必须建立在本体之上——数据从本体中来,模型在本体上验证,能力在本体中沉淀。
极佳视界集中展示了通用具身大脑GigaBrain-0.7和通用人形小脑模型GigaBrain-WBC-0.5,分别对应机器人的大脑和小脑。灵境智源正式发布全栈国产化具身智脑致境T300具身大脑及T81具身小脑,为国内机器人底层技术自主可控夯实根基。智身科技以真正干活的机器人为核心定位,集中展示从运动控制即小脑到智能决策即大脑的全栈技术能力。
大脑层与小脑层的技术突破,正在从两个方向同时重塑人形机器人的能力边界。
大脑层解决的是认知天花板——机器人能理解多复杂的任务、能在多大范围内自主决策、能在多少种场景中泛化。小脑层解决的是执行天花板——机器人能走多稳、跑多快、在多复杂的地形上不摔倒、在多精细的操作中不失误。
两者叠加,构成了人形机器人从能看到能想再到能干的完整进化链条。
银河通用创始人王鹤在大会期间给出了一个明确的时间表:具身智能的ChatGPT时刻有望在2028年到来。而AstraBrain-WBC 0.5的发布,已经让人形机器人的小脑率先迎来了GPT时刻——这是全球首个成功验证运动控制Scaling Law的模型。
从专利的视角来看,大小脑层的专利布局逻辑正在发生根本性的变化。
在肢体层,专利保护的是结构——关节的构型、灵巧手的传动方式、传感器的布置。这类专利的特点是看得见、摸得着,但容易被绕行——竞争对手换一种结构、换一种材料就可能跳出保护范围。
在大脑层,专利保护的是方法——世界模型的构建方式、任务规划的算法、多模态输入的对齐与融合。这类专利的特点是抽象,但覆盖范围广。一旦你的专利覆盖了一种端到端任务规划方法,竞争对手很难通过换几个代码模块来绕过。
在小脑层,专利保护的是控制——步态生成算法、平衡维持策略、外力干扰补偿方法。这类专利介于前两者之间,既有算法层面的抽象性,又有与物理世界强耦合的具体性。
这正是容度原理在大小脑层最直接的应用场景。
容度原理的核心是P7层级跃迁——从保护具体实现升级为保护功能模块。在大脑层,这意味着你的专利权利要求不应该写一种基于Transformer的具身智能任务规划方法,而应该写一种在非结构化环境中自主分解长程任务并生成动作序列的决策方法——无论竞争对手用的是Transformer、Diffusion还是RNN,只要实现的是同一个功能,都落入保护范围。
在小脑层,这意味着你的专利权利要求不应该写一种基于ZMP判据的双足步态规划算法,而应该写一种在动态扰动下实时维持全身质心稳定并生成适应性步态的控制方法——无论竞争对手用的是ZMP、CPG还是强化学习,只要实现的是实时维持质心稳定并生成适应性步态这个功能,都落入保护范围。
2026年正在成为人形机器人智能进化的分水岭。大脑从感知走向认知,小脑从编程走向学习。当Pelican-Unify实现了端到端的理解、推理、规划、行动闭环,当AstraBrain-WBC 0.5验证了运动控制的Scaling Law,当EngineAI Awaken构建起从本能反射到自我成长的五层体系——人形机器人的认知觉醒和GPT时刻,正在同时发生。
而专利布局,必须比技术进化更快一步。那些率先在大小脑层完成从结构专利到功能专利跃迁的企业,将在人形机器人从能看走向能干的下一阶段,拥有真正的智能护城河。


