2026智源大会 | 在路线之争的喧嚣背后,千寻智能押注模型在物理世界的真实进化

2026智源大会 | 在路线之争的喧嚣背后,千寻智能押注模型在物理世界的真实进化

2026 年 6 月 12 日至 13 日,第八届北京智源大会在京召开。在这场深度聚焦具身智能、世界模型、AI 自进化系统等尖端议题的年度盛会上,千寻智能携具身机器人 Moz1 亮相,并展示了基于最新具身模型Spirit v1.6实现的泛化桌面整理任务、扭蛋机任务,以及零延时遥操作体验。

 

在本次大会备受瞩目的「百亿估值具身智能企业 CEO 圆桌」上,千寻智能创始人兼 CEO 韩峰涛结合产业发展周期,分享了关于当前阶段集中力量进行大模型预训练与高质量数据积累的战略考量;联合创始人兼首席科学家高阳则在「具身智能与人形机器人」论坛与《重塑物理世界,打造机器人通用大脑》的主题演讲中,全方位地深入剖析了全模态输入输出模型的技术逻辑,并探讨了如何通过跑通闭环,大幅降低场景部署成本的可行路径。

 

作为国内少有兼具 AI 算法与硬件本体全栈自研能力的具身智能团队,千寻智能始终锚定“扎实基础模型,搭建数据体系,降低部署成本”的方向。这一次,千寻智能把这份思考带到了行业舞台中央。

 



Part.1:

Moz亮相:自主推理,精准遥操

 
 

此次展出的 Moz1 机器人,搭载了千寻智能自研的 Spirit v1.6 具身大模型。该模型通过融合世界模型与端到端控制,将多模态感知、未来的世界状态预测与精细动作生成深度集成,赋予机器人强大的动态场景理解、自主物理交互与实时重规划能力。

 

正是依托这一核心算法底座,Moz1 突破了传统预设规则与硬编码逻辑的限制,展现出了极高水平的运行柔顺性,在非受控的展台环境下自如完成了三组真机实操演示:

 

 

桌面整理,自主长程任务规划


 

面对散落着文具、水果、饮料的杂乱书桌,Moz1 接收到的全部指令只有「整理桌面」这四个字。

 

依托 Spirit v1.6 具身大模型的端到端推理能力,Moz1 独自完成了从高层语义理解到复杂任务拆解的完整链路。展台大屏幕上实时投射着它的“思考轨迹”:拉抽屉、放置物品、整理笔、摆放水果,每一步动作队列的生成都清晰可见。

 

面对现场刻意制造的突发干扰,Moz1 展现出了极强的抗干扰与重规划能力:当Moz1 将水果收纳好后,工作人员将其再次拿出,它能立刻感知到阻碍并即时重新规划,把水果稳稳放回盘中;如果在它准备关抽屉前提前帮它把门关闭,它会短暂思考后巧妙跳过这一步骤直接推进,不刻板执行既定列表,而是根据环境实时重新规划。

 

在紧张硬核的技术测试之外,小墨还懂得一些浪漫表达。当工作人员把一支鲜花放在桌上时,Moz1 顺畅地识别并稳稳夹起,落落大方地献给来宾。在指尖微力控的细腻协作中,完成了一场暖心社交互动。

 

 

扭蛋交互,无惧干扰追踪目标

 




 

 

作为本次大会当之无愧的“人气王”,扭蛋互动区在开展后便排起了望不到尽头的队列长龙。面对络绎不绝的体验来宾,Moz1 凭借端到端推理能力,一气呵成地执行旋转、抓取、出球与递送动作,将装有惊喜纸条的趣味扭蛋精准发放到大家手中。

 

在技术层面,由于真实扭蛋机每次出球所需的旋钮圈数完全随机,Moz1 并非机械地执行预设指令,而是利用视觉系统实时紧盯出球口。当感知到扭蛋落入托盘的瞬间,便能立刻做出闭环判断并精准停手,整个过程均由模型从视觉输入到动作输出自主完成。随后,机械臂通过高频追踪并精确预测体验者双手的三维空间轨迹,即便面对观众的随机晃动,也能在毫秒级内动态修正运动路径,平稳顺畅地送上手中的幸运。

 

 

摇操体验,零延迟精准同步



 



 

 

同样备受热捧的高精度遥操作体验区,则让展台体验从机器人的“自主推理”无缝切换到了极致的“人机合一”。来宾们可以亲自上场深度体验摇操 Moz1,得益于千寻自研的 WBC(全身协同控制)算法,人机运动时差控制在毫秒级,操控者的手部动作可以被 Moz1 实时同步还原,人手的自然抖动也在传输过程中被自动过滤。

 

这种细粒度的端到端物理交互,对系统在不确定环境下的控制鲁棒性有着极高要求。完成串糖葫芦任务时,需要将竹签平稳穿过阻力较高的水果,力度过大会造成损坏,WBC 让 Moz1 在感知到指尖反馈后自动调节施力,实现柔顺控制,完美呈现了千寻底座技术应对高频交互与多变物理场景的超高水准。


 

Part.2:

千寻智能CEO韩峰涛:

夯实大模型预训练,

探索高价值场景落地


 

 

6 月 13 日上午,智源大会专设「百亿估值具身智能企业 CEO 圆桌」,千寻智能CEO韩峰涛提出:当前具身模型的能力与部署成本之间的差距,决定了规模化落地的条件尚未成熟;今年的核心任务是完成大规模预训练、积累高质量数据,为接下来真正的 Scaling 阶段储备弹药。

 

千寻智能自创立之初便将高质量数据建设视作核心,目前已在全国布局三十多万个采集点位,专职数采人员超过千人。

 

 

韩峰涛:

 

"制约具身智能机器人大规模落地的核心点在于部署成本。现在模型可能只有一两岁的智商,当前模型的投入重点仍在于预训练。"

 

"假设完美人形机器人是 100 分,当前 AI 约 3 分。但有了大模型之后,3 分到 50 分的差距可以非常快地弥补,这正是这个赛道发展速度这么快的核心原因。"

 

"当下算力并不稀缺,各类模型架构、世界模型相关技术也层出不穷,但如果数据供给跟不上,再优秀的架构也难以发挥价值。在我们看来,数据才是目前行业真正的核心瓶颈。"

 

 

Part.3:

千寻智能联创&首席科学家高阳:

跑通软硬件系统闭环,

把大模型部署成本打下来


 

 

6 月 13 日下午,千寻智能联创&首席科学家高阳在「具身智能与人形机器人」论坛带来主题演讲《重塑物理世界,打造机器人通用大脑》,并参与了论坛的圆桌讨论。

 

在主题演讲中,高阳介绍了千寻智能自研的全模态输入输出模型(The Omni Model)。这一框架不再将 VLA 与世界模型视为对立路线,而是将二者统一为同一模型下的不同目标函数,既输出动作序列,也输出对未来世界状态的预测。他同时分享了一个来自千寻内部的定量结论:Spirit 系列模型预训练数据量每增大 10 倍,完成下游任务所需的后训练微调数据量就降低 2.5 倍。当预训练规模足够大时,新任务的部署代价有望从当前的"10 小时量级"压缩至"分钟级"。

 

在圆桌讨论中,高阳进一步阐述了对具身智能发展路径的完整判断:行业将经历两个阶段。第一阶段是"引导程序阶段",通过可穿戴数采设备和互联网视频积累预训练语料,将基础模型推进到边际部署成本极低的临界状态,使任意新任务通过少量微调即可落地。越过这一阶段后,才会迎来大规模部署、真实世界数据持续回流、模型自进化飞轮真正转动的第二阶段。

 

 

高阳:

 

"VLA 还是世界模型之争其实不重要,它们只是完成机器人同一个操作目标下的不同目标函数。既然都有用,为何不放进同一个模型里训练?"

 

"只要收集到足够规模的真实场景数据,任何一个新任务的边际部署成本都会非常低,微调即可完成。"

 

"未来 12 到 24 个月,具身基础模型会有非常大的进步,我们会马上迎来一个繁荣时代的开端。"

 

 

Part.4:

结语


 

在为期两天的论坛中,“落地时间”、“数据与模型的权重”、“世界模型的物理映射”等核心命题被反复拆解与博弈。这些关于范式的讨论,本质上是对具身智能同一未来的集体押注:跨越虚拟与现实的鸿沟,让机器人在物理世界中真正具备进化能力。

 

行业的共识,正是千寻智能正在践行的路线:把基础模型做扎实,把数据体系搭起来,把部署成本降下来。

 

作为拥有具身基座模型算法与硬件本体全栈自研能力的头部团队,千寻智能正依托覆盖全国的数据采集网络与全新升级的 Spirit 具身基座模型,持续缩短技术与物理现实之间的交互距离。我们将始终致力于具身大脑通用泛化能力的提升,推动机器人技术在更多高价值产业场景中实现真正的规模化落地。