161: 原力灵机唐文斌:中国最早的 AI 创业者和他的具身新旅程
- 唐文斌把具身智能当前的首要瓶颈归结为“智商”,而不是机械臂、camera 或其他本体。 端到端控制的 performance 可能只有 50%-60%,RoboChallenge 上的桌面任务成功率甚至可能只有一半;原力灵机的 generalist 模型也才 30% 多。公司 2026 年的技术重心是把 multi-task/generalist 泛化能力大幅推高,而非继续堆单任务 specialist。“智能的、有用的、可信赖的机器人”中,后两者眼下都先卡在前者。
- 他的商业化判据远比“交付一台机器人”严格:真实场景、每天开机十小时以上、连续运行两个月,并且要有一定数量。 被追问何为“有量”时,他随口以 100 台作为量化例子;按这个标准,他认为行业里“可能几乎没有”成熟案例。原力灵机给 2026 年定下的目标是“一个场景,一千台”,让落地数据而非采集数据启动飞轮。关键不在铺十几个 POC,而在两三个场景真正闭环。
- 物流被选为第一落点,不是因为机器人已经能做到百分之百,而是系统可以容纳它犯错。 机器人失败后,调度系统可把任务送给人工工作站,也可远程接管;客户买到的是机器人、人工、其他自动化设备和调度共同组成的连续工作流。场景还必须同时满足错误容忍、时间容忍、适度泛化和长时间作业,才能把 total cost 算明白。
- 原力灵机押注“具身原生”:机器人数据应从 VLM 预训练的 day one 就与互联网多模态数据(含视频)及智驾数据共同训练。 唐文斌把在现成 VLM 后嫁接 Action 模块比作让初中毕业生突然进体校——根骨上限低,还可能把“语文、数学”忘掉;因此 VLA 阶段也要把 Action、grounding、VQA 等能力 co-train。DM0 与阶跃联合完成原生 VLM 训练,再由原力灵机继续训练 VLA 和 post-training。
- 在硬件上,原力灵机不把完全标准化的本体、包括标准人形,当作所有场景的默认答案,而采用“模型解锁场景,场景定义硬件”。 标准本体容易 underkill 或 overkill,真正的上限先由“人脑加遥操作”能否完成任务决定;高重心人形或轮式双臂可能只能跑到 0.8-1 米/秒,低重心 AGV 却可到 4 米/秒,有些工位甚至不需要机器人自己移动。公司的解法是标准模块快速组合,而非每个项目重新定制。
- 唐文斌认为可持续护城河不是短暂的模型领先,而是使用量带来的数据飞轮。 旷视的人脸认证业务因更多认证产生更多数据、又提升金融级准确率,按他的说法至今仍有约 70%-80% 市占率;普通 SDK 没有这个循环,优势就只是时间差。具身智能也一样:最终最有价值的不是昂贵采集或漂亮 demo,而是批量机器人运行中的失败、接管和任务反馈。
- 十五年 To B 经历留下的核心教训是:价值必须可量化、产品必须可标准化,也必须警惕竞争导致的 overpromise。 2019 年优衣库项目经过五轮竞标、使用上千台机器人,初期只达到目标效率的 40%;旷视争取半年延期、推倒全部代码重来才完成交付。唐文斌的总结是,PPT 上的“假 ROI”无法带来复购,而“你说做不到,他只会认为你弱”的市场机制会让失败项目被系统性隐藏。
- 他预计行业会先容纳大量 vertical 公司,再随通用模型吞掉小模型而集中到全球个位数平台型玩家,且多数可能来自中国。 最终资格取决于模型智商、场景闭环和数据飞轮的联动,而非融资额或当前榜单;风险管理则是“准备好足够多的干粮”,同时避免散弹枪式扩张。旷视的反思是“A 加 B 加 C 基本上约等于 max(A,B,C)”,原力灵机因此拒绝表演型机器人和高节拍、低容错的汽车产线,把资源压在通用模型与少数可规模化场景上。
1. 编程最早提供的是解决问题的成就感
唐文斌在浙江新昌读初二时,学校刚开始组织信息学竞赛,从每班挑两名数学成绩最好的学生。他和两三个伙伴拿到机房钥匙后,很多同学更愿意打游戏,但他们觉得“编程其实比打游戏更好玩”。
数学、物理题通常是在寻找答案,编程却是在设计“求得答案的方法”;路径可以不唯一,优化题甚至没有绝对最优解,只能不断寻找更优方案。这种开放性后来直接延伸到 AI、调度和机器人优化。
程序提交后立即得到 wrong answer 或 accepted,构成了极强的正反馈。唐文斌把它称为“工程师解决问题的快感”:构思算法、优美实现、通过全部测试,再把能力扩展到网站、工具乃至游戏外挂。
2. Topcoder 把思考、对抗和即时反馈压缩到五分钟
唐文斌大学后继续参加 Topcoder、ACM 等比赛,并非为了保送,而是“就好玩”。他最喜欢 Topcoder 的 Challenge:常规比赛结束后,选手只有五分钟阅读同房间代码,用一组反例把对方程序成绩归零,自己获得 50 分。
每份程序只能被 Challenge 一次,因此不只考算法,还要抢速度和观察力。他记得一次同房间 20 人都提交了同一道题,另外 19 人遗漏了同一个小 trick,他把 19 份程序全部击穿,仅 Challenge 就拿到 950 分。
这种经历形成了他对评测的直觉:好的系统不只是给答案,还要在压力下迅速暴露边界。今天 Codeforces 被用于代码模型 benchmark,在他看来仍是在量化同一类能力。
3. 好 benchmark 的核心不是难,而是区分度
2007 至 2013 年,唐文斌与另一位 IOI 金牌选手胡伟栋牵头承担竞赛命题等学生工作,创业两年后仍继续参与。他说做一道题可能只需一两个小时,出一道好题却可能花一周。
命题要把约 200 名参赛者的水平真正拉开:题目既要有新意、考察点明确,又不能只是机械地提高难度。“一个好的出题并不是说这个题有多难或者多简单,它核心要的是区分度。”
这套经验后来迁移到具身智能评测。唐文斌的原则是“你自己得是一个好的 player,你才能够是一个好的 judge”,因为没有真实研发和操作体感,就难以设计能牵引技术进步的 benchmark。
4. 竞赛网络最终变成了一条延续十余年的人才链
唐文斌早年在竞赛圈认识楼天成、蒋凡、王小川等人,也在带队、讲课时结识了大量中学生。范浩强初三升高一进入国家集训队,高一到高二参加 IOI,唐文斌回忆他“应该”拿了第二名。当时还出台了参加国际赛并获金牌后不再继续参赛的规定;不过唐文斌明确说,范浩强其实初三就已经保送了。
范浩强问“那我没事干了怎么办”,唐文斌便邀请他加入刚创立的旷视。后来公司让这名高中生先试深度学习,原因是新技术尚无成熟经验,动手足够快、足够聪明的人可能更重要。
唐文斌从范浩强初一、赵尔静约初二时就认识他们,此后长期一起工作。被问及旷视最多有十几个 IOI 金牌时,他纠正:“我们 NOI 的金牌更多。”
5. 印奇的组织力与共同的视觉兴趣促成了创业约定
唐文斌和印奇在清华并非入学即熟识;两人大二进入一个 27 名男生、没有女生的班,后来又都在微软亚洲研究院实习。印奇跟随孙健做人脸研究,唐文斌则从数据挖掘和社交网络研究意外转入图像搜索。
一次全班参与的学生节剧目让唐文斌重新认识印奇:印奇担任导演,组织 27 名同学参与一个“既温馨也搞笑”的复杂剧本。唐文斌从中看到的不只是技术能力,还有把多人组织起来的能力。
两人在 2009 年本科毕业前约定以后一起创业。那时还不流行把所有事情叫 AI,他们谈的是 machine learning、computer vision,以及一个很朴素的判断:“未来机器人都需要眼睛。”
唐文斌随后成为唐杰获得招生资格后的第一名研究生。导师学术休假期间,他进入微软亚洲研究院一个刚从 text mining 转向 image search 的组,“来都来了”地接下新方向,最终完成的图像搜索工作还被用于 Bing。
6. Kinect、iPhone 4 和独立开发者浪潮共同触发了旷视
2010 年前后,Kinect 的体感交互大热,iPhone 4 又第一次在手机上提供前置摄像头。唐文斌和印奇由此想到:手机既能看到脸和手,能否把 Kinect 式体验搬到移动端?
墨迹天气等独立开发者的成功让他们相信,小团队也可能靠 App 挣钱。两人各投入一台 MacBook,发现开发马力不足后拉来杨沐,三人做出体感游戏 Crows Coming《乌鸦来了》。
游戏没有挣到预想中的钱,却一度进入 App Store 免费榜前三,还获得行业奖项,带来大量投资人。三人原本只有“未来会创业”的模糊方向,于是决定“在战场上学习也是一种挺好的学习方式”,接受联想之星和联想创投投资正式开公司。
旷视后来还做过三维轮滑游戏:用户可用手机跳跃、用人脸躲飞弹;团队也构想过把手机当弹弓的体感版 Angry Birds。技术创意很多,但他们逐渐承认,自己并不真正热爱小游戏的策划、收费点和数值体系。
7. 放弃游戏后,Face++ 成为寻找场景的开放实验
唐文斌说团队偶尔玩游戏,但偏好《星际争霸》这类体量更大的作品;他们无法从小游戏商业设计中获得成就感。2012 年底,旷视停止全部游戏开发,确认目标不是成为游戏公司,而是把视觉技术用到更多场景。
当时人脸技术仍不够成熟,团队也不知道最佳落点,于是先做 Face++,把 API 开放给开发者共同探索。它曾为美图秀秀、美图手机提供人脸关键点、瘦脸和放大眼睛等 SDK,也试过以图搜衣、服饰推荐等方向。
这段经历暴露了创始团队的基因限制:对 To C 大众审美和 To B 场景都缺乏深刻感知,常常是“拿着锤子找钉子”。唐文斌直言,他们喜欢的东西“并不是大众审美”,单靠技术出发很难自然成为用户驱动型公司。
8. 支付宝开户让深度学习第一次转化成规模业务
旷视第一个真正起量的业务,是为支付宝相关的线上开户需求提供金融级人脸识别。客户需要确认远程开户者确为本人,而支付宝比较市场方案后,认为旷视效果最好。
唐文斌回忆,当时 LFW 上大家的水平大约在 99.1%;他同时提到,旷视早期率先把效果从 90%-91% 直接拉到 98%-99% 一带。转折来自 AlexNet 同期兴起的深度学习,但团队最初同样“将信将疑”。
公司让范浩强先做实验,范浩强与赵尔静组成内部所谓“强静组合”,把人脸关键点检测到最终识别的一系列问题做出了显著提升。唐文斌从中得到的不是“追逐每个新概念”,而是对新技术保持足够开放、尽快用实验判断。
9. 只有数据飞轮能把技术时间差变成护城河
程曼祺指出,上一轮 AI 创业中不少技术优势没有变成商业成果;唐文斌的修正是“还是看场景”。纯技术差异往往只是时间差,别人过几天也可能追上,真正门槛是使用产生数据、数据再改善产品的正循环。
身份认证具备这条飞轮:服务支付宝后,旷视又进入其他互联网金融、滴滴、Uber 等场景;认证量越大,见过的人和边界情况越多,系统越接近金融级准确率。按唐文斌所述,该业务至今仍占约 70%-80% 市场。
美颜 SDK 则不同,客户对极限准确率要求没那么高,也不会持续回流足以拉开差距的数据,因此壁垒最终只是时间差。大型客户当然可以自研,但若认证只是业务中的小环节,外部供应商把研发成本摊给多个客户通常更经济。
10. AI To B 必须先回答价值、成本占比和标准化
唐文斌的第一条原则是客户价值必须能量化:到底降了多少成本、增加多少效率,不能只做一个看起来漂亮的 PPT ROI。“假 ROI”也许能帮助签下首单,却无法支撑复购和规模化。
第二条是最好解决广泛存在、但在单个客户成本构成中占比不太高的问题;占比过大就会刺激客户自研替代。程曼祺以英伟达、宁德时代反问:高占比又不可替代不是更好吗?唐文斌承认那是强大之处,但车企造电池、大厂自研芯片也说明替代压力始终存在。
第三条是警惕“项目陷阱”。B 端需求天然多样,供应商必须明确哪些功能标准化、哪些可配置、哪些才定制;如果每个客户都重新做一套,收入可以增长,组织和交付却无法 scale。
11. 零下十度、四十公里和 200% 流失率启动了物流机器人业务
约 2016 年,唐文斌与印奇参观天津一座天猫超市仓库:空间高大而没有暖气,现场约零下十度,拣货员每天拉车行走约 40 公里,相当于在低温里走完一个马拉松。
管理者让他们猜年度人员流失率。唐文斌猜 60%,对方说“你这个就缺乏想象力”,真实数字是 200%。这不仅是工资账,更是招不到人、留不住人和管理复杂度的问题,在日本、韩国、欧洲和北美更突出。
团队从 day one 就有机器人梦想,旷视当时使用的 MegV(Mega Vision)这一名称也承载着“先让机器人看懂世界”的想法。仓库把这种长期愿望变成了明确需求:让机器人获得“手和腿”,为物理世界输出生产力。
12. 仓库的标准对象和调度问题让机器人第一次可规模化
与开放环境相比,仓库至少把对象约束为托盘、料箱或单件商品,存在一定标准化,因此适合作为机器人起点。团队的长期想象仍是走出仓库、园区和固定盒子,但当时通用机器人在技术上并不现实。
早期真正决定系统效率的不是单台车有多聪明,而是货位分配、订单优先级、交通组织和多车协同。唐文斌把仓库视作大型优化题,正好对应团队在竞赛、运筹和强化学习上的积累。
为摆脱纯项目制,业务把仓库拆为入库、托盘存储、箱式存储、发货等环节,每个环节用标准产品和方案,再通过配置完成组合;集成商也可拿这些“积木块”搭建完整系统。
分拆后的原力聚合机器人以 Atomics 为品牌,收入约一半来自项目、一半来自产品,托盘和箱式产品、销售与渠道均趋于成熟。唐文斌称其规模已达“几个亿”,另有不少尚未确认收入的订单,海外占比快速提升。
13. 优衣库项目把 overpromise 的代价完整暴露出来
2019 年上海优衣库自动化仓库招标几乎叫齐国内相关供应商,像选秀一样进行了五轮筛选。项目使用上千台机器人,复杂度极高;旷视承认经验不是最多,却强调最终效率取决于软件、算法和调度。
To B 竞争迫使供应商不断抬高承诺:别人说能做,客户就问旷视能不能,团队只得接下许多自己也认为技术风险极高的要求。系统完成后,若目标效率为 100%,实际只有 40%,“差点搞砸了”。
旷视向客户解释已经踩清问题,请求延期半年,并把全部代码推倒重来。项目最终完成,客户反而认可其锲而不舍;唐文斌随后赴日本与优衣库创始人柳井正会面,后续也获得更多合作。
14. 竞争式采购会系统性制造过度承诺和隐形失败
唐文斌至今没有一个轻松答案:如果供应商还不是公认权威,诚实说“做不到”常被客户理解为能力弱,而不是判断专业;竞争者先承诺,就先拿到订单。
反馈周期又往往以年计算。供应商半年后失败,客户可能已经失去信心;客户与供应商都不愿公开失败项目,市场因而只能看见成功宣传,看不见 overpromise 的总体代价。
信任建立后,关系才会改变:供应商可以指出风险,双方先用小规模实验验证,再从“no”寻找“how to yes”。原力灵机依托原有物流业务与客户建立的技术信任,希望据此减少为拿单而虚报能力的压力。
唐文斌把当下不少具身项目形容为 POC、PR 甚至“摆拍”:文娱和科研之外,到底多少机器人在持续运行,没有清晰答案。厂商共同抬高客户期待,而技术未必已经到达相应状态。
15. 真落地依赖完整工作流,而非假设单机永不失败
“有用”首先要求完整解决客户任务,其次要求经济账成立。机器人偶尔能成功完成一个动作,不等于客户的流程已经闭环;失败后若变成异常、必须临时叫人处理,系统就只能停留在 POC。
唐文斌不假设模型很快达到 100%。更务实的产品要预先设计失败路径:调度到人工工作站、远程接管,或让其他设备续做,使整体工作流即使遇到模型失败也能连续运行。
闭环与 ROI 是两个独立问题:兜底机制先保证任务不被中断,再把机器人、人工、远程人员、调度和设备的 total cost 加总,确认客户仍能省钱或提高产出。
16. 原力灵机是在复杂重组后重新起跑的新公司
旷视团队 2024 年已开始尝试大模型驱动的机器人控制和 VLA;原力灵机则在 2025 年春天正式运营。中间数月主要用于重组:部分股东退出,新基金承接股份,原有股东也在新公司保留一部分权益。
范浩强、蒋竞天等核心成员并不缺外部机会,却仍选择一起创业。唐文斌把原因归结为多年协作形成的能力信任、兄弟感情,以及物流机器人留下的客户、场景和工程积累——这些组合能提高成功概率。
原力灵机约有 100 人,约 40% 来自原同事,60% 是新加入者;公司按全新创业公司设置激励,预留了约 30% 的期权池,而不是让后来者进入一套固化的旧结构。
17. 高人才密度提升迭代速度,却不能自动完成商业化
唐文斌认为“强的人会喜欢更强的人在一起”:人才之间即使意见不同,也认可彼此有独立想法和解决难题的能力。这种化学反应可减少流程化协调,让研发迭代更快。
但人才密度不能直接变成收入。商业落地不仅要解决最难的算法,还要理解客户、处理脏活、补齐全部细节;这些工作需要不同类型的人配合,而不只是再增加一批竞赛金牌。
旷视研究院曾流行一句“这不本质”,研究者对不够困难的问题兴趣骤降。唐文斌如今反过来强调:“当你真正变成一个商业化的产品的时候,那你所有对客户有影响的东西都是本质的。”
财务回报并未被浪漫化。他承认自己和印奇“心中有愧”,因为带团队创业多年却没让大家挣到钱;团队对技术和社会价值有更高追求,不代表经济回报不重要。
18. 多次低估技术变化,让唐文斌选择更早押注具身智能
旷视最初并不相信深度学习会比 SVM 等方法好多少;Transformer 出现后,张祥宇还发表过“Make CNN Great Again”,试图说明 CNN 也能达到相近效果,后来仍不得不承认 Transformer 演进更快。
自动驾驶早期同样经历怀疑,如今自动驾驶已经上街。唐文斌的复盘是:“历史上每一次技术变化都低估了它的变化速度”,即使不断提高心理阈值,技术最终仍常比预想更快。
具身模型当前成功率很低,却处在一条“非常陡的进步梯度”上;资金、人才和注意力的涌入还会加快实验循环。对他而言,机器人是 AI 在物理世界输出生产力的一种终极形态想象,需求本身并不需要被创造。
19. “智能、有用、可信赖”最终都指向模型能力
原力灵机把使命写成“打造智能的、有用的、可信赖的机器人”。“智能”解释了这次创业的技术变量;“有用”要求完整解决任务且算得过账;“可信赖”则包括安全和可靠。
唐文斌的关键归因是:眼下“有用”和“可信赖”最大的共同障碍仍是智商低。机械臂、camera 和不少本体部件已经可用,模型却无法稳定理解环境、执行任务和处理变化。
因此公司把模型能力视作第一要务,阶段性商业化排在第二;但二者不能割裂,商业化必须产生真实反馈,再反哺模型,而不是单独做一条与通用模型无关的收入线。
20. “具身原生”反对在现成 VLM 后简单嫁接 Action
行业常见做法是下载开源 VLM,在末端加一个 Action 模块,再训练 VLA。唐文斌把它比作九年义务教育后才进体校:小时候没有练身体,能力上限受限;只狂练体育,又会把原有语文、数学落下。
对应到模型,一方面机器人数据应从 VLM 预训练初期就进入,而不是等 VLM 完成后才见到;另一方面,VLA 训练不能只优化 Action,也要 co-train grounding、VQA 等多模态能力,避免原有能力显著下降。
他借原生多模态与嫁接多模态作类比:from scratch 的原生训练成本更高,却更可能得到更好的能力结构。原力灵机希望把同样原则从 VLM 延伸为具身原生的 VLM/VLA。
21. DM0 把互联网、智驾和机器人数据从 day one 放进同一训练链
唐文斌把物理世界数据分为三类:互联网多模态及视频数据、智驾数据,以及机器人操作数据。他认为三类数据应从 day one 联合训练物理世界原生 VLM,而非各自形成孤岛。
机器人的 Action 不只包括手,腿的运动和 navigation 同样是 Action;因此 Visual Language Navigation 与 VLA 在底层相通。若目标是室内外泛环境机器人,智驾数据能加强环境理解和导航,而不只是服务桌面任务。
DM0 的训练分为三段:原力灵机与阶跃把多模态、机器人及部分智驾数据混合,联合完成 VLM 预训练;原力灵机再继续训练 VLA,最后做 post-training。
阶跃、千里和原力灵机被唐文斌称为“兄弟公司”,存在业务合作。机器人数据来自原力灵机,智驾数据来自千里,阶跃有多模态数据积累,联合基模则可能让各方受益。
22. 真机数据仍是主料,仿真只在特定任务中有效
原力灵机同时使用 robot-centric 与 human-centric 数据。前者包括遥操作、手扶、外骨骼及无本体采集等方式,后者包括可穿戴设备产生的数据;最终效果取决于这些数据的混合“配方”。
唐文斌目前对 contact-rich 操作中的仿真较谨慎:刚体尚可处理,非刚体难以逼真;力、触觉等多模态信号也难模拟,sim-to-real gap 使其对真实操作模型的帮助有限。
仿真在两类问题上更有价值:一是 locomotion,机器人主要与地面接触,可大量学习重心和运动控制;二是更 high level 的任务理解、分解和规划,不必精确复刻接触细节。
对世界模型生成数据能否 scale,他保持开放。视频、第一视角、仿真和真实使用飞轮都可能是路线,但生成质量能否真正帮助现有模型仍是“big if”,所以当前仍以真机数据为主。
23. 具身系统可能不是双层,而是三个不同频率的模型
System 2 负责慢思考、推理、任务理解和分解,可能运行在云端、频率较低;这一层正是 LLM 和基础多模态模型已经擅长的部分。
System 1 负责中频机器人操作,VLA 可能约为 10 Hz。但旋转、微调等精细动作很难仅靠 10 Hz 控制,因此下方还可能需要 System 0,在 100 Hz 以上处理力、触觉和快速反馈。
三个模型之间应该传递什么中间表示、如何让大脑输出真正改善小脑 performance,唐文斌明确说“现在其实也不知道”。这不是工程接口的小问题,而是具身模型架构仍待解决的核心问题。
节目尾声把这一设想与 Sharp 在 CES 提出的三层结构相呼应:基础模型擅长宏观规划,创业公司的独特空间更多位于软件、硬件紧密耦合的 System 1 和 System 0。
24. 基础模型公司未必能轻易覆盖具身创业公司
唐文斌用“看梅西踢足球”作比:观看再多视频,也未必能让自己学会踢球。具身能力与具体硬件、接触反馈和控制频率紧密关联,不能由更大的视频模型自然全部解决。
OpenAI、Google、字节等基础模型公司在 System 2 上有明显优势,但 System 1、System 0 仍需模型与硬件共同迭代。大厂当然也可以投入硬件和场景,只是任何公司的资源和精力都有限。
更关键的是数据来源。单靠采集数据并不能解决问题,真正高价值的数据应来自批量使用中的失败、人工接管和任务结果;要得到它,必须先把应用闭环,这不是单独训练一个模型就能完成。
行业因而面临鸡蛋问题:机器人不成熟,所以无法批量使用;不能批量使用,又没有使用数据。谁能先让有限能力的模型在合适场景持续运行,谁才可能建立难以复制的数据壁垒。
25. 评测正从 specialist 走向 generalist,zero-shot 仍然太早
唐文斌把评测分为三层。Specialist 是在基模上获得某一任务的大量数据,再 fine-tune 成只做这一任务的模型;它代表当前行业更多正在做的能力路线。
Generalist 或 multi-task 要求把约 20 个任务的数据交给同一个模型,再用提示词驱动它完成全部任务,更直接考验泛化。Zero-shot 则连目标任务数据都不给,只靠提示完成未见任务。
原力灵机当前 generalist 成功率只有 30% 多,唐文斌认为 2026 年的重要变化会是行业从 specialist 走向 generalist;zero-shot 今年可能仍做不到,必须先把 generalist 显著推高。
由于 sim-to-real gap 很大,模型改动最终仍需大规模真机测试。Benchmark 不只是对外排名,而是给研发提供信号:哪个方向有效、当前进步发生在哪个维度。
26. 当前好场景必须同时容错、容时、泛化且长时间运行
原力灵机给场景设了四个“必要不充分”条件:允许机器人犯错或能为错误兜底;没有过强节拍要求;存在适度泛化,值得用模型而非非标自动化;并且每天长时间作业,以支撑投资回报。
汽车产线恰好违反前两条:高度不容错,又有严格节拍。唐文斌认为外界想象中的 pick-and-place,到了现场会受到包装、辅材、容器、位置和工艺限制,真实复杂度与宣传相差很大。
即使原力灵机拥有汽车产业链关系、千里也有汽车工厂,公司仍对汽车产线说 no。唐文斌强调“很多东西判断要去现场看”,不能因为特斯拉或 Figure 讲汽车工厂故事,就把它视作天然最佳场景。
节目尾声保留了另一种场景观:贾鹏更强调从头到尾由机器人完成的端到端任务,唐文斌则接受人类兜底。两者的共同点,是都避开节拍过快的工作。
27. 物流可以成为有限智能机器人的“温室环境”
物流系统本来就同时包含人工和各种已有自动化设备,因而容易接入能力尚不完整的新机器人。机器人没有完成任务时,调度系统可以把货物转至人工站,流程仍然闭环。
唐文斌把它类比为滴滴或 Uber 网络中自动驾驶车与人类司机并存:单台机器不必覆盖一切,系统通过分工、远程接管和动态调度吸收失败。
这种“温室”不是掩盖能力,而是创造持续使用的条件。机器人若因一次失败就停摆,永远得不到真实反馈;允许它在系统中反复尝试,失败数据才能回到训练管线。
28. 持续使用需要可检验的运行标准,而不是更多 demo
唐文斌现场给出的定义是:真实生产或服务场景、每天开机十小时以上、连续两个月,并且“有量”;被追问何为有量时,他先以 100 台作为粗略数字。
按这个判据,他认为行业可能几乎没有成熟案例。许多视频只证明某次成功,没有说明是 30 次失败里挑出一次,还是模型的稳定平均水平。
原力灵机不准备同时铺开很多行业,而希望找两三个场景真正闭环;一个场景有 100 台甚至 1,000 台持续工作,比十几个浅层案例更接近商业落地。
公司给 2026 年定下“一个场景,一千台”的目标,并要求这些设备符合持续开机标准。唐文斌把千台视作数据飞轮可能启动的量化门槛,而非单纯出货数字。
29. 硬件上限由遥操作验证,模型不能凭空定义本体
唐文斌不同意“模型定义硬件”的简化说法:判断一个硬件能否解决任务,先看人通过遥操作能否完成;如果人脑控制这套本体都做不到,再强的算法也无法突破精度、负载或构型上限。
完全标准化本体容易出现 underkill 或 overkill:相机位置、末端尺寸可能让它根本伸不进去;即便能做,过度设计或过强的移动能力又可能让 ROI 失去竞争力。
高重心人形或轮式双臂很难快速移动,唐文斌估计约 0.8-1 米/秒已接近上限,急停还容易倾覆;低重心 AGV 却可能达到 4 米/秒,因此可由 AGV 快速运送,操作机器人留在工位不动。
原力灵机的表述是“模型在解锁场景,我们通过场景去定义硬件”。公司会保留标准模块,再像乐高一样快速组合成不同形态,避免在标准人形和逐项目定制之间二选一。
30. 基础设施的价值在于提高迭代效率,而不是装点生态
唐文斌认为模型当前效果只是“五十步笑百步”,领先会交替出现,真正竞争力是迭代效率。它依赖数据、训练、推理、硬件和评测整条基础设施,而非一张阶段性榜单。
DexBotic 最初服务内部复现算法、比较实验和统一数据流程;它不是替代 PyTorch,而是在其上增加面向具身研发的 toolbox,可配置 VLM 基模、vision encoder、Action 模块、diffusion 路线及部署方式。
RoboChallenge 则用大规模真机测试为研究提供信号,DeepFlow 面向工作流。唐文斌的逻辑是:没有可靠 benchmark,公司不知道自己是否进步,整个行业也难以形成共同技术坐标。
他把开放基础设施称为“既利他也是利己”。行业当前最重要的不是众多公司中谁先领先,而是“这个行业到底多快能行”;若模型始终达不到应用门槛,除了科研、文娱外,所有公司都可能成为泡沫。
31. MegEngine 的教训是开源必须发生在生态尚未固化时
旷视 2013 年便开始自研后来称为 MegEngine 的深度学习框架,当时只有 Caffe 和 MXNet,TensorFlow 也还没出来。但团队只把它当内部好工具,直到 2018 年才开源,生态窗口已经关闭。
唐文斌的复盘不是“小公司不该做框架”,而是“核心要早”。DexBotic 选择在具身开发尚无主导工具时开放,让外部使用、修改和贡献能反过来提升内部效率。
DexBotic 1.0 在前一年 10 月已开源,唐文斌称已有约 1,000 名外部开发者,不少高校在用;千问团队也与原力灵机交流,并安排人员基于它开展开发。
模仿学习之外,团队发现 RLinf 已把强化学习框架做得很好,便选择打通接口、探索合并,而不是重复建设。开源在这里首先是信任机制:“code 都给你了”,使用者可以自行修改,不必被供应商锁住。
32. 自办榜单的公平性要靠完全可复现解决
DM0 在 RoboChallenge 两条榜单上排名第一,引发了“既当运动员又当裁判”的疑问。唐文斌说团队内部也纠结过,但最终认为提交与否“不本质”,因为测试、代码和训练细节都公开。
外部团队可下载 DexBotic、DM0 code 以及各 task 的 fine-tune 和 generalist 细节,直接复现分数。其公平性不依赖原力灵机口头保证,而依赖任何人都能重跑结果。
他强调 RoboChallenge 的初衷不是制造长期第一名,而是形成能衡量真实技术阶段的 benchmark;另一家公司两周后超过 DM0 完全正常,榜单应牵引共同进步,而不是替公司背书。
33. 最终胜负取决于通用模型、场景飞轮和长期专注能否合为一体
唐文斌预计行业早期会存在很多 vertical 公司;随着大模型能力增强、小模型被吞并,能力将逐渐集聚,最终可能只剩全球个位数平台型公司。他进一步判断多数可能来自中国,因为具身比纯大模型更依赖硬件供应链和快速本体迭代,但也承认硅谷公司可能以模型为核心占据位置。
留到最后需要两件事:模型智商领先,以及机器人在场景中长期使用形成的数据飞轮。前者是灵魂,后者把失败、接管和反馈持续喂回模型;唐文斌给飞轮设想的起点仍是“一个场景一千台”。
他认同落地过深可能把公司拖入单场景优化,因此要求直接用奔向通用的当前模型落地,再靠场景选择和系统工程补不足,而不是为每个客户训练一个 overfit 模型。“要警惕变成小老头公司”——活很久、规模不大、本质仍是非标项目商。
旷视最大的战略反思是不够专注:视觉、安防、自动驾驶、机器人和手机方向不断做加法,人才再强也会被稀释。“A 加 B 加 C 基本上约等于 max(A,B,C)”;若重来,唐文斌会把更多人集中到一两件真正相信的事情。
原力灵机因此拒绝表演型机器人、春晚式曝光和汽车产线等诱惑。面对可能到来的 Gartner 低谷,策略是“准备好足够多的干粮”,在市场情绪好时储备资金,又不以散弹枪方式消耗;判断上则“既不能短期太乐观,也不能长期太悲观”。
2026 年的两项硬目标分别是把目前 30% 多的 generalist 成功率推到一个未公开但“非常激进”的水平,以及让一个场景的一千台机器人持续运行。仍未解决的问题包括三层模型的接口、最可扩展的数据路线,以及是否需要新模型结构。
唐文斌把自己的角色概括为“AI 技术产品经理”:既理解模型边界,又能用 work around、工作流和基础设施把技术恰好放进客户场景。十五年创业后,他仍记得旷视前台特意摆放的机器人,并把具身智能称为“值得投入 lifetime、投入所有时间去做”的事情。
Full transcript
你们最多的时候是不是有十几个 IOI 的金牌?
我们 NOI 的金牌更多。
当时范浩强作为高中生,是怎么跑到你们这儿上班的呢?
反正这也是个有趣的故事。以前研究院有一句挺逗的话,大家叫“这不本质”。大家都想去解决那个本质的问题,但实际上,当你真正变成一个商业化的产品时,所有对客户有影响的东西都是本质的,对吧?它不是最后最难的那个事情才叫本质。
所以还是回到刚才那个问题:今天到底有多少机器人是真正在被持续使用的?有多少具身机器人是在被持续使用的?
以前研究院有一句挺逗的话,大家叫“这不本质”。大家都想去解决那个本质的问题,但实际上,当你真正变成一个商业化的产品时,所有对客户有影响的东西都是本质的,对吧?它不是最后最难的那个事情才叫本质。
欢迎收听晚点聊,我是曼琪。本期嘉宾是原力灵机的联合创始人和 CEO 唐文斌。2011 年,他和两位清华同学印奇、杨沐一起创立旷视,这是中国最早的 AI 创业公司。2025 年初,唐文斌成立原力灵机,开始具身智能的新创业。在本科到研究生期间,他做过 7 年中国信奥赛国家队的总教练,认识了大量奥赛小天才,其中不少人之后加入旷视,现在又在原力灵机和文斌一起创业。这期我们聊旷视的创业复盘和原力灵机的这一年。这是一家不做人形机器人的具身智能公司,也是一家会直接参与多模态基模预训练的公司。这两件事都是少数派选择,原力灵机会给中国具身智能市场带来哪些不同呢?我们正式进入本期节目吧。
今天非常高兴可以邀请到唐文斌,原力灵机的创始人,做客晚点聊。你可以和我们的听友简单打一个招呼吗?
OK,晚点好,大家好。我是原力灵机联合创始人兼 CEO 唐文斌。灵机是一家希望打造智能的、有用的、可信赖的机器人的公司,这是我们的使命。我们希望通过具身智能、通过 AI 的能力,以机器人作为形态,赋能更多场景,创造更多价值。
文斌也是一位非常资深的 AI 创业者。2011 年的时候,你和印奇、杨沐一起创立了旷视;2025 年初,原力灵机成立。中间有十几年的过程,包括你从初中的时候就开始做编程。我也想从这段经历聊起:最开始你是怎么接触上编程的,然后怎么开始参加竞赛的?
1. 编程竞赛塑造工程师
我老家是绍兴下面的一个县城,叫新昌。我们那个地方原来没有接触过这种竞赛,非常巧合的是,我上初二的时候,我们的初中——新昌县城关中学——刚开始搞这个竞赛。当时学校从每个班里挑了两个数学最好的同学,去学习竞赛。
反正也是阴差阳错,我遇到了编程竞赛,也就是 NOI 这件事。我们当时有很多小伙伴去机房,老师也给了我们机房的钥匙。很多小伙伴去了机房更愿意打游戏,但我们有两三个人觉得,编程其实比打游戏更好玩。
我觉得这也跟兴趣有关。从那时候开始接触竞赛,运气也比较好,后来拿到了一些成绩。
对十几岁的你来说,编程的乐趣如果描述一下,是什么?
我觉得是一种解决问题的成就感。一个问题在那里,你通过构思一个方法、一个算法,把它编程实现,然后通过了所有测试,确实解决了这个问题。这个代码如果又写得很优美,那你其实会有一种工程师解决问题的快感。
我认为这是一种非常强的正向激励。
像信息学竞赛,因为它可能涉及实际去编程,和数学、物理竞赛有什么不一样的地方吗?
我原来其实也参加过数学竞赛和物理竞赛,数学题和物理题很多时候相当于这道题有一种解法,解出来会有一种解题的快乐。但编程很多时候解法不唯一,它有很多种不同的解法。
而且我们并不是去求得那个答案,而是在设计一种方法去求得这个答案,享受的是寻找方法的过程。很多编程题目也很有意思,它其实没有最优解。比如我们要找到一条最短路,或者求一个解,使得一个问题的优化方案达到一个比较优的状态,它可能并不存在唯一的最优解。
所以你可以发挥自己的想象,发挥自己的可能性,去找到一个较优解。这跟今天做 AI 或者做优化问题,其实很多事情是一样的。
整个过程就是不断思考、寻找解法、获得反馈,而且反馈很多时候非常及时。你的程序提交上去之后,马上就会得到一个 “Wrong Answer” 或者 “Accepted”。
所以我们当时除了做竞赛题,也写了很多不同的程序。我们做过网站,也写过一些东西;我们也玩游戏,写过游戏外挂。你会觉得自己逐渐变成了一个可以制作很多工具的人,所以整个计算机科学是非常有意思的。
那你们当时保送的时候,在清华是可以选专业的。你是 2006 年上的本科,对吧?
对。但那个时候,绝大部分同学都没怎么想,大家默认就应该去计算机系,所以我们所有人都去了计算机系。
我之前和印奇聊的时候,他说他在清华读本科时,不是成绩最好的那种学霸。他走的是文艺路线,会跳拉丁舞,是清华国标队的队员。你在大学的时候也继续参加了很多竞赛,对吧?
对,像 Topcoder、ACM 等等。
高中时很多人参加竞赛,可能有一个比较实用的目的,比如保送。大学继续做这件事,应该确实是特别喜欢吧?
对,我觉得就是好玩。
你说的那种刺激和正反馈,能不能讲一些具体的比赛?哪些比赛会给你这种感觉?
很多比赛其实都会。参加编程竞赛,我们都是想赢的。
Topcoder 里面还有一个很有意思的环节,叫 Challenge。比赛是 1 个半小时,大家把程序提交之后,可以在同一个房间里看别人的程序。你有 5 分钟时间去看别人提交的程序,如果你认为他的程序是错的,就可以提交一组数据,让它输出错误答案。这样你就可以把他的成绩变成 0 分,同时给自己加 50 分。
我特别喜欢那个环节。它很有挑战性,需要观察力和速度。每个人的程序只能被 Challenge 1 次。如果我把你的程序 Challenge 掉了,其他人就不能再来把你的程序 Challenge 掉了,所以它还得比手速、比观察力。
这是一种在很大压力下,同时需要思考并形成结果的方式。大家都非常享受这个过程,而且对抗性很强。
你记得自己最爽的一次吗?比如抢到了多少分,干掉了多少队?
我们当时一个房间一般是 20 个人。有一次 Topcoder 比赛有 3 道题,其中一道题,20 个人全部提交了,而且我认为他们都有一个很小的 bug,或者说一个很小的 trick 没有发现。
我把那 19 个人全部 Challenge 掉了。那次印象非常深,我靠 Challenge 拿了 950 分,就是 19 乘以 50。
这些分数会放到累计的分数榜单里,对吧?Topcoder 一直是一个累计、持续的排行榜。
对。每次比赛都会给你的 rating,可能提升一点,也可能降低一点。今天很多 AI benchmark 里面有一个叫 Codeforces 的 benchmark,大家其实也是在评测类似的东西。
楼天成也很喜欢打这个比赛,是不是?你们是老乡,他也是浙江人。
对。我第一次参加信息学竞赛就是跟楼天成一起。当时他高二,我初三,我们俩都是浙江队的。
那个时候全国赛不分初中、高中,都是一样的题。所以我们那一届是同一年浙江队的。
当时你还认识哪些竞赛的同学,觉得挺好玩,或者现在还保持交流?
其实挺多的。今天很多圈子里的人以前都搞过竞赛。比如阿里的蒋凡,我们很多年前就在论坛上一起灌水。楼天成也是。我们公司里面当然还有很多人。
Kimi 里的周星宇,原来也是搞竞赛的。王小川很早年也搞过竞赛,而且还当过国家队教练。
因为后来你自己也去当过国家队教练。你是在本科期间开始做的,对吧?
对。这个其实是学生的义务劳动。中国计算机学会需要一些学生工作人员,因为整个比赛是由计算机学会组织的,中间有一些命题相关的工作,大部分由学生委员来做。
所以我从大二开始,和另外一位同学胡伟栋一起牵头做命题工作。胡伟栋比我大一级,也是 IOI 金牌。我们做了很多年,从 2007 年到 2013 年。2013 年之后,就交给另外一位同学来整体组织这件事。
相当于你创业两年之后,还做了两年的教练?
对。
是因为你特别热爱吗?创业应该挺忙了。
对,就是很好玩,我们也很享受这个过程。
这和你自己打比赛有什么区别?出题和做题有什么区别?
2. 从选手到裁判
出题比做题难得多。一个好的题目,并不是说它有多难或者多简单,核心是要有区分度。我们要把参加比赛的 200 个同学的分数拉开。
所以整个题目要考虑,如何找到一个好的设置,考察的点足够有趣,和以往的题不太一样,还要有新意。出一道题非常费力,我们做题可能只需要 1、2 个小时,但出一道题可能要用 1 周时间。
我觉得这有点像现在做 AI 里的 benchmark,做 evaluation 的过程。定 evaluation 是一件非常难的事情,包括今天具身智能的 evaluation 也是一样。什么是一个好的 benchmark?如何让这个 benchmark 有区分度,能够评测出不同维度的能力,需要非常认真地思考和体系化的设计。
这里面有什么窍门或者方法吗?
很多时候还是要靠经验判断。你自己得是一个好的 player,才能成为一个好的 judge。如果你自己不是一个 player,就做不了好的 judge,因为你对这个东西没有体感。
今天 AI 里面很多 benchmark,最早的模型相关 benchmark 是 OpenAI 定的。今天具身智能的 benchmark,我们也是最早一批跳出来做的。我觉得逻辑是类似的:你得是一个好的选手,才有可能成为一个好的裁判。
回到上学的时候,你本科时就和印奇认识了。当时对他的印象是什么?
3. 创业伙伴开始成形
我跟印奇本科一开始其实没有那么熟。我们班很神奇,是一个没有女生的班,一共 27 个男生,在清华是一个非常神奇的班。
我们那一届是从大一到大二,在清华里面重新考了一次试。他原来是自动化系的,我是计算机系的,所以大二时大家重新来到一个新的班级。那一年清华宿舍不够用,我们甚至还不住在同一栋楼。
后来熟起来有两个原因。第一个是我们都去了微软亚洲研究院实习。他当时跟着孙健做人脸相关的工作。
那是哪一年?
应该是 2008 年、2009 年,也就是大三、大四的时候。他在四楼,我在三楼。我在另外一个组,跟着张磊和蔡瑞。蔡瑞现在在小米。当时我做的是图像搜索。
所以我们在微软亚洲研究院经常碰面,聊聊他那边在做什么、我这边在做什么。因为都和图像有关,交流还挺多,我觉得这是我们熟起来的一个契机。
第二个原因是大四的时候,清华有一个学生节,大家去表演节目、热闹一下。我们那一年班里排了一个剧,27 个人排一个剧,全部都是男生。
演什么了?
演了一个小品。印奇是导演,他还从国标队请了一个女生来客串。
我对那次印象特别深,因为导演这个工作其实很难。他希望所有同学都参与进去,所以做了一个非常复杂的剧本。我们的剧既温馨又搞笑。在这个过程中,我觉得他非常厉害,很有组织力。
你们 27 个同学都参加表演了?
基本都参加了。我应该属于路人角色之一。
我觉得这两件事情拉近了大家的距离:第一,我们在科研工作上有很多讨论和交流;第二,班剧这件事也让大家更熟悉。后来毕业前,我们就约着说,有机会要一起创业。
你说的毕业前,是本科毕业前吗?
对。2009 年,我们后来想创业,其实也是几个机缘巧合。因为他在做图像,我也在做图像。
那时候我们还不太讲 AI 这个词,讲的是 machine learning、计算机视觉。我们觉得计算机视觉一定是很有用的东西,未来机器人都需要眼睛,都需要看到这个世界。视觉就是让机器人看懂世界的一种方式。
所以我们觉得未来有机会可以一起创业,但具体创什么,其实也不知道。我们当时还想过,先去国外读两年书,或者去 Google 之类的公司工作一段时间,有机会再一起创业。
我当时在清华还读了一个 master,是唐杰老师的学生。
上次我们聊过,你说你是他的第一个学生。
对,我是唐杰老师的第一个学生。我之所以成为他的第一个学生,是因为当时唐杰老师刚升副教授,刚刚有招生资格。每年只能招一个人,所以第一个人就是我。
你为什么当时想选唐老师?
唐老师还是很厉害的。我们当时上了几门不同的课,觉得唐杰老师非常 sharp,对很多问题都有很深的洞见。
唐老师当时也在 KAC 实验室吗?
对,他那会儿就在那边,应该是做图计算相关的。
他后来怎么又和计算机视觉、图像结合起来了?
他其实没做视觉。我在实验室里做的还是 data mining,也就是数据挖掘。本科期间和研究生期间,我发表的一些文章主要都和数据挖掘相关,跟唐老师一起做了很多社交网络上的数据挖掘工作。
后来有一段时间,唐老师学术休假,去国外待了几个月。他说,你要不去微软亚洲研究院待一阵子?我就去了。
我去的那个组叫 Web Search and Mining,原来是做文本的。结果我去了之后第一天,mentor 就跟我说:“我们组改名字了,现在叫 Social Media Search。我们原来做 text mining,现在开始做 image search。你还干不干?”
我说,来都来了,再换一个组也很麻烦。结果就机缘巧合地开始做 vision。
我在微软亚洲研究院做的那篇工作,是用图片里的上下文信息去增强图像搜索能力。后来这个能力应该也被 port 到 Bing 里,做了以图搜图。
按照你们本来的计划,当时印奇在美国哥伦比亚大学读博士,你在清华唐老师这边读硕士,可能还想工作一段时间之后再创业。但实际上你们很快就开始创业了。后来是怎么回事?
4. 旷视从游戏起步
当时有一个机缘巧合。那时候 Kinect 非常火,我不知道你记不记得,大概是 2011 年前后,体感交互游戏机非常火,就是 Xbox 360 加上体感交互设备。
你可以拿着它做切西瓜的动作,不用手柄,直接用人体操控。手去切西瓜,或者做类似的动作。那时候体感交互游戏很火,这是第一个背景。
第二个背景是,我阿姨在那一年送了我一部 iPhone 4。我觉得 iPhone 4 是一个非常伟大的产品。那应该是 2010 年下半年,已经快到 2011 年了。
为什么 iPhone 4 很厉害?因为它是历史上手机第一次出现前置摄像头。当时我们就想,能不能把 Kinect 的游戏体验搬到手机上?
我们手持手机时,前置摄像头可以看到我们自己。既可以看到脸,也可以看到手在什么位置,可以做一些动作。所以我们觉得,通过计算机视觉的能力,可以做出体感交互产品。
第三个 trigger 是,当时有很多独立开发者挣到了不少钱,比如墨迹天气,还有很多独立开发者的 app 赚了很多钱。我们就说,自己一起做个游戏,挣点钱。
最早是我和印奇两个人。我们俩各投资一台 MacBook,以前用的都是 Windows 电脑,然后开始做游戏。后来发现两个人的马力不够,就把杨沐拉了进来,三个人开始做这个游戏。
这个游戏叫《乌鸦来了》(Crows Coming)。当时下载量还挺大,没有什么推广,一度到了苹果 App Store 免费榜前三。
但实际上,这和旷视之后的业务差别挺大的。
旷视刚成立时,其实也没太想明白要做什么。我们发布游戏之后虽然没挣到钱,但挣了一波名声,因为很多人下载,还拿了一些行业奖项。
这个游戏在独立开发者游戏里被认为是比较有趣的一个,因为我们用类似摇头的方式控制游戏,是行业上第一个在手机上的体感交互游戏之一。
后来很多投资人找上门来。我们想,见一个投资人,肯定也不应该只见一个,不如多见几个。我们觉得未来有机会一起创业,那在战场上学习也是一种很好的学习方式,不如就开始。
当时联想之星和联想创投投了我们,我们拿到了第一笔钱。
当时你们怎么理解创业这件事?听起来像是被很多外部因素推着做出的决定。
这是一个很真实的版本:当时我们有一个模糊的方向,觉得未来会走上创业的道路,但今天怎么走,其实并不知道。那就先走走看,我觉得这是一种模糊的方向感。
在这种模糊的方向感下,我们愿意一边前进,一边成长。创业还是一种手段,我们希望做的技术和产品能够给更多场景带来价值。工程师很多成就感的来源,就是看到问题在那里,先把它解决掉。
所以它是工程师解决问题的成就感的一种延伸,只不过是一种更极致的方式:你们自己做主,自己决定要解决什么场景、什么问题。
你们最开始做的《乌鸦来了》,是移动端手机游戏。当时移动互联网也是一个很大的方向,但旷视 2011 年成立之后,后来没有继续做 To C 和移动互联网相关的事情。
我们其实还做了一小段时间。旷视成立之后,我们希望把计算机视觉应用在不同场景里,其中一个重要方向就是游戏。
我们当时跟投资人讲,体感交互游戏可以成为一个很重要的品类,而我们在这个品类里做得还不错。第一款游戏是《乌鸦来了》,是一款 2D 游戏。第二款做的是 3D 游戏,叫《街头速滑》,是一款轮滑游戏。
它有几种操作方式。我们加入了摄像头和体感交互,比如跳跃:拿着手机做一个这样的动作,就可以跳。还会有飞弹飞过来,需要通过人脸动作躲避。它是一种多维度的交互式游戏。
那款游戏也卖了一些钱。当时 4399 和触控——也就是做《捕鱼达人》的公司——愿意帮我们做发行。那个游戏做得还挺精致。
后来我们还想过做一个体感交互版的《愤怒的小鸟》。拿手机当弹弓,拉弓、发射,所有这些都依靠视觉识别。比如拉得多远,对应不同的力度。
当时我们有很多好玩的创意,但做了一段时间之后,发现有一个很大的问题:我们自己其实不玩这类游戏。我们偶尔也玩游戏,但玩的通常是几个 GB 的游戏,比如《星际争霸》,或者 SLG 这类游戏。
我们会发现,做这些小游戏带来的成就感并不强。游戏策划、收费点怎么设计、数值怎么设计,这些事情我们在过程中体会不到成就感。
后来我们觉得,这条路可能有点走偏了。我们想把技术应用到不同场景,游戏只是其中一个场景。我们的目的不是成为一家游戏公司,而是想做技术本身。
你觉得张一鸣会看《内涵段子》和今日头条吗?
我觉得他也不看。
5. 从游戏转向人脸
所以还是要 follow 自己内心的想法。我们这帮人的想法,其实是工程师的想法,希望用技术去改变一些事情、实现一些事情。
那时候我们也没想明白该做什么。人脸技术还很早期,很多场景并不 ready,所以我们想,先做一个开放平台吧。于是我们做了 Face++,把所有 API 都开放出来,一起探索这项技术到底在哪些场景有用。
2012 年年终,我们停掉了所有游戏开发。
旷视一直是非常技术驱动的思维。你们很认定计算机视觉这个技术方向有潜力,然后去寻找各种应用场景。
回头看的话,你们当时的创始团队组合,有可能去做更偏产品或者用户驱动的创业吗?
我觉得从基因上可能很难。因为我们对用户和需求的观察非常肤浅。
不管是 To C 还是 To B,To B 的产品需要理解场景;To C 的产品需要有很强的感知力,能够切换到用户视角。但我们这帮人的喜好非常诡异或者独特,并不是大众审美。
我们内心觉得有趣的事情,未必是大部分人觉得有趣的事情。这个 mindset 还是拿着锤子找钉子:我们有 vision 相关的技术,有人脸技术,有图像搜索技术,那什么产品能做这个事情?
我们尝试了很多场景,比如通过图片搜索衣服。当时美丽说、蘑菇街也很火,我们就想,能不能做服饰推荐、基于视觉的服饰搜索。但我们最后发现,自己真正热爱的和擅长的事情,其实并不在那里。
从 Face++ 之后,旷视后来真正找到主要业务,是什么时候?
Face++ 作为一个平台,当时给很多公司提供技术。我们和美图秀秀、美图手机做了很多合作,提供人脸关键点检测,帮你把脸拍瘦、把眼睛放大等。
这些 SDK 业务做了一段时间,但真正第一个起规模的业务,是和支付宝的合作。
当时支付宝和浙江网商银行非常需要解决开户问题,也就是证明“你就是你本人”。用户不用去线下网点,可以直接在线上开户。这需要非常高准确度、金融级别的人脸识别技术。
支付宝应该在市面上所有提供人脸识别技术的公司里,最后发现我们的效果最好。
你们当时精度到多少?
当时有一个 benchmark 叫 LFW,是做人脸识别评测的数据集。大家的水平大概都在 99.1% 左右,我们是第一个把效果从 90%、91% 直接拉到 98%、99% 的团队,实现了跳跃式的发展。
当时用什么技术实现的?AlexNet 是 2012 年出来的,你们跟得很紧。那会儿 AlexNet 也算是全球范围内的标志性成果。
我们那时候其实也不太信,还是将信将疑。公司里第一个做深度学习的人,其实是范浩强。
我们派了一个高中生去探一探这个方向,最后发现效果非常好。当时是赵尔静和范浩强两个人组成了一个团队,我们内部叫“强静组合”。他们把整个人脸识别里的关键点检测和最后的识别等问题,都做得非常好。
赵尔静当时是本科生吗?
当时应该也是实习生,是本科生。
我觉得这也是今天 AI 公司可以借鉴的一种人才使用方式。当时很多东西还在摸索,深度学习也很新,没有太多经验可以借鉴。所以这个时候,一帮动手足够快、足够聪明的人其实更重要。
我们拉了很多搞竞赛的人进来。
当时范浩强作为高中生,是怎么跑到你们这儿上班的?
这是一个有趣的故事。小强是初三升高一的那一年进了国家集训队,高一到高二时参加了 IOI,那一年他应该拿了 IOI 第二名。
当时你是教练。
对。我是教练。
那一年出台了一个新规定:如果参加国际赛,也就是 IOI,并且拿到金牌,就不要再参加了,把机会让给更多人。
相当于他高一就保送了?
对。他其实初三就保送了,所以就没事干了。他就问我:“那我没事干了怎么办?”
我说:“我们刚开始创业,你要不来这儿吧?”所以他高二就加入了我们。
你们当时开始愿意尝试深度学习,是你们让他们去试,还是招了很多聪明的年轻人之后,他们自己去看、自己想试?
我觉得是在很开放的讨论过程中发生的。我们当时也看到,神经网络其实并不是一个很新的东西,只是把它做深了。但它到底能带来多大效果,大家还是将信将疑。
所以我们说,小强去试一试。小强也觉得这个方向很有意思,就试了试,结果效果出乎意料地好。
有很多新技术,我觉得要抱有足够开放的态度去看待。
你们当时技术做得很强,但另一方面也能看到,上一轮 AI 创业中,很多技术优势并没有转化成商业上的成果。
我认为这句话不完全对,还是要看场景。
如果只是纯技术层面的差别,那它的壁垒似乎只是时间差:今天你做出来,另外一个人可能过几天也能做出来。那真正的护城河或者门槛在哪里?
其实是数据飞轮。如果更多人的使用积累了更多数据,而这些数据又能帮助算法或者产品变得更好,这件事就变成了正向循环。
我们给支付宝做身份认证之后,后来就会发现,其他互联网金融平台也有类似需求。我们给几乎所有互联网金融场景提供服务,后来也服务了滴滴、Uber。
比如打车时,大家会担心拼车时旁边的人是不是本人,会不会有危险。很多线下 O2O 场景都有身份认证需求,它是信任的基础。
因为有更多人在我们平台上做认证,我们见过更多人,系统也变得更准确,最终达到金融级别的水准。今天在身份认证这件事上,我们依然占有大概 70% 到 80% 的市场份额。
这就是数据飞轮在发挥作用。
但卖 SDK 可能不是这样。今天大家对技术精度的要求没那么高,慢慢地大家也都能做。在没有数据飞轮的情况下,门槛确实只是时间差。
身份认证如果是特别大的公司,是不是也会自己做?如果它整个生态里有很多这种需求。
也会,但很多时候要看值不值得。还是要看清楚目的和手段。
所有东西当然都可以自研,但如果它只占你业务里的一个小环节,你投入很大力气研发,和我研发之后服务很多客户相比,我均摊下来的成本肯定更低。
比如今天滴滴依然是我们的一个大客户,滴滴的人脸身份认证量很大。它能不能自己做?可以,但我觉得没必要。
旷视找到的第一个起量业务,是偏软件的人脸识别技术方案,服务各种互联网应用和互联网场景。但外界对旷视的很多印象,还是来自后来更重、更 To B 的业务,比如安防。那是一个更难做的生意,为什么要转向那个方向?
6. 软件业务走向机器人
旷视过去几年做了很多加法,因为我们一直在寻找两个轴的平衡点:技术可达性和市场规模。
我们当时的人脸识别业务做得很好,但它的天花板并不高。一个人每天刷脸的次数其实有限,所以我们需要找到空间更大、需求更大的问题。它可能更难,但我们通过这种方式逐渐发展出新的业务,走向更大的需求和市场。
如果总结一下,AI To B 有什么经验和教训?
第一,你的价值能不能被量化计算。很多 To B 客户是非常理性的角色,他要看使用 AI 工具或者产品之后,到底解决了什么问题,降本也好、增效也好,能不能量化。
什么是可以被量化计算的,什么是不太好被量化计算的?能不能举个正反例?
我们有时会帮客户计算 ROI。但有很多 trick,可以让表面上的 ROI 看起来很好。如果这个 ROI 是自己骗自己、在 PPT 上给客户做了一个假的 ROI,也许可以搞定一些客户,但长期不能 scale。
客户续约会有问题,复购也会有问题。
第二,我觉得最好不要在客户成本构成里占太大。比较好的场景,是需求广泛,但你在每个客户的成本构成里占比不要太大。
如果你占比太大,他很有可能 replace 你。
你刚才说很多大厂可能会自己做。那怎么看宁德时代和英伟达?它们也占客户成本很大,但大家又好像离不开它们。这不是一种最理想的状态吗?
那它们厉害的地方就在于,强大到不可被 replace。
但宁德时代也一样,很多车企在自己建电池工厂。只是宁德时代的保有量在那里,客户也很认可,所以大家依然用了很多它的产品。
宁德时代和英伟达肯定都面临这种趋势。包括 Meta,海外和中国的所有大厂,Google 也都在做自己的芯片。只是目前这个阶段,它们仍然不可替代。
第三,我觉得要非常当心项目陷阱。做 To B 很容易陷入一个个项目,因为 B 端客户需求多样化。我们需要想清楚,产品标准化到什么程度,什么是配置化,什么是定制化。
如果每个项目都要给客户定制,业务的 scale 会有很大问题。
所以我们总结下来,希望找到的业务是:给客户的价值清晰、可计算;产品有足够的标准化程度,能够做成一家产品公司,而不是项目公司。
可以以旷视当时你负责、和现在做具身智能比较相关的物流机器人业务为例展开讲讲。你当时是整个业务的负责人,商业化也负责,对吧?
对,都是我负责。
以物流业务为例,我们现在的收入构成大概是一半一半:一半来自项目收入,一半来自产品收入。
项目收入的意思是,我们给仓库提供搬运机器人。它很像装修,因为每个房子长什么样、业务流程长什么样都不一样,所以大概率要定制化去 fit 这个仓库,非常非标。
前几年每个项目做得都不一样时,非常痛苦,scalability 有很大问题。
后来我们觉得一定要在里面寻找标准化。我们把仓库分解成很多环节,比如入库、托盘存储区、箱式存储区、发货区。每个环节里用标准化的解决方案和产品解决。
相当于把一个定制化的事情,变成更加配置化的事情。
同时,我们还有大约 50% 的收入来自产品化业务。前面还有一个集成商,他拿着我们的标准 component,搭建成完整解决方案。我们提供积木块,让他搭建成完整的系统。
旷视开始布局机器人业务,应该是在 2016 年左右。当时是看到了什么机会?计算机视觉当然用到了,但还有很多别的技术,这中间有一点 gap。你们怎么想到做这个事情?
我觉得在印奇和我心中,一直都有一颗想做机器人的梦,我们从 day one 就开始想。
你刚才说,最开始也觉得以后机器人都需要眼睛,所以认为计算机视觉是很有前景的技术。
对。旷视当时叫 MegV,Mega Vision,就是让机器人先能看懂世界。
我们有一次一起去了天津一个天猫超市仓库,看到里面有很多人拉着小车拣货,把天猫超市的订单发往北京、天津周边。
仓库非常冷,因为很高,没有暖气。我们去的时候是零下 10 摄氏度。每个拣货员每天要走差不多 40 公里,每天都在零下 10 摄氏度的环境里跑一个马拉松,非常夸张。
他们让我们猜人员流失率。我说 60%,他说我缺乏想象力。他们一年人员流失率是 200%,因为这个工作实在太辛苦了。
所以我们本来就想做机器人。先让机器人看懂世界,再让它拥有手和腿,对物理世界形成输出。仓库确实有很大的需求,我们当时也投资了一家公司,后来把它收了进来,逐渐形成了物流机器人业务。
这不完全是人力替代,它其实是帮助仓库客户省人、省地、省钱、省心。人员管理本身就很复杂,而且物流发生在消费周边。消费周边的人力一定更贵,经济条件也不差,年轻人确实不愿意去仓库里做零下 10 摄氏度、每天走一个马拉松的工作。
所以这不仅是经济账的问题。在国外这个问题更严重,比如韩国、日本、欧洲和北美,更没有人愿意做这种工作。
最开始像 Kiva 这种方案,亚马逊在用,后来也把这家公司收购了。你们当时做物流机器人,和那一轮创业潮有关吗?当时也有很多物流机器人新公司成立。
当时极智嘉、快仓,差不多都是那个时间成立的,但和他们没有什么关系。
我们自己一直想做机器人,也觉得这和刚才的问题有关:要找一个相对标准的场景。机器人的很多场景非常发散,过去工业机器人最大的应用场景就是汽车和 3C,以汽车为主。其他场景里的机械臂、机器人,量都没有起来。
仓库有可能在一定程度上标准化,因为它处理的对象要么是托盘,要么是箱子,要么是一件一件的商品。它形成了一定程度的标准化,更可能让机器人用起来。
所以我们觉得仓库是很好的场景,可以作为机器人的起点。
但我们真正想做的,并不是物流场景的方案提供商。物流可以作为起点,让机器人先用起来,eventually 走出这个盒子,走到园区、更开放的场景,变成更 general 的机器人。
可以说你们当时就想做通用机器人,只不过那时还没有“具身智能”这个说法。
对。当时技术还不够,很多事情需要等待技术变化。那时做通用机器人肯定不现实,很多机械臂的应用也做得非常不好。
当时新的技术是什么?
很大程度上是调度,偏运筹和强化学习的方法。一个仓库里有很多像 Kiva 一样的机器人,真正决定效率的是调度系统:如何让更多机器人协同工作,货放在哪里,订单谁优先处理,小车采用什么交通方式,以及多车怎么调度。
这件事和我们当年搞竞赛很像,正是我们擅长的事情,是一个优化问题。
2012 年开始的深度学习热潮,从 2012 年到 2016 年也有一波 AI 热。当时 AI 技术外溢到机器人领域了吗?哪些地方可以帮助机器人?
当时有一些,但不多。差不多 2015 年是 AlphaGo 和 AlphaGo Zero 的时代。机器人的调度问题,其实也可以被认为是一个下棋问题。
所以强化学习方法可以用到机器人的调度和调度优化里,技术上也在发生变化。
在没有后来的新技术变革时,你们用当时的机器人和 AI 技术,做到了哪些应用和商业结果?
我们服务了很多世界 500 强公司,比如可口可乐、雀巢、优衣库,在海外也服务了很多客户。
优衣库是一个很有意思的客户。2019 年,我们参与了上海优衣库的投标。那个仓库每年发出的货值非常夸张,发货量也很大。优衣库希望把仓库打造成自动化程度非常高的仓库,所以方案无比复杂。
优衣库在国内几乎把所有物流机器人和自动化公司都叫了过去,像《超级女声》选秀一样,一轮一轮筛选。
你们是所有人一起去,还是一波一波、单独见每家公司?
他是一轮一轮评选。第一轮所有人先去提案,提案完之后说哪些不行,下次就不用来了。然后第二轮、第三轮,一共做了 5 轮。
这个项目用了上千台机器人,复杂性非常高。我们依靠比较强的调度能力,客户最后选择了我们。
我们跟客户讲了两点:这么复杂的项目,最后决定效率的是什么?是软件和算法。
我们不是最有经验的方案提供商,但我们绝对是算法和调度最强的。客户也非常认同这一点。
这个项目价值多大?像这种项目最后拍板,需要到优衣库创始人级别吗?
基本上接近创始人这个级别。
你们最后是不是和创始人见面了?我记得印奇说过,你去日本见了他。
对,我去见了柳井正。
这个项目非常复杂,有很多家公司一起投标。这里面有一个 To B 的陋习:大家做了很多 overpromise。一家供应商说他能做,但我们认为技术上做不到,他却说能做到。
客户就问我们:“他说他能,你能不能?”这时是不是只能硬着头皮说我也能?
所以我们承诺了很多实际上技术风险非常高的事情。整个项目充满风险,很多东西我们都不知道最后能不能搞定,但还是硬着头皮说能搞定。
最后差点搞砸。仓库全部弄完之后,如果目标效率是 100%,我们其实只达到了 40%,有巨大的 gap。
当时我们觉得已经完蛋了,客户也觉得这个仓库根本没法用。时间表又非常紧,技术方案上也有一些问题。
我们痛定思痛,跟客户解释,希望再给我们一些机会。我们已经踩过一遍坑,也知道问题在哪里,有决心和信心解决。所以最后让客户给我们延期了半年。
我们把所有 code 推倒重来一遍,最后把项目搞定了。
后来去见柳井正,是因为他们也觉得这个方案太复杂、太难了,没想到我们最后真的能搞定。他们觉得这种锲而不舍的精神很好,后来也把一些其他项目交给了我们。
所以你们转危为安,把这个项目重新做好之后,你去见了创始人。
对。做 To B,你刚才问有什么经验教训,我现在也不知道答案是什么。
在竞争过程中,我认为会有很多 overpromise。因为我要拿下这个单子,竞争对手在客户那里吹牛,但如果我非常真诚、实在地讲,很容易就拿不到这个 case。
你们有没有试过很真诚、很实在地说“我做不到”?
当然有,于是很多 case 就丢了。
我认为这和你当时的地位有关。当客户认为你就是权威、就是专家时,你告诉他做不到,他会信任你。但如果你还没有在那个位置上,你说做不到,客户只会认为你弱。另一个人说他行,那就很尴尬。
这会导致一种畸形状态:大家的 overpromise 提高了客户对事情的期待,把期待拉到不切实际的状态,最后很多事情的结果不好,也摧毁了客户信任。这是今天 To B 市场里的一个问题。
你们有没有遇到过竞争对手跟客户说能做到,实际上也做不到,最后做了一段时间之后项目又流出来,客户再找别的供应商?
其实不是这么简单。首先,反馈周期可能以年为单位。他说能做,项目先给了他,可能半年之后才搞砸。半年之后客户发现项目失败,可能已经丧失信心,也不想再搞这个事情了。
而且大家通常羞于谈失败项目。不管是供应商还是客户,都不想谈,所以市场上其实听不到太多失败 case。
这种情况现在依然存在。但当我们和客户建立了很好的信任之后,会告诉他什么事情有风险,问题可能在哪里,然后一起想办法:能不能先做小规模实验,验证这个东西。
当双方有很高的信赖程度时,就可以很真诚地探讨解决方案。但如果是竞争式的状态,很多时候就会变成 overpromise。
你在具身智能行业观察到了哪些过度承诺的现象?
7. 具身智能必须真实落地
现在整个具身智能行业里,除了文娱和科研,到底有多少机器人在持续运行和被使用,其实也不太知道。
首先,一个机器人要怎么样才算有用?第一,你得真正把客户的场景闭环,真正完成他需要的功能,而不是在某种情况下可以,换一个情况就不 work。
第二,客户的账要能算明白。满足这两点,客户才会批量、持续地使用它。
但今天很多场景更像 POC,更像 PR。大家做了很多摆拍,但它是不是被持续用起来,我觉得要打一个问号。
从客户角度看,很多厂商在拉高大家的预期,技术实际上可能没有达到那个状态,但大家说“我这也能做、那也能做”。最后结果可能不会很好,大概率达不到原来的预期。
所以真正落地,还是要务实、有效地推进机器人在场景中的使用。
那你们会怎么选择?是不是也要参与一点过度承诺,因为技术本身在发展?
我们今天和几年前不太一样。现在有很多已经建立信赖感的客户。因为我们的物流机器人公司和很多客户建立了技术信任,他们知道我们这帮人的风格。
当我们说 no 的时候,我们是认真在讲,同时也在寻找 how to yes,寻找解决问题的方法。所以在这种信赖感下,不需要对客户 overpromise。
第二,我们会告诉客户,现在机器人和模型的水平是什么样。比如在 robot 圈,桌面任务能做到 100% 吗?其实做不到。
做不到 100% 怎么办?我们不假想着机器人能做到 100%,而是告诉你,机器人现在就是做不到 100%。但我们需要设计一套完整工作流,使得机器人 failed 之后,依然有办法兜住底,让整个工作流是完整的。
我提供给客户的是一套系统,而不是一台单独的机器人。同时要把账算明白。这才是更有效、更务实的方式。
如果总结一下,在成立原力灵机之前,旷视的机器人业务在技术和商业上做到了什么状态?
旷视的机器人业务现在叫原力聚合机器人,是一家单独的公司,品牌叫 Atomics,意思是原子的聚合。
我觉得现在业务进入了平稳增长期。搬运机器人的产品,不管是托盘类还是箱式,都已经有比较成型的产品形态。客户、销售、渠道体系,也都有相对成熟的体系。
增长还比较快,海外收入占比也在快速提升。
大概能做到什么样的市场规模或者收入规模?
现在是几个亿的规模。我们手上还有很多订单,只是还没有确认收入。
2025 年重新成立一家专门做具身智能的公司,当时是怎么考虑的?在旷视是怎么提议的?
8. 原力灵机重新出发
首先还是看到了很多技术变化。很早的时候,小强、蒋竞天他们就已经在做实验,探索用大模型驱动几个机器人,也就是做 VLA。
你说的很早是哪一年?
2024 年。我们 2024 年就开始做相关实验。
原力灵机正式开始运营,我理解应该是 2025 年春天。中间几个月是在准备什么?
我们在做重组。旷视还在北京,里面有一些退出的股东,也有新的基金承接他们的股份。
这个过程是一个比较复杂的交易过程。当时中介团队、印奇和我,都花了很多时间在这件事上。
原力聚合机器人拆出来之后,原力灵机、旷视和之前股东之间是什么关系?
原来的老股东在原力灵机这边持有一部分股份,这是拆分时的设置。
又赶上具身智能创业非常火热,像范浩强这些人为什么没有走?为什么大家还在一起创业?中间会不会有人找他们创业或者挖他们?
肯定有。小强、蒋竞天这些人其实都不缺机会,很多人都想拉他们。
大家之所以还在一起,第一,是相信我们这一群人在一起,能增加把事情做成的概率。大家这么多年的配合、信赖和能力上的相互信任,加上业务积累,包括物流机器人那边的客户和场景,我们都认为一起干,成功概率更高。
这是大家今天没有走的一个原因。
另外,兄弟感情也很重要。
范浩强和赵尔静,你在他们十几岁时就认识了,应该认识十几年了。
我跟小强认识,是他初一的时候;跟尔静认识,可能也是他初二的时候。
尔静也是因为参加竞赛,所以你在他中学时就认识他了。
对。印奇和我还是同一个高中,他是老乡,所以我们认识得更早。
小强是因为我上大学之后,去人大附中讲课。当时有个小孩子特别厉害,每天坐在第一排。人大附中很多孩子都很聪明,但大部分不一定认真。他是一个又聪明又认真的孩子,所以我印象特别深。
后来果然,他初三就进了国家集训队,高一进了国家队,参加 IOI 还拿了第二名,确实很厉害。
旷视这群人,确实是我比较好奇的话题。大家在一起的时间非常久,包括张祥宇、贾乐,他们以前也在旷视研究院。
对,大家一直处在一个大的体系里。我觉得团队之间还是有一种互相吸引的力量。
强的人会喜欢和更强的人在一起,彼此认可非常重要。旷视研究院早年人才密度很高,每个人都很强。大家可能有时意见不一样,但都觉得对方是很有想法、很强的人,这会吸引更多强的人加入。
大家会觉得,这帮人凑在一起,可以做出很多不一样的东西。
你们最多的时候是不是有十几个 IOI 金牌?
对,我们 NOI 的金牌更多。
现在很多 AI 公司,包括大厂,也强调很高的人才密度。但人才密度并不能直接转化成商业成功。
我觉得人才密度能够转化成生产力,转化成更高效的配合。一群足够强的人在一起,很多事情不需要那么流程化、机制化,很多化学反应可以天然形成,整个迭代效率和节奏会更高。
但从商业和落地角度,我们还需要对客户有洞察,对问题有理解。不只是把最难的那一部分解决好,也要把那些很脏的活都解决好。
这时候可能需要另外一群同学一起配合。强的人有时更愿意解决最本质的问题。
以前研究院有一句挺逗的话,叫“这不本质”。大家都想解决本质问题,对于不本质的问题,兴趣会急剧下降。这是研究院研究员高频使用的一句话。
这句话可能从印奇到我,我们有时也会说,自己也有这样的坏习惯。但当你真正做成商业化产品时,所有对客户有影响的东西都是本质的。它不是最后最难的事情才是本质。
所以还是需要团队搭配。
你觉得最强的人怎么看财务回报?旷视创业了很多年,字节可能也和你们差不多时间成立,比你们晚几个月。
财务回报对大家来说肯定非常重要。这也是印奇和我觉得有愧的地方:带大家创业这么多年,还没有让大家挣到钱。
但我觉得大家在财务回报之上,还有更高的追求,比如把事情做成、对社会产生影响的价值感。这个层面大家可能有更高追求,但财务回报依然很重要。
原力灵机是一家新公司,有一些旷视之前的股东,也有很多旷视资深的元老。你们吸引新的、和现在事情匹配的人才时,能给什么激励?比如期权,和一家崭新的创业公司相比有什么区别?
我觉得没有区别。我们现在就是一家崭新的公司,所有激励方式都按照新公司来做。期权池也和新公司差不多,我们留了 30% 的期权池。
你们现在有算过,多少是以前旷视的同事,多少是后来引进的新人才吗?
现在大概 40% 是原来的同事,60% 是新的同事。公司大概 100 人左右。
2025 年正式运营之后,当时看到具身智能行业是什么情况?你判断这个领域面临的主要问题,或者要解决的任务是什么?
当时资本市场开始变火,但不像今天这么火,已经有苗头了。我们看到的更多是技术变化这个变量。
我以前跟印奇说过,历史上每一次技术变化,我们都低估了它的变化速度。
最早深度学习出现时,我们也没有那么相信,觉得它能比 SVM 之类的方法好多少。但最后发现,它发展得非常快。
后来 Transformer 出来,翔宇还发过一篇文章,叫《Make CNN Great Again》。因为当时 Transformer 在 performance 上已经比 CNN 好,但我们认为在数学形式上有很多等价之处,所以觉得 CNN 也可以达到类似效果。
但后来发现 Transformer 的发展非常快。
包括自动驾驶,我们最开始也有很多人在怀疑到底能不能做成。今天大家看到,自动驾驶已经上街了。
现在机器人也是一个技术变量:端到端控制机器人到底能不能行?今天的 performance 可能还只有 50% 到 60% 的成功率,比如 Robot Challenge 上的桌面任务成功率都可能只有一半。但它处在一个非常陡的进步梯度上。
我们不断提高自己的阈值,觉得它会越来越快,但它依然每次都比我们想象中更快。因为有更多资金、人才和注意力涌入,所以发展变得更快。这是一件非常令人兴奋的事。
对于机器人来说,问题就在那里。机器人是 AI 作用于物理世界的终极形态想象。如何在物理世界里形成生产力输出,机器人可能就是一种形态。
所以我们觉得,今天的技术变量可能带来很大机会,而需求显然就在那里。
具体来说,几个最核心的瓶颈或者要先解决的事情是什么?
我觉得今天最核心的问题,是模型和大脑的问题。
原力灵机的同事讨论我们的使命,最后用了非常朴素的一句话:打造智能的、有用的、可信赖的机器人。
为什么是这三个词?“智能”,是因为技术变化是我们成立这家公司的原因,所以智能是核心。“有用”,本质就是能够完整解决问题;能解决问题,账还要能算明白,才叫有用。“可信赖”,当然包括安全性和可靠性,但智商低其实才是最大的不可靠。
机械臂、摄像头其实很多都已经 OK,问题是它不够智能,不能很好地完成任务。
所以今天核心瓶颈是,机器人是否有用,卡在智商上;可信赖也是问题,但智商低是最大的不可靠。归根结底,模型和算法能让机器人变得多智能,是最重要的事情。
2 月 10 日你们有一个技术发布会,也讲到比较相信的一种方法,叫具身原生。什么叫具身原生?
9. 具身模型必须原生训练
现在大家的技术框架基本都在使用 VLA。当然 World Model 和 VLA 之间也有很多互补的地方。
现在很多公司的训练方式是:下载一个开源 VLM,在后面加一个 Action 模块,然后开始训练 VLA。大部分公司都是这么做的。
这个问题有点像一个刚结束九年制义务教育、初中毕业的学生,你把他拉到体校,开始狂练体育。练完之后会发现两个问题。
第一个,他没有从小开始练体育,根骨不健壮,所以 VLA 的能力有上限。第二个,狂练体育的 3 年里,他可能把原来的语文、数学等文化课水平拉下来了。
所以今天很多 VLA 里的 VLM 能力,效果反而不是特别好。
你的意思是,在 VLM 上加一个 Action 模块训练之后,反而会影响多模态模型本身的能力?
对,会有很大下降。
这很简单,就像你把一个人拉去上体校,他不再上语文课、数学课。练完 3 年体育,文化课水平自然下降。所以他既要上体育课,也要上文化课,必须一起 co-train。
有两种方式解决。第一,他从小就开始练体育,最好在 VLM 初期就让它看到机器人数据,而不是 VLM 已经训练完之后,才让它看机器人数据。
你说的是预训练 VLM 的阶段,而不是 VLA 预训练阶段?
对,是 VLM 的预训练阶段。
第二,在 VLA 训练时,不只是训练 Action,同时也训练 grounding、VQA 等 VLM 的能力,做 co-train,这样文化课能力也能保留。
所以现在 VLM 训练有原生训练和嫁接训练两种方式。一种是先训练语言模型,之后再加视频数据,再做 alignment;另一种是 from scratch,从头训练多模态模型。
原生多模态可能成本更高,但效果应该更好。Gemini 系列一直是原生多模态,今天具身也是一样。问题是,我们能不能做到原生的 VLA,把机器人的数据在 day one 就加入进去,让模型从一开始就在 VLM 阶段看到机器人数据。
现在整个物理世界大致有三类数据。第一类是多模态互联网数据,视频数据也属于这类,大模型公司收集了很多。第二类是智驾数据,相当于开放环境最大的描述。第三类是机器人的操作数据。
我们认为,这三类数据应该在 day one 就联合送进一个模型,训练出物理世界原生的 VLM,再交给 VLA。
这个阶段需要给机器人加入开放世界的自动驾驶数据吗?
取决于你怎么定义机器人。
VLA 里的 A,不只是手的动作,腿的动作也是 Action。腿的动作和手的动作没有本质区别。Visual Language Navigation 和 VLA,本质上是一件事。
加入这类数据,会增加机器人对更多环境的理解能力。让它做导航,它的能力一定会增强。
如果你把机器人限制在纯桌面任务上,帮助确实可能不大。但如果我们想象的机器人不是只能在 table top 上工作,而是希望它在开放环境、室内和室外环境中,具备更强泛化能力,那这些数据就有价值。
所以你们的 DM0 模型就是这样做的?
D-M0 是我们和阶跃一起训练的 VLM,也就是说我们参与了预训练过程。
整个训练分成 3 个部分。第一部分是 VLM 预训练。我们把一些数据混合在一起:阶跃有多模态数据,我们有机器人数据,同时加入一些智驾数据,一起训练原生的多模态 VLM。
第二部分是基于这个 VLM,原力灵机继续训练 VLA。这一部分相当于双方合作、联合训练。第三部分是继续训练 VLA,再做 VLA 的 post-training。
通过这套 pipeline,形成一个更原生的技术:数据层面更原生,训练方法也更原生。
最近印奇也官宣担任阶跃的董事长,同时还是千里的董事长。阶跃、千里、原力灵机,这些公司都是 AI 技术公司,但技术类型和应用场景不同。它们之间是什么关系?
公司之间是兄弟公司关系,互相有一些业务合作。
比如机器人数据我们这边很多,阶跃没有;智驾数据在千里那边,大家可以合作,让模型能力汇聚到一起。这样一个模型可以 benefit 所有人,对所有人都有帮助。
你们之前的数据从哪里来?怎么采集?
跟大家一样,我们也在做采集。
数据有几种类型。今天大家会讨论,到底是以机器人为中心的数据,还是以人为中心的数据。
以机器人为中心的数据,可以通过遥操作、手扶、外骨骼,或者无本体的方式采集。第二类是 human-centric 数据,比如通过穿戴式设备形成的数据。
最后是一个配方:如何把这些数据混合好。
合成数据在这个配方里有位置吗?
我们现在用得比较少,以真机数据为主。
首先要定义什么是合成数据。现在只要是采集的数据,其实都可以说是在物理世界里合成的数据,它并不是真实世界本身。
我指的可能是仿真数据和生成数据。
仿真数据我们现在用得比较少。对于 contact-rich 的操作任务,我们觉得仿真数据现在帮助不是很大,而且很难仿真得真实。
刚体相对容易处理,但如果是非刚体,现在渲染出来的结果很难足够真实。多模态信息,比如力、触觉,也很难仿真得足够真实。
另外,仿真数据有很大的 sim-to-real gap,所以目前对算法的帮助比较有限。
但有两个环境里仿真非常有用。第一是 locomotion,比如机器人跳舞、跳跃。它和世界的接触主要是地面,只要保持重心稳定,和物理世界没有太多交互,这部分仿真很有用。
第二是更 high-level 的理解,比如任务分解和任务规划。它不需要真实操作,只要理解在一个环境里如何完成任务,比如找到水杯、把水倒掉等。任务理解层面,仿真数据可能很有用。
李飞飞、苏浩、黄仁勋都提到,接下来合成数据和世界模型生成的合成数据,可能对机器人非常有用。你怎么看?
我们也抱着开放态度看。大家没有疑义的一点是,数据一定要 scale。
仿真是一种 scale 的方式,视频数据也是一种 scale 的方式,human-centric data 是一种 scale 的方式,让机器人真实使用后形成数据飞轮,也是一种 scale 的方式。
关键是成本不能太高,量要大。
仿真和世界模型的问题在于,生成质量到底能不能帮助现在的模型学习,这是一个 big if。
互联网数据里也包含很多物理世界信息。比如视频里的信息,能不能帮助机器人的操作,也很有可能。但这条路现在还没有完全走通。
所以我们保持开放态度,但在目前情况下,还是以真机数据为主。
在你觉得对具身智能最重要的模型问题上,有两种观点。一种强调具身模型的独特性和独立性,另一种觉得它和大语言模型是一脉相承的。
你们和大模型结合,包括基于混合多模态再训练 VLA,哪些部分是一脉相承的,哪些是具身模型需要单独解决的问题?
首先是架构层面。现在很多公司在提双系统。System 2 解决慢思考、推理、任务分解和理解,这部分显然是大模型很擅长的。
第二部分是操作能力。今天可能是一个 VLA,上面的大模型大概率跑在云端,是更低频的交互。机器人操作的 VLA 可能是 10 赫兹,是中频交互。
但 10 赫兹的模型驱动机器人可能还不够。很多操作,比如拿起一个东西之后调整、旋转,10 赫兹不可能做出这种动作。
所以 System 1 下面可能还有一个系统,也就是 System 0,需要把力、触觉等信息处理得更好,运行在 100 赫兹以上。
可能会有 3 个模型。三个模型之间的 interface 到底是什么,现在还是开放问题。
回到大模型和具身智能的关系,我认为 System 2 层面一定有很强的关联,而且现在已经做得很好。具身智能公司更多是在 System 1 和 System 0,也就是更精细、更动作层面的问题上努力。
System 1 也包括让机器人逐渐理解问题、理解任务、执行操作。但今天 VLA 还处于非常早期的阶段。
做大模型的核心 AI Lab,比如 Google、OpenAI,国内像字节,也都在做机器人、做具身智能。长期来说,会不会被它们覆盖?毕竟它们有很强的大模型。
还是不太一样。以前有个比方:你看梅西踢足球,能不能学会踢足球?可能还是很难。你看视频,学不会自己踢足球。
今天机器人这件事,大概率和硬件有很强关联。大模型公司在 System 2 层面有很强能力,但在 System 1 和 System 0 上,同样需要很强的模型能力,而且需要和硬件形成关联。
第二,大家都说数据是很大的问题,那数据最终来自哪里?我觉得最终还是来自数据飞轮。
但这里有一个鸡和蛋的问题:机器人不成熟,不能被用起来;不能被用起来,就没有机器人使用过程中产生的失败数据和接管数据。
所以一定要找到一种方式,让批量化机器人先被使用起来。这个过程中产生的数据才最有用。
这意味着数据不是靠采集就能解决的,而是需要把应用闭环,才能建立真正的数据飞轮和壁垒。这不是一家模型公司就能单独搞定的事情。
但大厂也可以投入很大力气去做。
当然可以。没有什么事情是只有你能做、别人不能做的。但任何公司的精力都有限,没办法同时做那么多事情。
你现在觉得这个行业最重要的问题,是模型性能提升吗?大概什么时候能慢慢解决这个鸡和蛋的问题,让机器人先在一些场景里用起来?
我觉得今年就有希望。
这里有两个部分:模型能力提升和场景选择。
10. 机器人必须真正有用
先说模型能力。接下来模型能力提升的一个重要方向,是多任务模型。
我们在 RoboChallenge 上做了一些评测,现在分成两个 track。一个叫 specialist,假设你有一个 VLA 基模,完成任务时还给你这个任务的很多数据,你可以在这个任务上做后训练,再进行评测。也就是说,这个模型在基模之上被微调成只处理一个任务。
第二种是 multi-task 或 generalist。假设有 20 个任务,20 个任务的样本都给你,但只能训练一个模型。这个模型要通过提示词完成 20 个任务,对模型泛化能力的要求更高。
第三种是 zero-shot。模型完全没见过这些 task,也不给训练数据。机器人或模型来了之后,直接通过提示词驱动它完成任务。
我认为今年很重要的一点,是从 specialist 走向 generalist。现在大家更多还在做 specialist。
Zero-shot 今年可能还做不到。现在 generalist 我们也只能做到 30% 多,水平还很低。要先把 generalist 提升上去,才能谈 zero-shot。
所以今年模型会在 generalist 上有很大提升,解锁更多场景。
第二是场景选择。我们认为场景有几个特性。
第一,要是错误容忍的场景。今天做不到 100%,要允许犯错,或者有办法在犯错之后兜住。
第二,要是时间容忍的场景,不能有太强的节拍要求。因为可能做错,端到端方式也不能保证每 6 秒一定完成一次。
第三,要是有适度泛化的场景。如果场景特别 specific,非标自动化方案可能更好。
第四,要是长时间作业的场景,否则投资回报算不明白。
这四个条件是必要但不充分的条件。我们需要找到对时间和错误有容忍度、具有泛化性、又能长时间作业的场景,这些才是具身智能更适合落地的场景。
有什么这样的场景吗?
物流就是一个很好的场景。
物流的容错方式是,如果我们能做调度,机器人没干完、失败了,就让调度系统把任务送到人工那里,让人工接着干。
我们通过一套系统来支撑,不提供单机,而是提供一整套系统,让任务闭环。
这有点像滴滴或者 Uber 的网络:里面既有自动驾驶车辆,也有人和司机。机器人落地时,一定不完全是纯机器人的方式,而是一套系统。
机器人先干,没干完之后可以由远程人员接管,也可以从机器人工作站搬运到人工工作站,由人工接着干。通过各种方式,创造一个让机器人能够持续使用的环境,这个“温室”非常重要。
你说的这种方式,确实要设计整个系统,让客户觉得,即使让机器人试,也有可能试不出来,但对客户没有那么大的损失。
对。首先,兜底方案解决的不是 ROI 问题,而是闭环问题。
不能基线做到一半,机器人突然搞不定,变成异常行为,最后还得人处理。这样整个系统就不能连续、顺畅运行,只能做 POC,不是真正可被使用的产品。
第二个问题是把账算明白。要把整个系统的 total cost 算在一起,依然让客户的经济账成立。
你们现在已经开始做这样的实践了吗?
我们在做。应该会在今年年底拿出一些很有意思的东西给大家看。
现在竞争环境很激烈,很多公司在融资、PR,发布各种落地信息。你们到年底才放东西出来,会不会觉得节奏太慢?
我们的做事方法可能不太一样。我们的风格是技术信仰、价值务实。
一方面,我们也会放一些展示性的东西,让大家看到进展。但从真正落地的层面,我们要解决场景里的所有问题,而且账能够算明白。
这不是一个展示性产品,也不是一个 POC。但它的难度,比做一个可以展示的东西完全不在一个量级上。
所以还是回到刚才的问题:今天到底有多少具身机器人在被持续使用?
你怎么定义“被持续使用”?
就是一直在那里干活。每天开机 10 个小时以上,连续两个月都开着机,在真实场景里,并且有一定数量。
多少算有量?
就 100 台吧,随便拍一个数字。今天有多少个场景达到这种状态?
我认为可能几乎没有。
所以今天场景不在于广。场景落地和算法突破这两件事有一个夹角,不平行,但也不正交,有相关性,却不是完全对齐。
我们需要以最大的投入和坚定的步伐推动算法演进,通过算法和模型解锁一些场景。但解锁之后,不需要做得很广,不需要搞很多场景。
我们能不能找到两三个场景,在这两三个场景里真正做闭环?比如一个场景有 100 台或者 1,000 台机器人,持续为客户使用。我认为这才是真正商业上的落地。
你们最开始切入的场景,应该还是有积累的物流场景,是首选吗?
是。
硬件形态怎么考虑?会做人形机器人,还是服务于场景的其他形态?
我们当然也会做一些标准化形态,但最终进入场景时,完全标准化的形态很多时候并不适合。
它很容易走到两个状态:underkill 或 overkill。
比如到一个具体场景,标准化形态可能解决不了问题。相机安装位置或者末端伸进去时被卡住,就会出现这种情况。
另一种情况是,刚好这个构型能解决问题,但可能过度设计,导致成本偏高。
所以我觉得,完全标准化的硬件可能不是最好的方式。我们会有不同模块,进行组合。
我们内部的理念是:模型解锁场景,场景定义硬件。
我觉得这比“模型定义硬件”多了一个环节。有些公司,比如星海图,会说模型定义硬件,一脑多机。
模型其实定义不了硬件,因为很多时候硬件决定机器人的能力上限。
假设一个场景能不能用机器人解决,我们先看遥操作能不能搞定。如果遥操作都搞不定,算法再强也搞不定。
硬件决定机器人形态在这个问题上能够解决的上限。
遥操作其实已经体现了人的智力水平。如果人都搞不定,可能就是硬件本身的精度、负载或者其他问题导致的。
对。相当于用人的脑子加上机器人的硬件形态,决定这个问题可不可以被解决。剩下的事情再交给模型。
另外,进入具体场景时,经常要考虑 ROI,需要做很多冗余设计。但有些场景可能根本不需要。
比如有些场景,真的需要轮式双臂或者人形机器人吗?有时机器人甚至不需要移动。
现在的人形机器人也好、轮式双臂也好,重心都很高,不支持快速移动。可能开到 0.8 米每秒、1 米每秒就到顶了,因为一急刹车很容易倾覆。
但如果用一个小 AGV 把它送过来,AGV 可以贴地高速移动,开到 4 米每秒。那这个时候机器人站在那里就好了,不需要移动。因为重心太高,移动能力反而是冗余的。
所以看 ROI 时,需要根据场景选择硬件。但我们肯定不希望变成项目化,每个项目都定制硬件。
核心是把硬件做成模块化、拼接式的方式,能够快速组合成适合场景的形态。
相当于先抽象出几种基础模块,像乐高积木一样,再快速拼成不同东西。
对。
原力灵机比较特别的一点,是你们对外讲了很多行业基础设施的工作。比如之前发布的 RoboChallenge 测评,还有叫 DexBotic 的开发框架,以及 DeepFlow 工作流,而且都开放出来了。
一家创业公司为什么要做这些工作?
11. 开放基础设施加速行业
首先,开放出来本身对我们自己很有用。
模型公司或者具身智能公司最大的竞争力是什么?是今天模型效果好,还是别的东西?
所有模型都在交替向前、不断迭代,所以很重要的是迭代效率,而不是模型当前的状态。当前状态只是五十步笑百步,并不重要。
如何快速迭代,需要一系列基础设施,包括数据、训练、推理、硬件和评测基础设施。整个基础设施非常重要,这才是真正的核心竞争力。
我们发布的几个基础设施产品,比如 DexBotic,最初是因为我们内部要复现很多算法、比较算法、做大量实验。如何让这些实验有效进行,其实非常麻烦。
所以我们内部开发了一套框架,让所有人都可以在同一套框架上进行实验和比较,形成一种面向实验的 research 工具。
最开始它只服务内部,但我们觉得这类东西对所有 research 人员都有用,所以选择开源。希望更多人使用,也能反哺框架,让它更好,帮助我们自己跑得更快。
今天具身智能公司有很多家,我认为核心不是谁行、谁不行,而是这个行业多久能够整体变得可用。
最重要的是大家齐心协力,推动整个具身智能的发展,让算法和技术能力达到真正应用的水平和标准。这是今天这个行业能成立的最大 big if。
只要这件事能形成,就可以容纳很多家公司。但如果做不到,除了科研和文娱,就没有然后了,所有公司就都是泡沫。
所以我们开放很多东西,既是利他,也是利己。
RoboChallenge 也有几个目的。首先,它是对内的评测服务。我们做算法研发,需要很多评测,因为不知道哪个方向是对的。由于 sim-to-real gap 很大,需要基于真机的大规模测试,给算法提供信号,告诉我们该往哪个方向发展。
评测服务本身就是科研基础设施。如果没有 benchmark,怎么衡量进步?行业进步不了,我们自己也进步不了。
所以我们把它开放出来,用 benchmark 牵引大家一起提升算法 performance,衡量大家的 performance。
RoboChallenge 和 DexBotic 都是利他和利己的方式。
逻辑上确实如你所说,现在行业里都是创业公司,大家要一起把行业往前推。
但另一方面,创业公司之间融资和人才竞争也很激烈。大家可能不想用你们开发的东西。RoboChallenge 最近你们自己发布模型之后,在两个榜单上都是第一,也有同行觉得这样不公平。
我们内部也纠结过,但后来觉得没什么。
所有测试都是公开的。大家想复现我们的分数非常简单:下载 DexBotic 框架,下载 D-M0 的 code,然后提交 RoboChallenge,就能拿到那个分数。
我们公开了每个 task 上 fine-tune 的细节,包括 generalist 版本的细节,全部公开,可以直接复现。
所以我们觉得自己交不交,其实也不本质。后来和一些同行聊,大家也认为,既然都公开、都可以复现,这件事就不本质。
RoboChallenge 的初衷,并不是形成一个榜单让大家 PK,而是建立好的 benchmarking,衡量当前技术阶段和状态,在牵引下共同进步。
今天我们可能是第一,但很可能两周之后,某家公司提交一个模型,比我们更好,这完全有可能。
旷视之前也开发过 MegEngine,天元框架。但相比 PyTorch、TensorFlow 这样的框架,天元生态没有那么活跃,比较小众。
MegEngine 实际上达到了你们说的利他、利己吗?利己可能比较明确,利他的目的达到了吗?现在重新做这件事,是怎么想的?
MegEngine 是当年做 CNN 框架。我们最早只有 Caffe 和 MXNet,TensorFlow 也还没出来,所以没有一个好的框架。旷视刚开始做深度学习时,就觉得要自己做框架。
我们 2013 年就做了这一套框架,那个时候还没有 PaddlePaddle、PyTorch、TensorFlow。
但当时我们没有理解开源的方式。我们觉得自己做了一个很好的引擎,自己用就好了。等到想开源时已经是 2018 年,那个时候其实已经没有什么意义了。
基础设施要变得有影响力,被更多人使用,并通过开源力量一起建设,核心是要早。
所以现在开源 DexBotic,是因为当时 MegEngine 开源得太晚了?
对。今天没有太多人在做这件事,我们正好做了一个自己觉得很好用的东西,也愿意开放出来。大家不一定非要用,愿意用就拿去用。
具身模型的开发和实验,具体有哪些区别,导致 PyTorch、TensorFlow 不太支持或者不太好用?
DexBotic 其实是在 PyTorch 之上的一层,不是 replace PyTorch,而是提供更多面向具身智能的工具。
我们一开始不叫它框架,叫 toolbox。里面内置了一些功能。比如模型定义可以通过配置化方式完成,可以选择不同的 VLM 基模、vision encoder、Action 模块,也可以选择 diffusion 等不同方式。
这样做实验更方便。
第二,我们统一数据格式、部署方式。本地训练、云端训练都可以比较容易。它是一套工具,让很多事情变得更方便。
现在 DexBotic 更面向 VLA 和模仿学习。我们原来还想加入强化学习相关知识,但后来发现 RLinf 已经把强化框架做得很好了。清华的汪宇老师、吴文昕等人做的 RLinf,本来是面向通用强化学习,现在也在面向具身强化学习。
后来小强和汪宇老师、于超老师等人交流,觉得大家可以一起做。我们偏模仿学习,他们偏强化学习,两边现在已经打通了一些接口,未来有可能合并成一个更大的 project。
我们开源,也是希望更多人使用。如果觉得好用,可以在使用过程中 contribute 回来,让它变得更好,对我们自己也有利。
你们是 2 月刚开源的,现在社区活跃度和参与度怎么样?
我们在 10 月开源了 1.0 版本。现在应该有 1,000 多个开发者,外部开发者有 1,000 多个,也有不少高校在用。
吸引到什么同行了吗?知道有什么公司在用吗?
千问在用。我们之前也和林俊阳沟通过,他过来交流过,他们那边应该也安排了同学使用 DexBotic 做开发。
这又回到刚才的问题:很多大厂也在做 VLA、具身模型,林俊阳的团队也在探索这个方向。
但目的不太一样。阿里也是我们的股东,我认为它不是要自己跳进去成为一个 player,而是希望做好基础设施,做更好的 VLM,support 更多人做 VLA。这是它的战略定位。
而且它做也没关系。这个行业足够大,容得下很多玩家。
历史上有没有创业公司,早期就做面向行业的基础设施,后来取得比较好成果,或者形成了比较活跃的生态?
挺多的。比如 Databricks,Hugging Face 也算。Android 曾经也算是创业公司做的,当然比较早就被 Google 收购了。
Red Hat、Linux 系列,还有很多数据库,比如 MongoDB,以及很多消息队列,都是在整个开源体系下成长起来的。
DexBotic 的 code 量其实没有那么大,你们没有花太多精力吗?
我们还是花了挺多精力。
开源是大家增加信任感的一种方式。我把 code 都给你了,你可以自己改;不想合并到主线也没关系,拿去用就好了。
具身智能领域,包括测评和开发框架,大公司没有推出相关东西吗?相比于你们自己开发、开放给全行业,另一种选择可能是直接使用大公司的生态,比如英伟达也经常这么做。
我觉得现在还没有特别好的。
也许有公司会想做,但大公司愿不愿意投入力量还不确定。RoboChallenge 和 DexBotic 的工作量都很大,不是一朝一夕的事情,需要一帮很强的人认真做,而且要有足够好的分享精神。
长远来说,具身智能行业会是什么样的格局?规模有多大,集中度和产业链分工大概怎么样?
我觉得它会是一个逐渐演进的过程。在一段时间内会有比较多的公司,因为细分场景非常多。
在模型还不能统一的情况下,会有很多公司存在,做很多 vertical,这是第一阶段。
第二阶段,随着 AI 1.0 公司和大模型公司的能力逐渐集中,模型能力变强,小模型的能力被大模型吃掉,做 vertical 的公司会慢慢变得困难。
然后进入集聚阶段,出现平台型公司:可以以模型为平台,以本体为平台,自己做一些 vertical 场景;也可以把本体和模型以合适方式提供给更多应用公司去做场景落地。
最后可能个位数家公司就够了。
个位数是全球,还是中国?
我认为大部分公司可能会在中国,因为这件事和硬件强相关。具身智能比大模型更有中国优势,也更应该由中国公司来做。
硅谷获得大额融资的具身智能公司也不少。
但它们硬件迭代效率很低。模型可能做得好,但硬件迭代效率低,所以有可能成为以模型为核心的公司。比如 Pi 可能想做这种事情,也有可能被收购。
回到未来判断,当模型能力不断提升,变得更加通用和泛化时,整个事情会变成全栈。我们需要一个硬件载体提供产品形态,那时可能不需要那么多公司。
怎么样才能成为最后剩下的不到 10 家公司之一?
核心还是两点。
第一,模型能力领先是一切的根基。就像造车,最终是产业链整合,不需要自己开发每一个轮胎、每一个车架,产业链会有很多供应商协同研发。
但谁能让机器人更有灵魂,让它有一个好的大脑,成为智能、有用、可信赖的机器人,在场景中真正解决问题,并把商业模式跑通、把数据飞轮转起来,这是最关键的。
所以第一是模型能力和模型智商。
第二是在场景中形成更多人的使用,让机器人长期被使用,形成数据飞轮,再用数据飞轮反哺模型能力提升,形成竞争力。
大概到什么量,才算数据飞轮转起来?
如果量化描述,我觉得一个场景 1,000 台。
首先要有量,还要逐渐拓展到更多样化场景和任务。但在机器人能够做 100 件事之前,能不能先让它做成 1 件事,并且在这件事上批量应用、持续使用,我认为非常重要。
所以 1,000 台可能是一个门槛,针对能够持续使用的机器人。
之前我们和竹间智能创始人张威聊,他觉得如果现在就让机器人落地,可能先这样增长,最后到一个上限。因为花了很多精力优化场景,没有把更多精力放在模型性能提升上。等它变聪明之后,可能一下子解开一大片场景。
我认同。
落地和模型是夹角关系,目标并不完全对齐。模型要追求泛化性和通用能力,大模型最后一定会吃掉小模型,而不是针对场景 customize 一个模型。
但做落地时,应该用现在这个奔着通用能力去的模型,而不是针对场景 customize 一个、overfit 到场景的模型。否则就回到了做项目的逻辑。
你是通过这种方式平衡:用现阶段、奔着通用能力的模型去做落地,再靠其他方式补能力。
对。我们需要找容错场景,也需要其他工程能力去补。
具身智能公司要警惕变成“小老头公司”。就是最后变成一家做项目的公司,每个项目都 customize,原来是非标自动化公司。
为什么叫“小老头公司”?
因为长不大,但存在时间很久,也比较难倒闭。
我们成立原力灵机,核心就是追求通用化机器人的状态。我们会从一些场景开始,但不是只解决单一场景,而是希望走向通用机器人,在更泛化的场景和任务下,具备更通用的能力。
这个机会是存在的。所以算法和模型能力是第一要务,第二要务才是阶段性商业化。
阶段性商业化同时实现数据飞轮,要把两件事变成正相关。
阶段性落地后,才能获得数据,提升模型能力。
对。
现在整个具身智能行业非常火热。作为身处其中的人,你觉得有什么值得大家提前未雨绸缪、给行业一些提醒的地方?
现在大家的预期被拉得很高,我觉得这是好事。
你说的大家,指的是投资人和资本市场?
对。资本市场把投资人的预期拉得很高,但投资人也知道这里面有很多泡沫。
这是好事,因为它吸引更多优秀的人进来解决问题,让技术发展得更快。
技术上的很多事情可能需要时间。我觉得既不能短期太乐观,也不能长期太悲观。自动驾驶、早期深度学习、大模型,都经历过 Gartner 曲线。
现在大家的预期还在上涨。最后大家会问,落地真的被用起来了吗?所有投资人都很聪明,也知道现在还没有真正被大量使用,但他们仍然在投资,因为相信这件事。
这是一种模糊的正确:他们认为长期方向可以落地。经过这个过程后,真正务实、把数据飞轮跑起来、能够落地,同时坚持推动技术发展的公司,会走到最上方。
你觉得具身智能什么时候可能经历类似自动驾驶在 2018 年到 2019 年的沉寂期和低谷期?
不知道,这取决于很多事情。
自动驾驶在 2018、2019 年的状态,是因为当时技术上似乎没有变化,Waymo 那条路线没有像大家想象中演进得那么快。那个时候 Transformer 还没有开始,所以本质上是信心问题。
今天大模型给了我们很多惊喜,让我们在信心上有了很强的建立。
第二,机器人的商业化比自动驾驶更容易。当然,如果要 scale,可能更难,但取得阶段性的商业化成果更容易。
这两件事情叠加起来,也许机器人会更平滑一些,总会有阶段性成果释放出来。
但从业者要知道自己处在哪个阶段。模型到底是什么水平?大家发布了很多视频,这个 demo 是从 30 次失败里挑出的 1 次成功,还是当前真实水平?
我们要看以什么速度更快迭代,走向心中想达到的状态。阶段性商业化是否真的被使用,是否形成数据飞轮?
今天很多收入可能来自数据采集,大家卖出去的东西都是做数据采集,并不是真正落地,也不是真正有效的价值转化。我们还是要清醒地看待这些问题。
如果具身模型性能进展速度不如预期,可能是什么原因?
可能是数据原因,也可能是模型结构需要新的结构。
但我相信,有这么多资金和人才涌入,这个领域的发展还是会比较好。
如果信心进入相对低谷期,你们有什么提前准备?有什么 Plan B?
第一,准备好足够多的干粮。很多具身公司今天都在做这件事,头部公司融到很多钱,要先把弹药储备充足。
第二,要 bet 在自己真正相信的事情上。即使弹药多,也经不起分散式开枪,还是要专注在真正 believe、真正想 bet 的地方。
第三,如果技术上需要一段摸索期,就和行业一起摸索。在有粮食、有业务的情况下,我认为可以度过这段周期。
但我现在非常相信,这一波技术变革能够走向通用机器人。
你之前也经历过创业过程中的起伏和行业低谷。进入低谷时,心理状态和团队氛围是什么样?
我们团队心理上没有太大变化,因为内心相信的事情是一致的。我们没有跟着市场情绪,一会儿很兴奋,一会儿很低落。
主要是资本市场上的感受:低谷时融资很难。旷视历史上有几次融资都发生在低谷期,融资过程比较挣扎。
这也是一个教训:如何在情绪好、时间合适的时候储备足够弹药,同时专注地把弹药打在真正相信的事情上,而不是开散弹枪。
从团队角度,如果内心真正相信、坚定,我认为没有太大变化。我们做的事情还是那些事情。
成立原力灵机之后,你们曾经对什么事情 say no?拒绝做什么事情?
挺多的。
比如表演类的东西,我们会 say no。有人找过我们,很多合作伙伴和客户也有需求。但这和我们想打造有用的机器人不太一样。
情绪价值也是有用的,我并不是在抨击这个方向,只是和我们选择的方向不一样。我们真正想追求的是让机器人作为生产力,能够解决真实问题。我认为这是最大的需求和市场。
有几家公司花了几千万到 1 亿元上春晚参加表演,其中有些也不是主打表演方向。你觉得这算分散开枪吗?你们当时讨论过要不要上春晚吗?
我们不会。我们走的不是表演路线,春晚上的机器人大部分还是表演型。
还有别的吗?
还有和汽车相关、和汽车产线相关的场景。
我们有很多汽车产业链上的朋友,包括千里本身也有汽车厂。但我认为汽车场景非常不适合,因为它是高度错误不容忍、高度有节拍要求的场景,这两个问题都非常难。
大家觉得汽车厂可能是最好的场景,特斯拉在讲这个故事,Figure 也在讲和宝马合作。但我认为汽车厂不是好场景。
这是因为你们以前做物流机器人时,也服务过一些汽车工厂吗?
对。我们服务过,也觉得很多判断还是要去现场看。
想象中可能是一个 pick and place,从这头拿起来放到那头。但到了现场,你会发现包装形态、商品形态、辅材、位置限制、容器限制等,最后可能和想象完全不一样。
所以要有现场感,才能判断这个东西。
你刚才总结提前应对低谷的两个点,一个是足够弹药,第二是不要分心,把资源投到相信的事情上。这个和旷视的经验教训有关吗?
有关。旷视原来做了挺多事情,我觉得不够专注。虽然人才密度很高,但依然被稀释了,因为做了太多事情。
有些是主观原因,大家想 battle 的方向不一样;也有客观原因,比如做了盈利性比较好的业务,但市场规模有限。
所以形成了加法模式。但商业上,A 加 B 加 C,基本上约等于 max(A、B、C),也就是取最大值。
创业还是要 battle 在真正相信的事情上,把事情 make it happen。我认为这是最重要的。
如果再来一次,我们应该不会开那么多方向,应该让更多人集中力量做一两件事情。
上一轮 AI 热潮里,真正值得集中力量做的一两件事情是什么?
我觉得每一件事情可能都值得做,只是我们每一件都做得不够深。
当时有视觉、自动驾驶、安防、机器人,也有手机相关场景。每个场景深入下去,可能都是一个很大的公司。
但我们把它们做成了加法。虽然也有一定规模,也做得还可以,但还是分散了太多方向。
你觉得具身智能行业现在有什么被忽视的真问题吗?
我想想。今天真问题很多,我觉得模型和场景都是。
模型方面,大家的水平还没有达到接近可用的状态。比如大家看到 Figure 的视频,看起来很酷,感觉机器人已经可以进家庭做保姆。
3D Robotics 的视频也很震撼。
但我不认为现在的机器人已经达到可以进家庭做保姆的状态。它可能只是很多次失败中的一次成功。
所以我们需要更客观地看待现在的技术水平,更坚定地一步一步推动技术发展。
第二是落地。根据我们过去的经验,POC 和真实场景、真正落地之间,至少还差 80%。因为 POC 只需要验证成功时是什么样,失败时会怎么样,很多问题不需要解决。
真正落地需要机制,让机器人变成一种自动化机制。所以大家对落地也有巨大的 gap。
这不一定是被忽视,而是一个大家不太愿意暴露的问题。
我记得我和一位具身智能公司的 CEO 聊过,他说:“我特别想给这个行业泼点冷水,但又怕泼得太狠,把火泼灭了。”
我跟他说,客观地看待这件事,确实现在大家的预期被拉得过高,但很多进展的斜率依然非常陡。
所以预期虽然被拉高了,但事实也在快速追赶预期。
从 2026 年到 2027 年,你希望原力灵机达到什么状态?
今年技术层面的目标是,在泛化性上下功夫。算法目标会放在 multi-task 和 generalist 模型的成功率上。
现在只有 30% 多,我们今年的目标非常激进,但也看到了很多 signal,觉得有巨大的提升空间。
第二个目标是把场景上的数据飞轮转起来。我们定的目标是,一个场景,1,000 台机器人。
2026 年实现?
对。
你们现在其实没有展示过硬件,我印象中是这样。
我们有硬件,只是不展示。也没有必要展示。
我们现在关注两件事:第一,模型能力提升;第二,在真实场景中持续被使用,而不是做 POC,要有规模化的持续使用。
按照你之前的定义,1,000 台至少每天开机 10 小时以上,在真实生产或服务场景里使用。
对。
有哪些问题你现在还没有答案,但觉得很重要?
太多了,我有很多问题都没有答案。
比如现在大家讲 System 2 和 System 1,也就是大脑和小脑。大脑的输出如何作为小脑输入,真正提升 VLA performance?中间应该用什么表示,输入什么信息,现在不知道。
第二,数据到底怎么 scale?靠视频数据、egocentric 的人类第一视角数据,还是仿真数据?哪条路最能带来 scale 的效果,也不知道。
有很多未解之谜。但每个方向上都有同行在努力,我们也有自己的技术 bet。
从 2016 年之后你开始做机器人,到现在独立做一个业务,你发现自己有什么不一样的特质?
过去做产品和场景时,需要一种能力,叫 AI 技术产品经理。
以前做深度学习,算法往往不能 100% 满足场景。业务人员对技术有两种期待:一种觉得技术无所不能,另一种觉得技术什么也做不了。
但实际上,技术既不是无所不能,也不是一无是处。中间需要一些 workaround,让技术恰好被用起来。
现在大模型领域也很流行,从最开始的 RAG,到后来的 context engineering、environment engineering。
对。所以需要一个桥梁型的人,既懂技术,又懂场景。
不管在旷视还是今天,我们依然需要很多人,既知道技术能力的边界,又能在场景里思考客户价值。
旷视历史上培养出了一些很好的 AI 技术型产品经理。
你觉得你也是这样的人?
我也是充当这个角色。我认为自己是一个大的 AI 技术产品经理。
最后这会变成一个大工程。基础设施之所以重要,就是要把应用侧的数据飞轮带回来,连接到整个 research pipeline,让大家更快迭代算法,再通过评测挑选好的模型,应用到整个场景。
这最终也是一个巨大的基础设施工程。整个系统如何设计,可能需要我来做。
到现在你整整创业 15 年了。如果相对感性地形容,这一路是什么感受?
我非常感谢这个时代。
我们经历了一波又一波技术变化的浪潮,看到很多原来认为不可能的事情,今天在技术上变得可能。
最早我们说人脸识别能够抓坏人,绝大部分人都投了反对票,觉得这件事不可能实现。但今天这已经是非常容易的事情。
再到自动驾驶、机器人、具身智能、大模型,我很感谢自己遇到了这样的技术浪潮,也在这个过程中不断兴奋,想参与进去,实现一些内心的人生目标。
我感谢这个时代,也感谢这些技术变化。
相当于创业 15 年中间,已经有三四波让你很想投入、很兴奋的技术变化。
你有没有一个特别长期、想实现的技术理想?
我跟你分享过,印奇当时说他为什么选自动化系。他觉得“自动化”这个名字,是最接近 AI、最接近机器人的专业。
我们从旷视开始,就希望让机器人看懂世界。后来做物流机器人,我自己内心一直非常希望做机器人。
不知道你有没有来过旷视办公室。
我知道。你刚才说这段,我就想到了旷视办公室门口的那个机器人。
我们第二次搬办公室时,让行政买了一个机器人放在前台。这个机器人到现在还在旷视前台。
因为我们内心真的想把机器人打造出来。我觉得今天具身智能是一件值得投入 lifetime、投入所有时间去做的事情。
好,今天非常感谢文斌做客晚点聊,分享了从旷视到现在整个 15 年的创业经历,尤其是原力灵机这一次成立看到了具身智能怎么样的机会,以及团队已经做了哪些事情,在模型性能、场景落地上有些什么样的思考和实践。
嗯,谢谢。
本期连点呈现分享和往期节目中的两个呼应。第一,在 4 月初发布的第 157 期具身智能 2026 年 Q1 季报中,我和 Peter 聊到了 Sharp 在 2026 年初 CES 上提出的三层结构具身智能系统,这和唐文斌这一期提到的三层结构构想非常相似。我们当时讨论这个话题,是在聊 OpenAI、Google、字节这样的基础大模型公司不能做,而只有具身智能公司才能做的独特问题和领域。
唐文斌说,在 System 2,也就是负责宏观任务规划的这一层系统上,大语言模型非常擅长。现在大部分具身系统也有赖于大语言模型和多模态基模的能力;而涉及更精细动作的 System 1 和 System 0,则是软件和硬件更紧密结合的地方,是具身智能创业公司可以努力的空间。
这个想法也类似于第 155 期中智简动力创始人贾鹏所说的 physical agent,也就是物理 agent。他认为,本质上来说具身智能就是一个物理 agent。在这个大的 agent 系统里,基础模型是底层,而如何把基模的能力用好,是具身智能公司可以做的工作。其中重要的一种方式,就是获得真实使用场景下的反馈和数据,然后反哺整个具身系统的提升,这也是具身智能公司可以建立竞争力的地方。
第二个想分享的是场景选择上的对比。在第 155 期中,贾鹏说他觉得当前适合具身智能机器人的场景,是端到端的场景和任务,也就是任务从头到尾都可以由机器人完成。他当时举的例子,是在工厂里做比较灵活、柔性的搬运或者上下料工作。
而这一期里,唐文斌有一些相反的想法。他认为要找那些人可以兜底的场景,通过系统层的设计,让机器人干不了的活、机器人干错的活,人可以接着去干。物流就是这样一个例子。在庞大的物流调度系统里,既可以接入已经存在的各种自动化设备和人,也可以接入更加智能的新具身智能机器人。
在单机智能尚未达到极强通用性和泛化性的现在,落地仍然可以进行,因为机器出错时,可以通过系统调度和优化,让其他设备或人来接管,同时通过系统和工程工作,让整个体系的效率和投资回报率保持在对客户来说比较合理的空间内。
两个人对场景的描述也有共性,就是都希望找节拍没有那么快的任务。之前第 154 期节目中,千寻创始人韩风涛也提到,现在适合机器人去做的任务,对节奏和速度的要求不能太快。
这些对于先去什么场景落地的不同思考和选择,会逐渐成为具身智能公司之间的差异来源之一。本期节目就到这里,欢迎收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,欢迎推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果 Podcast 等渠道关注《晚点聊 Late Talk》,也欢迎关注我们的公众号《晚点 Late Post》,下期再见。