70.杭州六小龙第一股,与群核黄晓煌的访谈:一家硬科技公司的15年进化史
- 群核最硬的资产是一座“无心插柳”的物理世界数据金矿:2018年开源的InteriorNet数据集,在疫情阻断线下采集后被硅谷大厂主动找上门,如今公司已成为具身智能“大脑”公司和多模态大厂的重要数据提供商。黄晓煌坦言当年“我直觉觉得它有用,但当时还不知道它有什么用”,受ImageNet启发才开源;商业验证的信号是客户“会不会持续采购更多的数据”,目前复购“还可以”。
- 战略选择的核心逻辑是中国算力约束下的赛道选择:大语言模型证明“数据越多越智能”,但在中国算力受到限制,群核便转向“数据没有那么受限制、但数据稀缺、算力要求也没有那么夸张”的物理AI。且新模型必须同时赋能老业务——用大模型推测图片中物体的物理参数,替代人工处理,“老业务是我们的现金奶牛”,这是不做二次创业式转型的底线。
- 公司刻意避开红海:“我被巨头打过呀,逃都来不及,你要去找一个巨头聚集的市场,那不找死吗?”各大厂的物理AI仍是“很小的团队在探索,不像大语言模型那是倾全公司之力在做”,群核以三维数据切入,结合3D和视频模型,作为视频大模型的补充;黄晓煌对Meta的V-JEPA 2表示“没有认真研究”,而群核强调的差异化是空间一致性。
- 商业模式随AI重构:2023年看到OpenAI按token收费后,群核第一件事就是调整SaaS包年包月模式,因为原模式下“别人一用我就亏钱”,视频生成等重算力功能被CFO压着不许上线。SaaS的价值衡量也从“用户乘以每天花的时间”反转为“我占用你越少时间创造了越大的价值”。
- 复盘最险一刻:2021年上半年“一切都是超预期的”,疯狂招聘至近三千人,年底房地产、疫情、资本市场叠加急转弯——“当时要是再浪一点,估计就挂了”。此后定下铁律:底线盈亏平衡、永远不打光弹药,即便现在非常看好具身智能“我也不会乱烧钱”,投资人催增速也“稳健增长,我不烧”。
- 组织上区分“流程式部队”与“创新部队”(后者占十分之一):判据不是业务成熟度,而是“如果KPI制定不出来,就得用创新式的团队”。对股东同理直白:“股东他只是要钱又不要你命的”,不志同道合的股东“不要拖,尽量想办法,不管付出多大的代价,把人买出去,越快越好——现在再大的代价,对于未来来说也是最小的代价”。
- 六小龙效应实质性改变了人才供给:今年C9院校简历增长约九倍、海归简历是去年二十倍,而此前受房产大势拖累“你给我的工资我都不太敢要”,很多想做的事被无限延后。黄晓煌把招聘定为自己的第一优先级,面试方式是扔一篇论文加开放式题目,有候选人从早九点做到凌晨一两点,“我也陪着他”。
- 方法论一以贯之:“拿着锤子找钉子”,且商业节奏跟随学术界——公众视野里的热点“都是落后两三年、三四年以上的”,机器人在学术界热于2022—23年,产业界2024—25年才推。“连学者都没搞定的事情,你自己就别瞎折腾了”;群核的巨大成功场景则是“技术能够用在所有行业,正好遇到一两个超级爆发的行业”,目前最看好机器人。
1. 六小龙争议与十五年的技术底色
- 主持人开场直问“群核是被塞进去的一条小龙”的说法,黄晓煌不回避运气成分:“杭州其实有非常多优秀的科技公司,可能你说有60家都数得过来,最终被选为六小龙肯定是有运气的成分在。”
- 但他强调公司从成立就是科技主导:在GPU还没热之前发现GPU集群可加速物理渲染,“拿着锤子找钉子,到处找应用”,“即使拿到十年后的现在,当时那个技术依然是非常领先的”,只是那个年代“大家看不太懂”。
2. InteriorNet:无心插柳的数据金矿
- 起源纯粹是好奇心:科研小团队“做着玩,反正也没有什么业务压力”,受李飞飞ImageNet启发,2018年开源——“我直觉觉得它有用,但当时还不知道它有什么用”,“我们自己不知道怎么训练,要不开源出来让别人训一训看。”
- 疫情成了奇妙的转折:线下采集机器人和AI设备训练数据的路径被阻断,硅谷大公司科研人员到处搜解决方案时找上了门。开源初期“发论文有效果,做业务没什么效果”,2020—21年才发现它不光用于机器人,也可用于各种设备的训练。
3. 2021年的关键认知:缺的不是数据团队,是顶级算法
- 2021年群核把数据集团队扩到二三十人,原本想做成正式业务,结果发现客户要的是“帮我调一调算法”,而“这一块需要的是顶级的算法工程师,普通的工程师并不解决问题”——当时群核做不了,客户自己也没有这种能力。
- 解法是拉回老同学周子涵回国组建AI实验室。配齐的逻辑很清晰:周做3D视觉在高校苦于数据有限,而群核“正好是属于有GPU也有数据的,缺算法正好配齐了”。黄晓煌自述当时“也没想那么多,就觉得这挺有意思的一个全新的领域”。
4. GPU认知革命与“创新部队”组织学
- 做CUDA出身的黄晓煌坦白认知盲区:“你说你训练一个东西要一千颗GPU,公司里谁跑过来申请要被骂死的……我做GPU那么多年,以前从来没认识到有这么一回事”——数据越多效果越好的认知有,但从没想过把GPU集群做那么大。
- 转型不叫换血叫升级:老业务稳健提供现金流,但迎接新时代“必须有一批新的人才、新的组织形态”。划分标准值得记录:“如果你目标过程的操作能够制定得很清楚的话,适合流程式的;要怎么做也不清楚,KPI制定不出来,就得用创新式的团队。”创新式约占十分之一,人贵,“但比起机会成本,人的成本其实还好”。
5. 股东观:要钱可以谈,别来要命
- 战略调整时总会跳出一两个股东反对(如“不要在中国搞研发,去硅谷搞”),黄的原则是“不要为了股东的意见而调整自己认为对的战略方向,毕竟股东他只是要钱又不要你命的”。
- 对不志同道合的股东态度极为果断:“你也别拖,不管付出再大的代价,把人买出去,越快越好。现在再大的代价,对于未来来说也是最小的代价。”
6. 蹭热点方法论:哪里有热点,哪里就有英伟达
- 直接反转主流叙事:“蹭热点不可耻,你看英伟达也在蹭热点啊”——虽然英伟达蹭挖矿赛道他“很不认可”,主持人进一步认为英伟达在那一波赚到的钱让其“有实力、有底气”加大AI投入。黄晓煌的原则是“热点应该蹭,但不能瞎蹭,你至少给这个热点创造一些价值”;且“当你公司小的时候,你是必须蹭热点的”,公司够大才有选择权、可以自己制造热点。
- ROI逻辑说得赤裸:“有热点的随便一发几十万的阅读,没热点的几十个阅读……非得找一个冷门的行业推,那我也很痛苦啊。”筛选标准是价值观:重来一次挖矿依然不去,元宇宙可以试(“很酷的idea,没做起来也没办法”),Web3没参与——“我还是希望做一些实实在在创造价值的东西。”
- 更深一层的洞察:“不会有平白无故出现的热点,要么有公司在推,要么有国家在推,这些公司也好政府也好,也需要你助力,所以顺势而为就是这样。”
7. 被浪打入水:巨头搅局与说服不了的员工
- 主持人追问有没有被浪打趴下的经历,黄的措辞是“不能叫趴下,是入水”——酷家乐1.0时代“做了半天本身业务很好了,巨头突然进来搅局”,很多同事觉得“你这么小的公司怎么可能跟巨头竞争”就离开了。“大风大浪见多了,所有风浪都是生活的一部分。”
- 员工信心是他自认比调整自己精神状态更难的事:2023年做空间智能时有员工觉得“老板怎么又开始蹭热点了?AI跟你啥关系?”甚至有员工跑到办公室说“你搞一些虚头巴脑的,你好好搞搞供应链不行吗?”他的应对是积极倾听但不说服:“很多事情不是讲道理就解释清楚……人家信你就行,不信你就不行嘛。”
- 引马云的话自嘲式收尾:“你连自己都改变不了,还去改变别人。”再刺耳的声音都努力听,“但不会因为这些声音改变”。三位创始人因教育与工作背景一致,“这么多年没发生过方向性的不一致”。
8. 2023商业模式重构:从包年包月到token收费
- ChatGPT给黄晓煌的第一眼启发不是AGI,而是商业模式:OpenAI按算力、按token收费,而群核SaaS包年包月导致“很多非常好用但非常消耗算力的能力没办法上线,别人一用我就亏钱”——视频生成能力很早做出来,“一看我靠,一个视频要好几颗GPU算一个小时,CFO说不许推,一推我就亏了,财报没法看”。
- 理念随之整体反转:原来SaaS衡量标准是“用户乘以每天花的时间”,恨不得用户一天十二小时打开软件;“未来可能是我占用你越少时间创造了越大的价值”。新业务已按token计费,老业务“船大掉头”仍在调整中。
9. 空间智能四件套与“开灯关灯”问题
- 群核在李飞飞三分法(理解、推理、行为)上加了“生成”,共四部分:空间的理解、推理、生成、行为。核心问题用一个例子讲透:现在很多机器人技术还是图像技术,“你把灯关掉,它都会觉得在一个不同的地方”——几个机器人对同一房间的认知不一致,就没法一起工作。“我们得构建出一套系统,能够让机器人有这个记忆跟这个理解力。”
- 所谓泛化性也由此定义:“没有泛化性就是开个灯就不认识;产生泛化性就是不管开灯关灯,在各种情况下都能认识成同一个东西。”李飞飞《Thinking in Space》等论文对梳理方向“肯定是有帮助的”。
10. 穷则思变:2022年的艰难与ChatGPT开的门
- 时间线很诚实:2021年老赛道如日中天,“不会想着变革的,只有穷则思变”;2020—21年资本市场太好,准备去美股IPO并疯狂招人,之后市场格局、资本格局及各种大事件叠加被迫调整,AI的出现“给我们对于未来调整方向一个很好的曙光”。
- 主持人问是否感谢ChatGPT,黄的回答保留了硬气:“感谢倒谈不上,它突然给我们开启了一些新的大门……总归会有浪的,只不过你要做选择,有的时候是浪花,有的时候是滔天大浪。”大模型这波“已经持续了三年了,不像元宇宙一年就哑火了”。
11. 创始人分歧的解法:把情感问题变成数学问题
- 三位创始人有异议但没争吵,议题很具体:投入多少资源、应届生行不行、GPU量大管饱还是够用就好。应届生的结论是“肯定行——有经验的都被字节、阿里抢完了,也轮不到你。牌桌上有什么牌你就打好了,别怨天尤人,没有那么好的运气的。”
- GPU在CFO强压下选了“够用就好”,如今复盘有悔意:“其实可以多买一些的……有限的GPU肯定限制了想象力,有些模型本来可以训练得更大的。”但决策方法论保留:看GPU利用率是持续提升还是降低,“把讨论变成一个数学问题,因为数学问题是有答案的,情感问题是没有答案的”。
12. 为什么押物理AI:算力受限下的数据赛道
- 战略推演完整呈现:大语言模型开启的大门是“数据越多越智能”,但在中国“算力受到限制了,所以我们内部就没去做大的模型”,转向“数据没有那么受限制、但数据稀缺、算力要求也没有那么夸张”的赛道——物理AI数据更难获取、算力要求反而没那么夸张,“所以我们当时战略上调整到这个方向”。
- 另一条硬约束是不做无关的二次创业:新模型“不仅可以拓展新业务,还可以赋能老业务”——老业务所有物理参数、材质信息原来都要人工做,“现在训练大模型就可以猜出来照片里这些东西的物理参数,对老业务的效率提升是非常巨大的”。
- 场景在2023年就锁定三个:机器人(当时叫“设备的智能化”,人形与否不确定)、电商、工业4.0;影视、游戏、广告等“很多赛道都用得上”。
13. 学术界领先两三年:黄仁勋不是造未来,是跟风口
- 对黄仁勋“画未来”的祛魅值得单独记录:“我觉得不是造……他的那些东西学术界已经提出来了。学术界提到的你看不见,商业公司提到的你才看得见。”机器人学术界热的是2022—23年,产业界2024—25年才推——“你如果不看论文的话,只能看到公众视野的东西,那都是落后两三年、三四年以上的。”
- 他把这条变成了自己的商业决策纪律。主持人还提到一则“ Hinton带学生写信向黄仁勋要芯片、据说被拒”的轶事;黄晓煌对此只说“我估计是这样”,并总结:“连学者都没搞定的事情,你自己就别瞎折腾了。”
14. SpatialLM的底模选择:向梁文锋要小模型未果
- SpatialLM训了两个版本——通义和Llama。不用DeepSeek的原因是端侧算力:“底模太大带不起来,它最小的模型也有好几十B,给机器人用太大了。”黄晓煌直接跟梁文锋提过希望发小模型,得到的判断是DeepSeek“肩负的任务更多的是突破前沿,小模型更多的是做生态”。据周子涵所说,通义在小参数规模里跑得最好;黄晓煌也认可Llama的海外生态优势——“我们生成的数据得让其他模型再去理解”。
- 开源本身就是群核能做这件事的前提:“大语言模型出来之前我们就尝试做,输出脚本这事情我们就没解决……你说我为了训练这么一个小东西,我得训练一个大语言模型,我疯了我。”所以“我们也是开源的受益者,应该积极拥抱开源”。主持人称SpatialLM开源后很快登顶Hugging Face第三名,仅次于通义和DeepSeek;黄晓煌表示“直接商业收益肯定暂时没有”。
15. 世界模型竞争地图:视频派、三维派与学术派
- 路线区分是这段的干货:谷歌Genie 3“ 大部分是基于视频来训练”,群核“以三维方式切入,三维加视频模型”,“我们的模型大小肯定跟他们没办法比,只是做一个视频大模型的一些补充”。主持人提到英伟达Cosmos所称的“9千万亿个token、2,000万小时真人互动数据”;黄晓煌认为Cosmos“做得非常不错”,更多是提供引擎和基础设施、“卖更多的显卡”,群核与英伟达也在合作。
- 对李飞飞World Labs的评价带着礼貌的怀疑:“更接近于实验室的学术成果……我也没看出有什么商业化前景,那可能是我认知有限啊。”腾讯混元3D主要是游戏数据、游戏风格;而群核Tech Day的demo用真实待拆照相馆一张图生成逼真房间,“我们更希望做有技术前瞻性、但又能服务现实生活的”。
- 三个概念的辨析:黄仁勋的物理AI强调与物理世界的连接,李飞飞的空间智能更多在数字世界对空间的理解,世界模型侧重视频模型符合物理规律——“实际上都指向了同一个问题:现在的大模型对世界的理解跟我们完全不太一样。”
16. 蓝海是被巨头打出来的选择
- 主持人指出各大厂都在做空间智能,黄的纠正构成关键判断:“目前各个大厂还是很小的团队在探索为主,不像大语言模型那是倾全公司之力去做的。”主持人将其概括为蓝海而非红海。
- 选蓝海是伤疤教出来的:“我被巨头打过呀,逃都来不及,你要去找一个巨头聚集的市场,那不找死吗?”筛选标准:“在你的视野范围内找一个巨头做了没什么太大意义、又适合你做的东西——图像生成模型我们也能做啊,但巨头肯定做的我就不做了。”
17. 飞轮:工具产数据、数据训模型、模型反哺工具
- 群核的空间智能体系由工具、数据、大模型组成,“缺一不可,它是一个飞轮”:训练数据“没有办法从互联网上直接扒出来”,得由工具产生——酷家乐、棚拍都是工具;数据训大模型,大模型再让工具更高效。
- 数据金矿的来历是既有业务流程的反转:群核在全屋定制、工业4.0等业务中积累了带物理参数的数据;做工业4.0时为确保生产结果与设计一致,本就建了仿真系统。开源InteriorNet时的问题意识是“工业4.0是把数字的东西变回物理的东西,那看到一个物理的东西,能不能用AI把它推成数字的东西?”2021年初步验证可行,2023年有了scaling law的认知后“训练得更智能,泛化性更强,这是原来没想到的”。
- 摆脱存量数据依赖也在推进:SpatialGen(上传一张图自动生成空间,如一张夏威夷图片替代三维建模)本身就是生成数据的工具,已开源;更远的方向是让智能体自己探索、自己产生数据。
18. SpatialVerse的商业化现实:NDA、复购与sim-to-real
- SpatialVerse一句话定位:“为空间智能领域提供合成数据”,原本服务内部模型团队,需求多了才独立成为与酷家乐平行的业务线,客户包括具身智能相关公司、AIGC(快手可灵、Pika一类)和VR/AR。主持人称听说几乎所有具身智能“大脑”公司都有合作;黄晓煌则说有的公司会反馈、有的不会。“Google公开了我们就说一下,其他签了NDA就别说了。”早年判断数据有用的方式很直接:产品发布后“有一些产品就是用我们提供的合成数据做出来的,一眼就能看出来”。
- 收入坦白得可爱:“做机器人的公司收入都比较一般吧。能够从这些公司身上获得一些收入,覆盖我们的投入,已经很好了。”效果判断看“会不会持续采购更多的数据”,复购“还可以”;老业务服务近五万客户,而“现在任何一个行业有一千个客户都不错”,所以希望技术更通用。
- 技术上的诚实:sim-to-real一定有gap,“你肯定不能只用一种来源的数据,得混入真实数据一起训练,机器人才有泛化性。有些人虚拟训练的模型现实里没法用,是因为数据集里根本就没有现实世界的数据。”VLA暂不做,因为“跟硬件绑定比较大,甚至不同的人形机器人都不能跑同一个VLA,那我训练来干嘛呢?”
19. 与视频生成公司:互补还是直接竞争
- 群核的差异化是空间一致性:“现在视频生成公司有时候换个角度,房间都变了,不符合物理规律。我们是能够保证房间是稳定的。”主持人点破:“这个不叫互补,这叫你能做到他们暂时还不能做到的事情。”黄承认,但坚持“未来应该不是竞争关系而是合作关系”——天马行空的动漫故事用视频模型效率更高、算力成本更低,群核自己也会调用可灵、混元等模型,“爱用啥用啥,各自数据不一样,训练出来的能力也不一样”。
- 棚拍是落地样本:电商商品不换实景换背景,Tech Day上“模拟黄昏的光线”“平面广告的追光”的demo引发全场鼓掌,目前电商行业反馈最好。底层哲学一句话:“真实世界是不可计算的,你只有把它变到虚拟世界里面去,才有办法处理它、优化它。”
20. 人才:九倍简历、面试到凌晨与应届生Leader
- 六小龙效应的实际红利:今年C9院校简历约增长九倍、海归简历是去年二十倍,而前几年受房产大势影响“你给我的工资我都不太敢要”,很多想做的事因“专家不够分”被无限延后——今年这些新方向的成果“都是新人做的”。黄把最多时间投在招聘而非见客户:“每次最终留下来的,最终都是人创造的。”
- 面试法自成一派:不看简历,“扔一篇论文给他读一读,讲完给他出道题现场实现”,开放式不限时,有候选人从早九点干到凌晨一两点,“我也陪着他”,态度可以加分。AI时代的人才两极分化判断:“非常有经验的人还是很吃香,经验用DeepSeek搜一下又能搜出来的这种影响比较大,中间模模糊糊状态的比较尴尬。”
- 从英伟达学的用人体系:当年CUDA团队负责人可能是Stanford应届毕业生,团队“三分之一甚至一半”可能毕业于Stanford——“你会用一个应届毕业生做一个新业务的头吗?很难想象的。”群核如今“努力让毕业没几年的人做比较重要项目的leader”,已经开始尝试。
21. 最险的一年:2021与“永远不打光弹药”
- 巨大失败曾经很近:“二一年上半年觉得一切都是超预期的,疯狂招聘(一度近三千人),增长也很快,然后突然一下子发生了变化”——房地产、疫情、资本市场全部叠加。“我在想当时要是再浪一点,估计就挂了。”此后定规则:底线盈亏平衡,“我再烧钱,我也是不想亏钱”;有朋友的公司“打光弹药,进入万劫不复,没熬过去”。
- 教训延伸到当下纪律:即便非常看好具身智能“我也不会乱烧钱”,投资人催“烧点钱增速快一些”,他答“我稳健增长,我不烧”,每个岗位亲自把关“坚决不放水”——因为2020年招聘下放“后悔莫及”,招错人对双方都是伤害:“人家一心想把业务做好,进来两三年了你说不合适,那不是很荒唐吗?”
22. INTJ、死磕的缺陷与草台班子的安慰
- 自我画像:INTJ,座右铭“Life is tough, but we are tougher”,年轻时欣赏Bill Gates,“现在觉得Jensen Huang比较牛逼”——英伟达的底层判断(如GPU会替代CPU)多年不变,但应用的行业一直在变化;“一开始我还半信半疑,见到他一路起来之后,我觉得这个方法好”。
- 罕见的自我批判:tough性格“容易死磕”,与顺势而为相悖——房地产业务线国家调整后“还在那边死磕,后面才发现你把精力花在不对的事情上,天天在ROI很低的事情上一直做,意义没那么大”。他让合伙人发现自己死磕时“一定要提醒一下:不是你努力就一定能做好的”。
- 荐书《Breaking Twitter》,取的是旁观者视角对领袖的祛魅:“即使世界上最牛的leader,都是有搞砸的时候……不用怕各种草台班子的行为,行动永远比不行动好。”被问群核值多少亿时,黄只答“应该有吧”,主持人接“不少哦”——一句留白收尾。
Full transcript
群核在机器人狂潮当中是非常重要的数据提供商。
大语言模型它开启了一个新的大门,数据越多越智能。
物理AI呢是我们觉得是有机会的,因为它的数据更难获取,所以我们当时战略上调整到这个方向。
我经历过好几个周期,我们公司是火过好几次,就每次最终留下来的,最终都是人创造的。
每一次变革的时候,有些人认可,有些人不认可,这很正常。
做了半天,本身业务很好了,巨头突然进来搅局,然后巨头好不容易出去了,怎么市场又市场又动荡了?
大风大浪见多了,所有风浪都是生活的一部分。Life is tough, but we are tougher.
牌桌上有什么牌你就打好了,别怨天尤人的,为什么拿到的都不是最好的?没有那么好的运气的。
Hello,大家好,欢迎来到漫谈 Light Star,我是诗杰。
成立于 2011 年的群核科技,在走过 15 个创业年头后,于 4 月 17 日在港交所成功上市。这是一个中国合伙人的故事:3 位联合创始人是美国伊利诺伊大学的校友,其中董事长黄晓煌和 CEO 陈航在浙大竺可桢学院时期就是本科室友。
在 GPU 算力尚未被大众熟知的年代,3 位创始人凭借着对计算技术的热爱和执着,发现 GPU 集群可以极大地加速物理渲染,因此打造出渲染引擎,开启了一段拿着技术找应用、拿着锤子找钉子的典型创业历程。
我在去年 8 月和黄晓煌进行了一场访谈。这个故事中最打动我的是,回报总是发生在那些不计结果的好奇心和热爱之后。长达 10 年的时间,群核在最不性感、最难数字化的家装与房地产领域死磕,把每一个室内空间的物理参数、材质精准地搬进数字世界,最终打造出空间设计行业的 SaaS 工具酷家乐。
也正因为这样扎实而沉闷的积累,他们在 AI 时代突然发现,自己坐拥了一座关于物理世界规律的数据金矿。事实上,这家公司从 2021 年起就开始了从 SaaS 公司向 AI 公司的转型布局,比 ChatGPT 的爆发还要早 1 年多。
今天,群核成为了具身机器人公司以及许多训练多模态世界模型大厂的重要数据提供商。数据之外,这家公司也正在开放底层空间智能能力,推动 AI 对物理世界的理解、推理和交互。我们的访谈独家还原了一家创业 15 年的硬科技公司多次转型的全过程。
大家好,我是群核科技的创始人黄晓煌。
因为今年杭州“六小龙”一下子变得特别火,听到有一种声音说,群核是被塞进去的一条小龙。你有听说过这种声音吗?
这种声音非常少。但是我想说的是,杭州其实有非常多优秀的科技公司,可能你说有 60 家都数得过来,最终被选为杭州“六小龙”,肯定有运气的成分在。
1. 群核从 GPU 找到应用
我们公司从成立开始,实际上就是一个科技主导的公司。最早在 GPU 还没热之前,我们就发现 GPU 集群可以用来加速很多事情,后来就用来做物理渲染,拿着锤子找钉子,再到处找应用。
即使拿到 10 年后的现在,当时那项技术依然非常领先。包括我们现在做的这一套体系,依然是业内比较独特的,可以说是独一无二的。反而在那个年代,大家可能不太了解,也看不太懂。
我听说疫情期间,有一些硅谷公司发现你们有一个数据集叫 InteriorNet,他们想用你们的数据集去做机器人训练。因为疫情,很多线下训练没办法做了。
这个数据集是 3D 空间,我的理解是,像我们人上网课一样,让机器人在一个虚拟世界里面进行训练,对吗?
2. 疫情打开机器人训练需求
是的。疫情也是比较奇妙的,它让很多事情发生了改变。大家原来习惯训练机器人,或者训练一些 AI 设备、硬件,都是到线下场地进行采集。
疫情把这些事情全部阻挡住了,大家也在想新的办法去做这种探索。所以我们在 2018 年开源 InteriorNet 之后,大公司的科研人员也在到处搜相关的解决方案,看到这个东西就来联系我们了。
InteriorNet 是你们在做传统业务的时候,自然而然集成的一个数据集吗?
对。当时我们团队里有一小波人还在做科研,那个年代也就是做着玩,反正也没有什么业务压力,就觉得这个东西好像有一些用。
因为那个年代上一波 AI 比较火的时候,视频监控之类的应用比较火,我们当时就想,这个东西能不能用来做 AI 训练?反正我们自己也不知道怎么训练,那不如开源出来,让别人训一训看看。
我直觉觉得它有用,但当时还不知道它有什么用。这是受李飞飞的 ImageNet 启发的。
ImageNet 确实推动了后来深度学习的发展,是一个关键节点。那你们开源出来之后,一开始有效果吗?
一开始发论文有效果,但做业务没什么效果。
更多的学者用了你们这个数据集,发表了很多论文?
对,我们也跟他们一起发论文。
2023 年的时候,你们发现有机器人公司有这个需求,是吗?
2020 年、2021 年就发现了。它不光是机器人,也会用于各种设备的训练。
这个时候给你什么启发?
对我的启发很重要。我当时想,这个 AI 好像到了一个新的阶段。这个数据集竟然真的有用。
2021 年,你们还扩充了这个团队?
对,扩大到二三十人,就是那个数据集团队。
3. 数据价值需要算法兑现
后来发现,扩充团队也没什么用,因为我们发现这里面最关键的是算法。我们本来想在 2021 年把这个做成一个正式业务,和客户聊,你们有什么需求?客户确实有需求,他说:“我的算法效果不太好,你能帮我调一调吗?”
后来才发现,这一块需要的是顶级算法工程师,普通工程师解决不了问题。
当时我们还没关注到大模型,只知道客户花了很多 GPU 去训练,很多算法调优也没搞定。他说:“我能不能调一调这个算法?”我说:“这个做不了。”问他们有没有这个能力,他们当时也没有。
后来我们就组建了一个 AI 团队,周子涵教授也组建了一个实验室,专门做这个,之后才慢慢知道应该怎么做。
2021 年 5 月,你发现潜在客户有这个需求,但你也没有能力做,于是意识到需要重新组建一个 AI 团队。当时是这样吗?
我当时倒没想那么多,就觉得这是一个挺有意思的全新领域。正好周子涵也在研究这些。
他是你们的首席科学家,也是你的同学?
对,原来是同学。我就跟他说:“你要不回国,一起来做这个?”
我昨天和他聊了,他说他当时加入你们,是因为他做的是 3D 视觉,但在高校里数据量非常有限,而你们当时有一个看起来非常庞大的数据集。
对,所以他就来了。
实验室的组建,对你们现在来说是不是非常关键的一步?
是。我们当时正好有 GPU,也有数据,只缺算法,正好配齐了,于是组建了一个实验室专门研究。
这个过程中还是有很多认知上的变化。
什么样的变化?
举个例子,原来训练模型需要很多 GPU,但 GPU 很贵。你说训练一个东西要 1,000 颗 GPU,公司里谁会跑过来申请 1,000 颗 GPU?肯定要被骂死。大家会觉得,这个人是不是代码没优化好,怎么需要 1,000 颗 GPU?我们平常几十颗就顶天了。
以前就是这种观念,也不会把东西训练得很大。后来大语言模型火了之后才知道,原来现在这些东西需要很多 GPU。我做 CUDA、做 GPU 这么多年,以前也从来没意识到还有这样一回事。
你说数据越多效果越好,我以前有这个认知,但从来没有想过要把 GPU 集群做得那么大。
现在得做了吧?
现在肯定得做。因为你们的数据集是开源的,我理解这个时候也没有什么商业收入。
但你是从那个时候开始意识到,也许应该好好研究大模型,以及挖掘你们数据的价值,未来有机会把它变成一条商业收入线?
对。一方面,我们觉得这会成为一条业务线;另一方面,我们在和这些大公司合作的过程中,隐隐约约发现,这些训练需要非常大的数据量和非常多的 GPU 才能实现。
我们当时就意识到,好像哪里不对了。我们现在在做这一套研究,别人都不做了,那我们得跟进,自己去研究。包括现在内部的同事,我们问了一圈,大家也都不会,那就只能招相关的人,组建新的实验室来研究。
这就是我们刚才讲的转型时要“大换血”。你们现在不叫换血,叫升级。老的体系还在,因为老业务很稳健,也提供了很好的现金流,但要迎接新时代的到来,必须有一批新人才和新的组织形态。
4. 群核如何完成组织升级
对,要在这个基础上升级。两个体系都有:找到商业价值的,就用我们说的流程式部队;还没有找到商业价值的前沿探索,就需要创新部队。
其实不完全是找到或者没找到。我现在发现,如果目标和过程的操作能够制定得很清楚,就适合流程式团队;如果连怎么做都不清楚,KPI 也制定不出来,就得用创新式团队。
现在公司里面,创新式和流程式团队的占比大概是多少?
创新式团队大概占十分之一。
这十分之一的人应该很贵吧?就是我们现在所说的 AI 人才。
是挺贵,但比起机会成本,人的成本其实还好。
你怎么说服投资人,告诉他们我们现在要做一件新的事,还要招很多很贵的人?
每次做战略调整的时候,大部分股东还是认可的。当然,总会跳出一两个股东说:“不要在中国搞研发,没前途。要搞研发就去硅谷。”会有这种声音。
你也要想办法达成意见一致,但我觉得首先,不要为了股东的意见去调整自己认为正确的战略方向。毕竟股东只是要钱,又不要你的命。
我们大部分股东还是非常支持业务的。以前有句话叫“要钱没有,要命一条”,但你做公司得反过来:要钱可以谈,但不要来要命。
不要让这种股东长期存在,不然对企业的破坏力也很大。最好一次性解决这个问题。认可你方向、大家志同道合的,就一起往前走;如果不是志同道合的,也别拖,尽量想办法,不管付出多大的代价,把人买出去,越快越好。现在再大的代价,对未来来说也是最小的代价。
在中国还是要顺势而为。资本市场哪里有热度,我也要去研究一下,看看能不能和我的业务产生关联。但这里面有一个比较棘手的地方:投资人也好、市场也好,怎么让他们相信我不是来蹭热点的,而是我的技术和产品能够真正落到这些场景里并发挥作用?
首先我觉得,蹭热点不可耻。你看英伟达也在蹭热点,哪里有热点,哪里就有英伟达。
当年英伟达蹭挖矿这个赛道,我是很不认可的。这种赛道你也蹭,后来还赚了很多钱。但热点应该蹭,不能瞎蹭,至少要给这个热点创造一些价值。
另外,当公司小的时候,必须蹭热点;当公司足够大,或者你有能力的时候,才有选择。那时你可以自己制造热点。
过去有很多朋友很鄙视蹭热点,但在做业务的过程中会发现,有热点的地方,推广的 ROI 很高。没热点的地方,你嗓子喊破了也没人看,就像你们写稿子一样,有热点的内容随便发一篇就有几十万阅读,没热点的可能只有几十个阅读。
对。我就是想做 ROI 高的事情。我们的技术是通用的,那我在有热点的行业推广,效率高、产出高,团队也有成就感。非得找一个冷门行业去推广,我也很痛苦。
你刚才提到英伟达因为抓住炒币的热点赚了很多钱,这对英伟达的发展是很重要的一步。因为它在那一波炒币中赚了很多钱,之后就能加大在 AI 方面的投入。
是的。我现在慢慢理解了这些热点:有热点的地方,要么有公司在推动,要么有国家在推动,不会平白无故出现热点。
这些公司也好、政府也好,也需要你助力。所以顺势而为就是这样。我们也不是什么热点都去尝试,至少要在价值观上认可。
如果重来一次,挖矿你还是不会去吗?
不会,因为这和我的价值观不一致,我也不太感兴趣。元宇宙我可以去试,因为我觉得这是一个很酷的想法,没做起来也没办法。Web3 我就没有去试,因为我还是希望做一些实实在在创造价值的东西。
并不是说我不认可它就没有价值,只是我自己没有太明白它的价值。当然还有很多有热点的东西我看不明白,我也没有参与。基本上我们参与的赛道,至少本身是有一些价值的。
AI 这一波来的时候,我觉得英伟达已经准备好了。它前面在炒币这一波赚了很多钱,所以有实力、有底气。
2023 年对你们来说也是群核战略升级的重要一年。当时对于群核来说,这是一个好时机吗?那时候你们至少财务上还是亏损的,对不对?
5. SaaS 模式转向按算力收费
2020 年、2021 年资本市场太好了,我们当时很快就准备去美股 IPO,也招了很多人。后来整个市场格局、资本格局发生了变化,各种大事件都出现了,你就要调整。
AI 的出现,倒是给我们未来调整方向带来了很好的曙光。因为我发现这些新公司出来之后,第一眼观察到的不是 AGI 会怎样改变行业,而是它的商业模式,对我们之前使用的 SaaS 商业模式是一个很好的启发。
像 OpenAI 按算力收费、按 token 收费,我们之前是按 SaaS 包年包月收费。很多非常好用、但非常消耗算力的能力,没有办法推广、没有办法上线,因为成本太高。
你有好东西,但因为价格没有那么高,推出去不合适。别人一用你就亏钱。
对,所以那几年这件事本身就很纠结。看了 OpenAI 的商业模式之后,我发现,基于 GPU 的商业模式应该是这个样子,应该按 token 收费。这样的话,我有多少实力就能挣多少钱,不用藏实力。
所以我们提出的第一件事,就是调整、升级 SaaS 商业模式。2023 年想明白这件事之后,就很快开始调整商业模式。
这样应该能带来更多收入了吧?
理论上是,但现在还在调整过程中。因为船大掉头,我们有这么多客户。新业务都是按照 token 收费,老业务还在调整过程中。
但是这样一来,我们很多新的能力就可以发布出来。比如很多视频生成能力我们很早就做出来了,结果一看,一个视频要好几颗 GPU 算 1 个小时,这东西怎么推?推了半天,CFO 说不许推,因为一推就亏钱,财报没法看。
那现在就没问题了。如果新的商业模式按 token 收费,用得多、付得多,就没什么问题了。除了商业模式,还有其他变化吗?
原来都是把功能往小做、往便宜做,做得简单,更多的是植入 know-how。现在则是把功能做得更智能、更聪明,消耗更多算力,让人花更少的时间。这和原来的 SaaS 真的不一样。
原来 SaaS 的衡量标准,是用户数量乘以每天花费的时间,来体现产品的价值,恨不得用户一天 12 个小时都在打开我的软件。未来可能是我占用你越少时间,却创造了越大的价值,这才是最大的价值。解放了你多少时间,未来可能会这样衡量。
所以我们的理念也发生了变化。
我之前听过一个很有意思的比喻,说硬科技创业其实很像冲浪,尤其是你们这种拥有通用技术、然后要寻找不同场景的公司。就像你说的,要参与热点,一浪又一浪。有时候你可能站上去了,但有时候也会被浪打趴下。
目前你们好像还没有被浪打趴下的经历,有吗?
6. 公司如何穿越风浪
肯定有。什么时候?被打趴下之后,我也不会天天在 PR 里说。
那你现在来讲一下,什么时候趴下去了?
没有,肯定不能叫趴下,只能说是入水。比如说你做了半天,本身业务很好了,巨头突然进来搅局,你也会觉得,怎么回事?
这是酷家乐 1.0 的故事,对吗?
对。然后巨头好不容易出去了,怎么市场又动荡了?时间长了也习惯了,反正大风大浪见多了,所有风浪都是生活的一部分。
你不要太在意这些,做你能长期坚持的东西。当然不是盲目坚持,而是你能长期坚持的东西。你就不用怕别人怎么样,因为你长期做的时候,相信这件事一定有价值。我只要活着,肯定能找到方向。
首先,这东西有价值;另外,你在做这个东西的过程中,自己会产生愉悦感。
这在创始人身上还挺好理解的,但怎么在没有信心的时候,把信心传递给员工?因为士气可能会受到很大影响。
这确实是我创业过程中,比调整自己的精神状态更难的事情。我自己倒是比较乐观主义,外部怎么变化对我影响不大,但对员工的影响确实是让我比较苦恼的事情。
比如 2023 年我们开始做空间智能、做大模型,会有一些员工很认可,也会有一些人觉得:“老黄怎么又开始蹭热点了?AI 跟你有什么关系?”会有人这么想,这很正常。
第一次经历类似事情的时候,我挺痛苦的,但经历多了也习惯了。包括我们当时被巨头打的时候,很多同事也觉得我们完蛋了,这么小的公司怎么可能和巨头竞争?然后就离开了。
这很正常,就像股市一样,有人认可你,也有人不认可你。你不可能做到所有人都和你想法一致。对于和你想法不一致、或者不认可你方向的人,要积极倾听,但真的达不成共识的,该走就走。强留没有意义。
你要改变一个人的认知太难了,这时候更多的是做选择,不要试图改变别人。就像马云说的,你连自己都改变不了,还去改变别人。
刚才讲到一些质疑自己的时刻,眼角是有泪光吗?
每一次做变革,毕竟公司有一两千人,或者遇到外部风浪,有些人认可,有些人不认可,这很正常。一个家庭的意见都很难一致,更不可能要求所有人统一。
我们经历过好几波,现在遇到类似的事情也已经心如止水了。
你们 3 个创始人都还是比较简单、比较纯粹的人。
我觉得这点比较好。我们 3 个创始人的教育背景比较一致,工作背景也比较一致,所以遇到类似问题时,基本上观念完全一致,很快就能达成共识。这么多年,基本没有发生过方向性的不一致。
如果你们已经确认这件事情是有价值的,而且理论上可以被解释清楚,难道没有办法和核心员工解释清楚吗?
很多事情不是讲道理就能解释清楚。比如巨头来打你的时候,你说:“我们坚持下去一定能胜利,八年抗战都能胜利,我们怕什么?”这怎么解释?对方信你就行,不信你就不行,你列不出一二三四。
比如 2023 年、2024 年,我们跟团队说要做大模型、做空间智能,对方会说:“你在搞什么?你就是一家家装公司,怎么开始搞大模型了?”
所以我一开始问你的“六小龙”质疑,其实从员工这里就开始了。你们有很多员工原来就是从家装行业招来的,他们可能很难理解 AI 的前沿技术,会有这种情况吗?
有。甚至有员工跑到办公室来说:“你搞这些虚头巴脑的东西,不能好好搞供应链吗?”
你会怎么应对?
积极倾听,但我不会去说服他。没什么好说服的,我的嘴巴也不是特别有说服力。
我不生气,这有什么好生气的?我只是听他怎么想,积极倾听,试图理解背后的原因。从他的立场来说是对的,从公司立场来说肯定是不对的。
但从群核的发展历史来看,公司已经习惯变化了。每隔几年,即使原来的产业非常健康,仍然是很好的现金奶牛,企业如果想做大、做长寿,还是要不断寻找第二增长曲线。
所以,变化本身就是企业的本质。变化的过程中,有什么可以复用的经验吗?哪个方向更代表未来?
哪个方向代表未来是没法复用的,因为时代一直在变化。但有几个东西可以复用。
一个是你的新方向有没有创造社会价值,是不是真的给社会创造了更大的价值。过去几十年,房地产在中国创造了更多价值,让我们的生活变得越来越好。接下来,给中国、给世界创造更多价值的是什么?是机器人、大模型、人工智能,还是 Web3?这些都需要思考。
我觉得不能纯粹从赚钱的角度思考。纯粹从赚钱的角度来说,很多东西都赚钱,但有些事情只赚钱、不创造社会价值,我会非常谨慎。
另外,你得对这个领域熟悉,能够天天看相关资料,对事情做出判断,这种东西可以做。但如果你自己完全没有判断力,只觉得“这东西好牛”,就想去探索,这就不合适了。
我昨天也参加了你们的 Tech Day。你们有非常成熟的 Demo,我某种程度上也理解家装行业的同事为什么不相信你们要做空间智能。因为在早期,你们还没有非常成熟的产品让他们看到,他们会觉得你只是在追热点。
在早期,怎么说服大家这件事可做,而且你有能力做?
所以我说,经历了几波之后,我也不尝试去说服了,没有意义。
很多老员工认可的是公司的团队。一路上经历了风风雨雨,我们基本都会给老员工调整业务线。有人就会有不同的想法,我们会给他找到新的团队、新的方向,大家形成一种比较长的默契。
在公司待了 10 年以上的人,更多的是相信这个公司、相信这个团队,而不是单纯地一定要做某个赛道。他们相信的是这个团队的 DNA,至少是我们简单、专注、开放的 DNA。
有些人到了新公司,可能会习惯性地跑到老板办公室一顿质问,第二天就收到离职通知。你碰到这种比较冒犯的方式时,还是会很体面地处理,这是你骨子里的状态吗?
我没觉得冒犯。首先,我不觉得这种行为是一种冒犯,反正就是聊。如果他在开会的时候进来骂骂咧咧,那肯定不行。
但平常约个时间,如果我有空,他约好时间进来说什么,我都觉得很开放。在我们公司,你可以讲任何想法。
在这个变化过程中,最难的是什么?
人的问题肯定是最难的,这确实是我们很难的一个地方。
首先,你在公司找到新的方向,希望带领大家到一个新的高度,但肯定还有一批人想照着老路继续往前走,里面有巨大的说服成本。
比如我们公司现在养了上百名科学家,很多人会说:“你为什么不把这些人裁了,给大家涨点工资?公司赚了这么多钱。”这种声音肯定会此起彼伏,但也没什么好解释的。
你只能朝着正确的方向努力。当然,过程中也会有不少压力。如果新的方向不对,或者掉坑里了,反对的声浪肯定会越来越大。
时间长了,我的态度就是,这些声音我都努力听。不管多刺耳,我都会听,但不会因为这些声音改变。
目前是用自己的利润在做研发吗?
是的,加上之前的融资。
融资应该早就花掉了。
对。
你们公司从第一天开始就是一个非常重研发的公司,对吗?
对。我们现在有利润,所以利润上没什么问题。
我查了一下,“空间智能”这个词其实是 20 世纪 80 年代由心理学家提出的,但去年李飞飞又把这个概念至少在 AI 领域推到了一个新的高度。
空间智能这个词和群核的业务联系在一起,最早可以追溯到什么时候?
7. 空间智能从何而来
其实我们从刚成立的时候就开始研究这个方向了,只是当时还没有“空间智能”这个词,更多用的是 3D 设计、3D AI 之类的说法。
特别是 2018 年我们开源 InteriorNet 之后,隐隐约约觉得,AI 和文字、图像不太一样,它更多是在理解 3D 空间。但具体用什么词来描述,我们想了很长时间。
叫 3D AI 不合适,因为会和其他概念重合。后来我们一直在想怎么描述这个赛道,最后觉得“空间智能”这个词不错。
李飞飞再次提出这个词的时候,你觉得它很准确?
对。
它是不是可以概括你们正在做的所有事情?
是的。我们现在把空间智能分成 4 个部分:空间的理解、空间的推理、空间的生成,还有空间的行为。这 4 个部分基本上代表了我们平常在做的产品。
比如我们现在坐在这个环境里,你看到的和我看到的,这个房间里的所有几何结构是一样的。我们都是人类,所以有同样的认知,这是空间理解很关键的一点。
但很多机器人不是这样。几个机器人在一起,我坐在这边看到的,和你坐在那边看到的可能不是同一个房间。那就完了,这些机器人没法一起工作。
为什么不同的机器人看到的会不一样?
据我所知,是因为机器人领域现在还没有一套统一的算法架构,底层架构也不统一。可以理解为,它们现在用的是各自不同的语言。
不光是位置不一样。你把灯关掉,或者换一盏灯,它都会觉得自己处在一个不同的地方。也就是说,它对空间的理解更多是对图像的理解。
现在很多机器人的技术还是用原来的图像技术在做。图像技术意味着,灯开着和灯关着,就是两张不同的图像,它的理解也就不一样。这种理解力原来是没有的。
我们得构建出一套系统,让机器人拥有记忆和理解力。
这也是李飞飞那篇论文《Thinking in Space》的核心理念:AI 需要更进一步地看到这个世界、记住这个世界。
这篇论文有没有对你们梳理自己要做什么,起到进一步推动作用?
肯定有帮助。我们也看了很多相关领域的论文。空间理解要用在哪里?我又不直接做机器人,现在做家务的机器人也没有几台,那我具体用在哪里?
所以我们会探索,怎么在老业务里使用空间智能技术。老业务就是围绕房地产做的家装、电商等业务,我们也希望把这种新技术用进去。
2021 年最早来找你们要数据集的,除了集成公司,还有其他公司吗?
有。硅谷那几家大的公司基本都知道,不过我们签了 NDA,再描述下去就违反协议了。
后来我们看了论文,也发现有一些新的算法出来了,需要这些空间认知模型。
看完论文之后,是不是就非常清楚地知道这些数据集能派上什么用场?
那个年代还没有完全弄清楚。当时的说法是,让空间理解产生泛化性。
你在图像里做空间理解,没有泛化性。所谓没有泛化性,就是开灯之后不认识,或者关灯之后不认识。产生泛化性,就是不管开灯、关灯,或者处在各种不同情况下,都能认识成同一个东西。
当时基本上理解到这些。但随着技术不断发展,现在就越来越清晰了。
在还不清晰的时候,你已经决定公司要战略升级、要做空间智能了吗?
2021 年还比较模糊。
变化的时间点是什么时候?
8. 群核等来战略转折
2023 年。因为 2021 年我们的老赛道如日中天,业务也很好。
2022 年是比较艰难的一年,2021 年业务特别好,那时候不会想着变革。只有穷则思变。
你会不会很感谢 2022 年 10 月 ChatGPT 的出现?否则你可能只是在大环境变化之后处于迷茫和焦虑状态,没有新技术点燃你新的方向。
感谢谈不上,它只是突然给我们开启了一些新的大门。
刚才用冲浪比喻硬科技创业,如果 ChatGPT 没有出现,也许这道浪就没有来,但可能会有别的浪。总归会有浪,只是你要做选择。有时候是浪花,有时候是滔天大浪。
AI 大模型是超级大浪吗?
现在看起来肯定足够大,已经持续 3 年了,不像元宇宙那样一年就哑火了。
在大模型这波浪潮里,你们几位创始人因为都是技术出身,有过任何异议吗?
有异议,但没有争吵。
什么异议?
投入多少资源、怎么投入、招人的标准是什么、应届生行不行、还是一定要工作经验、GPU 买多少、是量大管饱还是够用就好,这几个问题都特别重要。
我们先从招人聊起。应届生行不行?
现在的结论是肯定行。有经验当然最好,但有经验的人都被字节、阿里这些公司抢完了,也轮不到我们。
所以我们得想办法从应届生里面找到最符合我们价值观、最能打的人。
我觉得创业者得有一个心态:牌桌上有什么牌,就把手里的牌打好。不要怨天尤人,为什么拿到的都不是最好的。没有那么好的运气。
那 GPU 是量大管饱,还是够用就好?
我们经过几番讨论,在 CFO 的强压下,最后决定够用就好。
但现在想起来,这个决定是挺正确的吧?
够用就好其实是正确的,但现在想起来,当时可以多买一些。
2023 年算力很贵、很稀缺,也很紧俏,但那个时间更值钱。可当时也没办法,因为我们会想,万一这是一个做 1 年就没掉的赛道,这些 GPU 怎么办?
但现在大家都在把大模型落地到应用,肯定还需要更多算力,尤其是推理时代到来之后。
据我所知,2023 年算力非常紧俏,但 2024 年市场上也多出了不少算力,因为大量当年号称要做基座模型的公司死掉了或者退场。
对,所以它其实是有一个曲线变化的。
但今天看起来,你还是会觉得当时投入得比较保守,因为时间更值钱。有限的 GPU 肯定限制了想象力。
对,有些模型本来可以训练得更大,但没有办法训练得更大。
这说明你们在做这件事的过程中看到了越来越大的价值,所以才会后悔当初投入少了。
但这也没什么好后悔的,万一投错了呢?投错了就麻烦。
GPU 到底要买多还是买少,这件事怎么测算?
看利用率。GPU 利用率加上去之后,是持续提升还是在降低?反正就把讨论变成一个数学问题。
数学问题是有答案的,情感问题没有答案。
我理解,新方向目前的突破口主要有几类场景:一个是机器人,机器人训练需要数据,而且是 3D 数据,在这个领域应该是非常稀缺的数据。
对。
另外一个是电商,还有你们传统的房地产相关产品。由这些数据集衍生出的服务和工具,主要就是这 3 个场景。
目前能用到的其实还有影视、游戏、广告,很多赛道都用得上。
最早在 2021 年联系你们的那批硅谷公司,用完 InteriorNet 之后,效果具体是什么样?
不能说,这些都是保密的。
我知道,我也不会说。那你自己怎么判断数据集到底有什么用?
因为后面他们的产品发布之后,我们能看得见。有一些产品就是用我们提供的合成数据做出来的,一眼就能看出来。
怎么看得出来?
这肯定的。只要做空间相关的东西,很多就是用我们的数据做的,所以很快就知道它能干什么了。
你怎么判断这件事的商业价值有多大?
我们首先判断的是,这个东西有没有社会价值,能不能提高社会生产率、提高大家对生活的满意度。
所谓商业价值,都是人琢磨出来的。有价值的东西一定有商业价值。很多东西有价值但没有商业价值,往往是因为过度竞争造成的。但我们做的很多事情,竞争并没有那么激烈,所以我们更关注这件事如何产生价值。
这可能也受英伟达创业理念的影响。英伟达原来做 CUDA,当时的想法就是,这东西有价值,做出来就是它自己的。
Jensen Huang 很早就做 CUDA,是因为他相信 GPU 是未来。
他也不得不相信,因为他没有别的选择。如果 CPU 是未来,英伟达这家公司就没了。
当时英特尔想把 GPU 做进 CPU,做成一个大芯片。如果那个方向才是未来,那 GPU 就不需要存在了。这甚至都不是鸡生蛋蛋生鸡的问题,因为如果他不相信 GPU,也不会有英伟达这家公司。
我觉得他更像是在夹缝里找到一个机会。当时那还是一个很小的机会,但黄仁勋很厉害的一点是,他永远会去创造未来、描绘未来,每年画一些饼,看有没有人跟随。
我觉得不是创造,更像是跟随风口。因为他做的那些东西,学术界都已经提出来了。学术界提到的东西你看不见,但商业公司提到之后你才看得见,所以你会觉得是他在创造未来。
实际上是学术界先创造出来,先发表论文或者取得突破,他才会开始做。比如机器人,学术界在 2022 年、2023 年比较热,2024 年、2025 年产业界才开始推动。
这也是我想问的。今年的 GTC 重点讲了物理 AI,为什么是今年?因为学术界在 2022 年、2023 年就已经热过了。
这个东西在学术界火了之后,大家觉得不错,才会到产业界去推动。产业界一推动,才会联系媒体到处宣传,大家才会进入公众视野。
如果你不看论文,只看到公众视野里的东西,那些都已经落后 2、3 年,甚至 3、4 年以上了。
我之前读英伟达相关的书时,看到一个很有意思的细节。好像是 Hinton 当时带着学生做实验,写信给黄仁勋,想要几块芯片,但英伟达拒绝了。
那可能是一二十年前的事。当时他也没有识别到未来 AI 领域的趋势,或者至少当时不愿意支持。
我估计是这样。包括我们自己做商业决策,我也是学他的做法:至少等学术界出现一些突破,再来做。连学者都没搞定的事情,你自己就不要瞎折腾。
今年我们能够看到群核在机器人狂潮中扮演非常重要的角色,因为你们是具身智能公司非常重要的数据提供商。地下的数据宝矿终于让大家看到了价值。
这件事是你们从 2025 年开始重点强调的,还是更早?
2018 年就在研究,2023 年大概就知道它能做什么了。
这 3 个场景是 2023 年就选定的吗?电商、机器人,还有工业 4.0。
对。当时还不叫机器人,更多是设备智能化,类似扫地机器人。我们认为传统设备的智能化是大势所趋,但到底是人形还是其他形状,当时还不确定。更准确地说,可以叫设备智能化。
但坦率讲,如果是以前传统扫地机这样的设备,和今天具身智能所面对的市场天花板相比,肯定还是后者更高。
肯定。但扫地机只是这个大赛道里的一个细分,不能否定它。它其实是机器人普及到千家万户的一个很好案例。
你们当时是想给所有类型的机器人公司提供服务吗?
对,我们想给所有类型的机器人公司提供服务,但当时也在摸索。那个年代会训练大模型的机器人公司非常少,包括现在真正能训练的也很少。
所以你们要开源模型,把难度降低?
对,不然很难做。
除了场景清晰了,还有哪些方面清晰了?
技术方向也相对清晰了。
技术方向是指,你们基于 Transformer 架构,还是目前用的是 VLM 架构的 Spatial LM?怎么确定用哪个框架?
做实验,不断做实验,看哪个效果好。
所以 VLM 目前是最好的?
目前这个阶段是。
但最后一定会通往 VLA,对吧?
VLA 更多是做行动,比如抓取。现在这些模型都还不完美,仍然有提升空间。下一阶段会出现什么,谁都无法预测,我们也在研究。
你怎么确定空间智能这件事会通向哪个方向?
我们是这么考虑的:首先,大语言模型开启了一扇新的大门。并不是说我们一定要去做 ChatGPT 之类的东西,而是它让我们看到,数据越多,模型就越智能。
在大语言模型上,我们也看到了 Transformer 这样的框架。数据越多,模型越智能。
但我们在中国做这件事,有一个天然问题,就是算力受到限制。所以我们内部没有去做大语言模型,也没有去做图像大模型、3D 大模型,而是把重心转向数据没有那么受限制、但数据稀缺、算力要求也没有那么夸张的赛道。
物理 AI 是我们觉得有机会的方向,因为它的数据更难获取,算力要求反而没有那么夸张,所以我们当时战略上调整到了这个方向。
物理 AI 能做什么?
它覆盖的范围非常广。首先我们确定一点:肯定不会重新二次创业,去做一个和原来完全没有关系的东西。我们希望大模型出来之后,不仅可以拓展新业务,也能够赋能老业务。
毕竟老业务是我们的现金奶牛。物理 AI 的好处是,我们老业务原来所有东西都需要物理参数、物理材质信息,过去都要人工处理。现在我们可能通过训练大模型,直接猜出照片里这些东西的物理参数,这对老业务的效率提升是非常巨大的。
这只是一个例子。它有很多能力不仅能够用在机器人上,也可以用在老业务上,这也是我们选择这个赛道的原因。
选了新赛道之后,原来的创新部队足以 cover 这件事吗?还是需要大量新人才加入?
需要大量新人才。其实 2022 年、2023 年挺难,招聘并不容易,虽然也能招到一些人,但今年确实好招了。
今年 C9 院校的简历数量大概比去年增长了 9 倍。
这要感谢“六小龙”的抬头吗?
对。
海归简历呢?
是去年的 20 倍。
但这其实是你意料之外的。“六小龙”这个事情,怎么可能意料到?
对,这怎么意料?我也是看媒体才知道。
2025 年之前,你们知道自己是“六小龙”吗?
不知道。2025 年之前,连这个名字都没听过。
真的吗?
真的。
开心吗?
怎么说呢,又开心又紧张。你也不知道后面会遇到什么事情。
我们公司整体文化还是比较务实的,也怕被捧杀。还是希望名气和实力处在同一个水平线上。名气拉得太高,容易被捧杀,也会有点惶恐,所以我们还是尽量保持低调。
现在大家都说空间智能是通往物理 AI 的关键。2025 年是物理 AI 第一次进入大众视野。你觉得接下来物理 AI 的热潮会延续到 2026 年吗?
我相信会。语言模型的发展相对成熟了,但物理 AI 还缺数据,仍然处在发展过程中,有点像几年前的语言模型。
数据肯定是缺的,算法、硬件、算力也都有改进空间,所以我觉得机会还是很大。
为什么 Jensen Huang 在 GTC 上也那么强调物理 AI?
很大因素是,现在物理 AI 相当于大语言模型 2.0 的阶段。
它很多东西要跑在设备上,算力不像云端大语言模型那样,可以把几千、上万个 GPU 连在一起。机器人端侧的 GPU 完全不够用,所以数据问题、算法问题,大家都在研究,这就是机会。
你刚才讲到,因为端侧算力有限,你们做了一个空间语言大模型 Spatial LM。它的底座用的是通义,对吗?
我们训练了两个版本,一个是通义的,一个是 Llama 的,这两个版本都有。
你们还用了 Llama,这个我之前不知道。
对,通义和 Llama 都训练了。
昨天我和你们的首席科学家周老师聊,他提到一个关键点:因为端侧算力有限,所以跑不了太大的模型,DeepSeek 的尺寸太大。
年初我让他们用 DeepSeek 去训练,做了半天发现,底模太大,带不起来。它最小的模型也有好几十 B,给机器人用太大了。
但我希望 DeepSeek 能发一些小一点的模型,我也跟梁文锋说过。
他怎么回答你?
我觉得他们不做参数小一点的模型,可能是因为意义不是特别大。他们肩负的任务更多是突破前沿、做到最高级别。小模型更多是做生态。
周老师提到,在参数比较小的规模里,通义跑得最好、能力最强。
对。这也呼应了端侧算力有限,所以选择模型时要有自己的考量。
那 Llama 呢?
Llama 的表现也最好。它在海外生态比较好。我们生成的数据要让其他模型理解,海外可能用 Llama 比较多,那就在 Llama 上训练,再用 Llama 去推理,效果会好一些。
刚才聊到李飞飞的论文,她把空间智能分成几个维度。你们好像也把空间智能分成了 4 个维度。
李飞飞分成 3 个:空间理解、空间推理和空间行为,也就是 VLA。我们增加了一个空间生成,因为我看其他论文里也有空间生成。
昨天在 Tech Day 也看到,你们现在这 4 个方向都有对应产品,但 VLA 还没有。
对,VLA 还没有。
为什么?
因为 VLA 和硬件绑定比较大。我暂时还没做硬件,目前 VLA 还没有办法跨硬件使用。
比如一台机器狗的 VLA,给一个人形机器人用不了,甚至不同的人形机器人也不能运行同一个 VLA。那我训练它干什么,给谁用?自己也不用。
9. 世界模型路径开始分化
现在全球顶尖玩家好像都在做空间智能,或者称为世界模型,对吧?大家的方法有什么不同?
我们先从 Google DeepMind 发布的 Genie 3 说起。你们和 Genie 3 的本质区别是什么?
按我的理解,他们大部分是基于视频训练,从视频里学习。我们是从 3D 方式切入,结合 3D 和视频模型。
Google 的 Gemini 等模型,更多是先从视频切入,可能也会用 3D 做一些约束,方式不太一样。但我们的模型大小肯定没办法和他们比,我们只是做视频大模型的一些补充。
Meta 有一个叫 V-JEPA 2 的世界模型,应该也是基于视频。
那个我没有认真研究。
你们是基于 3D 生成的,对吗?
这些数据其实就是过去不断做业务积累下来的。
后来有用其他方式扩充数据集吗?
我们正在研究。内部有其他立项,想通过一些手段收集更多数据,扩充存量数据,这件事一直在做。
你们的数据集目前主要聚焦在室内场景?
目前是在室内,但不光是家庭,也有办公室、工厂。
那英伟达的 Cosmos World Foundation Models 呢?
我们也在和英伟达合作。英伟达更多是提供一个引擎,卖更多显卡;我们可以提供数据给需要的企业,让他们训练自己的模型。
英伟达的 Cosmos 好像说有 9 千万亿个 token 的训练数据,来自 2,000 万小时的真实世界人类互动。我们应该怎么理解这些参数?
首先,Cosmos 做得非常不错,肯定是非常好的。英伟达也是为了推动行业发展,更多是给其他公司提供基础设施或者 Demo。
像它这样的参数规模,目前群核肯定训不了吧?
要训也能训,但花这么大成本和代价去做,你的价值点在哪里,也得研究。
我们毕竟规模小很多,GPU 也没那么多,所以做这些事情时,都得评估是不是一定要由我们来做。
你们的训练方式和英伟达有什么区别?
本质上没有太大区别,只是模型没那么大,GPU 没那么多。
相比 Google DeepMind 主要用视频训练,英伟达其实和我们更接近。它也是通过实际场景的 3D 数字孪生数据积累来训练模型,只是参数量比群核大很多。
那李飞飞的 World Labs 呢?前几天他们发布了一个 Demo,你看了吗?
看了。李飞飞做的更接近实验室里的学术成果,不像英伟达的那么落地。
我不太懂技术,但我看了 World Labs 的 Demo,感觉像国外先进游戏的画面。
但昨天在你们 Tech Day 看了一个很有意思的 Demo:你们选了一个即将拆除的照相馆,那是一个真实场景。简单来说,模型上传一张图片,就能围绕这张图片自动生成一个房间。
和 World Labs 比起来,World Labs 很像一个游戏世界,非常虚拟,但你们生成的空间很真实。
对。World Labs 是一家很伟大的、偏学术的公司。我个人猜测,李飞飞成立这家公司,也可能是因为在学校里获取 GPU、筹集经费太难,所以需要成立一家公司来做这些事情。
它的成果在我看来更多是学术成果,我暂时没看出什么商业化前景,可能是我认知有限。
但我们做东西不是把自己当成学术机构。我们更希望做一些有技术前瞻性,同时又能够服务现实生活的东西,更贴近生活,也更贴近商业化。
那腾讯的混元 3D 模型呢?他们主要做室外,而且也是你说的游戏风格。
我估计他们主要用在游戏上,可能会有游戏公司需要。
腾讯的室外数据从哪里来?
他们本身做游戏,游戏里的数据就是游戏数据。你看起来那个风格也很像游戏。
所以在世界大厂当中,真正用空间采集的 3D 孪生数据来训练模型的,目前只有英伟达吗?
据我所知,各大厂都在做,只是数据占比怎么样不清楚。英伟达其实做很多模型,这只是其中一个。
Google、Meta 之类的公司肯定也在探索。空间一致性是所有公司都会关心的,只是它们最终怎么确定技术方向,我不知道。但它们肯定都会在一定程度上引入 3D 数据来做约束。
现在你们做的事情,看起来是各家大厂都非常重视的事情。
也没有。
物理 AI 难道不重要吗?
我觉得目前各大厂还是以探索为主,可能只是很小的团队在探索,不像大语言模型那样倾全公司之力去做。
所以你们不在红海,而是在蓝海。
红海我经历过,因为被巨头打过。我们知道被打得逃都来不及了,不能主动去找一个巨头聚集的市场,那不是找死吗?
这次的蓝海也不算是特地挑的,就是在视野范围内,找一个巨头做起来没什么太大意义、又适合自己做的东西。
比如图像生成模型我们也能做,但巨头肯定会做,所以我们就不做。
什么时候开始加大资源,正式立项做群核自己的空间语言大模型?
大概是 2023 年或者 2024 年,时间也没多长。
具体训练的过程中,比你们想象的简单还是难?
实际上,在大语言模型出来之前,我们就尝试做这个东西了。但那时候想让模型输出脚本非常困难,AI 能不能输出正确脚本,这件事我们一直没有解决,所以一直不知道怎么做。
后来有人开源了 Llama,通义也开源之后,我们才有条件做。否则为了训练这么一个小东西,还要先训练一个大语言模型,那不是疯了吗?
就像你会炒菜,但厨具太贵了。
对。也正因为这样,开源才好。你永远想不到别人下一步会怎么使用你的东西。
我们也是开源的受益者,所以应该积极拥抱开源。
这个模型的数据集从 2021 年就开始准备了,只是 2021 年那一波没有试成功。在没有别人开源大语言模型之前,我们自己训练的模型输出脚本总是不对。
现在有 3 个概念:黄仁勋今年 GTC 强调的物理 AI,李飞飞去年强调的空间智能,还有最早由 Yann LeCun 提出的世界模型。这 3 个概念有什么关联和差异?
我个人觉得,这 3 个概念的方向很接近,当然各自强调的点也有一些区别。
黄仁勋可能更强调和物理世界的连接;李飞飞的空间智能,更多是在数字世界里理解空间;LeCun 的世界模型,我感觉更侧重视频模型,要符合物理世界的客观规律。
这 3 个概念的侧重点不太一样,但实际上都指向同一个问题:现在的大模型有幻觉,或者它对世界的理解和我们完全不一样,对空间的理解也不一样。所以我们需要新的模型来解决这个问题。
你们的空间智能和李飞飞的空间智能有什么区别?
区别肯定有。我们更多是在已有业务的基础上发展,聚焦以真实世界为基础的空间智能。
我看李飞飞很多 Demo,有些更像游戏世界。游戏世界、完全动漫化的世界,我们暂时没有计划做,所以区别还是挺大的。
我对空间智能有一个自己的理解:它是帮助 AI 或者智能体理解物理世界规律的能力。
为什么空间智能是 AI 迈向物理世界的必经之路?
现在所有机器人,它的大脑肯定是数字世界里的,因为它就是用数字世界的数据来计算的。至少以我们目前的技术,没办法离开电脑。
不管做什么样的机器人,最终都得把所有数据集中到数字世界里运算,算好之后,再以某种方式返回到物理世界。所以数字世界是必不可少的。
但在数字世界里运算时,物理世界的规律不会自动出现在数字世界里。那怎么让它出现?只有当计算结果和你推测的世界相吻合,机器人才能真正干活。这就是空间智能要解决的问题。
你们是怎么构建空间智能的?
我们实际上是先有了物理世界的约束,然后在这个基础上产生大量带有物理世界参数和约束的数据,再基于这些数据进行训练。
怎么理解物理世界的约束?
物理世界的约束,就是这些东西必须出现在 3D 模型里。简单理解就是这样。
训练的时候,你是可以知道这些参数的。
你们最早的 InteriorNet 数据集,其实就是在给房地产行业做家装渲染的过程中自然形成的原始数据集。
我们做全屋定制、做工业 4.0 的时候,形成了一个数据集,然后和这些作者商量,购买了一些版权。
这些数据你们自己也做了大量清理工作。你刚才讲的物理世界约束,指的是你们在服务客户的过程中,会做很多参数界定?
对。我们做工业 4.0 的时候,要确保生产出来的所有东西在真实世界里可以使用。所以我们本身就做了一个仿真系统,去模拟生产出来之后的样子,确保它在物理世界里不会出现问题。
因此,这套系统本身就存在了。
你可以理解为,这两个步骤原来是反过来的:一开始我们先有数字世界里的东西,给它赋予各种参数和系数,然后把它生产到物理世界里,再确保生产出来的东西,其参数和系数与预期一致。
我们当时开源 InteriorNet 的时候就在想,这件事有没有可能反过来做?我看到一个物理世界里的东西,能不能通过 AI 把它推回数字世界?
就是把它反过来。
对。当然我们一开始不知道怎么做,所以开源出来,让大家去实验。后来陆陆续续有学者发现,可以反过来做。
我们刚才讲到,2021 年有公司进一步找到你们。既然 InteriorNet 本来就是开源的,他们为什么还要找你?
因为数据量还不够。他们一开始拿这个数据训练了一阵子,发现效果挺好,但后来需要更多数据。
当时你们有更多数据吗?
因为这涉及版权,我们还是得去找作者购买。有些客户还有特殊要求,比如某些场景需要加强,需要更多方案。这时候费用就由需求方来承担。
所以当时我理解,InteriorNet 是你们的一个 side project。
也不算边缘项目,是科研团队在做的、顺手可以商业化的一个项目。
当时其实没有想过要利用这个商机赚更多钱?
没有。那个年代根本没想过怎么赚钱。今天可能有一些商业化的影子,但当时没有,我们只是单纯好奇。
工业 4.0 是把数字世界的东西搬回物理世界。那当你看到一个物理世界里的东西,能不能用 AI 把它推成数字世界里的东西?这件事很有意思。
我们当时想,这东西做出来肯定可以发很多论文,然后就做了。
到 2021 年,初步验证了反过来是可行的,很多团队会拿来训练 AI、训练机器人。
是的。
到了 2023 年,这个雏形更加清晰了。
对。它可以反过来,并不代表它可以获得所有信息。
2021 年的时候没有真正意义上的大模型,大家只是反过来做一些比较粗浅的工作。那时候其实也有大模型,但还没有跑通,也没有被世界看见。
那时大家还没有认识到 scaling law。2023 年有了之后,模型就可以训练得更智能,泛化性更强,理解力更强,这些都是原来没想到的。
现在空间智能是群核最大的战略。它由哪些要素组成?
10. 工具数据模型形成飞轮
空间智能包括 4 个部分:空间理解、空间推理、空间生成和空间行为。空间认知是空间理解的一部分。
从公司战略上来说,工具、数据和大模型缺一不可,它们是一个飞轮。光有大模型还不够,要由工具产生数据,再由数据训练大模型,然后大模型成为空间智能输出的核心。
这个体系能够循环起来,最终才能产生空间智能。
工具用来产生数据,这怎么理解?
训练大模型的数据不是凭空生成的,也没办法直接从互联网上扒出来,总得有一些方式获取这些数据。
机器人的数据大概可以分为两种:一种是仿真合成的,一种是真实世界采集的。真实世界采集很贵,所以据我所知,做机器人大脑的公司主要还是使用合成仿真数据。
那你们做了哪些工具,用来生产训练 AI 所需的数据?
你说的这两种方式都需要工具。不管是真实世界采集,还是用物理设备采集,都需要工具。我们做的纯软件产品,比如酷家乐,也是工具。
这两者都属于我们布局里的工具。
但真实世界里的东西,怎么进入数字世界,变成数据?
由工具来完成。
你们现在有哪些产品是生产数据的工具?
比如酷家乐,还有棚拍,这类产品都是工具。
棚拍是你们推出的新产品,对吗?
对。它是给实拍产品做影棚的。
比如电商商品要卖到世界各地,每个国家都有自己的影棚风格。像我们今天这个影棚,后面放的是水墨画风格。如果你要去非洲,就不可能使用这个背景。你不用更换真实场景,只要通过工具换一个背景,人物或者商品本身不变,整个环境就发生了变化。
原来通过贴图可以改变图片,但场景改不了。如果要做视频,这种空间智能工具就能发挥作用。
昨天现场很多人鼓掌的一个 Demo,就是棚拍一个商品,然后模拟黄昏的光线,马上出现了非常逼真的黄昏光线。
如果现在要一个平面广告拍摄的追光,也能出现一个追光,而且都非常真实。
是的。棚拍主要应用于电商行业,但实际上能用在很多行业。目前电商行业的反馈比较好。
我昨天也和你们的首席科学家周老师聊了一个很有意思的点。我问他,你们现在肯定有存量数据集,所以群核有先发优势。但未来如果大家都意识到物理 AI 的重要性,也会重视数据,纷纷开始采集物理世界的数据或者生成数据,那你们的优势是不是有限?
所以我刚才提到,我们公司是由工具、数据和模型组成的。
你要有高效的工具去获取数据,不管是给人用的还是自动化使用的,都得足够高效。有了更多数据之后,可以训练大模型,再用大模型让工具更加高效,这是一个循环。
周老师还提到,群核其实希望尽快摆脱对存量数据的依赖。有很多种方式,比如让 AI 或智能体自己探索,探索的过程中就会自己产生数据。这样数据集会更庞大,也可能有意想不到的收获。
是的,我们也在往这个方向努力。所以我们在做 Spatial Gen,让它自己能够生成数据。
Spatial Gen 是一个空间生成模型,对不对?
对。
昨天看到的 Demo 是上传一张图片,它就能自动生成一个和图片相关的空间。
对。
它其实也是一个生成数据的工具。
是的,没错。
那现在 Spatial Gen 能被谁用起来?
我们内部主要用 Spatial Gen 给电商生成场景。比如后面要换成夏威夷风格,如果通过 3D 建模来做会很累,但一张夏威夷的图片可能就能把这个场景建出来。
目前主要给电商行业使用,但我相信它的场景会非常广泛,所以我们开源了。大家都可以上传一张图片,自动更换背景。
这和现在很多视频生成公司的业务已经有一点重合了,对吧?
实际上我们和视频生成公司是互补关系。我们的模型可以保证空间一致性。
现在视频生成公司有时候换一个角度,房间都变了,它不符合物理规律。我们的模型能够保证房间是稳定的。
我觉得这不叫互补,而是你们能做到一些他们暂时还做不到的事情。
是的。这意味着,在一些应用场景里,我们有可能做他们暂时无法做的商业化。
但他们的东西我们也没有去做。比如国内一些首尾帧视频生成的能力,我们也会调用。
如果不要求空间一致性很高,比如要做天马行空的内容,现在的视频模型可能更好。你做一个动漫故事,不需要考虑物理空间是否真实,只要把故事讲清楚就行,而且效率更高、算力成本更低。
你是在暗示,和这些视频生成公司之间没有直接竞争关系?
我觉得未来应该不是竞争关系,而是合作关系。
我们也会调用他们的模型,很多地方没必要自己重复造轮子。内部电商业务线把 Spatial Gen 作为其中一部分,但外部有好的模型,比如可灵、混元,我们也会调用。
反正是开放的,适合某个场景就用哪个。每家的数据不一样,训练出来的能力也不一样。让我们去做可灵这类产品的大模型也不现实,所以互相调用就好。
3D 空间对于真实世界的价值到底是什么?
真实世界是不可计算的。说白了,在软件或者数字世界里,没办法直接处理真实世界。
你把真实世界拍成视频,也没有办法准确地计算它。只有把它变成虚拟世界里的东西,才有办法处理、优化它。
我们探索的很多前沿技术,本质上都是数字技术。但要把数字技术落到物理空间,需要一个桥梁。也许那个镜像世界就是桥梁。
你要先模拟出一个数字镜像世界,然后才能把两者嫁接起来。它得进入数字世界,才能被计算。
你花了多久去了解机器人行业对于数据和空间智能的需求?
我基本上每周都在和这些潜在需求方交流。不同公司的需求不一样,进展也不一样。
机器人行业原来使用仿真数据时,有一个 sim-to-real gap。
因为仿真数据是纯生成的数字数据,用这种数据训练时有效,但放到真实世界里就会出问题,中间存在一个 gap,叫 sim-to-real gap。
对。这个 gap 是训练方法的问题,也可以叫泛化性问题。Sim-to-real 一定会有 gap。如果没有体现出泛化性,换一个环境就会产生 gap。
所以我们很强调泛化性。训练 sim-to-real 的时候,还是要混入一些真实数据,否则一定会有 gap。
数字数据当然完全可以使用。你可以让底模或者整个模型的数据量变得更大,但肯定不能只使用一种来源的数据,必须用多种来源的数据一起训练,机器人才能有泛化性。
为什么有些人在虚拟世界里训练出来的模型,在现实世界里没法用?
因为它的数据集里根本没有现实世界的数据。
听说你们好像和几乎所有具身智能行业的“大脑”公司都有合作。他们会反馈使用你们数据的真实效果吗?
有的公司会反馈,有的不会。
那怎么判断你们的数据使用效果?
主要看他会不会持续采购更多数据。我们还是需要得到合作伙伴的真实反馈,这样才能更好地优化体系。
现在复购频率高吗?
还可以。
现在这个行业大家也都在摸索。有时候合作伙伴还会问我:“你知道怎么训练更好吗?”大家都在摸索,但我觉得这是好事,反而是一个机会。
刚才我们聊到空间语言大模型 Spatial LM、空间生成大模型 Spatial Gen,还有你们的 SpatialVerse。SpatialVerse 是一个平台,会为具身智能业务提供服务,对吗?
对。我们对外提供合成数据服务的业务,就放在 SpatialVerse 这条业务线下。
如果用一句话解释,SpatialVerse 是做什么的?
为空间智能领域提供合成数据。
SpatialVerse 里面也会包含 Spatial Gen 生成的数据?
对。Spatial Gen 是一个空间生成模型。
这一块收入和利润好吗?
说实话,这个行业里,做机器人的公司收入都比较一般。能够从这些公司身上获得一些收入,覆盖我们的投入,已经很好了。
SpatialVerse 的团队原本是服务内部模型团队的。因为这几年需求越来越多,我们把它抽出来作为独立业务。
我们投入了很多资源和研发,建设了数据合成基础设施,只给自己用太浪费了,所以很多能力也开源出来,剩下的则对外提供服务。
据我了解,SpatialVerse 不只是服务自身业务,也有 AIGC、VR、AR 等客户,对吗?
对,服务各种类型的公司。AIGC 这一类,比如快手可灵、Pika 这样的公司,都有可能使用 SpatialVerse 的服务。
Google 和我们合作之后,在它发布的论文里也感谢了 SpatialVerse 的很多合作。它公开了,我们就可以说;其他没有公开的,签了 NDA,就不能说。
VR、AR 也可以理解为整个行业都有机会和你们合作?
是的。但这 3 块业务已经够大了。
其实客户的绝对数量并不多。我们老业务服务了将近 5 万个客户,现在任何一个行业有 1,000 个客户都不错,所以我们还希望它能更通用一些。
刚才讲到你们最主要的几大产品:空间语言大模型 Spatial LM、空间生成大模型 Spatial Gen,以及用来训练和生成数据的 SpatialVerse。这 3 个构成了大的空间智能战略吗?还有别的吗?
Spatial LM、Spatial Gen 相当于这个品牌下面的模块。SpatialVerse 和酷家乐是平行的业务线。
你会花更多时间在哪里?
总体时间可能还是酷家乐更多,SpatialVerse 花的时间也很多,因为酷家乐使用的大模型,也需要 SpatialVerse 团队提供合成数据来训练。
把这些空间大模型开源时,有做过什么心理斗争吗?
以前还是有很多斗争的。辛辛苦苦做出来的东西,为什么要开源,免费给大家使用?
DeepSeek 成功之后,给了大家一个很好的示范。
你们把 Spatial LM 开源之后,很快登顶 Hugging Face 第 3 名,仅次于通义和 DeepSeek。现在应该也有很多人在使用这个大模型。开源之后,有什么效果或者意想不到的收获吗?
直接的商业收益肯定暂时没有。
群核还缺人吗?
缺,还缺,还会一直招聘。
主要是招聘高级算法人才吗?
算法人才,高级不高级倒无所谓。关键是聪明、学习能力强、动手能力强。
怎么确定 AI 时代群核要抓住的是什么?我们聊了很多,但都是你们目前已经有的东西。
11. 人才决定下一阶段增长
在我脑海里,最关键的还是人才。人才是所有一切的基础。其次还是要把战略体系梳理清楚。
AI 时代到来之后,know-how 都被打破了。以后还需要对行业有经验的人吗?
我觉得会严重两极分化。
举个例子,招大客户代表,原来需要有行业经验的人,而且经验越丰富越好。现在这些非常有经验的人依然很吃香。
但有一些人,虽然有经验,却不是特别精通,而这些经验用 DeepSeek 搜一下就能找到,这部分影响会比较大。尾部的人比较容易被替代,中上层还是没问题。
这也不是这些人的错,只不过接下来招聘新人时,要么招聪明、动手能力强的人,要么招在这个行业里真正有经验的人。处于中间、模模糊糊状态的人,会比较尴尬。
你们前几年就想做这些事情,但没做出来,是因为人才密度不够吗?少数几个专家要做更重要的事情,专家不够分?
对,专家不够分,只能往后搁。
今年做出来,是因为人才补充上来了?
是的,这些都是新人做的。
今年对你们来说真的是至关重要的一年。
肯定是。今年公司知名度提升之后,很多业务同事跟我说:“你赶紧多跑跑客户,多收点钱。”
但我想了很长时间,觉得自己最多的时间应该投入在招聘上。这几年让我苦恼最多的就是人才匮乏,有很多想法做不出来。
前几年让我非常苦恼的,是房地产大趋势的影响。大家会觉得,这家公司行不行?你给我的工资我都不太敢要,因为看不到长远发展,也不性感。大部分人会担心这些事情,所以很多想做的事被无限延后。
所以 2025 年是你刚开始大展身手的一年?
我经历过好几个周期。我们公司火过好几次,但每次最终留下来的,都是人创造的。
所以目前来说,人才工作在我这里肯定是第一优先级。
能不能详细描述一下你们火过哪几次,留下了什么?
我记得最早一次是酷家乐推出之后,2013 年底、2014 年初,在微博上火了一波,每天服务器都挂了。
因为几乎整个房地产产业都开始使用你们的产品。
对,那是第一次。后来 2017 年、2018 年做工业 4.0 的时候也火过一波,2021 年 SaaS 特别火的时候,也火过一波。
这些都和酷家乐有关吗?
酷家乐后来改成了 SaaS 商业模式。反正就是起起落落,有时候火了之后,天天要见客户。
但最终我觉得,公司能够形成长久竞争力,首先是人才,其次是产品和技术。很多客户之所以找你,是冲着产品和技术来,而不是冲着你的名气,也不是因为创始人和他吃顿饭,就会长期合作。
早期有人会说这是中国特色,但时间长了我发现,客户花钱,最终要的还是最好的产品。人才是把产品做到最好的根基。
所以我创业这么多年,现在看清楚了这件事:有风口来,就抓紧招人。
第一次见候选人的时候,你会重点看哪些方面?
我不看他原来有什么经历。我会扔一篇论文给他,让他读一读,然后给我讲一讲。讲完之后,如果我觉得他理解得差不多,就给他出一道题现场实现。
这个题目不是 1 个小时能做出来的。有的候选人从早上 9 点过来,一直做到晚上 12 点,但我不限制时间。
我出的题目都是开放式的。好的候选人可以把结果做得非常好,差的可能什么都做不出来。
解你的题目,时间最长的候选人用了多久?
做到凌晨一两点。我也陪着他。
这种态度会先打动你,然后决定给他加分吗?
可以加分。
刚才聊到的这些围绕空间智能衍生出来的新产品,是不是用 AI 把群核重新做一遍的过程?
我觉得不是把群核重新做一遍,而是一个战略升级的过程。你可以理解成从信息时代进入智能时代。
在 AI 智能时代,群核接下来锁定的主轴,就是做好 3D 空间的理解、计算和应用。
你会像当年最初创办群核时那样,手里拿着一项技术,拼命寻找利润最高的行业或场景吗?
我们一直的方法论就是这个:拿着锤子找钉子。
所以你们是一家横向不断寻找新领域的公司。作为创始人,你会怎么学习一个新领域?
看资料、看视频、看论文,另外就是找相关从业者交流学习。
所有信息都有可能是假的,所有认知都有可能是错的。只有通过实验,才有可能把它变成正确的。而且过去所有正确的经验,今天也有可能变成错误的。
你觉得群核可能因为什么获得巨大的成功?
当我们的技术能够用在所有行业,又正好遇到一两个超级爆发的行业,公司就会上一个大的台阶。
接下来哪个业务最有可能碰到一个火热行业的大爆发?
空间智能用在机器人行业,目前肯定希望很大。但如果市场发生变化,就及时调整。
不过我相信这项技术是通用的。
你会学习英伟达,像教主一样广结善缘、到处布局吗?
我早些年其实不是特别喜欢,但经历了这么多波,看到英伟达的成功之后,我也在改变自己的观念。
我觉得教主的做法可能才是对的,至少要广结善缘。对所有人都很友好,经常倾听各行业的声音,了解大家的需求,不断挖掘新的机会点和增长点。
但它不是在每个新赛道都另起一摊业务,它用的还是 GPU,只是在思考如何用最核心的技术更好地服务这个行业。所以我觉得这个方法论值得学习。
群核有可能因为什么遭遇巨大的失败?
2021 年、2022 年挺危险。2021 年上半年觉得一切都超预期,疯狂招聘,增长也很快,然后突然一下子发生了变化。
这个变化是疫情,还是房地产?
很多事情叠加在一起:房地产、疫情、资本市场,所有事情全部堆起来。
2021 年初为什么会觉得一切都很好?
因为我所有的业务都很好。
但 2021 年疫情已经开始了。
对,但当时可能全世界只有中国能够正常经营,经济进入一种非常亢奋的状态,业务异常好。到了年底就开始急转弯。
我现在想,当时如果再浪一点,估计就挂了。所以后来我们定了一个规则:公司尽快实现盈亏平衡。以后再烧钱,也不想亏钱,底线就是盈亏平衡。于是我们很快开始朝这个方向调整。
今天复盘,会觉得当时有什么决策失误吗?
肯定有。我觉得人的错误都发生在一帆风顺的时候,尤其是在最高点时,容易过于乐观,做出错误决策。
我们一度人最多时接近 3,000 人。后来我发现,所有公司都会遇到这种情况,人生也会起起落落。
但任何时候都要保留足够余量,不要把弹药打光。我有很多朋友的公司就是在那一刻太激进,把弹药打光了,进入万劫不复的状态,没熬过去。
那次经历之后,我觉得很危险。所以后来探索时不要太激进。即使现在我非常看好具身智能,我也不会乱烧钱。
刚才问群核有没有可能遭遇巨大失败,你想说的是,这个巨大的失败曾经已经非常接近你们了。
对。
你对自己的提醒就是,永远不要把弹药打光。
对。在好的时候,一定要反复提醒自己不要太飘。
包括现在状态很好,但投资人会说:“能不能增速快一点,烧点钱?”我还是稳健增长,不烧钱。
每一个岗位进来,我都要看一下,不放水,坚决不放水。
因为 2020 年业务需求量太大,招聘太多,我忙不过来,就把招聘下放了,后来后悔莫及。
你把不合适的人招进来,其实是我们的过错。进来的人也是一心想把业务做好,抱着和公司一起发展的心态。过了两三年再告诉他说不合适,这不是很伤人吗?
公司也很受伤,业务也没做好。对于因为招聘错误而进来的人来说也很受伤:我在这里花了两三年,你才告诉我不合适,这不是很荒唐吗?
最应该避免的,就是业务发展好的时候飘了,然后乱招聘。那是最容易出问题的时候。
最后回答几个轻松的问题。你的 MBTI 是什么?
INTJ。
你最欣赏的人是谁?
年轻的时候比较欣赏比尔·盖茨,现在觉得 Jensen Huang 比较厉害。
我年轻时学计算机,觉得比尔·盖茨基本改变了整个计算机行业。越到后来,我越觉得他的企业经营方式值得学习。
包括他用人。比如当年在 CUDA 团队里,他可能让一个斯坦福应届毕业生去负责一个项目。在中国很多公司里很难想象,你会让一个应届毕业生做一个新业务的负责人吗?
当时他们团队里可能三分之一甚至一半的人都是斯坦福毕业的,人才密度非常高。
今天群核能做到让一个应届毕业生做项目 Leader 吗?
我在努力让毕业没几年的人去做比较重要项目的 Leader,现在已经开始尝试了。
所以你意识到,让应届生做项目 Leader 其实很厉害。
对。我自己做企业一段时间之后,才意识到这一点很厉害。
让应届生做项目 Leader,背后体现的是企业的什么能力?
是不拘一格用人。你想,项目负责人公司里有那么多老员工,有那么多经验丰富的人,大家都在等待这个机会,你却把机会给一个应届生,这对企业管理来说需要很大的魄力。
另外,企业还要有第一性原理。比如 GPU 会替代 CPU,这些底层判断很多年都没有变,但它应用的行业一直在变化。
这个方法论越到后来越值得学习。我一开始认可他的第一性原理,但对这种做法能不能把企业做大还有些半信半疑。看到他一路发展起来之后,我觉得这个方法、这种用人体系确实很好。
今天其实聊了很多,但你给人的印象还是一个比较 nice、比较体面的人。我很想知道,你有没有更深层次的人格特质?
这个我还没想过。我对自己比较 tough。
我们以前的座右铭是:Life is tough, but we are tougher.
对自己很严格的人,因为预期总是很高,甚至几乎难以达成。如果总是达不到自己的期待,继续向内施加作用力,会伤害自己吗?
倒不至于伤害自己,就是会觉得比较失落。
但我们也发现,这种性格的缺陷是容易死磕。一件事没做好,就非要死磕。但实际上这有问题,和顺势而为有些违背。
所以我也经常和合伙人说,如果发现我在死磕,一定要提醒我。不是努力就一定能做好,有可能你只是在一件不正确的事情上努力。
历史上有哪些事情证明你是在死磕?
原来做房地产相关业务时,我觉得那可能是一个巨大的业务线,应该把它做好。
后来这个业务线并不是因为我们做得不好,而是国家政策调整了。可我当时还在想,这个业务也就这么点收入,不管怎么调整总是能做大,于是继续死磕、继续努力,花很多时间研究。
后来才发现,是把精力花在了不对的事情上,没必要死磕。天天在 ROI 很低的事情上持续投入,意义没有那么大。
如果推荐一本书,你会推荐哪本?
前阵子看了《Breaking Twitter》。我很喜欢 Elon Musk,这本书从一个侧面写了他收购 Twitter 的过程,以及他是怎么操作的。
我觉得很有意思的是,很多世界顶级领导者自己写的自传,里面都是英明的决定,但从旁观者角度去看这个人,会更真实。
这是一个主观视角和客观视角的对照?
对。自己写回忆录,当然都是正确的决定、英明的选择,但过程中也有很多草台班子的行为。
所以我觉得不用害怕各种草台班子的行为。行动永远比不行动好,行动过程中总会把事情搞砸。即使世界上最厉害的领导者,也都有把事情搞砸的时候。
但无所谓,我们也尽量保持真实的一面。公司里做了很多错误决定,我也会说:“这是我做的,当时脑子抽风了,做了这个决定,现在正在改。”
所以 Elon Musk 的这本书给了你很大的共鸣:原来这么厉害的领袖,也会做很多经不起多方位审视的事情。
对。
这让你觉得自己并不孤独。
对。坚持第一性原理、能够快速行动的人,在过程中肯定难免犯错。
英伟达现在市值超过 4 万亿美元,你觉得群核值得多少亿?
应该有吧。
不少哦。那祝你们上市顺利。
谢谢。
好了,这期节目就是这样。欢迎前往 B 站、微博、小红书、视频号等平台观看这期节目的视频版,或者关注公众号也能找到相关的文字报道。欢迎在评论区留下你的分享。这里是漫谈 Light Star,我们一起记录时代的每一寸跃进。
I used to rule the world. Feel the fear in my enemy's eyes. Listen as the crowd would sing. Now the old king is dead. Long live the king. One minute I held the key. Next, the walls were closed on me.