聊聊2025 Google I/O与Gemini背后的灵魂人物
泓君YiwenKimi KongShaun WeiBruce Liu
- 谷歌一年打完翻身局:从2023年Bard答错詹姆斯韦伯望远镜问题、一夜蒸发超千亿美元市值,到2024年被OpenAI的4o抢风头,再到今年Gemini 2.5 Pro全面霸榜——本期呈现的判断是,模型、多模态、分发优势同时显现,"对于它而言应该是个顺风局了"。
- AI Mode只是"半革命":前DeepMind的Kimi Kong指出,谷歌手握90%以上搜索流量入口和最好的模型与搜索工具,做AI搜索"不是能力问题,是意愿问题"——但AI Mode与Gemini.google.com至今是两个分裂的产品、两个业务单位,能否深度整合流量入口才是关键变量。
- 商业模式的演化路径已可见:AI搜索单次成本远高于传统搜索(要过GPU、过上下文),但对冲手段包括订阅分层(含Ultra档)、对商家收"AI内排名费",以及"原来给你100个广告,现在给你三个、每个单价做得更高";GPU推理成本两年已降95%,还会指数级下降。
- 成本护城河是硬的:十年TPU布局免掉"Nvidia税"、业界最强内部Infra、软硬一体优化,使Gemini API价格可能只有OpenAI的1/5到1/10;参照DeepSeek论文披露约80%的溢价空间,谷歌有本钱把API打到接近成本价——"它的搜索已经足够养活它了"。
- 2.5登顶的技术叙事:网络数据如"化石燃料"般耗尽后,重心转向强化学习、让AI批判AI——如同AlphaGo的"第37手";组织上是Jeff Dean(预训练/基建)、Oriol Vinyals(强化对齐)、Noam Shazeer(NLP)"三足鼎立",加上Demis的整合管理与Sergey Brin回归带来的Founder Mode(部分团队一周60小时)。
- 创业公司警报再响:I/O一开"创业公司又要倒一批"——虚拟试衣类首当其冲;活路在垂直深度:"我优先级第一的事情有可能是Google的第30个重要的事情"。Agent创业者对模型"没有任何忠诚度",谁快、好、便宜用谁,按任务自建评测体系选型。
- 看多的最大保留项是产品基因:Shaun直言"Google的产品一直是它的弱项",现在的打法是一次发10到20个产品、哪个起飞就砸资源(NotebookLM是先例)——技术四层(TPU硬件、集群、数据、算法)全占,产品转化仍是待验证环节。
1. 两年低谷后的翻身仗:从Bard翻车到2.5霸榜
- 泓君的开场坐标系:2023年Bard回答詹姆斯韦伯望远镜问题出错,市值一夜蒸发超千亿美元;2024年I/O前一天被OpenAI的4o"狙击"抢走风头;2025年"破釜沉舟,打了一场漂亮的翻身之战",Gemini 2.5模型全面霸榜。
- Kimi Kong(CambioML联创、前DeepMind,曾主导谷歌首个用AI Agent优化广告投放的项目)印象最深的是横向广度与纵向深度的整合:从Gemini 2.5 Pro到Imagen、Veo,"给你提供了一个模型全家桶",纵向则一路铺到安卓XR可穿戴,展示的是"全面布局"的野心。
2. Veo 3的分水岭:加了声音,"从文字变成了电影"
- Shaun Wei(HeyRevia创始人、前谷歌语音助手)最震撼的是Veo 3:"我能感觉到它是从文字变成了电影"——Sora当年只出画面,还要靠ElevenLabs等后期配音,而Veo 3的"语音、背景、音效还有嘴型都能对得上",难度在于对上下文乃至物理世界的理解。
- 他给的时间标尺:"大家还记得当时是威尔史密斯吃面条,这才其实两年的时间,就已经变成一个可以做出动作电影的状态了。"另一个感慨:Gemini"终于实现了它(Google Assistant)十年前的愿景"——一个随时以文字、视频、多模态陪伴你的AI。
3. AI Mode实测:革自己的命,但第一回合输给了OpenAI
- Kimi在发布前灰度测试过AI Mode:查一架正在空中飞行、不知航班号的晚点航班,同题喂给OpenAI、AI Mode和Perplexity——只有OpenAI给出正确结果,另两家根本没搜出来。他指出AI Mode对上下文理解已大幅提升,但当时效果仍逊于OpenAI搜索。
- 定性判断不含糊:AI Mode"是在革自己的命",把谷歌最稳定的广告营收模式完全改变了;Pichai自己也说这是十年来搜索最大规模的变化。
4. Kimi的核心论断:谷歌"半革了自己的命",缺的是意愿不是能力
- 搜索"有可能真的是全世界最赚钱的生意"——Satya Nadella说过最后悔的就是微软没把搜索做成。Kimi判断谷歌有可能是所有科技公司里最有能力做好AI搜索的:"我永远不相信Google没有创新的能力……有可能真的是人才密度最大的一家公司。"
- 但现状是"半革命":AI Mode in Google.com和Gemini.google.com是两个产品;Gemini、DeepMind AI Lab和搜索在Google内部又是两个完全不同的业务单位。"这不是一个能力的问题,这是Google的意愿的问题,是它有多愿意深度革自己的命。"
- 能力面的推演:模型强、指令理解强之外,关键是工具调用——谷歌握有每年90%以上的搜索入口流量、世界最好的搜索引擎工具。此前OpenAI在AI搜索和工具调用上领先一段时间可以理解,"现在Google拥有最好的模型,也拥有最强的搜索引擎工具……对于它而言应该是个顺风局了",只看愿不愿意做产品的深度整合。
5. 试衣demo背后:一键闭环购物与SEO的地震
- 泓君复述现场:微胖女生上传照片虚拟试衣,效果保留了真实身材(现场欢呼),比价、打折、Google Pay一键下单——"以前每一个网站注册、输密码、选尺码的漫长流程,现在一键就下单了"。本质上这就是一个Agent。
- Shaun拆出四个冲击:AI搜索成本极高("它是要过GPU的,要过上下文理解的",而传统搜索每次也要付机器成本);搜索加入个人化图片与偏好;结果丰富度从千页链接收敛为"我就告诉你一个结果,你不会离开到其他页面"——SEO这个巨大生意怎么做成了大问题;以及谷歌一直落后Amazon的购物闭环,这次直接做进了搜索里。
- 后来泓君补了一个现场花絮:阿里的人评价试衣场景——"让用户试衣服这个点不重要,谷歌如果能把尺码搞对就很不错了",尺码比虚拟好不好看更是痛点。
6. 钱从哪来:订阅分层、商家AI排名费、"推三个但单价更高"
- Shaun:"羊毛出在羊身上"——I/O上已给出方案:从便宜版到Ultra的订阅分层;同时对商家继续收费:"你不做广告,但你如果在我的AI里边要排名的话,我还是会要求你有一定的收费。"Shaun点出难点:AI推给用户的是固定的一两个结果,"它的优势就是不让用户选择"——保险、旅游类点击转化本就几十美元一单,收敛到1-2个推荐后单价只会更高。
- Kimi的开源节流框架:多模态+全上下文让定向广告质量更好,"有可能它原来是给你100个的广告,现在就给你三个……它可以每个单价做的更高"——而且保留人做选择的HILT环节本身就是情绪价值。节流侧:ChatGPT出现两年,"整个GPU的推理成本已经降掉了95%",未来还会按指数级往下降。
- Kimi借Anthropic的说法框定购物Agent的难度:"如果这个事情对于人而言就非常有挑战的话,那对于模型而言其实也是会非常有挑战的。"购物是长逻辑链任务,做成了意味着"我们有可能只看到了冰山一角"——很快AI Mode能做更多长逻辑链的事。
7. 谷歌的搜索护城河:数据、个人上下文、分发
- 若OpenAI/Anthropic也来抢搜索入口,Shaun认为谷歌的优势是海量数据+个人定制化:从索引网页到YouTube,再到你的邮箱——"Google有你个人信息的,这是其他的生态不具有的";OpenAI目前的粘性主要来自工作信息。
- Kimi补充:谷歌的使命是整合全球信息,握有"有可能世界上最好的一个知识图谱",叠加5-10年的个人浏览记录,"它的起点其实就已经非常高了"。Shaun再加一层:安卓+Chrome的分发体系"估计也就只有苹果跟它抗衡"。泓君的引申:这一轮还是巨头的机会,创业公司"可能还真是小而美的机会"。
8. Gemini 2.5为何登顶:数据耗尽后,可能转向"让AI批判AI"
- Kimi先声明已离开DeepMind近一年,以下是框架性推断:预训练、SFT、对齐(RLHF)三步中,去年NeurIPS时大家已说网络数据"就像化石燃料都被耗尽了",这一年精力更多花在对齐上——尤其数学、代码这类目标可验证的任务,"不只是人类反馈的强化学习,而是启动一个路径让AI自己来批判AI"。
- 他的参照系是AlphaGo:"关键其实就在于它能下出像'第37手'那样超越人类常规理解的决策"——当你让模型自己判断"什么是对的",才会在编程和数学上出现2.5这种惊艳结果。
- 他还原了各家你追我赶的次序:OpenAI先做人类偏好,谷歌追;人偏好难做时Anthropic用编程突围;OpenAI再用o1开推理(Kimi离开时谷歌还没启动推理模型,"当时推理还没在优先级上");如今谷歌把三者补齐,"开始引领这个潮流了……让别人成为我的追赶者"。
9. 为什么Anthropic的代码更好:数据配比、YOLO run与取舍
- Kimi的机制解释:预训练"永远都是有个数据配比的"——代码、自然语言、中英文各配多少,"现在就是一团乱,没有人知道什么是最优的配比"。Anthropic可能把代码放在最高优先级,预训练就配入更多高质量代码,基座强了,"别的能力肯定会有一定相对应的下降"。大厂对齐阶段则是各团队攒创新发起"YOLO run",两周后看整合出什么——每个团队优先级不同,最终是取舍。
- 亲测的代价案例:他做营销文案时把Gemini、ChatGPT、Claude、Perplexity同题对比——OpenAI写得"非常有调性",而Claude写出来"就有可能有一种跟一个无聊的码农在聊怎么做市场"的枯燥感。总结成一句话:"输入垃圾、输出垃圾……这只是比例问题。"
- 两个延伸判断:Dario的标准是编程模型不该只解LeetCode("没有直接的商业价值"),而要写出能直接进生产的高质量代码;数学则是Grok做得好——创始团队有顶尖数学家,而评测本身是"先有鸡还是先有蛋":你得有那个能力才能评得动模型。
10. 灵魂人物:三足鼎立,加上Demis的黏合剂
- Kimi点名Gemini此前由Jeff Dean和Oriol Vinyals共同领导。Jeff Dean是"计算机科学的活化石"——圈内玩笑是简历该写他"没干什么事"才装得下一页;他擅长预训练所需的数据与集群大规模调度。Oriol是AlphaGo、AlphaStar、AlphaZero、MuZero的灵魂人物,代表DeepMind更深的强化学习功力。
- 第三足是借收购Character.AI赢回的Noam Shazeer——"我最尊敬的一个人",从Attention is All You Need到Grouped Query Attention。三人把预训练与对齐"整合成一个有机的迭代流程",这是谷歌快速追上对手的组织解释。
- Demis的作用在管理:"极顶聪明的人……非常不愿意去听从他人",Demis把刚合并的Google Brain与DeepMind拧成一个朝AGI的有机整体。组织细节:至少Kimi离开时,Demis和Jeff Dean都直接向Sundar汇报,Jeff Dean并不向Demis汇报。
11. Brin的Founder Mode与士气翻转
- Kimi讲的内部段子:Sergey Brin回归(2023年即回,最近才高调亮相)带回"Founder Mode"——"创始人都在那儿一周待60个小时,你作为Google员工,难道好意思干40小时就回家吗?"他朋友所在的图像生成团队,Brin一句"Meta又出了一个新的模型,我们的什么时候出来",大家就"得了吧,周末加班去吧"。部分团队确实是一周60小时。
- Shaun的外部视角:谷歌人才密度极高但"大部分人之前都处在一个非常躺平的状态,因为广告太赚钱了";被OpenAI抢风头加上Brin回归后,"整个Gemini团队的士气都非常高涨——AGI如果要有人做出来,是不是就应该是Google?"从去年被抢风头到今年霸榜,只花了一年。
12. API为什么敢卖"白菜价":TPU、Infra与DeepSeek的推算
- 泓君抛出事实:Gemini token价格一度可能只有OpenAI的1/5到1/10。Shaun给三个原因:十年前开始深耕TPU生态,"避免了很多Nvidia的税";谷歌Infra极强、有自有数据中心和"基本上无限的资源",而OpenAI、Anthropic靠第三方云,动态调度大集群的能力远不及谷歌;软硬一体化让模型在自家硬件上跑得更好。
- Kimi的佐证与推算:SemiAnalysis给GPU云打分时榜首是"CoWeave"(可能是CoreWeave,OpenAI用它做GPU调度),他当时开玩笑"再往上还有一个最牛的,应该是Google内部"。成本价没人知道,唯一线索是DeepSeek论文披露约80%的溢价空间(成本只占收费的两成)——DeepSeek那个体量、用GPU都如此,反推OpenAI利润可能很高。
- 关键结论带着原话的免责声明:谷歌不需要靠API赚钱,"它的搜索已经足够养活它了,它可以只是收你一个白菜价……但别反驳我,我不是说它一定就是一个收支平衡的白菜价"——只是它有足够资本,有可能把价格压到近成本价。
13. 创业者的生存法则:无忠诚度选型、垂直深度、产品基因之问
- Shaun的选型哲学:"没有最好的模型,只有最适合你的模型"——打电话业务对延迟最敏感(1-2秒延时体验就崩),Gemini 2.5 Flash延迟还不够低但2.0 Flash非常快,OpenAI的4.1 mini/4.1 nano快但智能弱,长上下文(将近512K窗口)低成本任务选Gemini Flash/Pro,纯agentic工作流选Claude。"你其实没有对任何一个模型有任何的忠诚度,谁的模型又快又好又便宜,我们就用谁的。"Kimi补刀排行榜:"看一看就可以了……会有一定水分"——LLaMA 4曾向lmsys提交专门讨好人类投票的特殊模型;初创该自建量化评测,评的往往已是系统而非单个模型。
- 模型vs工程之辩:Kimi认为当下ToC产品"更多时候还是纯的模型能力"(Sam Altman说GPT5不是一个模型而是一个系统,但那是未来);ElevenLabs赢在只做一件事、只配最好的音频数据,而大厂可能有20个团队各有优先级必然取舍——"我优先级第一的事情有可能是Google的第30个重要的事情"(他注明这话出自Sarah Guo的播客)。Kimi的总结是:"模型决定下限,工程决定上限。"
- 大厂碾压警报:泓君引"谷歌I/O一开,创业公司又要倒一批",Shaun认同——虚拟试衣创业公司首当其冲,"Google做了,Amazon肯定也会做……ToC是一个非常难的事情";调一个工具就能做的打电话Agent门槛越来越低,垂直流程浅的会被直接取代(他自己做医疗B2B呼叫中心,暂不直接受冲击)。
- 收尾的产品基因之问:Shaun直言"Google的产品一直是它的弱项",现在的打法是围绕Gemini一次性发10到20个产品,"它也不确定哪个产品能跑出来……一旦发现哪个真正起飞了,就开始往里面不停地砸资源"——NotebookLM靠"天才产品经理"加的一键生成播客功能意外爆火,就是这套打法的样本。泓君的结束语:模型竞争已进入"你追我赶、各领风骚100天"的阶段。
Full transcript
1. Google I/O三年回顾:从Bard失误到Gemini 2.5 Pro的翻身仗
大家早上好,欢迎来到 Google I/O。每年 5 月,谷歌都会在山景城总部举办 Google I/O,这是一个面向开发者的活动。每年,谷歌都会在这个活动上集中发布一批新产品。
2. Google的模型全家桶:从广度到深度的融合
疫情之后,基本上每年我都会去 Google I/O。我们先来回顾一下前两年的情况:2023 年,谷歌正式向 ChatGPT 发起挑战。当时谷歌发布了一款聊天机器人,叫作 Bard。它被问到詹姆斯·韦布太空望远镜的新发现,结果 AI 在回答中出现错误,导致谷歌的市值一夜之间蒸发了超过 1,000 亿美元。
2024 年,就在谷歌开会的前一天,OpenAI 上线了 GPT-4o 模型,效果震惊世界。甚至有很多外媒尖锐地评论说,这是 OpenAI 故意在狙击谷歌。度过了失意的两年,回到今年,谷歌可以说是破釜沉舟,打了一场漂亮的翻身仗。
3. AI Mode大幅提升上下文理解能力,但灰度测试体验弱于Open AI
在这次大会上,模型端的 Gemini 2.5 全面霸榜。这一集,我们就来深度揭秘谷歌大模型 Gemini 背后的灵魂人物,以及谷歌推出的 AI Mode 到底能否应对大模型对搜索的冲击,华尔街又会如何看待谷歌在美股“七巨头”中的位置。
今天跟我在一起的嘉宾,是 CambioML 的联合创始人 Kimi Kong。Kimi,你好。
Hello,你好。
你之前也是在 DeepMind。要不要跟听众简单介绍一下你自己?
首先,非常感谢今天的邀请,让我可以来到《硅谷 101》播客。我也是《硅谷 101》的忠实听众。
4. AI Agent创业模型选择:没有最好,只有最适合
我现在是 CambioML 的联合创始人兼 CTO。CambioML 是一家 YC S23 的创业公司,主要产品是 AI Agent——Energent.ai。我们的 AI Agent 可以帮你思考和行动。
在创立 CambioML 之前,我在 Google DeepMind 待了将近两年的时间,主要负责几个不同的模块。一方面是通过强化学习,帮 Google 增加广告收入。我主要做了两个项目:一个是整个大语言模型的评测;另一个是我们帮 Google 做的第一个用 AI Agent 来优化广告投放和搜索结果的项目。
完成这两个项目之后,我就离开 Google 创办了这家公司。去 Google 之前,我在 Amazon Web Services 待了 4 年,主要主导了几个不同的 Amazon 微服务架构项目。再之前,我是 Stanford 双硕士,有机械和计算机两个学位。
跟我们在一起的嘉宾还有一位,是 Shaun Wei。他是 HeyRevia 的创始人,之前在谷歌负责语音助手。Shaun,你好。
Hello,大家好。我是 Shaun Wei。我们是一家 AI contact center,也就是人工智能呼叫中心公司,主要深耕美国的医疗行业 call center,针对患者和医生之间的沟通,完全用语音实现自动化。
今年你有没有看 Google I/O 的直播?在这样一场发布会中,让你印象最深刻的一点是什么?
我觉得 Google I/O 给我印象最深刻的是,Google 对于整个模型和产品横向广度、纵向深度的整合。
5. 让AI教AI,Gemini 2.5霸榜秘诀
从广度而言,它包含了现在多模态模型所需要的所有不同 modality,也就是模态。从 Gemini 2.5 Pro 多模态模型,到 Imagen 图片生成模型,再到 Veo 视频生成模型,相当于给你提供了一个模型全家桶,可以让你完成各种不同的任务。
从纵向而言,它不只是一个云端的搜索服务,同时也可以在可穿戴的 Android XR 设备上,展示 Google 未来在不同纵向深度里的野心。所以对我而言,这让我感受到 Google 对未来的全面布局。
Shaun 呢?
6. 视频模型加入声音:Veo 3真正实现Text-to-Movie
对我印象最深刻的是它的 text-to-video,也就是文生视频。
大家在这个方向上已经尝试了很多,无论是之前 OpenAI 的 Sora,还是文生图、文生音频等各种各样的尝试。其实大家都想达到的目标就是:能不能把我大脑里想象的东西,变成一个电影画面?
我觉得终于在 Google 这次发布会上,看到了真正意义上可以从一个想法变成视频的产品。另一个让我印象很深的,是因为我之前做了很久的 Google Assistant。大家一直都很希望有一个真正意义上的 AI 陪伴着你。你有任何问题,无论是视频、文字,还是多模态的各种方式,这个 AI 都能够帮助你。
以前 Google Assistant 没有实现这个愿景,但是现在 Gemini 终于实现了它十年前的愿景。这一点让我印象非常深刻。
你刚才提到了 text-to-video,指的是 Veo 3 模型的发布,对不对?
是的,是 Veo 3。
我看它这次发布不仅有视频画面,还有声音。从整个多模态的角度来讲,加入声音会是一个门槛比较高的事情吗?你觉得它的发布,跟当时 Sora 那几次文生视频模型的发布有什么区别?
我能感觉到,它是从文字变成了电影,真正意义上变成了电影。
Sora 当时发布的其实也只是视频画面。它把文字变成视频之后,还要跟 ElevenLabs 或者其他公司合作,在后期加入声音。但 Veo 3 在多模态理解上,比如你看它很多视频里的语音、背景音效,还有嘴型,都能够对得上。
我觉得这个难度非常高。它考验的是整个模型对上下文的理解,以及对物理世界规律的理解。大家还记得当时的“威尔·史密斯吃面条”,这才两年时间,就已经从威尔·史密斯吃面条,发展到了可以做出动作电影的状态。
所以,加入音效还是很关键的一点。
没错。
我自己也对今年的 Google I/O 印象很深,因为我觉得今年谷歌有一个特别大的优势:它们特别骄傲的就是 Gemini 2.5 这个模型。
在发布会这个时间点的你追我赶中,这一轮终于是 Google 最领先了。去年这个时候,其实是 Google 在发布会之前被 OpenAI 狙击了。OpenAI 把 GPT-4o 推了出来,所以当时可以说,谷歌的发布会被 OpenAI 抢了风头。
今年模型最强,应用推广又很广,多模态也有新的进展。包括今年让我印象特别深刻的,是 Google 把搜索——也就是整个商业模式的基石、搜索的入口——给改了,改成了 AI Mode。
大家有关注 Google 新推出的 AI Mode 吗?简单理解,我觉得它可能是把搜索入口跟大模型结合起来。相当于在传统的搜索框里面,进去之后,左边有一个标签栏,加入了 AI Mode 标签。
当你问它一个问题时,大模型可以给你非常精准的回答,甚至还可以继续追问。它后面还有一个跟 Agent 相关的 demo:你想买一件衣服,它可以帮你完成从搜索到一键下单的闭环。当然,这个 demo 我们之后可以详细讨论。
首先,我们来聊一聊 Google 搜索的变化。你们会如何看待谷歌在搜索框里加入 AI Mode?你们觉得它会怎样影响谷歌的生态和商业模式?
我先说一下 AI Mode。很巧合的是,在它发布会之前,我其实就尝试了一下 AI Mode。当时我还把 AI Mode 和 Perplexity、OpenAI 的搜索稍微对比了一下。
从效果来讲,AI Mode 相比之前的搜索,已经大幅提升了上下文理解能力。对于上下文的理解,以及搜索相关信息的能力,它已经非常强大了。
但是站在搜索效果的角度来看,我当时测试的时候,OpenAI 的搜索其实比 Google AI Mode 的效果更好。我不知道这次正式发布时有没有进一步改善。
当然,你刚才说到的 Google AI Mode,其实是在革自己的命。我觉得这是真的。因为 Google 搜索的广告收入是最稳定的收入,从 AI Mode 的角度来说,它会完全改变传统的广告模式和营收模式。
Pichai 也说过,这是这十年来搜索领域最大规模的一次变化。我相信,从用户进入搜索的前端界面,到最后提供结果的方案,Google 内部都做了非常大的提升。
你提到之前灰度测试过 AI Mode,可以讲一下当时测试的是什么场景吗?为什么你会觉得 OpenAI 的搜索功能比谷歌更好?
我当时想搜索一架正在天空中飞行的飞机,以及它具体的落地信息,因为它晚点了。
这不是一个传统的搜索场景。正常情况下,我会去查一个航班时刻表,但当时我不太确定那个航班的航班号,只知道它大概的方向,是从 A 点飞到 B 点。我就搜了这样一条信息。
我让 OpenAI、Google AI Mode 和 Perplexity 同时进行搜索。我的提示词大概是:我知道有一架飞机从 A 点飞到 B 点,大概在几点钟出发,你能告诉我这个航班的详细信息吗?它现在大概在哪里、在空中的哪个位置,有没有准点出发,会不会晚点?
最后,AI Mode 和 Perplexity 都输给了 OpenAI。
我非常好奇。是因为它们搜不出来这个结果,还是搜索出来的结果不准确?
它们都没有搜索出来这个结果。它们没办法告诉我当下正在天空中飞行的航班号,结果只有 OpenAI 给了我正确的结果。
有意思。Kimi,你怎么看 AI 搜索?
我觉得,搜索有可能真的是全世界最赚钱的生意,而且是所有人都垂涎欲滴的生意。
7. 手握人才、模型、流量三大优势,意愿才是AI搜索之战的关键
很久以前,Satya Nadella 说过,他最后悔的是当年 Microsoft 没有把搜索这件事情做成,因为搜索太赚钱了。
说回谁有能力把这件事情做成,我觉得 Google 有可能是所有科技公司里最有能力把 AI 搜索做好的公司。但是,就像 Shaun 刚才说的,它有多愿意革自己的命?
对于所谓的创新困境,我只能说,Google 现在是“半革”了自己的命。因为现在 Google 的 AI 其实还是有两个产品:一个叫 AI Mode in Google.com,另一个是 Gemini.Google.com。
但根本上来说,Gemini、DeepMind AI Lab 和搜索,在 Google 内部是两个完全不同的业务单位。怎么把公司的流量入口整合起来,让用户觉得这是一个更加原生的 AI 搜索,而不是一家公司推出的两个产品?我觉得这不是能力问题,而是 Google 的意愿问题,是它有多愿意深度革自己的命。
革了之后,怎么用 AI 搜索产生新的营业收入?原来定向广告可能只是在搜索结果里显示最前面的几个推荐位,现在怎么把广告更加有效地嵌入 AI 模型的结果里?我觉得这是 Google 必须思考的问题。
但我觉得,Google 从根本上是有能力做成这件事的,更多是一个意愿问题。
我们说到第二点,它为什么有能力做这件事?如果一个大模型想把一个任务做好,模型是一方面,用户指令是另一方面。我完全不担心谷歌模型理解用户指令的能力。
除此之外,更重要的是工具调用。毫无疑问,Google 每年拥有超过 90% 的搜索入口流量,所以它的搜索工具一定是所有公司里最强的。
基于最好的模型和世界上最好的搜索工具,我完全不担心 Google 把 AI 搜索做到天花板的能力。只是因为 AI 搜索还很新,Google 内部也在进行大量自用测试。它们自己其实有好几个版本的搜索系统,甚至还在评估到底哪种搜索方式最适配 AI 模型。
我觉得这考验的是 Google 的整合能力:第一,它有多少意愿去整合;第二,整合的时候不要像之前那样出现翻车的情况。
你提到工具调用,是指哪些工具?你应该浏览哪些网站,应该搜索哪些特定的网站?
根本上来说,原来的搜索是直接把结果给你。现在相当于大语言模型要通过 Google 搜索这个工具,把各种信息整合成一个更好的结果交给你。
所以我觉得,短期来看,我完全可以理解为什么 OpenAI 能把这件事情做得更好。OpenAI 做 AI 搜索,有可能已经比 Google 领先了一段时间,包括产品层面。之前 GPT 模型对于工具的调用能力,有可能在 Gemini 2.5 之前也领先于谷歌。
现在 Google 拥有最好的模型,也拥有最强的搜索引擎工具。我觉得这是 Google 可以开始打翻身仗的阶段,对它而言应该是顺风局了。只是要看 Google 愿不愿意把产品做更深度的整合。
我希望看到的是一个统一的产品。ChatGPT 不只是聊天工具,还是一个整合式入口,是它们所有流量的入口。Google 现在的流量是分散的,对用户而言,其实还是一件非常令人困惑的事情。我觉得这是 Google 在产品层面必须做出的战略决策。
接下来,我们可以把 Google 的 AI Mode 和搜索具体展开,放在一个场景里面讨论。
比如我现在脑子里第一个想到的,就是 Google 在 I/O 上做的一个演示:一位女性要买一件衣服,她先对衣服进行大概的描述。描述完之后,谷歌开始搜索,搜到一堆销售这类衣服的网站。
接下来,它可以帮你比价,看哪个网站在打折,然后给你一个最低价格。中间还有一个环节:她把自己的照片上传上去,说想虚拟试穿一下,看看这件衣服穿起来是什么效果。
我当时印象很深刻的是,她是一个微胖的女生,而模特是非常瘦的模特。最后现场生成的效果里,这件衣服穿在她身上,依然是一个微胖女生穿起来的效果,所以现场一度响起了欢呼声。
之后她觉得这件衣服穿起来不错,于是决定下单。Google 直接一键完成了闭环,使用的是 Google Pay 的页面,也就是 Google 钱包。
整体上来看,以前我要搜索一件衣服,要去各个网站上比价,最终还要在每个网站注册、输入用户名和密码、选择尺码,然后下单,这是一个非常漫长的流程。现在通过 Google 搜索的 AI Mode,我一键就可以下单。
你们觉得这样的场景对谷歌来说可行吗?
我知道很多做 Agent 的人,考虑的第一个问题是:我是不是要把所有电商网站的密码都输入给 Google?它是不是必须拥有这些密码,才能帮我完成下单?
我觉得这次发布中有几个点让我印象很深刻。第一个,是传统广告模式可能会发生变化。比如展示型广告,用户看到一次,广告主就付一次费用;也可能是点击广告,用户点击进去之后才收费。
对于新的模式,用户说“我要买一个东西”,上面的展示型广告可能还是有,点击广告可能也还是有。但用户继续往下转化时,Google 要怎么从中收费?我觉得这会很有意思。
我相信运行 AI Mode 和搜索是非常耗钱的。因为搜索本身对大家来说是免费的,但每次搜索,谷歌其实都要承担机器成本。现在如果 AI Mode 面向所有人开放,成本就会非常高,因为它的计算逻辑不是你搜索一个问题就结束了,而是要经过 GPU 和上下文理解。
这个成本会非常高。那它会不会羊毛出在羊身上,最后通过某种方式把这笔钱从用户身上收回来?我不知道。
第二个变化,是搜索模式本身发生了改变。传统搜索基本上是文字描述加一些图片搜索,但 AI Mode 会加入更加个性化的图片搜索,也会结合你的偏好。我觉得搜索质量会进一步提升。
第三个变化,是结果的丰富度。以前的结果会展示一个完整网页和很多链接,你慢慢点进去;或者它在上面给你一个面板。但现在,它可能直接在同一个页面里告诉你一个结果,你不会离开这个页面去其他网站。
这也会对 SEO,也就是搜索引擎优化,产生非常大的影响。SEO 本身就是一个非常大的业务。对卖衣服的人来说,怎么保证自己的商品出现在 Google 的搜索结果里,会成为一个非常大的问题。
最后,就像你刚才说的,一旦我对某个东西感兴趣,怎么持续跟踪它?怎么保证它的价格稳定,直到价格达到我的理想区间?Google 过去一直在做购物,但做得不是很成功,一直落后于 Amazon。我相信这次就是它的一种更新方案:如何把购物闭环直接在 Google 搜索里面完成。
Kimi 怎么想?
我觉得 Google 实现的最大野心,是想做成一个 AI 助手。对于这个 AI 助手而言,购物其实是一件非常有挑战性的事情。
很久以前,Anthropic 有一个非常有意思的采访。它提到,如果一件事情对人来说就非常有挑战,那么对模型来说其实也会非常有挑战。
把模型当作一个人来看待,对我而言,什么事情既有高价值又非常有挑战?比如我想订一趟旅行,不仅要订酒店,还要订机票。对于购物来说,我要浏览很多网站来对比价格。
但我在不同网站比价时,可能并不是要登录自己的账号和密码。更多时候,我只是想知道有哪些网站可用:可以去 Amazon,也可以去 H&M,或者其他网站。模型要通过不同渠道搜集信息、对比价格,然后给你一个结果。
这种长逻辑链、需要多步骤完成的过程,我觉得现在已经可以做得非常好了。在不久的将来,Google 除了购物以外,在很多需要长逻辑链的任务上,也可以做到同样的效果。
所以我们有可能只看到了冰山一角。它现在只是完成了购物这样的长逻辑链任务,未来还会有更多长逻辑任务,可以很快由 AI Mode 帮你完成。
我整体上理解,谷歌做这件事情,就是从买衣服、下单到完成支付,实际上是一个 Agent,对吧?
是的。刚才大家其实已经提到了一些核心问题。比如以前一次搜索消耗的服务器成本,相比现在完成整个购物闭环所消耗的 token 和服务器成本,要小很多。现在这个成本突然高了很多。
我们知道谷歌的商业模式依赖于搜索竞价排名,商家也要做 SEO。改成这种模式以后,它的商业模式会怎样改变?它靠什么赚钱?
我觉得商业模式方面,Google 已经给出了一个方案。你如果看过 Google I/O,就会发现它有各种订阅服务:有便宜的版本,也有 Ultra 服务,还有不同级别的订阅。根据你使用 AI 的方式,比如更高的智能程度、更强的定制化能力,用户需要订阅和付费。
就像我说的,羊毛出在羊身上。
另一个方式,我相信广告也会跟着新一代 AI 改变。如果你用过 OpenAI 的搜索,或者做过一些开源项目,就会发现 OpenAI 本身会给外部网站导入很多流量,也会产生专门从大语言模型导出去的流量。
所以我相信,Google 内部也在思考:现在我已经能够给你提供更加定制化的个人回复,那么从这里导出去的流量,是不是也应该收取更多服务费用?
是对商家收费吗?
对商家收费。用户可以订阅服务,商家也一样可以付费。
你不做传统广告,但如果你想在我的 AI 结果里排名,我还是会要求你支付一定的费用。
不过我觉得 AI 的收费会更难设计。以前搜索可以提供给大家 10 页、100 页,甚至 1,000 页的结果。你只要保证自己出现在第一页,或者第一页的前 3 个位置,就可以了。
但 AI 实际上会推给用户一个相对固定的结果。它的优势就是不让用户选择。
对。
如果你了解传统广告,比如保险类广告、旅游类广告,每次点击或转化的收费都非常高,有可能每一单就是几十美元。
如果最终只推给用户 1 到 2 个结果,商家要支付的费用可能会更高,因为完成购买的概率也非常高。
理解。而且以后它的排名可能直接是在大模型里面。
对。
Kimi,你认同吗?
我完全认同。我觉得这件事永远是开源节流,可以从两个不同的方式来看。
先说开源。Google 可以用什么方式进一步增加收入?它可能不再像传统意义上那样,只是通过竞价给你做一个排名列表,再展示不同价格的广告。
因为现在是多模态模型,而且它知道你所有的历史记录和上下文,所以它提供定向广告的质量可以比原来更好。它可能不用给你推 10 个,只给你推 3 个。
作为人,做选择本身也是一种乐趣。现在 AI 产品给人的情绪价值,在于让你进行一个 HILT,也就是 human-in-the-loop、人工干预的过程。如果真的把人完全抹去,用户也未必希望完全自动化地完成一件事情。
以前可能给你 100 个广告,现在只给你 3 个,然后在语言模型里说:“这里有 3 个选项,你来做选择。”这样每个广告的单价就可以更高。
这是一部分从广告商品角度来看。Google 现在本身运行着一个巨大的搜索集群,可能是 CPU 搜索集群。Google 刚开始的时候,这也曾经是一个非常大的成本。
但传统意义上的搜索,CPU 成本在过去 20 年里可能已经下降了 1,000 倍、1 万倍,甚至 1 亿倍,具体数字我也不清楚。即使 ChatGPT 只出现了两年,到现在整个 GPU 推理成本也已经下降了 95%。
我觉得在不远的将来,推理成本一定会继续按指数级下降。未来如果你可以让广告主支付广告成本,让用户支付订阅费,同时继续降低 GPU 或 TPU 成本,Google 做得好的话,就有可能发展出一套更好的商业模式。
我们接着看。假设 OpenAI 或者 Anthropic 也来做这件事情,因为我觉得这件事对搜索的冲击还是很大,搜索入口也是大家都想抢占的一个位置。你觉得谷歌的优势是什么?
我觉得谷歌最大的优势,还是它拥有海量的数据。
无论是它索引的网页,还是它的 YouTube 视频,它的触达能力都非常强,拥有足够丰富的内容资源。而且大部分人都会有邮箱,其他信息也会存在 Google 里,所以它对用户进行个性化定制的能力非常强大。
尤其是我自己使用 OpenAI 的时候,它现在主要的用户黏性来自工作方面的信息。但 Google 拥有你的个人信息,这是其他生态不具备的。
这个很好。我想到自己现在经常使用 Chrome 浏览器,很多数据也存在这个浏览器里。在浏览器里完成一个入口,可能在一些购买行为上会更加便捷。
我觉得有几点。
一方面是搜索这个产品本身。Google 这家公司的使命,是整合全球信息。它基本上拥有世界上最好的知识图谱。
我们每个人在使用 Google 的过程中都会留下数据。比如我们使用 Google 5 到 10 年,浏览过程中的各种信息都会被记录下来。它相当于把世界信息和我们的个人信息整合在一起。
Google 有世界上最好的模型,也有世界上最好的搜索引擎,所以它的起点已经非常高了。它一定有能力做出最棒的产品,只是要看它以什么形式把产品部署给用户。
我觉得还可以补充一点,就是 Google 还有很强大的分发能力。
它有 Android,有 Chrome,拥有的分发系统估计也只有苹果能够与之抗衡。所以它的分发能力比所有其他公司都强大。
我最近也跟很多人聊过,大家觉得这一轮其实还是巨头的机会。在大模型竞争的这一轮,创业公司可能还真的是小而美的机会。
我们刚刚聊了很久的搜索,接下来可以聊一下 Gemini 2.5 模型的更新。
在谷歌这次的发布中,Gemini 2.5 Pro 现在在各项数据评分中都是所有大模型里最好的。Kimi,可不可以跟大家分析一下,它是如何做到的?
我已经离开 DeepMind 快一年的时间了,所以我也不知道同事们在这一年里又做了什么新的创新。
但我觉得,大语言模型训练的基础大概有 3 个步骤:预训练,也就是 pre-training;SFT,也就是 supervised fine-tuning、监督微调;以及最后的 alignment,也就是对齐。RLHF,也就是基于人类反馈的强化学习,也属于这个阶段。
大概从去年的 NeurIPS 开始,大家都在说网络数据已经被抓取完了,就像化石燃料已经耗尽了一样。我觉得过去一年,大家花了更多精力在对齐上,也就是强化学习,尤其是人类反馈和 AI 反馈。
比如数学和代码任务,因为这些任务有明确的目标,你可以完全知道一件事情做成了还是没有做成。
Google 基于 Gemini 1、1.5 和 2 的积累,尤其是在基座模型训练方面,再加上它开始更多地强调强化学习,不只是人类反馈的强化学习,而是让 AI 自己批判 AI,把这件事情做成。
比如当年 AlphaGo 为什么可以成功?关键就在于它能够下出像“第 37 手”那样超越人类常规理解的决策,也就是超出我们所有人的认知:这一步棋居然可以这样下。
我觉得未来的 AI,尤其是在强化学习中,如果让模型自己去判断什么是对的,那么在 Gemini 2.5 中,它们应该引入了更多强化学习的概念和用法。这导致 Gemini 2.5 在今天所有具有高度确定性的任务,比如编程和数学任务中,出现了令人惊艳的结果。
我记得去年大模型训练有一个比较集中的趋势:最开始大家都是预训练,后来在预训练之外加入后训练。比如 OpenAI 的 o1 系列,以及 DeepSeek 的 R1,都是推理模型做得比较好。
Anthropic 其实有很长一段时间没有推出自己的推理模型,但是 Sonet 3.5 和 3.7 在代码能力上有质的提升,这也带动了一批编程类 Agent,比如 Cursor 和 Windsurf 迅速崛起。
我好奇的是,为什么 Anthropic 生成的代码质量比其他家更好?我看这一次 Google 也在强调自己生成代码的质量比较好。代码质量能力的提升,主要靠的是什么?
我可以快速给出几个观点,Shaun 可以随时打断我。
模型训练永远就是那几个步骤:预训练,后面的监督微调,以及对齐,尤其是基于人类反馈的强化学习。
先说预训练。预训练永远有一个数据配比:要放多少代码,多少自然语言,多少中文,多少英文。现在这件事还是一团乱,没有人知道最优配比是什么。
我觉得对于 Anthropic 这家公司而言,代码可能是它们的最高优先级。它们在预训练时放入了更多高质量的代码信息,因此模型的基座能力首先就变强了。但基座能力变强之后,其他能力肯定也会有相应的下降。
基座模型完成之后,还要做大量的对齐。对齐时,很多大公司做的其实是我们开玩笑称为 YOLO run 的事情。
比如今天 Shaun 在 Google 的一个团队,我在 Google 的另一个团队,您在 Google 的另一个团队。每个人这周都有很多创新,我们把大家做的东西都集中起来,然后发起一次 YOLO run。两周之后,把所有人的东西整合在一起,看看最后做出了什么。
这意味着在对齐阶段,每个团队其实有不同的优先级。可能这个团队非常注重代码,那个团队非常看重写作能力,就像一个组织问题。
对于 Anthropic 而言,也许编程就是最高优先级。大家觉得,编程可能才是解决推理模型的钥匙,所以它们在预训练和后训练过程中,尤其是基于人类反馈的强化学习中,都加入了更多编程训练。
而编程本身也是非常容易量化的:一件事情做成了,或者没做成。结果就是 Anthropic 在编程能力上的表现非常好。
但也正因为它编程能力强,所以在其他能力方面,可能会存在一些缺陷。我最近学到了一个很有意思的故事。
作为初创公司的创始人,我现在不只是每天写代码,还要做很多市场营销和销售工作,也要写很多文案。我通常会把 Gemini、ChatGPT、Claude、Perplexity 都打开,把同一个提示词输入进去,让它们完成同一件事情。
有时候 OpenAI 的创意性写作做得非常好,写出来的东西很有调性,让我非常愿意把这样的市场营销文案发出去。但让 Claude 写的时候,就有可能像是在跟一个无聊的码农讨论怎么做市场,整个事情会非常枯燥。
我觉得这就是策略问题。大语言模型的训练就是“输入垃圾,输出垃圾”。如果你输入大量高质量代码,输出的代码质量也会更高,这只是比例问题。
我认为 Anthropic 在这方面下了更多功夫,主要还是看团队把哪一块放成重点。
你觉得 DeepMind 之前的重点在哪里?
好问题。我觉得其实是非常综合的能力。
以前我们会说,我们想要编程、数学、推理和写作能力,所以会设定一个通用的评估指标体系,覆盖多个不同的评估维度。
但我知道,我们之前有一些非常不擅长的东西,比如写代码。正因为不擅长,所以大家后来花了更多努力在这件事情上。这一波相当于追上了 Anthropic 的编程能力。
推理能力呢?也是重视程度的问题吗,还是说在整个后训练过程中,需要一些特别的技巧?
我还在 Google 的时候,Google 其实还没有启动推理模型。我离开 Google 的时候,刚好是 o1 开始出现的时候,所以当时推理能力可能还不在 Google 的优先级上。
我觉得那时它们更多是在尝试赶上 OpenAI 的写作能力,以及解决问题的能力。
目前来看,更多还是数据配比的问题。它们会加入更多对齐,不只是对齐人类偏好。
OpenAI 最开始推出模型时,重点是得到人类偏好的结果,所以 Google 做的第一件事,就是追上 OpenAI 做出的人类偏好结果。但很多时候,人类偏好是非常有限的。
如果要做“人类偏好”,什么事情更容易做?编程可能比较容易,Anthropic 把这件事做成了。于是 Google 会说,我现在不只想追上人类偏好,我还想写出非常好的代码。
当非常好的代码能力做出来之后,OpenAI 又做了推理模型。于是我想做的模型,不只是做出人类想要的东西,不只是写出好的代码,而且应该有非常缜密的逻辑,让大家知道怎么解决问题。
当 Google 把这件事情做成之后,我觉得现在它开始引领这个潮流了。它已经拥有最强的东西,接下来就要想怎么继续引领潮流,让别人变成追赶者。
数学问题是 Grok 做得比较好。Grok 是马斯克成立的一家模型公司的产品,因为我看它的创始团队成员里有非常顶尖的数学家,他们也一直在解决世界上很难的数学问题。
我觉得我的数学能力可能达不到顶尖数学家的水平。这是一个“先有鸡还是先有蛋”的问题:你需要有人拥有这个能力,才能评测模型到底好不好。
作为软件工程师出身,我可以非常直观地评价模型的代码能力。但这里还有两个不同的问题:这个模型只是能写出可以投入生产的代码,还是它只是擅长编程?这是两回事。
我觉得 Dario 曾经有一个非常有意思的说法:他希望自己的编程模型不是只会解决 LeetCode 难题,因为 LeetCode 题目其实没有直接的商业价值。他希望编程模型能够写出高质量代码,让 Shaun 或者我们的初创企业可以直接把代码投入生产。
我觉得这是 Anthropic 非常专注的一件事。
说回数学和编程的问题,我觉得也分为两方面:有多少人需要深入解决高深的奥数问题?这可能是展示模型肌肉的能力。
但除了高深奥数题之外,怎样把数学能力接入初创企业,或者接入不同公司,让它们产生直接的商业价值?我觉得这是更多商业公司需要思考的问题。
你觉得你在 DeepMind 的时候,谁是它的灵魂人物?比如 Demis?我看 Sergey Brin 最近也回来了。他应该准确来说是 2023 年就回来了,只是最近才开始高调亮相。
你觉得谷歌的模型更多体现了谁的价值观?
Gemini 之前是 Jeff Dean 和 Oriol Vinyals 共同领导的模型。我觉得之前就是这两位 Google 的灵魂人物。
Jeff Dean 有可能真的是计算机科学界的活化石。大家经常开玩笑说,如果你把 Jeff Dean 简历上“做过什么事情”删掉,只写“没有做过什么事情”,可能会比写“做过什么事情”更短。
因为 Jeff Dean 做的事情太多了,所以我们只写“Jeff Dean 没有做过什么事情”,这样就可以在一页纸上写完他整个人生的成就。
Jeff Dean 非常擅长预训练,因为预训练涉及数据和集群的大量调度。Oriol Vinyals 原来是 AlphaGo、AlphaStar、AlphaZero 和 MuZero 的灵魂人物,来自 DeepMind 的一批人对强化学习有更深入的理解。
所以,基于 Google 最擅长的预训练,再加上 DeepMind 最擅长的强化学习和对齐,Google 就可以快速追赶上竞争对手。
同时,Google 收购 Character.AI,又重新赢回了 Noam Shazeer。我觉得这有可能是我最尊敬的人之一,因为他在自然语言处理上的深耕非常久,从 Attention Is All You Need,到后来的 Grouped-Query Attention。
再加上 Noam Shazeer 的回归,我觉得他们三个人形成了三足鼎立的局面。他们不是分别负责预训练和对齐,而是把这些能力整合成一个有机的迭代流程,让模型能力不断提升。
所以对我而言,这三个人都非常值得尊敬,也正是他们让 Google 在这一轮非常快速地追赶上了竞争对手:Jeff Dean 负责整个 Google 的基础设施能力,Oriol Vinyals 负责对齐能力,Noam Shazeer 则对自然语言处理有非常深入的认知。
听下来非常有意思。但你觉得 Demis 在中间的作用是什么?DeepMind 和 Google 原本训练模型的团队之间,关系是什么样的?
在原来 Google Brain 和 DeepMind 还没有合并的时候,我觉得它们完全是两种不同的思路。
DeepMind 的强化学习非常强大,这也是 Google 收购它的原因。Google 本身擅长瞬间调度大量资源,规模化进行预训练和监督微调。我觉得 Google 的预训练能力还是非常强的。
最后其实是一个强强联合的过程:Google 擅长的事情和 DeepMind 擅长的事情,进行了非常强的整合。
后来,我觉得 Demis 扮演的更多是领导和管理的角色。原来我作为 IC,也就是个人贡献者时,可能只要写代码,就可以完成每天的工作。但当你运营一家公司的时候,我逐渐意识到,工作不仅仅是把任务完成,更重要的是如何激励一群最聪明的人,让他们朝着共同的方向把一件事情完成。
我觉得这是非常难的一件事。因为极其聪明的人,每个人都有自己的想法,也非常不愿意听从他人。
Demis 扮演了一个非常好的角色,把刚整合起来的两家公司变成一个有机的整体,给大家一个共同目标——实现 AGI。然后所有人都朝着这个目标,把自己最擅长的能力拿出来,把这件事情做成。
有意思。所以 Jeff Dean 和 Demis 的关系是怎样的?
Jeff Dean 现在应该是首席科学家,Demis 应该是 CEO。
相当于 Jeff Dean 向 Demis 汇报?
好像 Jeff Dean 不向 Demis 汇报,至少我离开时是这样。我不知道现在内部是什么情况。至少我离开时,Demis 和 Jeff Dean 都直接向 Sundar Pichai 汇报。
那你觉得 Sergey Brin,作为 Google 的创始人之一,回来之后会带来什么变化?
首先,我已经不在里面了,应该说不是“我们”。
对。你在的时候,他应该刚好开始抓这件事情。
我觉得 Sergey Brin 给 Google 带来的,更多是一种 Founder Mode,也就是创始人状态。
他带回了一种 Founder Mode,让大家知道应该以什么样的投入和方式来完成这项工作。如果创始人都回来做这件事了,创始人每周待 60 个小时,你作为 Google 员工,难道好意思只工作 40 个小时就回家吗?
所以真的是每周 60 个小时?
有些团队是这样的。我知道一些朋友原来在图像生成团队,他们说 Sergey Brin 回来之后,看到 Meta 又出了一个新模型,就问:“我们的模型什么时候可以出来?”
大家一听就知道了:周末加班去吧。
我觉得更多时候,这是一种 Founder Mode,是对大家士气非常大的鼓舞。我好像说得有点多了,可以让 Shaun 来阐明一下。
Shaun,你怎么看 Gemini 2.5 Pro?
我觉得 Kimi 已经讲得很好了,该讲的都讲了,不能讲的我觉得也讲得差不多了。
所以我就从一个外部的角度来说。因为我也在 Google 工作过,大家都知道,Google 的人才密度非常高。之前大部分人都处在一种比较躺平的状态,因为广告太赚钱了,大部分团队不需要特别拼命地做事情。
但这一波 AI 起来之后,尤其是去年 OpenAI 抢了 Google 很多风头,再加上 Sergey 回来、进入 Founder Mode,我知道整个 Gemini 团队的士气都非常高涨。
大家其实都憋着一口气:如果 AGI 要有人做出来,那是不是应该由 Google 做出来?Google 有最大的计算能力,有最优秀的人才,还有几乎无限的资源,再加上 Sergey 也冲回来了。
所以站在外部角度来看,Gemini 这一波崛起可能只花了一年时间。大家从去年的 I/O 被抢风头,到今年 Gemini 2.5 直接霸榜,几乎所有项目都到了第一名。连 OpenAI 今年可能都没办法再抢走这个风头了。
接下来还有一个问题。大家现在看到的是 Gemini 模型做得很好,但我知道很早以前,在 OpenAI 和 Anthropic 的 API 价格还很高时,Gemini 的 token 价格已经降到了当时 OpenAI 价格的 1/5 到 1/10。
当然,最新数据有没有反向促使另外两家降价,我没有去看。但整体来说,在开发者社区里大家都知道,Gemini 的 API 接入成本和 token 成本很低。我很好奇,它的价格是怎么降下来的?
我自己看,可能主要有 3 个方面。
第一,Google 应该从十年前就开始大量投入 GPU,当然它们叫 TPU。我觉得它们当时就想得很清楚:如果 Google Cloud 发展起来,就不能不停地向 Nvidia 或 AMD 购买 GPU。
所以 Google 从十年前就开始深耕 TPU 生态。它自己的 TPU 迭代速度,尤其是这两年明显变快了,因为需求非常大。拥有自己的 TPU,就避免了很多 Nvidia 税,不用单独等 Nvidia 推出新 GPU,也不用和别人抢。
第二,Google 本身拥有很强的基础设施。大家都知道 Google 的 Infra 非常强,它已经拥有几乎无限的资源,所以只需要想清楚如何动态调度这些机器。Google 动态调度机器的能力,远强于 OpenAI 和 Anthropic。
OpenAI 和 Anthropic 还没有自己的数据中心。Grok 现在很强,建成了世界上最大的 GPU 集群,但大部分公司其实没有能力调度这么大的集群,仍然依赖 Amazon 或 Microsoft 的云服务。
第三,因为 Google 能够定制自己的硬件、调用更大的集群,所以在优化模型时,软件和硬件可以一体化,模型也能在自己的硬件上发挥更强的能力。另外,它自己还拥有完整的开发者生态。
Kimi,有补充吗?
首先,我非常同意 Shaun 所说的。Google 的基础设施能力确实非常强。
很久以前,SemiAnalysis 出过一份很有意思的报告,给不同的 GPU 云服务打分排名。排名靠前的是 CoWeave,因为我知道 OpenAI 使用 CoWeave 来做 GPU 调度。
我当时还跟我的联合创始人开了个玩笑:其实在它上面还有一个,最强的应该是 Google 内部。Google 内部的基础设施能力真的非常强。
我再多说一点。虽然我们觉得 API 已经很便宜了,但没有人知道 API 的成本价到底是多少。
唯一能看到的线索,是当年 DeepSeek 发布论文时提到的内容。那篇论文的名字我有点记不清了,但 DeepSeek 说,它大概有 80% 的溢价空间,也就是说成本价只有当前收费价格的 20% 左右。
你看 DeepSeek 的模型规模,它用的还是 GPU,所以可以反过来估算 OpenAI 的情况,它们的利润可能非常高。
对于 Google 而言,它不需要通过 API 赚钱,因为搜索已经足够养活它了。它可以只收一个很低的价格,保证收支平衡就可以做这件事情。
但不要反驳我,我不是说它一定就是以收支平衡的白菜价在卖。我只是说,它有足够的资本,可以把价格降到接近成本价的状态来做这件事。
理解。现在信息量已经超级大了。
大家现在也都在做 AI Agent 相关的创业。你们在创业时,底层肯定要选择一个模型来搭建产品,你们会怎样选择模型?
站在我的角度来说,没有最好的模型,只有最适合你的模型。
很多做 Agent 的公司,最后都会把任务拆分成很多不同的类型。无论是分析文字、分析文件,还是分析图片,你需要判断当前哪个模型最适合你的任务。那个模型就是最适合你的模型。
当然,我们自己也会关注一些指标。因为我们现在做很多跟打电话相关的事情,对我们最敏感的就是延迟和稳定性。
如果出现明显的延迟,对方在电话里可能会感觉到 1 到 2 秒的停顿,体验就会非常糟糕。所以我们选择模型时,也会平衡这些因素。
对于特别敏感、特别需要实时性的任务,我是不是应该自己搭建模型,甚至完全不用外部的闭源模型?
如果有些任务对时间没那么敏感,但比较在意成本,而且可能需要接近 512K 的上下文窗口,这时候我可能会选择 Gemini Flash 或者 Pro。对智能程度要求高,就用 Pro;因为它相对便宜,所以会比较适合。
如果需要更强大的模型,或者已经习惯了 OpenAI 的模型,我觉得 OpenAI 对提示词和指令的理解、执行能力还是很有用的。我的很多数据设置也是基于 OpenAI,所以可能还会继续使用一些 OpenAI 的产品。
另外,Claude 这些模型的 agentic,也就是代理化能力非常强。如果是纯粹的代理化工作流,就会选择这些模型。
所以站在我的角度,没有最好的模型,只有在当前场景里最合适的模型。还要看哪个模型延迟低,因为延迟和模型大小有关,模型越小,延迟通常越低。
另外还取决于并发量,也就是当下同时处理多少个请求,这也会影响延迟。
如果是正常的云服务提供商,Gemini 2.5 Flash 现在的延迟还不是特别低,但 2.0 Flash 非常快。OpenAI 现在为了解决延迟问题,除了 GPT-4.1,还有 GPT-4.1 mini 和 GPT-4.1 nano,它们也都很快,但智能程度相对没有那么强。
所以这本身就是一个平衡,要看当前任务需要什么样的延迟。
理解。看起来也是处在一个你追我赶的状态中。你们会根据模型发布随时切换底层模型,还是说会采用一个“鸡尾酒”架构,大家一起使用?
会的。对于做 Agent 的公司来说,我的一个体验是,你其实不会对任何模型有忠诚度。谁的模型又快、又好、又便宜,我们就用谁的模型。
Kimi?
我补充两点。
第一,我完全同意 Shaun 的观点,这取决于你在做什么事情。但我想补充的是,你需要的不是人为选择最好的模型,而是一种可以被量化的选择方式。
比如我们做代理化工作流时,会把现在所有的模型都跑一遍,看哪一个模型在我们想做的任务上效果最好,然后就选择那个模型。
第二,正因为现在是百家争鸣的状态,所以才有初创公司的机会。
排行榜的排名,我们看一看就可以了。它在综合排名上表现好,确实有它的原因,但也可能有一些水分,没人知道。我不是说 Google 的模型有水分。
比如之前 Llama 4 在 LMSYS 排行榜上排名非常好。LMSYS 是一个人类投票的排行榜,反映的是人类喜欢什么。Llama 4 为这个排行榜提交的是一个特别优化过的模型,它的任务就是做人类喜欢的事情,而不是把基座模型或者普通的 Llama 模型上传上去。
所以这个排行榜看一下就可以了,它会有一定水分。但我不是说 Google Gemini 2.5 Pro 有水分。
正因为排行榜更多时候只是一个替代指标,所以你需要自己做评测。自己评测之后,就会知道不同模型擅长不同的事情。
这才给了初创企业机会:把不同模型整合在一起,做一个高度复杂的任务系统,切入一个垂直但极具深度的市场。
所以你们也是根据自己的需求来选择?
对。我们内部有一套非常完善的评测机制,跟我当年在 DeepMind 的时候一样。
当年我评测的是 DeepMind 的一个模型,现在我们评测的可能不是一个模型,而是一个系统。这个系统里可能包含很多个模型。
这次谷歌发布的内容中,还有一个让我印象非常深刻的点,就是实时语言翻译。
8. AI产品设计:模型决定下限,工程决定上限
比如 Google Meet 会上线英语实时翻译成西班牙语的功能,Gemini 2.5 Flash 可以根据文本生成 20 多种语言的声音。因为我自己做播客,其实是这些产品的深度使用者。
我在考虑一个问题:比如我的中文播客,如果能实时生成英文,只要内容做得好,是不是也可以进入英文市场,让大家收听?
但我使用这些模型时发现,核心不只是生成声音。生成声音可能很简单,但要让语音非常自然、流畅,让用户听不出 AI 感,还是有门槛的。
比如 ElevenLabs 的英文模型做得很好,但中文模型生成两个字还行,生成一句话时,语音就会有很明显的外国人口音。
所以你们觉得,这一类产品考验的核心到底是模型能力,还是工程能力?
我觉得现在我们使用的很多产品,尤其是直接面向 C 端的产品,更多还是纯粹考验模型能力。
未来,Sam Altman 说 GPT-5 不是一个模型,而是一个系统。我觉得未来大家会引入更多系统的概念。但现在作为 C 端终端用户,我们最直接接触到的,还是模型能力。
为什么 Gemini 在这些方面的体验可能没有 ElevenLabs 好?就像我之前说的,一个模型有很多团队共同负责。
可能有 20 个团队:这个团队说要增强编程能力,那个团队说要增强创意性写作能力;另一个团队说要增强实时 API 能力,还有团队说要在实时能力里增加中文、英文和西班牙语能力。
作为一家大公司,你不可避免地要做整合。在整合过程中,自然会有一些取舍。比如它的延迟非常低,同时就可能在某些表现上落后。
而 ElevenLabs 只需要做好一件事,不用考虑各种数据配比,只要把最好的音频数据加入进去,把这件事做好就行了。
你想做的是一个更横向、更浅层的任务,还是一个更垂直、更深入的问题?这相当于区分了它是初创公司的机会,还是大公司的机会。
所以核心其实是看团队内部重视什么?
我觉得是看优先级。不是说什么不重要,而是要排优先级。
在 Google 内部,对于初创公司来说,优先级第一的事情,可能只是 Google 排在第 30 位的重要事情。当然,如果这件事不在 Google 的路线图上,而你把它做成了,也可能获得一个非常大的市场。
这不是我说的话,是 Sarah Guo 在她参与的一些播客里说过的一件事。
你觉得考验的核心是工程能力还是模型能力?
我觉得都有。没有直接的模型,也没有直接的工程。
如果只给用户一个模型,体验其实还是会非常差。我只能说,模型决定下限,工程决定上限。
Shaun,你是做语音产品的,正好可以聊一下。
语音产品其实很有意思。比如文字输出,最后看好坏,可能只是每个人的偏好和喜好。但语音类产品不一样,所有人都能听出这个东西到底好不好。
就像你说的,如果模型生成的中文不好,甚至不用听两句话,听两三个词,我就知道生成效果不好。这是所有人都会有的共同感受。
我最早接触过 OpenAI 的 Realtime API,它可以实时完成语音到语音的端到端处理。后来我看了 Google Meet 的 demo,有几个点给我印象非常深刻。
第一,因为它是实时翻译,所以要保证信息准确。它是同声传译,语速和语调也要保持一致,而不是所有声音听上去都像机器。
第二,要保证速度足够快。最糟糕的体验就是对方说完一句话,5 秒之后你才翻译完。为了只解决两三百毫秒的延迟,工程上也要解决很多问题。
最后,很多翻译内容都和上下文有关。这个上下文应该怎样处理?是不是要把全部内容都放进模型里,同时还要保证速度足够快?这一点我也不是很清楚,但这些都是实时同声传译必须解决的难点。
它后来也在 AI 眼镜上展示了这个功能。我当时的想法是:这得多耗电啊?
其实还好。从技术角度来说,无非是怎样实现这个功能。
传统做法是打开一个简单的 WebSocket,或者通过服务器端进行流式传输。你可以把它理解成不停地发送请求,只是发送频率稍微高一点,但其实不会特别耗电。
而且如果是控制硬件设备,音频码率也不需要特别高,所以数据量没有想象中那么大。
9. 巨头一更新,创业公司倒一批
我记得谷歌还展示了一个 demo,就是 Project Astra。它会帮用户修自行车,包括发现零件有问题时,还可以让大模型打电话。
你觉得以后越来越多 Agent 加入模型,或者大公司可以直接为用户打电话、提供一些服务,会对你们的商业模式产生冲击吗?
我们现在主要是医疗领域的 B2B 模式,并不会直接面向 C 端。
你说的这个场景,对于很多 ToC 公司确实会有非常大的影响。随着大公司的模型能力越来越强,它们首先要做的,就是面向 C 端,扩大用户可以使用的能力。
所以对于 C 端公司来说,确实会有很强的冲击。
你刚才说到打电话的场景。很多 AI Agent 打电话时,只需要调用一个工具就能完成。如果你的垂直领域工具很少,或者整个商业流程和逻辑很简单,那么确实有可能被大公司直接取代。
所以有一种说法是,谷歌 I/O 发布会一开,感觉创业公司又要倒一批。你还记得去年还是 OpenAI 一开发布会,创业公司就要倒一批。
确实是这样。就拿你刚才说的虚拟试衣服来说,应该知道有很多公司在过去一年都在做这件事。
Google 一旦把这个功能做出来,这些公司可能就没有机会了。Google 做了,Amazon 肯定也会做。最大的几个购物网站都拥有这个功能之后,小公司就没什么机会了。
所以 ToC 是一件非常难的事情。
很有意思。关于试衣服这个场景,昨天我在谷歌现场还跟阿里的人聊到过。他们其实一直在尝试这个场景,但他们对这个功能的评价是:让用户试衣服这个点不重要,Google 如果能先把尺码搞对,就已经很不错了。
可能尺码是一个比“虚拟看一下自己穿起来好不好看”更痛的需求。
对。所以我觉得,现在的演示是直接上传一张照片。我不知道你有没有看过,苹果手机或者带有激光雷达传感器的设备,可以对人的身体进行简单扫描。
你只要拿着手机,围着自己转一圈,它就可以大概建立你的 3D 模型,把你的高矮胖瘦一次性输入进去。
现在 Google 只给了一张照片,但我觉得它要做这件事情也非常容易。
综合来看,你会怎么看谷歌在大模型这一轮竞争中的优劣势和生态位?
我觉得 Google 的优势有几个方面。
第一个是它拥有自己的硬件生态,不依赖 NVIDIA 提供硬件,所以在底层就已经比大部分公司有优势。基本上没有多少公司能做这件事情。
第二,它拥有非常大的服务器集群。因为有 Google Cloud 和自己的数据中心,它拥有近乎无限的算力。能够独立建设数据中心的公司非常少。
再往下是模型层。它拥有大量数据来训练模型。我觉得随着大家越来越接近 AGI,训练方法之间的差距已经没有那么大了。谁能获得最高质量的数据,谁的优势就会非常大。Google 恰好拥有非常庞大的数据。
最后是算法层。Google 拥有非常强的算法团队。所以 Google 通过这一年的努力,做到现在模型排名第一,我觉得一点都不奇怪。
你刚才提到硬件生态、服务器集群、模型层和算法层。总结来说,Google 还是一家技术公司,它的技术非常厉害。
这一点我非常认同。但同时,大家对 Google 的质疑是:它的产品基因不够强。
我们来看 Google 的明星产品,很多产品其实做得很好,但并没有一直维持运转下去。你会怎样看待 Google 把这些技术变成一个有穿透力的强产品?它在产品上的布局是怎样的?
我觉得 Google 的产品一直是它的弱项,它自己也很难做出特别好的产品。
所以我觉得 Google 这一波要做的,是围绕 Gemini 这个非常强的模型打造自己的生态。
你看它从 Gemini 手机应用,到 XR 眼镜,它不是只发布一个产品,而是一次性发布了可能 10 到 20 个产品。
我觉得站在 Google 的角度,它其实也不确定哪个产品能真正跑出来。你如果关注过 Google NotebookLM,就会知道,它原本也是一个非常小的项目。突然火了之后,Google 才开始向里面投入资源。
所以我觉得 Google 现在的趋势是:它不确定哪个产品会赢,但先把所有产品都摆到合适的位置。一旦发现哪个产品真正可能起飞,就开始不断往里面投入资源。
这就是我觉得 Google 现在在做的事情。
你现在还会用 NotebookLM 吗?NotebookLM 最开始是把所有研究资料输入进去,然后给你非常好的总结,可以按照几种模板来总结,同时你还可以根据总结去查看它引用的是哪一部分。
但它最厉害的是,产品经理在上面加了一个一键生成音频的功能。它一下就在整个播客圈火了:几十页的长文本,甚至一本书,都可以快速变成一个十分钟的播客,用音频总结出来。
我觉得这个产品刚发布时非常火,但现在声量小了很多。我不知道你现在还有没有持续使用和关注。
我获取信息的主要途径,后来大部分都是播客。这也是我做这件事的主要原因,所以我觉得播客会变成非常常见的信息获取渠道。
NotebookLM 非常聪明的一点是,任何信息放进去之后,它都能变成一种我可以接受的模式,变成一个属于我的个人播客。
我用过几次之后,如果以后要听,我会选择一些内容。因为现在长播客确实很多,我会挑几个自己想听的。
你会直接听长播客,还是先把长播客总结一下,然后把它变成短播客来听?
我其实也试过把自己的节目放进去,让它总结成一个短播客。我觉得它总结得还不错,但目前只能做英文版。
我自己会听两三个小时的长播客,因为我觉得那些播客可以让我不遗漏任何细节。只要是我想知道的知识点,听一遍播客就可以从头到尾覆盖到,而不会丢失中间的细节。