# E201｜从Manus到ChatGPT Agent：底层技术架构有何不同？（上）

硅谷101 · 2025-07-25 · 80 min · https://www.youtube.com/watch?v=3Kygpc3rCCo

## 逐字稿

泓君

上一集节目我们刚刚复盘完AI智能体的投资逻辑，OpenAI就发布了它的第一款通用型智能体ChatGPT Agent。今天我们为你带来了一个重磅消息：我们将推出ChatGPT智能体。人们一直希望有一个统一的代理，它能够自主运行，使用自己的计算机去完成真正复杂的任务。今天我们邀请来了Pokee.ai的创始人朱哲清，他也是前Meta AI应用强化学习团队的负责人，本科与斯坦福博士阶段的研究方向都是强化学习。

很多网友问，怎么感觉这个有一点点像我们经常用到或者提到的Manus跟Genspark？这一期我们会聊聊，Manus、Genspark、ChatGPT Agent这些看上去很像的通用型AI智能体，它们在技术架构和设计逻辑上有什么不同；也会聊到全世界最顶尖的强化学习人才分布，以及AGI，也就是通用人工智能的5个层次。

从这两三年的AI发展来看，OpenAI定义的前3个层次的通用人工智能可能已经实现，或者部分实现了。而对于一些前沿研究者来说，我们现在正处在从第3层到第4层的跨越期，强化学习正是揭开谜底的钥匙。

另外，嘉宾的学习与工作语言都是英文，所以今天的播客中出现了很多中英夹杂的专业术语。对非技术听众来说，听起来可能会有一点不友好，但比起语言的问题，这依然是一期很高质量、极具前瞻性的对话。如果大家理解有困难，可以在B站或者YouTube上观看我们的字幕版。

欢迎Pokee.ai的创始人朱哲清，Bill Zhu。哈喽，Bill。我们今天录制的时间，正好是在OpenAI刚刚发布ChatGPT智能体的这个周末。它其实是周五上午发布的，我不知道在它发布以后，差不多过去一天半的时间，你有没有使用？

朱哲清

对，我们确实第一时间就使用了它。因为在它发布前一天，大家其实都已经看到了它们在Twitter上的一些预热，我们在当天下午三四点钟就开始试用它了。

感觉它的总体效果可能比我们想象中要差一些，速度也比我们想象中慢很多。核心原因应该是跟它原生的Deep Research和Operator本身的速度有关。因为深度研究相对于市面上所有的产品来说，还是相对比较慢的一个研究产品；再加上Operator本身，我们也知道它的基准测试上的速度也很慢，所以它把两者结合以后，整体速度就更慢了。

比如说，有一个比较简单、大家都在对比的用例，就是先做深度研究，然后再去创建一个切片。像这种用例，时间基本上在35分钟到1个小时之间，所以是一个非常慢的过程。

我觉得它的优势在于，它在浏览器上真的要做操作的时候，是相对有优势的。比如说它去定制衣服，或者预订旅程的时候，它在浏览器上的点击能力要超过市面上大多数基于浏览器的智能体。

所以非常取决于你的使用方向是什么。如果是偏运营相关的一些工作，可能不是很适用；但如果是偏消费者相关的，它可能会更适用一些。

泓君

你可不可以具体举一下例子？你具体用了它哪些方面？刚刚你提到，在挑衣服或者做旅行规划的时候，它看起来比其他基于浏览器的智能体更有优势。可不可以讲一下你的整个使用场景，包括我们对比它跟其他使用浏览器的智能体时，它的不一样是什么？

朱哲清

我可以简单举两个例子。一个就是我想去新加坡待3天，我就问它：“你能不能帮我把整个旅程定下来，然后去找对应的航班、酒店信息，并把它定下来？”

它确实花了很长的时间。一开始它先去做规划，这个规划所有的语言模型现在都可以做，所以没什么可让我赞叹的地方。之后它去搜往返的航班，以及对应的酒店，其实难度也没有很大，但是目前市面上大多数基于浏览器的智能体，在这方面做得都不是很好，ChatGPT相对会好一些。

因为它的vision，也就是视觉感知能力，相对更好。它有点像机器人的感知架构，里面有vision-language model，也就是视觉语言模型。它会根据视觉感知的结果，再进行反馈。

泓君

你的vision model，是指它在比如找航班的时候，能看到搜索页面的信息？它不一定要通过后台数据或者API接口调用的方式，指的是这个不同？

朱哲清

大多数基于浏览器的智能体里面，都有一些视觉感知的部分。也就是说，它要去看那个页面到底长什么样。

因为很多时候，如果靠基于浏览器的方式，它完全是靠后端想办法，把页面里面所有的HTML组件拉下来。拿到组件以后，再去判断每个组件是什么，然后选择要点哪个地方，再去执行。

很多时候，第一，你有可能在访问页面的时候就会被卡住，因为你等于是在爬虫爬人家的页面。第二，作为一个基于浏览器的智能体，你希望它能够看到整个视觉层的结构是什么样子，所以视觉感知能力就会有帮助。

当然，很多计算机使用智能体都带有视觉感知能力，所以也不算是一个很大的创新。但因为它的视觉感知能力相对强一些，所以导致它真的去执行的时候，要比我现在看到的市面上其他浏览器智能体好一些。

泓君

它帮你订机票、酒店，然后做旅行规划，整体花了多久？它最后完成支付环节了吗，还是只是把所有航班选好了？

朱哲清

我记得应该是二三十分钟。只是选好了，到了支付环节，都是人去接管操作的。

我觉得支付环节是所有智能体业务范围内最麻烦的一个点。因为正常的人类不会信任智能体去做支付，所以很多时候所有智能体一旦涉及支付，都会卡死在那里。

不是技术上卡死，而是产品上卡死，因为人和智能体之间的信任还没有达到那个标准。所以导致大多数智能体，像我们也一样，其实有很多跟支付相关的功能已经集成完了，但是一直没有开放。

因为我觉得不会有人那么轻易地信任Pokee去做这件事情。OpenAI也有一样的问题，到了支付环节，还是需要人类去接管，然后完成支付任务。

等于说它花了20多分钟，但当中你还是得花时间说“我要去付钱”。总体来说，我觉得实用性没有很大，我宁可自己花点时间，十几分钟全部搞定。

另外一个相对比较常用的用例，就是它们在电商方面也花了很多力气。比如说根据你的要求，再去找相对应的产品。

我个人还不是很喜欢这种产品方式，因为我感觉它整个帮你搜索产品、找相对应产品的过程，比如什么颜色、什么样的款式，其实是一个挺慢的过程。而人去选的话，也就是点几个键的事情。

我一直认为，电商这个方向的决策链路很短，导致智能体真正能够给你带来的优势很小。因为它真正需要人类决策的范畴，可能也就是3到4步，最多了。

它不像其他事情，比如你要做一个调研、写一个幻灯片、写一个电子表格，这些都很花时间，而购物可能没有那么花时间。我觉得购物最花时间的地方，其实不是你已经想好了要什么，到下单的这个过程，而是你在选择的那个过程。

泓君

刚刚你提到，用它订航班和酒店的时候，我特别想问，你最后自己订的那家酒店，跟它做旅行规划、帮你找到的那家酒店是一致的吗？你对它找的结果满意吗？

朱哲清

不一致。航班也不是，因为它有很多信息都不知道。

我举个例子，我一般出门都住Hyatt，飞航班的话，我一般都会尽可能在直飞里面找价格比较低的。但它在找的时候其实没有反馈机制，一开始只会在高层次上问你三四个问题，就是深度研究的那种问题。

它一轮完成以后，后面没有再跟你有反馈，它就一直自己执行。所以它定的相当于是一个笼统的解决方案，到最后我得全部推翻重来，因为它没有用任何我喜欢的品牌，也没有加入个性化的部分。

这是我认为目前市面上Agent产品，特别是To C、面向消费者的智能体产品，而且跟生产效率不相关的智能体产品的一个最大痛点。

OpenAI一直在强调它们的记忆能力，这确实很重要。但是它们从哪里去一开始收集这些记忆，就变成了一个没有办法解决的冷启动问题。

泓君

但其实只要你告诉它一次，你喜欢住凯悦酒店，它可能以后就记住了，跟一个人类助理一样，你越用才会越顺手。假设让你的秘书帮你订机票，你可能也得跟他沟通：“我要凯悦酒店，我在飞机上偏好什么时间段、什么价格、什么舱位。”

朱哲清

对，确实是这样的。但是，人类会不会愿意做这么一两轮沟通，说完以后它是不是能记住，这其实是个问题。

我目前用ChatGPT下来，它对于你的一些行文偏好是有一些记忆的，但是更复杂的偏好，它的记忆其实没有那么完整。ChatGPT刚出来的时候，我问过它跟旅行相关的问题，但这次再问它的时候，它仍然没有记住当时给它的一些反馈。

所以它并不能够很完整地把你所有的反馈都记下来。

泓君

我们知道，在OpenAI推出这一轮ChatGPT智能体以前，刚刚我们反复提到过，它有两个智能体：一个是Operator，处理跟电商购物相关的智能体调用；另一个是Deep Research，用来做深度研究。

我看它这次的整个发布，自己的感受是，它有一点像这两个智能体之间的结合体。因为你也在开发智能体相关的产品，你觉得OpenAI在这个中间的核心技术壁垒是什么？把这两个智能体放在一起，难度大吗？

朱哲清

其实没有很大。这次的产品甚至让我感觉，它们是因为看到市面上有很多通用智能体出现，想要占领市场而做的一个动作，而不是说它们真的已经准备好了。

像它们发布会上给出的产品演示，其实也并不是很成熟的状态。说句实话，它们做的很多任务，和市面上的通用智能体相比，效果可能更差一些，速度又更慢。

它为什么要把深度研究和Operator放在一起变成一个智能体？核心原因是，深度研究是帮你检索信息，也就是“我从哪里可以得到更完整的、面向用户需求的信息”；Operator则是基于这些信息，去执行任务。

过去这两个方向基本上是割裂开的。如果要了解更完善的信息，你只能直接用深度研究。用完以后，它可能给你一个巨大的报告，但这个报告也不足以让你去做什么事情，你可能只能把报告复制粘贴到某个文档里面。

Operator也是一样，你必须已经知道自己想要什么，然后基于想要的东西，再去找Operator，让它帮你操作网页来完成任务。

这两个方向在各自的领域里可能都做得比较好。它希望能够把从信息获取、信息检索到执行的端到端体验打通，通过这两个能力实现这一点，这是一个比较符合常理的决策。

但我目前看起来，它相当于是一个工程解决方案，也就是做一个判断：如果用户需要非常复杂的信息检索，那就去做深度研究；完成深度研究以后，拿着这些信息再去执行。如果不需要，那就直接执行。

当中还有一个偏编程和虚拟机的解决方案，这一点跟Manus很像。它确实有虚拟机，可以执行比如生成PPTX文件、用Python脚本写一些脚本，或者写一些Bash脚本，让虚拟机去执行任务。

所以它基本上就是一个从深度研究到浏览器，再到虚拟机的结合体。

泓君

你觉得它跟市面上的通用型AI智能体，主要区别是什么？或者说，市面上所有这些通用型AI智能体，如果我们把它们放在一个池子里，看各家各自的优劣势，分别是什么？因为我相信，它们在解决不同场景的问题时，还是会有一些区分度的。

朱哲清

目前的通用智能体，我把浏览器和非浏览器的全部列出来，可能包括这么几家：Perplexity、OpenAI。Anthropic其实没有推出自己的通用Agent，但它们有编程Agent。我们相对比较小一些，比较晚才出来，还有Manus、Genspark。浏览器方面可能有Yutori、Fellou，还有Flowith，Flowith可能更偏垂直领域一些。

首先，在浏览器能力和操作能力上最强的，目前应该还是OpenAI。特别是在把深度研究和浏览器操作放在一起以后，它们绝对是最强的。

如果你去看一些基准测试，比如像最新出来的browsing camp，它们能够达到50%多的基准测试分数，其他最高目前也只有20多分，而且是在开源环境下。

在浏览器的实际执行上，Operator做得还是相对比较好的。因为当年的Operator是跟很多有API、有虚拟机的环境去对比的，它只有一个浏览器。所以现在加上虚拟机能力以后，Operator加上OpenAI的虚拟机，应该会超过市面上一些浏览器加虚拟机的工具。

但是它唯一比较麻烦的一点，在于OpenAI的虚拟机装了太多东西，什么都想往浏览器里面塞，导致速度很慢。

浏览器方向包括OpenAI、Fellou以及Manus的一部分，因为Manus也使用浏览器。另一个方向是完全只有语言模型，再加上一些执行能力，可能也可以算虚拟机，但它是一个受限的虚拟机。

它并不是可以调用整个系统里的所有包，而是有一些预设的包，然后去完成任务。

当然，我们也不能忘记Perplexity。Perplexity在浏览器方面做了一个相对比较另类的产品：它的浏览器不是一个能够导航浏览器的智能体，而是在用户使用浏览器的时候，给你一个sidebar，也就是侧边栏，让你告诉它“我需要在这个页面上做些什么”，然后它去帮你执行。

泓君

Browser就是浏览器的意思，sandbox就是虚拟机。所以刚刚你提到了基于浏览器和基于虚拟机的两种搭建方式，可不可以整体跟听众科普一下，现在整个AI智能体的搭建，在底层架构上有哪几种？

朱哲清

现在的智能体有4种大的方向。

一个是基于浏览器的智能体；第二种是浏览器加虚拟机的智能体，在这种智能体里面，会有很多操作通过虚拟机里的代码以及命令行来完成；第三种是只有虚拟机，但是虚拟机内部有非常大的限制，主要通过语言模型生成代码，然后只能运行某一种类型的代码；最后一种，是可以横跨很多工具、进行很多集成的智能体。

我先讲一下浏览器和非浏览器。浏览器、虚拟机、纯语言模型，再加上Pokee这种方式，这4个方向之间都有可以互相借鉴的代码，而且也有互相重叠的地方。

浏览器的意义在于，我认为世界上所有的网页和互联网服务，都可以在某个网页上呈现。所以我只需要让智能体能够看到那个网页、操作那个网页，就可以完成任务。

基于浏览器的智能体，用户可以看到它在页面上点击哪些地方，它可以一页一页地去看，就像人在操作网页一样。

它的缺点是什么？就是很慢，而且token消耗特别高。原因在于，你去看一个网页，就等于要把HTML文件直接拉下来，里面可能还包括一些JavaScript脚本，然后把它们全部拉下来，从零开始全部读一遍，只为了操作一个网页。

但它确实是万能的。

第二个是虚拟机。虚拟机的意义是，我可以在线下写一些Python脚本、Bash脚本，或者JavaScript脚本，然后直接在虚拟机环境里运行这些脚本，来完成任务。

比如说你要做数据分析，完全可以告诉虚拟机智能体：“这是一个表格文件，它的表头是时间、每周销售、品类等。”拿到这个文件以后，你就直接告诉虚拟机：“你能不能照着这个文件，帮我做一个每周的数据分析？”然后它就给你写一个Python脚本，帮你运行，得到结果。

虚拟机环境的好处是，它可以运行很多线下的、开源的包。它的缺点是，很多情况下无法访问互联网，特别是那些需要完整授权和身份验证的产品。比如说你要登录自己的Facebook，这些事情它肯定做不到。

第三种是语言模型加虚拟机的Agent。它可能限定在一个大环境里，JSBox就是一个这样的例子。它不给你完整的虚拟机，这个例子里面甚至连浏览器都没有。

以JSBox为例，它有一个以语言模型为主体的推理过程，写代码也完全靠语言模型。它有一个虚拟机，让它运行一些代码、生成一些东西，然后再把结果转化成可视内容。

但那个环境甚至不能叫虚拟机，因为它是非常受限的。它只有三四个包，环境是完全被控制的，无法临时下载一个开源包。比如说我现在需要临时修改一张图片，如果这个任务在它原始设计的工具包里没有，它自己不会去下载一个包再完成这件事情。

所以这种设计是JSBox，比如幻灯片智能体、表格智能体，在设计的时候就把可用的包限制住，不让用户使用更多的包。这是一个相对封闭的工作流：在受限环境下，用语言模型作为主体写代码，同时用一个小型环境去执行。

最后一种，可能跟我们以及以前的Zapier、n8n、UiPath比较像，但工作流内部的每一个节点，是通过和第三方服务提供商直接集成来完成的。

这种方式的优势在于，可以保证每一个服务的交付都非常可靠，因为是第三方直接提供的。比如Facebook，它把权限给我们，就不会出错。

但与此同时，它也有局限，就是不可能把每件事情都实现。很有可能用户想要在个人Facebook账户上发图片，但我们做不到，因为Facebook只允许创作者和商业用户自动发布这类帖子。

所以这是我们和以前的UiPath、Zapier、n8n相近的一条路径。总的来说，就是这4种类型。

第二种和第三种之间的边界很模糊。唯一的区别在于，第二种的虚拟机是语言模型执行完以后，提供给用户使用的一个几乎开放的虚拟机，你可以自己选择下载新的包，再去执行任务。所以虚拟机本身的能力，是整个智能体能力的主体。

而第三种可能是语言模型在现有的包之下生成什么代码，这件事已经成为限制整个智能体能力的主体。

泓君

从用户的使用体验上说，如果我们把Pokee、Genspark、Manus和OpenAI的ChatGPT智能体放在一起，你觉得用户体验会有什么非常明显的不一样吗？

朱哲清

其实有很多地方都不一样。我们先讲Manus，因为它是第一家出来的。

Manus的体验是，尽可能用一个虚拟机加浏览器的环境，搭建一个几乎让人觉得万能的环境。它有一个语言模型作为规划主体，规划完以后进入Browser，由另外一个Agent完成浏览器导航。它得到的信息会被总结下来，再进入虚拟机执行，如果有必要的话，它确实可以做很多事情。

虽然它有很多时候会出现幻觉，因为它看到的上下文太长了，但理论上它确实可以涵盖市面上你所需要的所有功能。

但与此同时，它也被浏览器能力限制住了。比如说你要真的发一个帖子，它就做不到，因为它需要在页面上导航，选择那个小按钮，选择完以后再上传图片、生成视频，各种各样的操作都很难。

比如说你要建一个Google表格，或者把Google表格里的某个表格改成一种格式，也比较难，因为注意力空间太小了。浏览器就是它的主要限制。

第二点就是它很慢，这也是Manus和ChatGPT智能体的一个共同问题。因为用了浏览器，所以速度会非常慢。

泓君

三十多分钟做一个任务，我觉得还是快的。我最开始使用的时候，可能要一两个小时，不过那个时候还比较早。

朱哲清

对，现在肯定比以前快了，因为它们整个基础设施都已经搭起来了。但是它的瓶颈还在那里，甚至最后会变成network call，也就是网络请求。

下载一个网页本身可能就需要三四秒，这个时间是跳不过去的。

ChatGPT的优势在于，它们的深度研究做得好，能够做出很详尽的报告。如果你通过这个报告再去执行某些任务，结果会相对更详尽一些。

Manus的总体优势，可能在于它的虚拟机环境搭得比ChatGPT更好一些。但这个我还需要更详细地去查，因为我还不太清楚ChatGPT里面的虚拟机能做到什么程度。不过我猜，Manus已经在虚拟机上花了很多精力去部署，应该会有一个比较小的优势。

JSBox一开始有一个超级智能体，几乎是说“我可以做任何事情”。但后面它发现能够处理的工具数量还是有限，所以开始做模板。

比如幻灯片是一个智能体，AI电话是一个智能体，表格是一个智能体，浏览器也单独做了一个智能体。在同一个用例下面，它会把用户体验作为核心目标，然后做一些模板。

不管你问什么问题，它总是用这样的模板去生成幻灯片，总是用这些工具去搜索信息，使得它变成一个相对标准化的工作流。它越来越不像一个通用智能体，而变成了一个偏人为选择的智能体。

但它的速度确实比Manus和ChatGPT快一些。原因就是它没有那么复杂的浏览器导航，同时它的虚拟机本身限制很多，在某一个Agent里面只有这么一点工具。

泓君

这样是不是也更节省token？

朱哲清

会相对节省一些token。它把大任务拆成了细分的垂直小任务。我猜它想做的是，随着应用场景一个一个完善，最后变成一个承载了很多小任务的大平台。

泓君

对，有点像微信小程序一样的一个平台。

朱哲清

Pokee可能最大的不一样，就是它可能是目前所有Agent里面最快的。我们现在还没有把深度研究智能体开放出来，但确实有一个深度研究智能体正在开发当中。最后我们会把自己的深度研究智能体和执行智能体放在一起，总体体验会有大幅提升。

但总体速度应该是市面上所有产品的4到10倍左右。之所以可以做到，是因为如果不再需要使用非常复杂的虚拟机，也不再需要非常复杂的tool calling，我们现在直接使用第三方集成的SDK和工具，通过自己的调用工具功能，整个速度会大幅提升。

也就是说，没有了MCP和现在市面上工具调用里巨长无比的上下文问题，所以每次调用工具的成本可能能够削减50%到60%。再加上我们自己的上下文工程，使得整个成本至少跟OpenAI的ChatGPT智能体、跟Manner相比，有一个数量级的区别；跟像Verticalize JSBox这样的产品相比，可能也有几倍的差距。

在token使用上，我们确实有劣势，特别是跟基于浏览器的智能体相比。我们并不是完全万能的，有一些任务，比如在个人账户上发布Facebook帖子，我们就只能在Facebook页面上发布；Instagram也必须是创作者账号或者企业账户，个人账户没有办法帮你发帖。

泓君

所以只有企业用户才能使用你们的智能体？

朱哲清

不是企业用户，是创作者或者企业账户。

比如说你在接Instagram和Facebook接口的时候，它们给到你的就是企业用户或者创作者才能操作的界面。它们不希望所有个人用户都用智能体去发帖，发完以后没人上Facebook和Instagram。

它们希望个人用户像普通用户一样，每天去Facebook和Instagram上看帖子、发帖子，这样才有参与感。企业用户和创作者用户则希望能够让他们创作更多，所以才把接口开放给他们。

每个平台都有自己的限制。我觉得这条路径其实相对比较符合商业逻辑。

如果你想象所有个人用户都通过一个智能体，想办法用浏览器去破解Facebook或者Instagram账户，或者破解某个平台，通过爬虫访问网页来完成任务，那对于平台来说就是一种损失，平台会把浏览器访问全部卡掉。

所以如果你一开始就是跟着平台的商业逻辑走，以前有人会通过很手动化的方式写代码完成产品上传，现在就会有人直接写一段文字，在网页上运行，然后把这个视频creative，也就是个性化内容，上传到这些社交媒体平台上。

其他平台也是一样，它们开放给你的权限，就是它们认为开发者、非个人用户或者非普通用户真正最需要使用的工具。如果你可以把这些工具放进智能体里，原来就会使用这些工具的人，就会转过来说：“我写一行提示词就行了”，不再需要写那么多代码。

泓君

所以我理解，Manus、Genspark，还有OpenAI的ChatGPT智能体，它们的商业模式其实是面向消费者的；而你的商业模式听起来，现在应该更偏向企业端。

朱哲清

现在这个时代，企业端和消费端的模糊性很高，但是我们一定是让专业用户及以上的人群来使用我们的产品。

专业用户以下的普通用户，其实使用一个非常省时间的AI智能体的概率不高。这也是为什么市面上很多AI智能体的留存率非常差，因为它没有重复性，很多工作流用一次就结束了。

而我们目前看到的很多用户，每周都会重复运行一模一样的工作流。所以这是我们发现它具有重复性的地方。

泓君

那这是不是也很取决于平台会给你们开放什么样的SDK工具和API接口？

假设我每天收到很多微信消息，想有一个智能体帮我管理所有信息，帮我回复一些比较基础的信息，前提还是微信要给这样的智能体开放接口。它们是不是愿意把这些接口开放给开发者？

朱哲清

在美国，开发者社区是很多大公司，特别是科技公司所崇尚的方向，所以大多数公司都有非常完善的接口和开发工具包。甚至有些公司给到你的只是一个非常简单的爬虫接口，也不会给你Python开发工具包之类的东西。

国内公司可能会相对差一些，很多接口并不开放给你。但像企业微信、创作者级别的微信，也会把接口开放出来，你可以自动回复，什么都可以做。

国内整个生态其实也在慢慢开放，特别是MCP这波出来以后，很多公司都开始被迫开放开发工具包和接口。比如高德地图就是一个例子，之前没有那么开放的高德地图，在MCP出来以后，首先把地图生态完全打开了。

所以其实有很多这样的例子。我们目前也有一些公司给我们开放平台API，有些接口是独家的，有些不是。

总体来说，这个商业模式一定是偏专业用户的商业模式，因为很多普通用户端的使用场景非常浏览器导向。比如你去浏览网页、买东西，其实旅行需求也有偏专业化和非专业化之分。

专业化的旅行需求，比如出差，每次都是标准化的：你每两周要去一趟湾区，每次都住同一个酒店，那就可以每两周帮你买一次机票。

但如果是普通用户出去旅行，他可能是“我要去这个地方玩”，酒店也想探索新的，航班也有很多变化，比如今天刚发了奖金，想要飞商务舱，里面有很多变数。

所以这种用例本身更适合基于浏览器的智能体，因为它就是有一台电脑在前面，可以打开浏览器去做事情。

泓君

在你跟大公司合作的过程中，它们开放API接口的动力是什么？包括你刚刚也提到，国内高德地图接入MCP，它们的动力又是什么呢？

朱哲清（Bill Zhu）

首先，整个智能体浪潮会在某种意义上取代正常的网页流量。

过去可能是一个人打开浏览器，在搜索引擎里输入一段搜索，得到搜索结果以后，点击一个网页再去做某件事情，这是一个常规流程。

但未来可能是，你打开ChatGPT；如果你是普通用户，就打开ChatGPT，如果你是专业用户，就打开Pokee，然后输入一段话：“今天早上我看到了Replit CEO的一个采访，你能不能直接把YouTube上的那个讲稿拉下来，帮我写一段报告，告诉我他的增长策略的核心观点？”

然后智能体就直接完成了整个流程，我从头到尾都没有打开YouTube。

未来购物可能也是一样。你可能从头到尾只打开ChatGPT，说：“我明天要去一个晚宴，需要一套正装。”它已经知道你的身材、身高，然后自动帮你找到最符合你的衣服，把衣服呈现在你身上，你看一眼觉得不错，它再告诉你现在有一个折扣，然后完成付款，可能就是这么一个流程。

这给我们的启示是，过去所谓的工作流已经改变了。它不再是通过浏览器开始整个工作流，去下单、获取信息，然后再进入另外一个网页进行操作。

无法避免的是，我认为在接下来1到2年，大多数门户网站，不管是电子商务、搜索、视频网站，还是其他各种类型的门户网站，它们的流量一定会非常快速地下降，而入口会变成各个方向的智能体。

这也是为什么Google要推出A to A（智能体通信开放标准）。每家公司都可能有自己的智能体，智能体之间可能会发生交互。如果一家公司能够占据这个协议，率先在Gemini里面完成部署，最后它就会成为整个生态里最大的赢家，因为它成为了智能体入口。

ChatGPT也是一样，Cloud也是一样。它们推出协议，也是想要战略性地占据智能体入口。这也是Pokee要推出协议的原因，我们也想占据专业化场景下的智能体入口。

泓君

你们为什么想自己推出协议，而不是直接接一个标准的MCP？这样大家都可以统一使用，你也能在更大、更广的生态里，直接接入很多已经接好的软件。

朱哲清（Bill Zhu）

其实MCP现在的可用性很差。现在市面上应该快有2万个MCP了，其中真正可用的不到200个，而且大多数MCP都没有人维护。

导致的结果就是，大多数公司不愿意花时间去做MCP。我们的目标是，公司不再需要做MCP，也不需要自己搭建一个MCP服务器，只要直接把开放API给到我们，剩下的由我们来管理。

所以对于服务商公司来说，它们什么都不用做，就可以获得一个额外的流量入口。

泓君

你刚刚在描述，接入智能体以后，互联网会发生什么样的变化。比如门户网站的流量会大幅下降，像听到Replit CEO的一段演讲，直接在ChatGPT或者Pokee上就完成对这段演讲的复述。

我在想一个问题，因为我的身份是创作者，跟你的身份是不一样的。你觉得未来这件事情对创作者会有什么影响？

假设我们上一期节目聊到腾讯算法广告大赛，那期节目里有一个口播广告。只有更多的人听这个播客，大家才会听到这段广告，它才能支撑播客的商业模式运转下去，大家才能持续赚钱，把这档节目运营下去。

但如果以后没有这个过程了，大家会说：“这期播客为什么没有开AI总结？”然后就不去听播客，直接看AI总结，那对广告来说其实就是流量的折损。

朱哲清（Bill Zhu）

我觉得广告这个行业会永远存在，但是它的发生形式会改变。现在市面上有很多专注于广告的AI公司，它们都在研究，语言模型时代或者智能体时代，广告要如何被插入。

我举个简单的例子。在播客里插播广告这件事情，未来可能会变成另一种形式。

现在的播客，大多数情况下，除了平台向你收费以外，播客提供者本身是不收费的。比如硅谷101录了一个播客，大家都是免费听的；如果你在YouTube上使用YouTube的广告，YouTube再通过广告跟你们分成。

未来可能是，我们需要获取你这个播客本身的知识产权权限，这个权限是有价值的。每一次通过调用，或者通过网页访问，找到你们播客的某个时间点，或者获取到你的信息，任何智能体都要向你付款。

你不再需要负责广告流量，广告由智能体来完成。智能体会说：“我得到了这个信息以后，怎么在整个工作流或者用户体验中插入广告？”

这个时候，智能体可能会问：“我们现在得到了这个对比，你想选择哪个智能体去尝试探索？”这件事情本身没有界限分明的答案，所以会出现一个排序机制。

智能体推荐哪个智能体让用户去尝试，就可以向那个智能体的公司收费。广告在这个时候发生，而支持每个API、每个第三方插件的产品本身，或者知识产权本身，都可以直接收费。

所以对于创作者生态以及SaaS生态来说，从某种意义上讲是变好了，而不是变差了。你不再需要在Google上投广告，也不再需要免费把内容发给YouTube，让它帮你投放，而是由智能体直接向你付费，通过它自己的广告机制支付自己的成本。

我不觉得你们会受到很大的冲击。

泓君

整体上我觉得，流量分成这样的模式会变得越来越弱。如果智能体调用了很多创作者的内容，怎么给创作者付费，可能是未来会讨论的一个问题。

我稍微有一点疑问的是基于流量的这套方式。比如你有推荐算法，一个页面可以显示10条播客内容，或者12条你想点击的视频信息。但一个智能体在回答问题的时候，我觉得现在还是比较聚焦于精准，它可能引用的范围就相对更小了。

朱哲清（Bill Zhu）

上个星期在ICML的时候，有一个专门做推荐系统的人，我们俩聊到了这件事情。聚会之后，有一个研究者上来问我：“你觉得推荐系统之后会是什么样的发展路径？”

我当时告诉他，我觉得推荐系统的大方向可能会受到巨大挤压。在智能体的整个框架下面，它仍然是一个推荐系统端到端、基于动机的决策过程，但它每一次给你的交互，其实只是给你一条信息，或者几条最相关的信息。

这个时候，它的决策链不再是按照排行第一、排行第二、排行第三这样的方式去决策了，而是以时间作为决策点。

一个人和智能体之间交互的总时长基本是固定的。就是说，这个智能体好，我就会跟它交互更久。它的目标可能是，在每一个时间点上，推荐的东西能够让你所花费的时间和它能够得到的回报成正比。

这个时候，原来的推荐系统算法可能就不那么成立了。原来的推荐系统算法是说，每一条内容被点击的概率，可能跟它的排名成正比。

而现在可能变成，我每一次给你推荐或者回复的信息，基本上都是你一定会去点击的东西，但你会不会进行第二轮交互？下一次你花时间跟我交互，我所占用你的时间成本，就要求我推荐的这一条信息必须是最精确的。

这样会使得你跟我有更多交互。所以它的目标就变成了：我不是在一个页面上给你呈现5条、10条内容，而是可能有5轮、10轮对话，每一轮的目标都是让你跟我进行下一轮交互。

这个时候，它跟传统推荐系统的算法就完全不一样了。所以当时我跟他说，我觉得整个推荐系统，特别是这种基于排行的推荐系统，长期发展的潜力可能会被极度压缩，因为它可能不再有排名。

它更多的是一个基于顺序、基于体验、基于探索的交互机制。你可能唯一的目标就是，每一条内容都给你最精确的结果，同时在不损失未来机会成本的情况下，在同等级别的内容里选择一个能够带来更多收入的内容。

当然，我也不是百分之百确定这一定是未来的方向。但从目前的智能体发展趋势来看，我个人感觉可能会是这样一个方向。

泓君

我觉得非常有意思。之后创作者生态会怎么演变，也是我们一直非常关注的一个话题。那下一期节目中，我们将重点聊聊强化学习与它人才分布的大本营，以及AGI的五个层次与我们现在的位置。欢迎大家继续收看我们下一期视频。
