

编辑:前沿在线 编辑部
过去一个月,Personal Agent 的热度集中爆发。
Meta 的 Muse、OpenAI 的 Dots 先后亮相,前者打通云端邮件、日历、支付全链路,后者连接四千多款应用替人办事。行业里几乎一边倒的声音是:App 的时代结束了,以后所有需求都能靠对话解决。

十月初,Airbnb CEO 布莱恩・切斯基在TechCrunch的专访里给这盆火浇了盆冷水。他说内部测试过多款消费级 Agent,体验都不理想。
消费级 AI 至今没真正跑通,每个 App 确实都该往 Agent 方向演进,但 Agent的界面绝不该只是一个对话框。
变化比预想来得更快。OpenAI 新发的 GPT6 正式搭载智能 UI,AI 输出不再是整段文字,而是可以直接点击交互的图形界面。
大模型厂商自己下场验证了一个判断:对话是 AI 的演示形态,不是最终的产品形态。

这个分歧,行业里很少摆上台面。Personal Agent 的终局到底是什么,是更聪明的命令行输入框,还是专属于每个人的图形化应用?
我们的判断偏向后者。对话只是用来创造工具的方式,不是日常使用的最佳形态。
近期 Eazo 和 Qoni 两款产品先后亮相,从终端应用到底层基础设施给了一套完整样本,创始人谢扬近十年的连续布局,也让这条路径多了份可参照的产业样本。


计算机交互的演进,始终是朝着远离文字、贴近人的方向。
从命令行到图形界面,再到多点触控,每一次更替都在降低门槛、扩大人群。
文字是描述世界的压缩方式,不是世界本身。
人每天面对的是有颜色、有形状、有声音的真实场景,不是一行行字符。

当下的对话式 Agent 能听懂自然语言,会自主规划,能跨平台执行。
但剥开概念看,交互底层还是文字输入输出的逻辑,本质是更聪明的命令行。

放到真实场景里,局限很明显。高频重复的事,每次都要开口描述一遍,效率反而更低。
老人、孩子、有表达障碍的人,没法靠指令用 Agent,再聪明也白搭。
高度个性化的需求,定制开发成本太高,通用产品又贴不拢,长期是块空白。

行业里有两个普遍误区。
一是认为界面最终会彻底消失,所有操作都靠语音。二是认为未来所有软件都是实时生成的,不需要稳定的产品形态。
真实用户的行为恰好相反。
人需要稳定、可预期、伸手就够得着的工具,不是每次用都要重新沟通一遍的管家。
就像卧室灯的开关,都希望装在床头随手可及的位置,没人愿意躺上床后还对着空气喊一句关灯,等系统回应。
能点的就不想说,这不是懒惰,是人和工具相处的基本逻辑。
这条路径已经验证了三代。
最早谢扬做 Fellou,深度联动本地电脑,理念比市场早了一个周期。

后来 Codex、龙虾这类产品跑通 AI 代码生成,让自动生成应用有了工程基础。
到今天 GPT6 搭载智能 UI,图形化交互连大模型厂商自己也在往前推。
整个行业其实都在往同一个方向走:Agent 的交互,不该困在对话框里。

当前 Personal Agent 分化出两条完全不同的技术路线,对应的用户价值和市场空间也完全不同。
主流路径是 Agent 替你操作别人的 App。
Muse、Dots 都是这个思路,核心是跨应用调度执行,适合一次性、探索性的复杂任务。
用户说一次需求,Agent 在各个应用之间穿梭,最后返回结果。

这条路的边界也清楚:使用者只能是发指令的本人,每次都要重新描述需求,覆盖不了海量长尾个性化场景。
它更像效率工具,替人把已经存在的流程走完,而不是帮人创造新工具。
另一条路径,是 Agent 为你生成专属的 App。
代表产品是 Eazo,核心逻辑是对话用来造,界面用来用。

用户用自然语言说一次需求,Agent 生成一个专属的图形化应用,之后日常使用直接点击就行。
这条路的本质,是把 AI 从对话助理变成个人应用生产工具。
GPT6 的智能 UI 跟这条路同属一个逻辑,区别在于智能 UI 是在对话过程中生成界面片段,仍然挂在对话入口上。
Eazo 走得更远,直接生成独立完整的 App,可以脱离对话单独使用,还能分享给别人。

产品设计上,Eazo 走了跟行业相反的思路。
绝大多数 AI 开发工具默认用户是产品经理,要写清需求、拆功能、反复调提示词,最后产出往往还是跑不通的半成品。
Eazo 反过来,默认用户只有模糊想法,需求拆解、视觉设计、工程实现、部署上线全由工具承接,直接交付可用的成品。
这种体验差异集中在两个核心能力上。
一个是 Wild Design 设计体系。
每个需求都会生成至少六套完整的专业视觉方案,覆盖排版、色彩、动效、材质和整体氛围,用户不用懂设计术语,凭直觉挑个方向就行。

它还支持多模态一体化创作,同一个对话里就能完成界面设计、2D/3D 角色生成、场景搭建、动画和音频,不用来回切工具。
从实际产出看,这套设计体系已经覆盖相当多品类,英语学习产品、

插画师单页作品集、

桌游骰子计算器、

动态音乐播放页、

食材适配食谱生成器、

竖版跑酷小游戏、

攀岩小游戏,

都能在同一套逻辑下生成。社区沉淀的大量公开作品,也成了可复用的设计素材库。
另一个是一站式全栈交付。
用户只用自然语言描述需求,系统自动搭好前端、后端、数据库、认证和支付,不用自己选技术栈、配服务器、申请密钥、配置域名。
内置四十九个 AI 模型可直接调用,集成 Stripe 支持全球收款,完成后一键发布到公开链接。
相当于把产品、设计、前端、后端、运维的工作,压成了一次对话。
支撑这套体验的,是 Eazo 自研的通用 Agent 框架 EazoTack。
它经过五次重构,分创作交互、Agent 协作、工具能力、运行平台四层,靠缓存优先的上下文管理,实现 98.3% 的七天全网缓存命中率,首 Token 响应时间 1.5 秒。
只用十五个核心工具加一个元工具,就实现对主流产品的效果超越。按 Eazo 公开的 Benchmark v3.0 测评,一百零三道可比测试里,Eazo V5 综合质量得分 88.0,高于 Codex CLI 的 84.4,在输入理解、设计深度、资产整合、开发运行等高权重维度都保持领先,成本还降低约三分之一。





真正值得注意的是,这些设计逻辑已经在真实用户场景里跑通了。
有用户 Adam Waxman 把睡眠顾问给的宝宝作息方案做成共享应用,原本是一页写满条件判断的 PDF,现在变成一家三口加保姆共用的实时作息表,小睡时间短了会自动重排后续安排。
这种需求应用商店里找不到,也不值得商业公司专门做,但对这家人价值十足。
这款应用只用了一周晚上的时间做出来,四个月后退役,因为成本够低,用完即弃也不心疼。
Hacker News 上有个用户给自己做了饮食热量记录器,每顿饭写一句话描述,自动换算营养数据生成趋势图,坚持几个月后健康状态明显改善。
他总结出一条规律:自己做的大多数应用,原本都是备忘录里越写越长的笔记,变成专门工具后处理起来简单很多。
还有人做了菜单栏小工具,点一下就能看到家里各个房间的温度。
有人自己做无广告白噪音应用,比去应用商店找一个还快。有人等了好几年语言软件支持蒙古语,最后花一个晚上自己做了一个。
这些高度细分、高度个人化的需求,从来不是商业产品的目标,却是图形化 Agent 最能发挥价值的地方。
除了工具生产能力,Eazo 也搭了轻量创作者生态。
所有公开作品都能被其他人查看使用,支持 Remix 二次创作,在别人作品基础上改外观、加功能、调场景,快速变成自己的工具,不用从零搭。

平台还上线了 Skills 市场,创作者可以发布自己沉淀的功能模块,供别人调用并赚取收益。

配合邀请分佣体系,用户邀请其他创作者注册并完成充值,可获得对应比例返佣,月付订单返佣 50%,年付订单每月返佣 70%。
对零散创作者来说,这不只是做工具的平台,也是变现创意的渠道。
两条路径不存在谁取代谁,各自有清晰的适用场景。对话式 Agent 更适合一次性、探索性、跨平台的任务。
图形化 Agent 更适合高频、重复、个人化、多人共用的场景。前者解决跨服务的效率问题,后者解决长尾需求的供给问题。
很多人只看到生成应用这一步,其实这只是起点。
用户生成的专属工具越多,越会产生聚合需求,从零散的应用收拢成统一的个人工作台,所有工具共享身份、互通数据、联动触发。
再往下,它就不再是做 App 的工具,而是管理日常的个人智能入口。
底层是统一的 Agent 基础设施,上层是随需求生长的图形化应用,围绕一个人的生活和工作,形成一套生长式的智能应用体系。

行业里很多人觉得 Muse、Dots 的核心竞争力是大模型能力。

往深了看,真正拉开差距的是三件事:身份、行动、记忆。
一个真正能用的 Personal Agent,要知道你是谁,能替你真实做事,能记住过往的事。
这三件底层能力的建设难度,远高于模型本身的调优,也是很多团队能做演示级Agent、却做不出能用产品的核心原因。
身份是第一个缺位。
过去三十年的登录系统都是给人设计的,Agent 要进企业系统,只能借用员工账号密码。最后没人知道操作是人还是 Agent 发起的,权限给多了收不回来,出了事找不到责任人。
行动是第二个缺位。
大多数 AI 只能输出文字,真正的工作要在一个个网站、SaaS 里点击操作,还是得人来完成。有 API 的系统很少,通用的截图识别加坐标点击又慢又贵,没法大规模落地。
记忆是第三个缺位。
每次对话都从零开始,Agent 不知道用户是谁、上次做过什么,同样的内容要重复很多遍。
现在每家做 Agent 的公司,都要从零搭这三套系统,重复建设成本极高,这也是 Personal Agent 迟迟无法普及的核心原因。
Qoni 的思路刚好反过来,把底层能力做成可复用的托管基础设施。
这套能力不是凭空来的,是谢扬近十年连续创业的积累。
早年间知识图谱还只是学界概念时,他就开始探索结构化记忆与语义理解的落地。
七年前切入身份认证赛道,做出开发者圈知名的 Authing,把身份权限做成标准化的开发者基础设施。
一年前又 All in 浏览器 Agent 方向,推出 Fellou,深度联动本地电脑与网页操作。那时候很多人还在争论 Agent 有没有用,他已经在啃行动能力这块硬骨头。
Fellou 更像一次超前于市场的验证。当时行业还没准备好迎接本地 Agent,但谢扬看准了大方向:Agent 的核心从来不是大模型本身,而是身份、行动、记忆这三件脏活累活。
等到 Muse、Dots 带火整个赛道,所有人都意识到这三大能力的重要性时,谢扬已经把三段能力攒齐打通,打包成可复用的基础设施 Qoni。
更难得的是他对交互形态的长期判断。全行业追捧纯对话 Agent、喊 App 已死的时候,他早就提出对话框是 AI 的 Demo,不是终局。
他始终认为对话是用来造东西的,不是每件事都靠对话来做,Personal Agent 最终会走向图形界面。
这种提前数年的路线判断,在跟风盛行的 AI 创业圈里并不多见。
作为国内首个面向 Personal Agent 的托管基础设施,Qoni 的定位很清晰:不做大模型,只做 Agent 的水电煤。
它把身份、行动、记忆三件事打包成标准化服务,任何企业和开发者都能通过一套 SDK 接入,不用再从零搭,相当于把 Agent 的入场门槛,从做一整套系统降到了只做上层业务逻辑。

GenAuth 专门解决身份问题,是为 Agent 设计的身份体系。
跟传统真人身份认证不同,它给每个 Agent 发放有边界的数字令牌,每个 Agent 都绑定一个真实的人,继承这个人的权限,且只能少不能多。
Agent 的每一步操作都记在对应人名下,可审计可追溯。
一次认证就能接入公司在用的各个应用,不用每个应用存一套账号密码,直接解决了企业最担心的权责不清、权限失控。
Web Agent 解决行动问题,在云端真实浏览器里完成全流程网页操作。
它不用截图看坐标点鼠标的通用方案,而是结合 Coding Agent 与视觉模型直接读懂网页再操作,速度更快成本更低。
一句指令可以拆成多个分身,同时在不同网站执行不同任务。
遇到需要本人登录或验证码的页面,Agent 会暂停等人工处理,再从停下的地方继续,不会直接失败。
对企业里大量的填表、查询、录入类工作,这是第一次真正可用的自动化方案。
GUMem 解决记忆问题,实现跨会话的长期记忆。
常见的记忆方案只认字面,同一个意思换个说法就匹配不到。GUMem 先做本体语义理解意思,识别不同表述指向的同一件事,再存进向量库。

它用四层记忆结构,从原始对话到提取事实,再到经验总结和主题分类,每条记忆都可追溯来源,出错可修改,无用可删除。在公开的长期记忆评测 LoCoMo 上,GUMem 综合准确率 92.9%,完成同样测试的 Token 用量不到主流方案 Mem0 的一半。
前面提到的所有 Eazo 上的个人应用,底层都跑在 Qoni 这套基础设施上。用户登录身份、应用数据记忆、跨页面操作能力,都由底座统一提供,不用每个应用从零开发。
对想做自有 Agent 的团队,这意味着不用再花半年到一年从零搭三套系统,只需聚焦上层业务逻辑和场景设计,几周就能上线产品。
这套能力刚好卡在所有现有产品的能力盲区。
对个人和小群体,低表达人群专属工具、多人共享协作工具、备忘录需求工具化、个人微型商业化工具,这些场景要么对话 Agent 用不了,要么通用产品覆盖不到,定制开发又不划算。
对企业和开发者,身份行动记忆一体化的托管基础设施更是市场空白,市面上只有零散的大模型 API、身份服务、浏览器自动化工具,没有任何一家把 Agent 落地必需的三件套打包成标准化服务。

关于 Personal Agent 的未来,现在有两种完全不同的预判。随着基础设施层出现、大模型厂商下场做智能 UI,第三种可能性也在浮出水面。

第一种是切斯基提出的路线,大厂各自为战的 Agent 帝国。
按他的判断,每个头部 App 都会把自己做成 Agent,彼此互联互通,最终形成几个大的 Agent 入口。
这条路本质上是 App Store 时代重演,流量和价值依然掌握在少数大厂手里,海量长尾个性化需求依然没人满足。
优势是体验稳定、能力强,适合通用高频场景,劣势是灵活性不足,永远覆盖不到细分小众的个人化需求。
第二种是长尾路线,人人都能拥有专属 Agent。
以 Eazo 为代表的工具化路线,底层基础设施开放,上层应用百花齐放。任何人都能用一句话生成自己的专属工具,不用懂代码,不用管底层技术。
它真正激活的是海量长尾需求,那些太小、太个性化、不值得商业公司开发的场景,第一次有了对应的软件产品。
这条路的价值不在于替代大厂,而在于填补大厂触达不到的空白。

第三种可能,是基础设施层的崛起。
更长远看,行业很可能形成三层格局。最上层是大厂的通用 Agent 与智能 UI 入口,服务大众高频需求。中间层是无数垂直、小众、个性化的定制应用,满足长尾场景。
最底层是公共基础设施,为所有 Agent 提供身份、行动、记忆等通用能力。
Qoni 这类玩家的机会就在最底层。
当身份、行动、记忆从每家公司的自有能力变成全行业的公共服务,整个 Agent 赛道的创新速度会大幅提升,创业门槛会大幅下降。

就像云计算普及催生了一波互联网创业潮,Agent 基础设施的成熟,也可能催生一波现在还想像不到的应用创新。
从商业化看,这套双产品组合形成了完整闭环和阶梯式演进。
短期靠 Eazo 的订阅制跑通 C 端现金流,用远低于定制开发的成本激活海量长尾需求。
中期靠 Qoni 的企业订阅与增值服务打开 B 端增长,为团队和企业提供 Agent 底座服务。
长期则有望从工具演进为平台,靠生态交易抽成与基础设施调用计费实现规模效应。
和纯流量型产品不同,这套模式的价值支撑很扎实。
需求真实存在,只是此前供给成本过高。价值感知清晰,用户不需要复杂教育就能做出付费决策。规模效应下边际成本持续递减,符合工具类产品的健康盈利模型。
当然生态建设和市场教育都需要时间,这条路不会一蹴而就,但方向一旦跑通,释放出来的长尾市场会远大于现在的想象。

站在产业视角看,有三个判断越来越清晰。
第一,别陷入对话崇拜。
交互形态从来没有终极答案,只有场景适配。对话是伟大的起点,但不该成为唯一的终点。
命令行没有消失,只是退到了专业场景。
对话也不会成为唯一的形态,它会停在最适合的位置。智能 UI 的出现、图形化 Agent 的发展,都是在丰富交互的可能性,而非用一种形态替代另一种。

第二,Agent 赛道的竞争,已经从模型层向上转移到交互层,向下沉淀到基础设施层。
只卷大模型参数,已经跑不出终局。谁能做出更好的交互形态,谁能提供更成熟的底层能力,谁才能真正把 Agent 从演示变成普及。
谢扬这类连续创业者的价值也在这里,他们不蹭热点,在热点之下深耕底层能力,等风来的时候已经准备好了。
第三,Personal Agent 的真正普及,一定是从少数人用指令,变成所有人用界面。
当老人孩子都能轻松使用的时候,当每个人都能拥有属于自己的工具的时候,这个时代才真的到来。
从产业演进节奏看,这条路大概率分四步走。
第一步打透 Eazo 的体验标杆,让做个人 App 用 Eazo 成为创作者群体的共识。
第二步开放 Qoni 底座,跑通第三方开发者生态,把个人产品能力沉淀成行业通用的基础设施。
第三步收拢个人入口,从创作工具演进为个人智能工作台,把用户的使用场景从创作时延伸到日常时。第四步向上延伸向下扎根,构建完整的个人智能应用生态。
不用急于喊出概念,每一步踩实了再往下走,反而更有可能把图形化 Personal Agent 从一家的产品主张,做成整个行业的共同路径。
最后也抛一个问题给你们。你更看好哪条演进路径?你最想让 Agent 给你做一个什么专属 App?

