从回答到执行:三家模型更新之后,我看到 AI 产品的竞争点变了
模型开始接触真实工作环境之后,AI 产品经理要重新理解任务、工具、成本和责任。
最近一轮更新里,OpenAI、Anthropic 和 Google 接连发布了新模型。新闻标题通常在比较推理、代码、标准化测试和价格。把这些更新放在一起看,我更在意另一件事:模型开始接触真实的工作环境了。
按各家的公开发布说明,它们可以打开浏览器、调用工具、运行代码、操作桌面软件,并在几十分钟甚至更长时间里持续推进一项任务。
这会改变 AI 产品的比较方式。过去我们问“它能不能给出更好的答案”,以后还要问“它能不能在有权限的环境里把一件事做完”。对产品经理来说,这不是换一个模型名称那么简单,任务定义、工具接入、成本核算和责任边界都得跟着改。
还要先划清一个边界:下面谈到的“完成能力”,通常是模型、工具、执行环境和安全护栏共同作用的结果,不能简单归因于裸模型的分数。
一、先把三家模型的更新摆在桌面上
如果只看发布标题,很容易把这轮更新理解成“又换了三个更强的模型”。但三家真正补的不是同一块能力:一家在补模型进入工作现场的能力,一家在补长任务持续运行的能力,一家在补高并发场景下的速度和成本。
下面的对照以各家公开发布说明为口径,不是我的横向基准测试。表里的“更新”是厂商公开描述的能力,“产品位置”和“需要补的控制”则是我基于产品落地做的归纳。
| 模型 | 这次具体更新了什么 | 它在争什么产品位置 | 产品还要补什么控制 |
|---|---|---|---|
| GPT‑6 Astra | 把 Computer Use、浏览器、专业软件、代码和前端检查放进同一条执行链;公开示例包括填表、更新 CRM、做在线研究、生成网站和检查页面。 | 复杂专业任务的执行器 | 确认策略、权限隔离、可撤销动作和人机交接 |
| Claude Fable 5.1 | 重点从一次回答转向跨应用、跨小时甚至跨天的长任务:先规划、调用工具、失败恢复、持续汇报;同时强化代码测试、视觉检查和缓存读取。 | 长任务与异步协作 Agent | 状态持久化、检查点、数据留存、异常接管 |
| Gemini 3.8 Flash | 在保持 Flash 速度和低价定位的基础上,加强长程编码、多步推理和循环式工具调用;另推出仅向可信防守者开放的 Flash Cyber。 | 高并发、低成本的工作型模型 | 努力等级、Token 预算、速率限制和高风险能力分级 |
所以这不是一张简单的“谁第一”排行榜。Astra 更像在争复杂专业执行,Fable 5.1 在争长任务的持续性,Flash 3.8 在争把 Agent 能力压到更低的单位成本。它们的差异,必须放回具体任务、工具和约束里看。
GPT‑6 Astra:把“打开软件做事”变成主能力
这次最值得注意的变化,不只是代码或推理分数,而是 Computer Use 被放进了更完整的工作链:模型可以浏览网页、填写表单、更新 CRM、查资料、写入文档、创建网站,再打开页面做前端检查。它开始处理的不是“请给我一段代码”,而是“请在这个环境里完成一项工作”。
这也意味着产品不能只接一个聊天框。要让模型可靠执行,至少要有可观察的浏览器或桌面环境、明确的工具契约、分级权限,以及在付款、发送、删除等后果性动作前停下来确认的机制。模型会行动,不代表产品可以把决定权一并交出去。
Claude Fable 5.1:把长任务的“接着做”补上
Fable 5.1 的重点更像是把 Agent 从“几轮工具调用”推进到“长时间工作”:它可以先拟定计划,跨多个应用和浏览器调用工具,遇到失败后恢复,并持续告诉用户进展。对代码任务,公开说明还强调了测试、视觉检查和对复杂代码库的持续处理。
它解决的是另一种痛点:不是模型会不会做某一步,而是任务跑到一半以后还能不能保持状态、知道已经完成了什么、在什么时候需要人接手。公开定价也给了一个很具体的方向:输入每百万 Token 10 美元、输出 50 美元,缓存读取 0.25 美元;厂商还估计典型工作流成本可降约 25%,Agent 工作流最高约 45%。这些是厂商口径,不是跨模型实测,但它说明长任务的成本不只由一次输出决定,上下文如何复用本身就是产品设计的一部分。
Gemini 3.8 Flash:把 Agent 能力压到更低成本
Gemini 3.8 Flash 的路线更明确地强调速度、价格和规模化使用。相较前一代,公开说明把重点放在长程编码、更充分的推理步骤和循环式工具调用,同时保留 Flash 系列的低成本与快速响应定位;Flash Cyber 则把更强的网络安全能力放在经过信任验证的防守者场景。
它的价格信号也很清楚:公开的首发价仍是输入每百万 Token 0.75 美元、输出 3.75 美元,与上一代 Flash 的定位保持一致。换句话说,Google 不是只想证明“这一代更强”,而是想让更多多步任务在同一成本带里跑起来。
这对产品经理的启发不是“所有任务都用 Flash”,而是要把任务拆成不同档位:简单分类、抽取和高并发自动化,优先看单位成本和延迟;复杂判断再升级到更高能力的模型;高风险能力则需要单独的权限、审计和开放范围。模型的努力等级越高,Token 预算和等待时间也越要被纳入设计。
放在一起看,三家其实在争三种产品位置
如果把三次更新翻译成产品语言,大致可以这样理解:Astra 负责把模型带进复杂的专业软件和真实工作现场;Fable 5.1 负责让任务跨越更长时间,减少“做到一半丢状态”;Flash 3.8 负责把多步推理和工具循环做得更快、更便宜、更容易规模化。
这三种位置没有天然高下。一个需要人工确认的财务流程,最关心的可能是可控性;一个需要连续跑几小时的研究任务,最关心的可能是状态和恢复;一个每天处理数百万条内容的流水线,最关心的可能是延迟和单位成本。脱离任务谈“最强模型”,对产品决策帮助很小。
二、为什么这些更新都在往“执行器”靠
传统问答的流程很短:用户提问,模型生成,用户决定是否采用。Agent 要面对的是一条循环:理解目标,拆步骤,选工具,执行,读取结果,判断状态,再决定继续、重试还是停下来。
让模型“写一段代码”和让它“交付一个功能”,是两种不同的产品。后者要读代码库、修改文件、运行测试、打开页面检查效果,发现报错后再回到实现处修改。分析销售数据也一样:读取 CRM,找出异常客户,查原因,更新记录,最后生成会议材料。模型一直在接收环境反馈,不能只靠最初那句指令一路往下写。
所以我会把 Agent 的基本能力拆成四件事:目标不能中途漂移;状态要记得住;成功、失败和未知要分开;遇到权限不足或结果不确定时,知道停下来交给人。模型的边界,已经不只是“知道什么”,还包括“在什么环境里能完成什么”。
三、Computer Use 拆掉的是接口墙,不是权限墙
Computer Use 可以理解为“让模型像人一样看屏幕、点按钮、输入文字”。它本身不应成为绕过权限的通道。模型能看到和操作什么,仍受账号、应用权限、审批策略以及多因素认证、单点登录等机制约束。它改变的是进入软件的方式:过去人走图形界面、机器走 API,现在模型也能沿着屏幕上的路径操作。
这让没有开放 API 的长尾软件有了接入可能,但不代表 API 过时。结构稳定、权限清楚、容易计量的任务,还是应该优先走 API;跨系统协调可以使用 MCP 或其他工具协议;在缺少标准接口、但仍能通过界面完成的长尾场景里,浏览器或 Computer Use 可以补位。
页面变化、延迟和误操作的风险,需要另行评估。好的 Agent 不会迷信某一种工具,而是根据任务选择入口。能看懂屏幕不等于能稳定操作:页面一改版,按钮位置可能就变了;弹窗、验证码、网络延迟和反自动化策略,也会随时打断流程。
Computer Use 更像是补上接口缺口的一条路,暂时还不能当成万能连接器。
四、App 不会消失,工作流入口会移动
Salesforce 仍然保存客户记录,Excel 仍然负责计算,Power BI 仍然负责图表。变化在于,用户可能不再逐个打开它们。用户只需说:“找出本月销售下降最大的十个客户,分析原因,更新 CRM,再生成明天开会用的报告。”
Agent 可以按顺序读取 CRM、查询背景资料、运行分析、生成图表并整理报告。App 仍是数据和规则的承载系统,但不一定是每次工作的第一站。
这也解释了为什么软件厂商更可能重视 API、MCP 和 Agent 文档。接口越稳定、动作越可解释,Agent 越可能走正式入口,而不是靠 GUI 绕路。对应用层公司来说,单纯套一个聊天框的空间会变小;真正有价值的仍是行业数据、业务流程、专业工具,以及用户对结果的信任。
五、模型价格要按“完成一项任务”来算
Agent 很少只调用一次模型。它会反复读上下文、调用工具、等待外部系统、重试失败步骤。于是我会把一次任务的成本看成:模型调用、工具调用、重试、人工修复、等待时间和错误造成的损失,而不是只看每百万 Token 的报价。
按这几次发布给出的定位,Fable 5.1 的缓存机制针对的是长任务中的重复上下文;Astra 可能单次调用更贵,但如果少走弯路、少让人返工,总成本未必更高;Flash 则试图把复杂任务的门槛压低,让更多场景用得起。这些是基于产品定位的推断,不是我做过的横向测算。最后仍要回到任务的成功率和预算。
产品评估至少要记录:一次成功任务调用了几次模型和工具,失败后需要多少人工接管,高峰期是否稳定,平均等待多久,错误动作能否发现和撤销。最强的模型,不一定是使用量最大的模型;企业最后买的是可预测的成功任务成本。
六、安全从拒答规则变成能力分级
只生成文字时,风险多半是答错或说得不合适。模型一旦能改文件、动 CRM、发邮件,风险就变成了行动:读错数据、改错记录、越过流程,甚至执行无法撤回的操作。
因此安全要写进产品结构,而不只是写进模型提示词。同一个底层模型可以按身份、场景和审核结果开放不同能力。例如,普通用户只读,经过审核的角色才可写入;涉及付款、删除、外发或高风险领域的动作,必须有人确认。系统还要留下完整日志,在不确定时暂停,出错后支持恢复或回滚。
公开发布说明里提到的 Astra、Fable/Mythos 和 Flash Cyber,采用了不同的开放范围和安全分层。这里能确认的只是产品叙事方向,具体能力、适用对象和保留政策,仍应以厂商正式说明为准。
如果我负责设计这类产品,会先回答几句话:它能访问什么,不能修改什么?哪一步必须确认?“不知道”如何显示?谁能看到行动记录?这些边界没有写清楚,模型能力越强,团队越需要先把控制措施补齐,才可能放心上线。
七、模型发布正在变成生态发布
从这些产品的发布方式看,模型很少单独呈现。按公开发布说明,Astra 被放进 ChatGPT、Codex 和专业软件,Fable 5.1 与 Claude Code、浏览器 Agent、企业云平台相连,Flash 则进入 AI Studio、Android Studio 和 Gemini API。
竞争的单位也就不只在模型本身,还包括工具协议、执行环境、开发者平台、企业分发和评测反馈。这里讨论的是产品组合方式,不是独立性能测试。
同一个模型,工具调用更稳、上下文管理更好、监控更完整,实际体验可能就更好。对应用层公司来说,这既是压力,也是提醒:壁垒不在“把模型接进来”,而在于理解某类用户的工作,把模型、工具、权限和人工配成一条可靠流程。
八、AI 产品经理要开始设计任务边界
早期 AI 产品经理常把时间花在 Prompt 和输出风格上。Agent 时代,我会先问另一组问题:任务到哪一步交给模型?哪些步骤必须用工具?模型何时能自己决定?什么算完成?失败时谁接手?
模型可以更换,但产品应该留下稳定资产:任务定义、成功标准、评测集、工具契约、权限策略、异常处理和人工介入规则。这样模型升级时,才有东西可比较,不必凭“感觉这次更强”重做产品。
我会重点看五个指标:真实任务完成率、中断率、人工接管率、单位成功任务成本,以及错误动作被发现和撤销的时间。模型更新只有改变这些指标,才算改变了产品。
实际落地时,我会按五步走:先把任务和“完成”写清楚;再画出模型、工具和权限的边界;为继续、暂停和人工接管设条件;用小流量真实任务做评测;最后把有效的流程、工具契约和异常处理沉淀下来。这样换模型时,比较的是结果,留下的也是产品资产。
结语:执行能力进入产品主舞台
把这几次更新放在一起,我看到的不是一次简单的模型换代,而是模型开始参与工作。软件入口、接口设计、计费方式、企业采购和安全管理都会随之调整。
App 不会立刻消失,GUI 也不会取代 API。会调用工具的模型,更不等于一个可以放任不管的员工。真正值得追踪的是:它能不能在真实环境里持续推进任务,成本是否可预测,权限是否守得住,出了问题有没有人接得住。
有几件事暂时没有被模型发布解决:数据质量、权限配置、界面变化和失败恢复。它们听起来不如新模型耀眼,却往往决定一个 Agent 能不能从演示走到日常使用。
模型会继续变强。产品价值仍然要靠人把问题定义清楚,把流程搭起来,并对最后的结果负责。
未来的差距不只在于谁会调用工具,更在于谁能发现问题、构建解决方案,并对结果负责。
作者注:本文依据相关公开发布说明整理,讨论的是产品方向,不是独立性能测评。文中型号、价格和接入范围请以各厂商的最新官方页面为准;“厂商宣称”“报道提到”和“作者判断”并不等同。
Keep Reading
继续阅读
从行业观察回到具体的 AI 产品工作。
AI 产品经理如何判断一个 AI 功能能不能上线?
从偶尔能用到可以交付:定义真实任务、测试集、发布门槛和反馈闭环。