从 Chatbot 到 Coworker:产品单位从回答变成交付
Agent 的关键跃迁不是聊天更自然,而是能接住目标、跨工具推进并交付可验收结果。产品设计因此必须围绕任务状态,而不是消息流。
Chatbot 的基本单位是一轮回答:用户提问,模型生成,价值在消息出现时结束。Coworker 的基本单位是一项工作:理解目标、收集材料、操作工具、处理中断并交付结果。两者可能共享同一个对话框,但产品结构完全不同。
Anthropic 对 agentic systems 的总结强调工作流与自主 Agent 的差异;OpenAI Agents SDK 则把工具、交接和追踪作为一等能力。这些实践说明,模型只是执行者之一,真正的产品要管理一个跨越时间和系统的任务。
Coworker 的运行单位是带状态的任务。系统需要保存目标、约束、已完成步骤、待办、产物和外部依赖,并在每次工具调用后更新,而不是靠聊天记录猜测进度。计划允许随证据调整,关键节点生成可验收的中间产物。于是对话只是提出目标、处理分歧和汇报结果的界面,真正的工作发生在状态机与工具之间。中断后能否从可信状态继续,是这种架构的直接检验。
从回答到交付,首先要把目标显式化。系统应确认期望输出、截止条件、可用资源和不可触碰边界,并把它们变成可查看的任务卡。聊天记录不是任务状态;用户不该翻几十条消息才能知道工作做到哪里。
把聊天机器人包装成同事的风险,是用拟人语气掩盖执行能力缺口。它可能主动提出宏大计划,却无法处理登录、文件冲突或任务中断;用户反而要持续看守,承担比自己操作更高的协调成本。过度自主也会把小误解扩散到多个系统。若没有明确边界和恢复机制,“同事感”只会扩大错误半径。用户还可能因礼貌表达而错过真正重要的风险提示。
其次是让 Agent 拥有有限但真实的行动能力。连接日历、文档、浏览器或代码仓库后,它可以完成闭环,但每种工具都需要权限、失败处理和幂等设计。会调用 API 只是起点,能在部分失败后恢复才接近同事。
Coworker 体验还需要异步性。长任务应在后台运行,在需要决策时召回用户,并在完成后提供交付物与变化摘要。自主不是不打扰,而是在正确节点打扰。把所有步骤实时铺在聊天里,会让用户变成监工。
判断产品是否完成跃迁,可以给它一个跨工具、可验收且会遇到异常的任务。观察它能否复述约束、保存进度、在高风险动作前请求授权、遇阻后换路,并交付用户能直接使用的结果。还要计算用户澄清次数、接管时间与返工量。减少消息轮数不等于提高生产力,减少用户持有任务的时间才更接近价值。最终产物还应能够脱离聊天窗口独立使用和检查。
信任来自可检查的工作,而不是拟人化语气。系统要展示用了哪些来源、改了哪些文件、发送了什么,以及哪些步骤未经验证。危险操作先预览,关键成果可撤销,失败时保留现场而非只说“抱歉”。
商业指标也要变化。消息数和日活无法区分闲聊与价值,团队应测任务启动率、完成率、人工接管、交付物采用率和再次委托率。当用户开始把连续工作交给系统,而不是偶尔问问题,留存才有结构性改善。
更深的变化是,AI 产品从出售表达能力转向承担交付责任。回答可以在一句话后结束,任务却需要所有者、截止条件和失败处理。真正的 Coworker 不必模仿人的人格,而要继承工作的契约结构:知道什么算完成,什么不能擅自决定,出了问题如何交代。信任由这些朴素制度累积,而非由更自然的寒暄产生。产品人格可以增强亲近感,却不能替代责任结构。
Coworker 不是一个更像人的聊天机器人,而是一套让人放心委托的工作系统。下一代 AI 产品竞争的是可交付性,不是可聊性。谁能让任务边界清楚、过程可控、结果可验收,谁才真正跨过了 Agent 的门槛。
同事型产品还需要理解组织语境。相同的“整理销售数据”,在不同公司可能意味着不同字段、审批路径与保密等级。通用模型可以推断步骤,却无法凭空知道内部规则。产品应把组织知识做成可引用、可更新的资源,并在规则缺失或冲突时升级给负责人,避免把惯例猜成政策。
《从 Chatbot 到 Coworker:产品单位从回答变成交付》讨论的表面是功能,底层其实是一份委派契约。用户需要知道自己交出了什么目标、哪些资料会被使用、系统可以替他做到哪一步,以及什么情况下会停下来请求确认。把这四件事放在同一个可见界面中,比让 Agent 用更像人的语气解释自己,更能建立可以重复使用的信任。
体验失败往往不是发生在执行动作,而是发生在目标被悄悄误解之后。一个助手可能准确点击了按钮,却选择了错误候选、忽略了隐含约束,或把临时偏好当成长期授权。产品应在目标含糊、风险上升或上下文冲突时主动提出最小问题;高质量追问不是打断自动化,而是避免用户在最后才发现整条路径偏了。
交付型体验也会重新定义通知。聊天产品希望用户尽快回到界面,Coworker 则应尽量减少打断,只在目标分歧、权限请求和结果验收时出现。每次通知要带上已完成工作与具体选择,让用户能一次决定。若系统频繁要求微小确认,说明任务边界或默认规则尚未设计成熟。
衡量这类体验时,除了任务完成率,还要记录用户接管发生在哪一步、接管后系统能否理解修正、每次成功交付需要多少额外澄清,以及拒绝或取消是否真的生效。好的 Agent 会随着使用减少协调成本,而不是把交互从一串点击换成一串更难审阅的聊天消息。
从商业模式看,按消息或 token 收费与交付价值并不天然一致。一个优秀 Agent 可能用更少对话完成更多工作,反而降低传统活跃指标。团队需要转向完成任务、节省返工和可持续委托等指标。只有收入与用户结果更接近,产品才有动力减少无意义交流,并把复杂度留在后台系统。
权限设计也需要与心理负担匹配。低风险、可逆动作可以在明确范围内自动完成;涉及外发、付款、删除、身份或敏感资料时,应把对象、影响和回滚方式呈现出来。重点不是制造更多弹窗,而是让少数真正关键的决定足够醒目,使用户能够理解并承担自己的选择。
未来的差异不会只来自谁能做更多动作,而来自谁能在持续关系里保持边界感:记得有用偏好,允许用户修改和遗忘;主动推进任务,又不把不确定性藏起来。用户最终留在一个 Agent 身边,不是因为它永远不犯错,而是因为它犯错后仍可被理解、纠正和重新委派。
— 完 —