← 回到文章列表

Agent 为什么必须展示进度,但不该直播所有思考

长任务需要可预期、可干预的进度界面。有效透明度来自计划、状态、证据和阻塞点,而不是滚动播放模型的内部文字。

聊天机器人几秒内回复时,一个加载动画已经够用;Agent 工作十分钟甚至数小时时,沉默会被理解为卡死。用户不知道它是否在推进、绕路还是重复消耗。进度可见性因此不是装饰,而是长任务能否被委托的基础。

Agents SDK 的 tracing 与各类 computer-use 工具强调执行轨迹,这些底层记录为产品界面提供了素材。但工程日志不能直接倾倒给用户:工具参数、token 流与内部草稿既难读,也可能包含敏感信息。透明度需要编辑,而不是直播。

进度展示应由任务状态而非生成文本驱动。系统把工作划分为可观察阶段,每个阶段关联输入、产物、阻塞和下一检查点;工具调用完成后更新状态,计划改变时保留原因。界面再把这些运行事实压缩成时间线,让用户看到已完成的证据、当前动作和等待事项。这样即使模型更换路径,进度仍有稳定语义。

有效进度至少回答四个问题:目标是什么,当前在哪一步,已经产生什么,下一次何时需要我。用户需要的是可预测性,不是每个 token 的可见性。一个简洁的任务时间线,通常比不断滚动的思维链更有用。

进度信息也可能产生虚假确定感。开放任务很难线性量化,百分比往往只是步骤数量的装饰;频繁刷新细节会让用户误以为必须持续监督。另一个风险是把内部日志直接暴露,其中可能含凭证、个人数据或未经核验的草稿。透明度若没有筛选与层级,会同时增加焦虑、认知负担和安全暴露。

计划也不能伪装成承诺。Agent 在发现新信息后应允许调整路线,并明确说明为什么改变、会增加多少时间或权限。已完成、进行中、等待输入和失败必须是可区分状态,不能都显示成一个旋转图标。

进度界面必须允许干预。用户应该能暂停、取消、修改目标、跳过步骤或接管某个操作,并知道取消是否会留下半成品。没有控制权的透明,只是把焦虑可视化。可恢复的检查点比更漂亮的动画重要。

评估进度体验时,应让用户在任务运行中离开、返回、暂停、修改目标和取消,观察其是否能迅速判断现状与残留影响。衡量长时间无更新是否引发重复提交,阻塞提示能否带来正确输入,以及最终产物能否对应时间线中的承诺。估时可提供区间或下一里程碑,并在外部等待发生时明确区分系统停滞与正常排队。

估时要诚实。Agent 很难精确预测开放任务的完成时间,可以提供范围、已处理比例或下一检查点,而不是虚构一个不断跳动的百分比。遇到外部服务排队或权限阻塞时,应展示原因和可选路径。

团队可以测量用户取消发生在哪个状态、多久没有更新会引发重试、哪些步骤最常被接管,以及完成后用户是否理解发生了什么。这些行为数据能帮助压缩无意义状态,同时保留真正影响信任的节点。

更深来看,进度界面是 Agent 与用户之间的协作协议。它持续回答哪些承诺已经兑现、哪些假设发生变化、控制权现在属于谁。内部思考不稳定且难以验证,工作状态却可以被双方共同确认。把透明度建立在状态和证据上,才能让用户放心离开屏幕;真正的自主,反而依赖一条随时可理解的责任线。

Agent 的进度体验最终是一份持续更新的工作契约。好的进度条展示承诺、变化与证据,而不是思考表演。当用户随时知道发生了什么、能做什么,后台任务才会从黑箱变成可依赖的协作。

不同任务需要不同粒度的进度。批量处理文件可以显示已完成对象和失败清单,研究任务更适合展示已覆盖的问题与待核证主张,等待外部审批则应指出责任方和下一次检查时间。统一百分比无法表达这些差异。进度组件应读取任务语义,而不是给所有后台工作套同一动画。

《Agent 为什么必须展示进度,但不该直播所有思考》讨论的表面是功能,底层其实是一份委派契约。用户需要知道自己交出了什么目标、哪些资料会被使用、系统可以替他做到哪一步,以及什么情况下会停下来请求确认。把这四件事放在同一个可见界面中,比让 Agent 用更像人的语气解释自己,更能建立可以重复使用的信任。

体验失败往往不是发生在执行动作,而是发生在目标被悄悄误解之后。一个助手可能准确点击了按钮,却选择了错误候选、忽略了隐含约束,或把临时偏好当成长期授权。产品应在目标含糊、风险上升或上下文冲突时主动提出最小问题;高质量追问不是打断自动化,而是避免用户在最后才发现整条路径偏了。

计划变化是建立信任的关键时刻。Agent 发现原路径不可行时,应说明新证据、影响范围和是否需要额外授权,并保留原计划供比较。若每次调整都悄悄覆盖旧步骤,最终结果即使正确,用户也无法判断中途发生了什么。可见的变更历史能把“反复试错”转化为合理的适应过程。

衡量这类体验时,除了任务完成率,还要记录用户接管发生在哪一步、接管后系统能否理解修正、每次成功交付需要多少额外澄清,以及拒绝或取消是否真的生效。好的 Agent 会随着使用减少协调成本,而不是把交互从一串点击换成一串更难审阅的聊天消息。

进度透明还可以反向改善系统工程。当大量任务长期停在某个模糊状态,团队会发现工具缺少明确终态或异常分类;用户频繁接管某一步,也提示自动化边界划错。界面不是运行日志的末端包装,而是一面暴露工作流设计质量的镜子。可解释的状态越难生成,底层任务模型往往越不成熟。

权限设计也需要与心理负担匹配。低风险、可逆动作可以在明确范围内自动完成;涉及外发、付款、删除、身份或敏感资料时,应把对象、影响和回滚方式呈现出来。重点不是制造更多弹窗,而是让少数真正关键的决定足够醒目,使用户能够理解并承担自己的选择。

未来的差异不会只来自谁能做更多动作,而来自谁能在持续关系里保持边界感:记得有用偏好,允许用户修改和遗忘;主动推进任务,又不把不确定性藏起来。用户最终留在一个 Agent 身边,不是因为它永远不犯错,而是因为它犯错后仍可被理解、纠正和重新委派。

— 完 —