← 回到文章列表

从 Ai4 看企业 AI:预算正在从聊天能力转向执行闭环

Ai4 的议程把 Agent、评测、可观测性和真实演示放在中心。企业买家不再只问模型能回答什么,而是在问它能否进入流程、承担责任并持续产生可核验结果。

8 月 4 日至 6 日的 Ai4 不是判断技术真伪的实验室,但它是观察企业预算语言的好窗口。主办方把 AI Agents、Coding Assistants、Eval、Observability、RAG、世界模型和真实 Agent 演示集中放进议程,Google Cloud 的舞台甚至直接使用“从聊天机器人走向自主 Agent”的表述。会场议题不能证明市场已经成熟,却能说明买家正在问什么

前两年,企业 AI 项目常从一个聊天入口开始:连接知识库,让员工提问,展示回答速度。这个形态容易理解,也容易上线,但商业价值经常停在“使用量很多、流程变化不大”。当回答不能直接进入工单、代码、审批或客户交付,AI 就只是工作之前的建议层。

今年更明显的主题是执行。企业不再满足于模型给出下一步,而是希望系统读取上下文、选择工具、更新记录、触发流程并交付结果。这并不意味着所有公司都要追求全自动,而是采购评价从“回答质量”转向“完成一个任务需要多少人类补位”

一旦目标从聊天变成执行,产品清单就会重排。模型能力仍然重要,但权限、连接器、评测、可观测性、回滚、审批和系统集成会占据更多预算。一个 Demo 里不起眼的审计日志,到了生产环境可能比多两分 Benchmark 更重要,因为它决定安全团队是否允许 Agent 接入核心系统。

这也解释了为什么“真实演示”正在成为新的营销资产。聊天产品可以用精选问题展示聪明,执行型 Agent 则必须展示完整路径:任务如何开始,遇到异常怎样处理,哪些步骤需要人工确认,最后在什么系统产生了可验证变化。越接近真实环境,预录视频的说服力越低。

对创业公司来说,增长策略要从卖能力转向卖闭环。“我们支持最强模型”“我们有一百个连接器”都很容易被复制。更难复制的是对某个业务流程的深层理解:谁发起任务,哪些数据可信,例外由谁处理,成功如何计量,以及结果怎样进入现有责任体系。

一个好的垂直 Agent 产品,首页不应该只列功能,而应明确一个可购买的结果。例如把保险理赔材料整理时间从两天缩短到两小时,把销售跟进遗漏率降低到某个范围,或把安全告警调查形成可审计报告。企业预算属于结果负责人,而不是属于“喜欢 AI 的人”。

采购路径也会改变。过去的 SaaS 试用关注席位数和月活;Agent 产品更适合用任务样本、人工接管率和单位交付成本做试点。先在低风险、重复度高、结果可检查的流程中运行,积累失败类型和基线,再逐步增加权限。所谓落地,不是连接上数据,而是形成稳定的责任闭环。

这类试点必须同时进入业务、IT 和安全三套语言。业务负责人关心产出与周期,IT 关心集成和维护,安全团队关心权限与事故。如果产品只能向其中一方证明价值,项目很容易在从试用转向采购时停住。最强的销售材料往往是一份三方都能读懂的任务级报告。

会场上 Agent 主题密集,也意味着同质化会更快。每家厂商都能展示规划、工具调用和多 Agent 协作,用户很难从概念分辨差异。真正的竞争会转到三个隐性资产:真实任务数据、经过失败迭代的工作流,以及能让安全与业务同时接受的治理层。

大型平台的优势是分发、身份和现有系统;创业公司的优势则是敢于深入一段狭窄流程。与其正面做“企业通用 Agent”,不如选择一个预算明确、输入可获得、输出可验证的工作单元,把完成率和恢复机制做到极致。平台最终可能提供通用执行层,垂直公司仍能拥有业务定义与数据反馈。

企业买家也需要避免“自主程度”陷阱。更高自主并不天然意味着更高价值。一个可以独立运行十步、却在第九步制造难以发现错误的 Agent,可能不如一个在关键节点稳定请求确认的系统。应当优化的是每单位风险下的有效自动化,而不是演示中无人触碰键盘的时间。

评测因此必须进入销售过程,而不是研发团队内部的附属品。供应商应当愿意用客户样本建立任务级基线,公开失败分类,并说明模型更新后如何回归。客户也要把验收条件写成可重复测试,而不是依赖几位高管试玩后的主观印象。

从更长期看,企业 AI 的预算会逐渐分成三层:基础模型与推理成本、Agent 运行与治理平台、面向具体业务结果的应用。中间层不会完全被模型公司吃掉,因为企业需要跨模型、跨数据源和跨组织边界的控制;应用层也不会消失,因为责任与价值发生在具体流程里。

所以,Ai4 释放的核心信号不是“Agent 又火了”,而是企业对 AI 的提问方式正在成熟。它们开始从“能不能回答”转向“能不能执行”,再从“能不能执行”追问“出错时谁负责、如何恢复、价值怎样计量”。能回答后三个问题的产品,才更接近可持续收入。

— 完 —