Peter 的七月:模型正在退居二线,Agent 系统正在成为主角
把 Peter Steinberger 7 月的公开讨论放在一起看,主线并不是押注某一个模型,而是把模型放进可替换的 Harness、可纠错的 Loop 与可组织的 Graph,再用高频、可验证的实践把能力变成结果。
围绕五个长期主题展开,按话题发生的时间整理。
把 Peter Steinberger 7 月的公开讨论放在一起看,主线并不是押注某一个模型,而是把模型放进可替换的 Harness、可纠错的 Loop 与可组织的 Graph,再用高频、可验证的实践把能力变成结果。
从购买同区礼品卡、兑换 Apple Account 余额,到在 ChatGPT iOS App 内确认订阅,以及续费、取消和退款。真正容易出错的不是按钮,而是地区、账号与账单归属。
WorkBuddy 与 QoderWork 正把 AI 从回答问题推向操作软件、交付文件和组织专家。真正的竞争不是谁的功能更多,而是谁能赢得用户把工作交出去的信任。
Harness 定义 Agent 的工作世界,Loop 定义它如何在时间中纠错,Graph 定义多个步骤如何协作。三者不是迭代代际,而是可靠 Agent 系统的三个控制面。
最前沿模型的差距已经缩小到个位数,但竞争没有结束,反而从“谁最聪明”分裂成能力、成本、速度、Agent 交付和开放权重五条战线。
风险分类、技术文档、透明度、日志和人工监督必须进入产品生命周期;越晚补做,越容易演变为昂贵且不可验证的合规债务。
Superpowers 没有过时,但把重流程设为每个任务的默认值,正在变成新的瓶颈。2026 年更需要的是 Selective Powers:按风险、按复杂度调用能力。
惊艳演示能带来注册,却不能建立习惯。持续使用来自稳定价值、低摩擦入口、可信反馈和与真实工作流的结合。
真正的杠杆不在提示词长度或并行数量,而在于把任务、上下文、验证和提交设计成一个持续收敛的交付系统。
终端分屏的价值不在于同时开更多 Agent,而在于给任务、写入范围、验证与人工决策划出清晰边界。
终端不是一场“谁最快”的竞赛。AI 协作、图片上下文、远程兼容、渲染速度与工作习惯,决定了你真正应该留下什么。
广告可以补贴算力并扩大免费访问,但对话承载着比搜索词更敏感的意图。商业化必须把赞助、答案和个人上下文彻底分层。
当商品发现、比较和购买发生在同一次对话里,品牌争夺的不再只是搜索排名,而是能否成为 Agent 可理解、可验证、可交易的商品供给。
模型能力会扩散,长期偏好、关系、历史决策和纠错记录更难迁移;但上下文只有在可控、可见、可删除时才会成为资产。
三种入口掌握不同上下文与控制权。未来不会由一个界面通吃,而会由能跨入口保持身份、权限与任务连续性的系统胜出。
桌面 Agent 横跨文件、应用和账号,传统一次授权无法表达真实风险。更好的权限系统应围绕任务、动作与可撤销性设计。
推理只是成本栈的一部分。上下文膨胀、重试、工具调用、人工复核和客户支持共同决定单位经济,产品设计本身就是毛利工程。
通用助手拥有频率、身份和分发,垂直 Agent 拥有工作流、责任与行业数据。胜负不会是二选一,而是入口与交付层的重新分工。
当任务可以离开当前会话继续运行,AI 产品从偶尔打开的工具变成持续工作的队友,留存逻辑也随之改变。
自然语言降低了第一版门槛,但需求建模、数据责任、异常处理和长期维护仍然存在。更准确的变化,是更多人能成为软件产品的直接创造者。
补全几行代码已经不是主战场。下一阶段的价值在于理解任务、修改仓库、运行验证、提交变更并对失败负责。
代码产量提高后,重复逻辑、错误抽象和无人理解的实现会更快累积。真正的解法不是少用 AI,而是让验证、所有权与删除能力同步增长。
真正有价值的记忆不是保存所有对话,而是把架构意图、验证命令、历史教训和局部规则变成可定位、可更新的仓库资产。
美国更强于前沿模型、芯片和全球开发者平台,中国更擅长工程扩散、场景整合与成本竞争。政策、供应链和市场结构会让两套生态长期共存。
当 Agent 能长期运行并跨系统行动,它需要稳定身份、受限凭据、声誉、预算和责任链。未来互联网将不仅服务用户,也要识别代表用户行动的机器主体。
从截图生成页面只能赢得演示。真正可持续的价值,是让设计意图、组件、token、代码和视觉验证长期保持一致。
PR 把任务、代码差异、自动检查、讨论和责任装进同一个可审计对象,因此比聊天窗口更适合承接 Agent 的交付。
Agent 能看见多少、代表谁行动、何时必须停下,决定了企业 AI 能否从演示进入生产。权限系统正在成为 Agent 基础设施。
MCP 统一了模型连接工具与数据的接口,但协议普及只是起点。能否形成开放互操作层,取决于发现、身份、安全与运行治理。
眼镜把 AI 放进连续感知、即时询问和免手操作的回路,但真正的平台跃迁取决于续航、隐私、显示、输入和开发生态能否同时成立。
工作不是一个不可分割的单位。AI 会先接管部分任务、改变交接界面和能力组合,再让组织重新定义职位、晋升与薪酬。
一个能稳定安装依赖、运行测试、访问必要工具并隔离风险的环境,比精心修辞却无法执行的提示词更接近生产力。
Agent 能写文件、跑命令和访问网络后,隔离不再是安全附加项,而是让自动化可以被放心委派和规模复制的前提。
Agent 执行的工作量与用户人数不再线性相关,按席位收费开始失真;但结果定价也带来归因、质量、风险和预算可预测性难题。
诉讼不会单独解决训练数据争议。可机器读取的权利保留、来源记录、集体许可与收益分配,正在把版权冲突推向新的基础设施市场。
当实现工作可以被批量委派,团队瓶颈会从写代码转向定义问题、维护系统边界、审阅风险和运营交付流水线。
长期记忆能降低重复沟通,却也把误解、监控感和离开成本带进关系。真正的护城河不是记得最多,而是让用户持续掌控。
模型竞争的约束从算法扩展到先进制程、封装、内存、网络、电网、冷却和资本。任何一环短缺,都可能决定产品能否按成本扩张。
思维链让 AI 显得可解释,却可能是事后叙述、遗漏真实线索或自信包装错误。可信产品需要证据、可复现过程与独立验证,而不是更长的内心独白。
端侧模型不是云模型的缩小版,而是一套围绕设备约束重写的产品系统。真正的优势来自任务边界、端云路由与持续测量。
真实任务由许多脆弱步骤组成。可靠 Agent 需要验证、重试、恢复、升级与清晰终态,把模型准确率转化成用户可接受的完成率。
长任务需要可预期、可干预的进度界面。有效透明度来自计划、状态、证据和阻塞点,而不是滚动播放模型的内部文字。
Agent 的关键跃迁不是聊天更自然,而是能接住目标、跨工具推进并交付可验收结果。产品设计因此必须围绕任务状态,而不是消息流。
执行环境、反馈循环和任务图解决了 Agent 怎么跑;控制平面要解决谁能跑、花多少、何时停,以及出了问题如何追责。
模型供应链包含权重、数据、代码、许可、服务与治理。把它压缩成开或闭,会遮蔽企业真正要做的可控性、成本和责任选择。
R1 的冲击不只来自成绩,而是开源权重、强化学习路径与低价 API 同时出现,让推理能力从稀缺功能变成可以被重组的供应链。
模型竞争正从一次性堆训练计算,转向为每个问题动态分配推理预算。产品的核心变量也随之从模型大小变成了延迟、成本与答案价值的联合调度。
当浏览器开始理解目标、代替点击并跨站执行,它就不再只是网页容器,而是在争夺需求表达、决策与交易的上游位置。
多模型时代,路由器在每次请求上决定质量、速度、成本与风险。它不是后端优化器,而是一套可学习的产品决策系统。
会调用工具不代表理解世界。世界模型通过预测动作后果,让 Agent 在执行前模拟、比较与避险,可能成为机器人和空间智能的共同底座。
文本、图片、代码和身份都能低成本合成后,市场会把价值转移到来源、签名、测试、担保和责任主体。验证将成为新的基础设施与职业。
模型能力差距会缩小,默认入口、现有工作流、数据连接、品牌信任和渠道规则却更难复制。产品必须把能力变成可被持续发现和采用的路径。
真正改变科研速度的不是文献摘要,而是从假设、实验设计、自动化执行到结果验证的闭环;模型必须接受物理世界的反驳。
真正的多模态助手需要在时间中保持对象、意图与环境状态,而不是把摄像头画面当作一次性图片附件。连续感知会重写延迟、隐私和交互设计。
禁止工具无法恢复旧世界。教育需要从监督最终答案,转向观察问题定义、证据判断、过程反思、口头解释与独立能力。
公开 benchmark 能比较模型,却无法替代真实任务、失败成本和版本漂移。成熟团队需要把评估做成持续运行的产品系统。
真正的人机协作不是在最后一步让人背书,而是让人能设定边界、看见分歧、纠正方向并对结果负责。
长期记忆、情绪识别与实时实验让说服从人群定向走向个人适配。风险不只是假信息,而是系统持续塑造选择却不被察觉。
长上下文扩大了模型一次能看到的材料,却没有自动解决检索、取舍、身份连续性与事实更新。真正的记忆是一套写入、召回和遗忘机制。