当模型也参加 AI 奥赛:真正被测的是 Harness,不只是智力
IOAI 首次设置独立模型赛道,并要求提交执行轨迹。它正在把模型评测从一次答案比较,推进到模型、工具、编排与恢复机制的系统考试。
8 月 2 日至 8 日举行的国际人工智能奥林匹克竞赛,第一次让 AI 系统拥有独立模型赛道。表面上看,这是“模型和学生同场做题”;真正有价值的变化,是主办方没有把参赛者定义成一个裸模型,而是定义成模型、Agent Harness 与编排共同组成的系统。评测对象从大脑扩展到了工作方法。
模型赛道设置两个六小时场次,每场处理多个任务。人类只能启动或在后端故障时恢复系统,AI 通过 MCP 提交结果,还必须保留模型调用、工具输入输出、子 Agent、代码执行和提示等轨迹。这些要求把“最后答对了多少”与“它是怎样完成的”放在同一个评价框架里。
传统 Benchmark 倾向于把模型放进干净的输入输出盒子:给一组题,看最终准确率。它适合比较基础能力,却越来越难代表 Agent 的真实表现。现实任务需要读文件、写代码、试错、选择工具、管理上下文和在失败后恢复。同一个模型接入不同 Harness,结果可能相差很大。
这也是为什么模型排行榜越来越难直接指导产品决策。一个模型在静态题库上领先,并不意味着它在你的代码库、权限环境和任务长度下更好。上下文如何整理、工具如何描述、什么时候并行、错误如何反馈、预算如何分配,都会改变最终质量。模型只是系统中的一个强组件。
IOAI 要求完整执行轨迹,解决了另一个长期问题:只看答案无法区分能力与偶然。Agent 可能依赖意外泄漏、无效重试或不可复现的外部状态得到正确结果。轨迹让评委看到路径、成本和依赖,也让失败能被分析。对于生产系统,这些证据往往比一张总分表更有价值。
但轨迹不等于公开模型的内部思维。产品真正需要保存的是可验证的行动事实:读取了什么输入、调用了什么工具、产生了什么中间物、依据什么测试继续、在哪里发生了人工接管。把这类事件结构化,既能审计,也能避免把冗长的自由文本误当成解释。
从 Builder 的角度,模型赛道实际上在考四种工程能力。第一是任务分解,能否把模糊问题变成可执行步骤;第二是工具选择,能否知道何时写代码、检索或验证;第三是状态管理,长任务中能否保存有效上下文;第四是恢复,局部失败后能否从检查点继续,而不是整段重来。
这些能力也解释了为什么 Harness 会成为新的产品层。过去应用只是把用户输入转成一次模型调用;现在应用要安排多轮工作、选择模型、控制权限、保存中间产物并评价结果。模型升级可以带来上限,Harness 则决定上限能否稳定变成用户可感知的交付。
对于教育,模型参赛并不意味着人类竞赛失去意义。恰恰相反,它迫使我们重新定义人的优势。如果机器可以在六小时内完成大量标准任务,学生的价值就不能只靠熟练复现套路。问题定义、数据判断、实验设计、证据质量和对结果的质疑,会比背诵固定解法更重要。
主办方把人类与模型分开排名是合理的,因为二者的资源和约束不同。更值得期待的是未来出现协作赛道:学生需要设计 Harness、选择模型、设置验证器,并对系统结果负责。那会更接近真实工作,也能测出人是否理解 AI 的边界,而不仅是会不会调用它。
企业内部的 Agent 评测也可以借鉴这一思路。不要只准备一百道问答题,而要设计十个完整任务,让系统在受控环境中读取真实格式的数据、调用有限工具、交付可检查结果。记录成功率之外的指标:人工接管次数、恢复成本、权限越界、尾延迟和每次有效交付成本。
评测还应当允许更换模型而保持任务与 Harness 相对稳定。这样团队才能知道提升来自哪里:是模型推理更强,工具说明更清楚,还是验证器避免了错误。如果每次换模型就同时改提示、数据和流程,排行榜只会制造热闹,无法支持工程决策。
评测治理同样重要。任务集需要版本、环境需要冻结、外部工具要记录变化,提交结果还要能被第三方复跑。否则,Harness 越复杂,越容易把不可见的资源差异包装成模型能力。公开轨迹与统一约束不是限制创新,而是让创新可以被比较。
对模型公司而言,这类比赛会把竞争从“谁更聪明”推向“谁更容易被编排”。稳定的工具调用、可控的推理预算、清晰的错误、可复现的执行和良好的长任务恢复,会成为与准确率同等重要的能力。一个稍弱但稳定的模型,可能在系统级任务中击败更强却难以控制的模型。
因此,IOAI 的模型赛道不是一场猎奇的人机秀,而是一种更成熟的评测语言。Agent 产品不应该把成功归因于模型名称,也不该把失败推给一句“模型有随机性”。当执行轨迹、Harness 和恢复机制都进入考场,AI 的能力才开始以系统工程而不是魔法来被衡量。
— 完 —