一个智能体把进化集的分数从八十五分提升到了九十二点八分, 但是把这个智能体迁移到完全没有见过的测试集上之后, 它的收益表现直接变成了零——这现象并不是系统里出现了什么错误代码或者故障, 而是现在的自动改进机制在内部运行过程中, 不知不觉地陷入了一种极其隐蔽的过度学习陷阱里的状态。
不碰权重只改外壳
在以前人们讨论递归自我改进这个话题的时候, 大家经常容易产生一种想象, 觉得人工智能会直接去修改它自己的模型参数, 然后利用升级之后更强大的版本迭代出下一代的结果。可是当我们把视线放到二0二六年实际的智能体工程实践操作中去以后, 就会发现现实的路径其实更加实际和可行。
具体的做法是不去触碰那些底层的权重数据, 而是选择在提示词的写法方面加以调整, 或者对工具调用的时机进行优化, 再或者是针对上下文与记忆管理的机制做出改变, 最后还可以完善失败恢复的策略, 所有的这些操作方法都是围绕在模型构建的Harness层这一框架之内展开的。
如果使用同一个基础模型, 但是编写的Harness程序代码的格式或者逻辑风格不一样, 那么最终能够完成任务的量可能会相差好几倍。进化这一套外部框架, 是当下提升智能体能力的比较现实且成本很低的一个切入点, 这样做可以完全避免去重新训练模型参数所需支付的高昂费用。
从执行轨迹到自适应搜索
现有的Harness Evolution通常遵循一个直观的、大家都能明白的流程。这个流程是先让当前的Agent去一组任务中跑一遍。然后根据任务执行的成功轨迹和失败轨迹, 来生成反馈信息。
接着, 依据这些反馈信息, 去修改Harness的相关配置。就这样反复迭代好几轮。最终, 整个运作过程会逐渐演变成针对有限数据集的持续自适应搜索。
Agent已经开始记住这个Benchmark所独有的模式了。它把随机涨的情况误判为了真实能力的跃升。它甚至在不断堆叠Prompt。它还在不断堆叠Context。它还不断堆叠控制逻辑。它正在用越来越多的test-time compute去换取evolve set上零点几的分数。
分数上涨的错觉
出现了一个最让人反常的奇怪情形, 这情形就是evolve score这条曲线的数值还在不断地往上增长。表面上来看, 所有的事情都显得完全正常。可是这个名叫Agent的家伙, 只要一步脱离了原本那个用于进化的数据集合。
然后它就会一头扎进一个它从来就没有见到过、也没测试过的Benchmark基准测试库里去。这时候之前获得的收益就会以最快的速度掉价减少, 甚至直接就消失得干干净净不见了影迹。结果就导致了一个极其矛盾的结局, 那就是这个分数越高反而越不靠谱。
这就意味着, 候选分数所存在的那一点轻微变动, 实际上是无法用来支持Agent实现了真正的进步这一观点的。或许增加了一段上下文信息这种行为, 仅仅是在使用更多的测试阶段计算资源来遮盖那些原本就存在的问题和缺陷而已, 而并不是说真正提升了执行层面的能力。
正则化拆分两个模块
RRSI这款产品的关键设计之处, 在于它并没有把Agent的自我修改能力给彻底锁死。
它将Harness RSI拆分成了两个相互独立的模块, 其中的Proposal这个模块, 其职责是决定在下一轮迭代过程中究竟应该尝试去修改哪些内容, 而Selection这个模块, 其主要工作内容则是进行判断, 以甄别出到底有哪些具体的修改方案真正具备资格被写入到永久性的状态之中去。
与此同时, 整个系统还会保留那份非常完整的进化历程方面的历史记录。
过去到底是哪一个假设被验证成功了, 还有哪一个具体的机制已经遭遇了失败, 某一次修改操作究竟是带来了多少数值的分数增量, 以及当时又具体付出了多大程度上的推理方面开销, 上述所有内容都会被完整地留存下来, 从而全部继续作为下一步搜索行动所要依据的那些实际证据材料来使用。
去掉正则化分数反而更高
在Agentic Workspace的实验设置中, 直接把Regularization去掉之后, 普通无正则进化可以把evolve score推到92.8, 这个分数明显高于RRSI的90.5, 单看进化集的数字, 无正则版本似乎“更强”。
但是实验的结果很明确地显示出来了, evolve score越高, OOD的表现就越差, 消耗的Token数量也越多。
RRSI这个选项的分数虽然稍微低了一点, 可是它落在了“消耗更少的Token”并且“OOD表现更高”的那个更好的区域里面, 所以候选分数的哪怕只有一点点微小的波动, 也不代表Agent就真的取得了进步。
自我改进的过拟合
搜索长期停滞时,RRSI会把部分capacity转向此前较少被探索的Harness component。Selection端更严格:落在evaluation noise范围内的涨分,不会被轻易写入永久状态。
自我改进实际上是一个反复利用有限反馈的自适应搜索过程, 因此它必然会遭遇机器学习中大家非常熟悉的老问题, 也就是过拟合这一点。分数出现一次上涨究竟是因为学到了更好的执行机制, 还是因为碰巧利用了噪声, 这就是 Harness RSI 这个系统必须正面回答的核心命题。
你感觉一下, 当Agent自己给自己打分、自己决定改哪里时, 谁来判定它是在真正进步还是在"自嗨"? 欢迎在评论区聊聊你的看法。觉得有用请点赞, 转发给同样关注Agent进化的朋友。

