第七周:微调开源模型去追前沿模型

同一个任务只改 harness,正确率从 17.1% 涨到 61.0%。在动微调之前,那一侧常常还有几十个点没被拿走。

位置
第 04 篇 / 共 5 篇
预计
5 分钟

微调这一章最有价值的部分,可能是判断什么时候不该微调

先看一组数

有一篇论文把 harness 当成可控变量做消融,环境是扩展过的 ALFWorld。它只改了三样纯脚手架的东西 —— 工具描述的详略、每步附带的辅助信息、工具 schema 的版本 —— 结果是:

  • 不训练,只把工具描述写详细:GPT-5 Mini 在一个任务上从 17.1% 涨到 61.0%
  • 3B 配好 harness,比 7B 配差 harness 高 14.1 个点

原文的结论句是:harness 的选择可以盖过模型容量的影响。 所以微调之前第一件事是确认瓶颈不在脚手架上

所以微调之前第一件事是确认瓶颈真的在模型,而不是在你给它的信息上。

顺序错了,微调会变成负资产

同一篇里还有一组更值得警惕的数。当工具 schema 发生变化之后:

训练时用的 harness 分布内 schema 变化后
信息量低 55.6% 2.7%
信息量高 69.6%
不微调的基线 13.5%

用信息量低的 harness 训出来的模型,遇到变化之后比没训练的还低 10.8 个点。

原因不难理解:harness 信息量低的时候,模型必须自己脑补工具的前置条件,而微调就是在把这些脑补固化进权重。一旦工具变了,固化下来的脑补全部失效,而且比没固化更糟 —— 它现在会自信地用错。

推论:微调会把你的 harness 冻住。 同一篇里,训练时应用 harness 比训练后再套上去高 20.7 到 22.5 个点。所以在 harness 还在改的时候微调,多半是浪费 —— 具体怎么做才不冻住那边有步骤。

那什么时候该微调

三种情况,判据都很实际:

一、每次调用都要重复解释同一件事。 如果系统提示里有两千字在教模型你们公司的术语,那两千字是每次请求都在付的税。微调把它移进权重是一次性付清。判据:这段解释的长度乘以调用次数,超过微调成本没有。

二、模型压根没有那个能力。 比如视觉定位 —— 一个读不出坐标的模型,工具描述写得再好也没用。这类能力在权重里,不在上下文里。

三、小模型 + 窄领域。 有工作专门做这个:让小的 agent 先跑、自动分析自己的失败模式、生成针对性的合成数据、再微调。2B–8B 的模型在单一领域上靠这条路去追大模型。这是垂类微调最有说服力的场景 —— 不是让小模型变通用,是让它在一格里够用。

真实收益比论文标题小

有一套面向领域 agent 后训练的闭环框架,在五批制造业数据上做了实测:

指标 提升
总分 +0.0098
通过率 +0.0240
证据准确率 +0.0280

而且五批里只有三批变好,有些批次是退步的,GRPO 还暴露出较高的 KL 风险。

这就是领域微调在真实业务数据上的样子:不是一条一路向上的曲线,是一堆有涨有跌、需要门禁去筛的批次。

微调之前至少要有的三样

那篇的结论是该管理整个「数据→训练→评测→发布」闭环,而不是「训练跑完了」。落到最小实践:

  • 留出集 —— 从头到尾没参与过调优的那批题
  • 配对评测 —— 同一批题跑两版相减,否则涨的那点分不清是模型还是运气
  • 应用链重放 —— 拿真实链路把新模型跑一遍,而不是只看一个离线分数

这三样没有的话,微调跑完你不知道自己得到了什么。

对着这三条自查,我得出的结论是我现在不该微调 —— 而理由不是「没数据」。我那套东西的 harness 这几个月一直在改:拒收门降级过一次、依据校验的口径松过一次、错误分类重写过一次。按上面那组数,训练时用的 harness 一变,微调的收益就作废甚至变成负的,那我现在训出来的东西下个月就是负资产。我的判断是:harness 的形状先稳下来,微调才有意义 —— 顺序反了,花的钱是白花的。

边界与代价

上面所有数字都是转述,我没跑过微调。 我能做的是把它们的实验条件说清楚,不能替它们担保能复现。转述的实验和自己跑过的实验,可信度不是一回事。

那 43.9 个百分点来自一个特定基准。 ALFWorld 工具边界清晰、动作空间有限。你的场景如果工具语义更模糊,harness 的杠杆未必这么大。

微调锁住的不只是 harness,还有供应商。 一份为某个开源模型微调的权重换不到别家。在模型换代速度这么快的时候,这笔账要算进去。