# L2 深度报告样例 · v5-harness × J2-RL tool-call 三门

> 产品化产出 B · 判据③样例(L2 档交付物形态展示)。2026-10-05 v1。
> 此为样例:自家 harness 自测,数据全部真实可复核;对外交付同形态。

## 1. 被测物信息

| 项 | 值 |
|---|---|
| 被测 harness | v5-harness(NautilusAgent 内核 + 双工具集 str_replace_editor/submit) |
| 系统提示词 | student-prompt-v0.1(2026-09-28 冻结,训练=部署同文) |
| 配置披露 | repo @ 4e14a898(L3 榜披露版) |
| 判据锚 | J2-RL tool-call 三门(legal/name/args),机器判分(不可写面) |

## 2. 评测设计

- **评测集**:33 条 held-out 真实任务轨迹,全量展开 n=753 prompt(held-out 宪法:改进样本永不入测池,交集=0 已实证)
- **三门定义**:legal(调用合法性)/name(工具名正确)/args(参数 schema 正确),逐题机器判分
- **最小可判差 δ≈2.1pp**:差值小于 δ 记 flat,不声称改进(防噪声冒功)

## 3. 结果读数

| 轮 | 配置 | legal | name | args(率) | 判读 |
|---|---|---|---|---|---|
| r75 | 基线裸生成 | 98.0 | 91.6 | 11.55% | 基线 |
| r76 | +前缀约束生成 | 99.3 | 94.9 | **13.94%** | **args +3.58pp > δ = UP**;dist -28.7% |
| r77 | +46 条异分布燃料扩池 | — | — | 11.55% | **-2.39pp > δ = DOWN**(增益被稀释回基线) |

## 4. 判因分析

1. **r76 增益来源=结构约束**:前缀+花括号强制生成使 tool-call 起手合法率上升,非模型能力变化。
2. **r77 负结果=燃料对口性>数量的因果实证**:新增 46 条燃料来自异分布源(路径不可推导,render 丢 toolresult),稀释 r76 增益;对照实验证明**扩池只收同分布**才能保增益。
3. **训练池多样性瓶颈**:1467 行仅 109 唯一 prompt——量 vs 质的下一根本瓶颈在分布,不在条数。

## 5. 改进建议(按优先级)

1. 扩池只收同分布(E1 金标 / 四验 pass 轨迹),异分布一律拒收;
2. 唯一 prompt 数 109→300+ 为下一目标(比总条数优先);
3. 前缀约束生成固化进 harness 默认配置。

## 6. 复现包

- 同卷:33 条 held-out 冻结轨迹集(sha 留档);每批改动后同锚同口径重跑
- 判分:机器三门脚本,单 trial,temperature 0
- 沉淀窗:改动后 ≥48h 再读数,防暂态冒功

## 7. 附:评测发现缺陷→修复→分差(本 harness 的 L4 案例)

评测过程中发现网关 chat 分支(无 tools+非 stream)分钟级挂起——定位为 CPU embed 在 event loop 串行+冷启动联网同步挂(faulthandler 全栈实证),非死锁。修复=三前置 wait_for 12s 降级+启动壳离线化;自验 HTTP 200/38s。修复前后分差随 E1 复考(10/13)收口——评测→修复→复测闭环的完整留痕。

---

*交付形态:本报告 + 复现包 + 机器判分原始输出。样例免费;对外交付 $199/次(L2 档,SLA 5 工作日/返工≤2/判据 sha 预注册)。*
