Benchmark · 写作质量
12 道按写作失效模式反推设计的题,4 个参赛者两两匿名对战。裁判逐维度只回答一个问题—— 这两篇哪篇更好,从不给绝对分。432 次裁判调用、9460 张票,折算成 Bradley-Terry 实力分。
按总胜率排布。两个「完整系统」把两个「裸模型」稳稳压在下面——这条分界线比底模代际的分界线清晰得多。
| 参赛者 | 总胜率 | BT 实力分 | 说明 | |
|---|---|---|---|---|
| 1 | kimi-k2.5 + StoryWeaver 第一 完整系统kimi-k2.5(系统) | 68% | 1.61 | 完整 Agent:write_novel 分包写作 → 审核子 Agent 挑毛病 → 改写子 Agent 定点修,未锁文风。 |
| 2 | kimi-k2.6 + StoryWeaver 完整系统kimi-k2.6(系统) | 56% | 1.11 | 同上,换更新一代底模。 |
| 3 | kimi-k2.5 裸模型kimi-k2.5(裸) | 39% | 0.65 | 梗概直接喂模型,一次成文,无系统提示与工具。 |
| 4 | kimi-k2.6 裸模型kimi-k2.6(裸) | 38% | 0.63 | 同上,换更新一代底模。 |
行对列的胜率,颜色越深赢得越多。
| 2.5(系统) | 2.6(系统) | 2.5(裸) | 2.6(裸) | |
|---|---|---|---|---|
| 2.5(系统) | — | 57% | 75% | 70% |
| 2.6(系统) | 43% | — | 63% | 60% |
| 2.5(裸) | 25% | 37% | — | 55% |
| 2.6(裸) | 30% | 40% | 45% | — |
k2.5(系统) 对 k2.6(裸) 是 70%——
把系统套在旧一代底模上,能压过裸跑的新一代底模;反过来 k2.5(裸) 对 k2.6(系统) 只有 37%。
换底模不如接系统。rubric 共 22 维(其中 9 维越低越好)。系统档拿下 20/22 维的榜首, 包括全部 9 个负向维度——审核改写循环最擅长的正是压掉「说教而非展现」「辞藻堆砌」「业余生涩」这类毛病。
系统支持锁定作家文风(古龙、张爱玲、江南、海明威、鲁迅),文风规范会整段注入 system prompt。
但本轮四个参赛者全部未锁文风,跑的是通用模式——榜上的「完整系统」指的是
write_novel 分包写作 + 审核改写循环这套流程本身,不含任何文风加持。
难判率 = 同一题下正反两序打架的维度占比。超过 1/3 说明这道题分不出高下,该改写或换掉。 本轮 12 道题全部达标,最高 33%、最低 2%。
| 题目 | 考什么 | 难判率 |
|---|---|---|
| 父亲的最后一次住院 | 反辞藻堆砌 | 33% |
| 药铺里的半个时辰 | 反对白无力 | 29% |
| 他还是没走 | 反廉价的转变 | 27% |
| 举报信 | 人物层次 | 25% |
| 追 | 句子节奏 | 22% |
| 退潮后的排档 | 画面感 | 20% |
| 收拾师父的屋子 | 明暗处理 | 20% |
| 出发前夜的镖局 | 生活切片 | 15% |
| 黑风峡的第一声马嘶 | 张力 | 12% |
| 她回来了 | 情感复杂度 | 8% |
| 药铺里的半句实话 | 对手戏 | 8% |
| 退货 | 反冗游拖沓 | 2% |
claude-sonnet-5,与被测 kimi 不同家族,避免自我偏好。glm-5.1 的位置一致率只有 30%(46% 的判定无脑选甲位),
claude-sonnet-5 是 68%。两者给出的名次完全相反——
若省掉这步直接开跑,会得到一个纯由位置偏见产生的错误结论。