Benchmark · 写作质量

系统加持,比换一代底模更管用

12 道按写作失效模式反推设计的题,4 个参赛者两两匿名对战。裁判逐维度只回答一个问题—— 这两篇哪篇更好,从不给绝对分。432 次裁判调用、9460 张票,折算成 Bradley-Terry 实力分。

总榜

按总胜率排布。两个「完整系统」把两个「裸模型」稳稳压在下面——这条分界线比底模代际的分界线清晰得多。

参赛者总胜率BT 实力分说明
1kimi-k2.5 + StoryWeaver 第一 完整系统
kimi-k2.5(系统)
68%1.61完整 Agent:write_novel 分包写作 → 审核子 Agent 挑毛病 → 改写子 Agent 定点修,未锁文风。
2kimi-k2.6 + StoryWeaver 完整系统
kimi-k2.6(系统)
56%1.11同上,换更新一代底模。
3kimi-k2.5 裸模型
kimi-k2.5(裸)
39%0.65梗概直接喂模型,一次成文,无系统提示与工具。
4kimi-k2.6 裸模型
kimi-k2.6(裸)
38%0.63同上,换更新一代底模。
系统 vs 裸(k2.5)
75%
同一底模,加系统后的胜率
系统 vs 裸(k2.6)
60%
同上,换新一代底模
k2.5+系统 vs k2.6 裸
70%
系统增益 > 一代底模差距

两两胜率

行对列的胜率,颜色越深赢得越多。

2.5(系统)2.6(系统)2.5(裸)2.6(裸)
2.5(系统)57%75%70%
2.6(系统)43%63%60%
2.5(裸)25%37%55%
2.6(裸)30%40%45%
最值得看的一格k2.5(系统)k2.6(裸) 是 70%—— 把系统套在旧一代底模上,能压过裸跑的新一代底模;反过来 k2.5(裸)k2.6(系统) 只有 37%。 换底模不如接系统。

分维度

rubric 共 22 维(其中 9 维越低越好)。系统档拿下 20/22 维的榜首, 包括全部 9 个负向维度——审核改写循环最擅长的正是压掉「说教而非展现」「辞藻堆砌」「业余生涩」这类毛病。

遵循指令2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)
人物行为可信2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)
人物层次细腻2.6(系统) › 2.5(系统) › 2.5(裸) › 2.6(裸)
声腔与语调一致2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
画面感与描写质量2.5(裸) › 2.6(系统) › 2.5(系统) › 2.6(裸)
文笔优雅2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)
情感投入2.5(系统) › 2.5(裸) › 2.6(系统) › 2.6(裸)
情感复杂度2.5(裸) › 2.5(系统) › 2.6(系统) › 2.6(裸)
连贯性2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
冗游拖沓 越低越好2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
对白无力 越低越好2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
说教而非展现 越低越好2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
平庸乏新 越低越好2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)
业余生涩 越低越好2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
辞藻堆砌 越低越好2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
过度渲染 越低越好2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
结尾正能量失调 越低越好2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)
廉价的转变 越低越好2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
明暗处理得当2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)
句子自然流动2.5(系统) › 2.6(系统) › 2.6(裸) › 2.5(裸)
整体阅读投入2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)
整体印象2.5(系统) › 2.6(系统) › 2.5(裸) › 2.6(裸)

关于文风

系统支持锁定作家文风(古龙张爱玲江南海明威鲁迅),文风规范会整段注入 system prompt。 但本轮四个参赛者全部未锁文风,跑的是通用模式——榜上的「完整系统」指的是 write_novel 分包写作 + 审核改写循环这套流程本身,不含任何文风加持。

为什么不比文风:文风是审美选择,不是能力高低。 先前用「江南」文风试跑过一轮,结果是它在「情感投入」维度断层第一、却在「连贯性」「遵循指令」上垫底—— 浓墨重彩换来更强的感染力,代价是更容易偏离题目要求。这种此消彼长无法用一个名次概括, 萝卜青菜各有所爱,故不纳入排行。

题目区分度

难判率 = 同一题下正反两序打架的维度占比。超过 1/3 说明这道题分不出高下,该改写或换掉。 本轮 12 道题全部达标,最高 33%、最低 2%。

题目考什么难判率
父亲的最后一次住院反辞藻堆砌33%
药铺里的半个时辰反对白无力29%
他还是没走反廉价的转变27%
举报信人物层次25%
句子节奏22%
退潮后的排档画面感20%
收拾师父的屋子明暗处理20%
出发前夜的镖局生活切片15%
黑风峡的第一声马嘶张力12%
她回来了情感复杂度8%
药铺里的半句实话对手戏8%
退货反冗游拖沓2%

怎么比的

裁判是校准过的。上线前用同一批章节比过两个候选: glm-5.1 的位置一致率只有 30%(46% 的判定无脑选甲位), claude-sonnet-5 是 68%。两者给出的名次完全相反—— 若省掉这步直接开跑,会得到一个纯由位置偏见产生的错误结论。