判断一份 AI 审稿报告有没有用,标准可以压缩成三句话:每条问题能被核对,每个分数能被复算,每条结论能变成一个具体的修改动作。第一条靠「证据三件套」纪律,第二条靠机检优先的评价引擎,第三条靠把报告与修订通道直连。三条缺一,报告就退化成一份读完即弃的观后感。
通用点评为什么没用
把剧本丢给通用大模型,得到的典型输出是:「节奏偏慢」「人物弧光不足」「建议加强冲突」。这类点评的问题不在于说错,而在于无法行动:
- 不可定位——「节奏慢」指哪几集、哪几场?改稿无从下手;
- 不可核对——判断依据是什么?模型自己也说不清,编剧无从反驳,也无从采信;
- 不可执行——「加强冲突」翻译成哪一行台词的哪个改法?没有答案。
更结构性的缺陷是维度错位:通用文学点评看「写得好不好」,短剧的生死线却是付费结构——卡点在不在位、钩子强不强、开环有没有偿还。审稿维度必须绑定付费结构,而不是通用文学标准。
标准一:每条问题给齐证据三件套
三件套是对每条问题(finding)的强制字段,缺一条就不允许出现在报告里:
- 证据原文——可定位的引句,精确到集与场。防的是模型幻觉:引不出原文的问题不成立;
- 依据数据——量化对照,例如「本集女主对白 2 行 / 全剧均值 14 行」。防的是印象流:让「人物失声」从形容词变成一条可复核的数字;
- 示范改法——句级示范,直接写出这句话可以怎么改。防的是「知道有病,不知道怎么治」。
三件套的本质是把举证责任压给 AI:报告的每一行都自带可证伪性。编剧核对证据原文后发现不成立,可以直接驳回这条问题——驳回本身也是有效信息,会进入下一轮评价的校准。
标准二:评分确定可复算
评分可信的前提是可复算——同一稿重跑分数不变;分数变了,能指出是哪几条问题的增减导致。做法是机检优先:五个维度中三个走纯机检,零模型调用,天然确定;两个走模型,但强制携带逐集证据块。
| 维度 | 引擎 | 成本 |
|---|---|---|
| ① 主线与人物 | 模型评审+逐集摘要证据块(剧集文本是最终事实) | 1 次调用 |
| ② 卡点与结构 | 主表规则核对+爆款节拍图谱对标(机检) | 零 token |
| ③ 钩子 | 逐集深评聚合,缺失才补跑 | 复用为主 |
| ④ 开环与伏笔 | 伏笔账本启发式核对(机检) | 零 token |
| ⑤ 台词与可拍性 | 集长与对白密度统计(机检) | 零 token |
扣分规则是明文常量:高、中、低严重度分别扣 15、8、3 分;单维设 20 分地板;同类型问题从第 4 条起半衰,避免一类病刷爆一个维度;总分是激活维度的等权平均,85 与 70 分是色带分界。规则公开的意义在于:分数争议可以对账,逐条问题加起来就是那个数,而不是「模型觉得」。
标准三:结论能变成动作
报告的终点不该是一份 PDF。每条问题携带锚点——维度、集号、字段、引句——点击即进入修订:AI 按示范改法生成行内 del/ins 修订预览,编剧逐条采纳或驳回。这里有一条不可破的红线:AI 永不静默直改——一切修改先出预览,人审采纳才落库,未点名的内容逐字不动。改完增量重审,分数变化与已解决的问题划线可见,「评价 → 修改 → 复评」的闭环由此成立。
有用的报告还必须诚实于覆盖范围:只评已写的集,后程只是计划层就明确标注「评的是已写集,后程仅计划层」——不拿未写的内容凑分,也不给未写的集下诊断。
标准本身也要被校验
最后一层:审稿标准自己也需要证据。这套体系以 13 份稿件、9 个题材做人工-AI 成对对照校验,并用经主编四轮迭代的生产级人工剧本作为黄金标准反向验证——AI 给高分的,人也认可;人挑出的问题,AI 能复现。工程口径上,整本剧本首链审稿约 9 分钟,增量重审约 70 秒,单集定点修订约 16 秒(生产环境真实链路实测,2026)。速度不是标准的一部分,但它决定这套标准会不会真的被每天使用。
方法论与数字出处
- 《多入口创作体系 · 当前态总设计 v2.0》§3–§4——以太之笔内部方法论文档:五维引擎表、finding 三件套纪律、评分规则与修订红线。
- 校验与性能数字:13 份稿件 × 9 题材人工-AI 成对校验、首链约 9 分钟 / 增量约 70 秒 / 定点修订约 16 秒,均为生产环境真实链路实测(2026),口径与官网一致。
以太之笔的「剧本评价与续写」工作流即这套标准的产品化:提交大纲、梗概、半成品或成稿,约 9 分钟拿到五维审稿报告;报告直连 Word 修订模式的修稿台,逐条采纳或驳回,达标后一键接回创作线继续写。
申请内测名额 · 内测期间免费使用全部已上线能力
继续读