可判定的输出,核心不是“答得对”,而是让不同人按同一份答案能得出相同结论。做法是把题目从“解释概念”改成“给定条件,选出动作并写出检查点”,再为每个检查点规定可观察的证据。这样,同一事实出现分歧时,分歧会落在证据上,而不是落在理解上。
两种条件下选择不同。条件一:知识点只有一个明确结论,例如某个标签的作用、某类页面的规范地址应指向哪里,适合出结论题,要求答题者给出唯一选项并说明排除其他选项的依据。条件二:知识点依赖站点现状,例如是否该合并两个内容相近的页面,适合出过程题,要求答题者先列出需要采集的信息,再给出条件分支。
判断依据很简单:如果换一个站点,正确答案会变,就不要出唯一答案的结论题。反过来,如果无论站点如何,某个判断都成立,就不要出成开放讨论,否则评分会失去可比性。
一个可判定的题干应包含三部分:已知条件、要求执行的动作、需要留下的证据。假设例子:某站有两个页面主题相近,一个已被站内其他页面链接,另一个没有;要求答题者决定是否合并,并写出判断所依据的三项信息。这里的“三项信息”就是可核对的部分,例如两页各自承接的查询意图、站内链接指向、内容重合的具体段落。
动作要具体到可以执行。把“优化这个页面”改成“为这个页面确定一个主要意图,并列出与该意图不匹配的段落,说明处理方式”。结果会直接影响下一步:如果答题者列不出不匹配段落,说明他还没有完成意图判断,应先回到意图识别,而不是进入改写。
评分标准里最容易被滥用的词是“理解”“合理”“清晰”。把它们换成可观察项:是否引用了页面上的具体文字,是否给出了判断成立的前提,是否说明了在什么情况下结论会反转。例如“这个页面应该保留”不是证据,“这个页面承接的是比较型意图,而站内已有页面承接同类意图,且两页正文重合段落超过一半”才是证据。
当多个角色对同一事实理解不同时,不要先争论谁对,而是让各自写出所依据的页面位置和判断前提。分歧会收敛到两类:一类是事实采集不同,补采即可;另一类是前提假设不同,需要明确采用哪一个前提。前者是执行问题,后者是决策问题,处理方式完全不同。
不是所有题都能判成对错。出现以下情况时,应判定为“需补充信息”,而不是强行给分:题干缺少站点类型或页面目的;同一动作在不同前提下结论相反且题干未限定前提;证据只能通过未提供的后台数据获得。把这些情形写进评分说明,可以避免把“无法判断”误判为“答错”。
一个实际动作是:在每道题后附一行“判定所需信息”。如果答题者写出的信息少于这一行,就先退回补充,不进入结论评分。这个动作会让练习节奏变慢,但能减少后续反复返工,因为错误被拦在结论之前。
单题可判定还不够,一组题之间也要能比较。做法是固定输出结构:条件、动作、证据、例外。无论题目内容如何,答题者都按这四项写。这样,批改者可以横向看出谁在证据环节薄弱,而不是只看到总分。
需要说明的是,答题正确率上升或某类错误减少,只能说明这批题在当前条件下更可判定,不能单独证明学习方法整体有效;练习量、题目难度和批改标准变化都可能带来同样结果。因此每次调整题目后,应保留旧版评分说明,便于对照是题目变了还是人变了。