本会正式比赛的评分模式 A,不是把各裁判的分数加起来比大小,而是采用 名次积分制。这份说明分五个部分:先说明为什么不用总分,再说明名次积分怎么算, 接着说明同分时如何裁定,最后说明并列名次与成绩单的看法。
先从最简单的情况说起。如果全场只有一位裁判,那么用分数排还是用名次排,结果完全相同:
| 情况一(分差很小) | 总分 | 名次 | 情况二(分差很大) | 总分 | 名次 |
|---|---|---|---|---|---|
| P1 | 75 | 1 | P1 | 95 | 1 |
| P3 | 73 | 2 | P3 | 83 | 2 |
| P2 | 72 | 3 | P2 | 70 | 3 |
问题出现在多位裁判的时候。要理解它,先要理解一个人类心理上的现象,这里称之为 识别差距(表现 · 识别 · 差距,即一个人心中「好一点」与「好很多」之间的距离)。
如果不指定范围,请三个人各自为同样三位选手打分,可能得到这样三组数据:
| 评分者 | 选手甲 | 选手乙 | 选手丙 | 识别差距 |
|---|---|---|---|---|
| A | 6 | 8 | 9 | 1 – 4(很窄) |
| B | 50 | 80 | 90 | 10 – 40(很宽) |
| C | 5 | 21 | 30 | 5 – 25(中等) |
首选某个测量制度其实也可以反映评分者某种程度的性格。默选窄尺度(识别差距小)的评分者倾向于保守、宽容、稳定。默选尺度宽者(识别差距大)倾向于严苛、对错分明、激进。
三个人的想法其实一样:甲最弱、乙居中、丙最好。但他们用来表达这个想法的数字尺度完全不同。 在各自的心里,A 的「6」、B 的「50」、C 的「5」表达的是同一件事。人类最擅长的是分辨排名 (比较好),不是准确用数字来表达真实有多少 “分别” 和 “距离” 来表达一个概念。 直觉的洞察和识别远超表面,甚至可以深至心理素质。
假设两位裁判,两位选手。裁判 A 的识别差距窄,裁判 B 的识别差距宽:
| 裁判 A 窄(差距 5) |
裁判 B 宽(差距 15) | 总分 | 结果 | |
|---|---|---|---|---|
| P1 | 70 | 85 | 155 | 胜 |
| P2 | 75 | 70 | 145 |
| 裁判 A | 裁判 B | 总分 | 结果 | |
|---|---|---|---|---|
| P1 | 70 | 70 | 140 | |
| P2 | 75 | 85 | 160 | 胜 |
四位裁判、三位选手。前三位裁判的识别差距很窄,第四位很宽:
| J1 | J2 | J3 | J4 差距很宽 |
总分 | 总分名次 | 各裁判名次 | 名次积分 | 积分名次 | |
|---|---|---|---|---|---|---|---|---|---|
| P1 | 81 | 82 | 80 | 60 | 303 | 第三 | 1 · 1 · 1 · 3 | 6 | 第一 |
| P2 | 80 | 81 | 79 | 95 | 335 | 第一 | 2 · 2 · 2 · 1 | 7 | 第二 |
| P3 | 79 | 80 | 78 | 90 | 327 | 第二 | 3 · 3 · 3 · 2 | 11 | 第三 |
一位识别差距宽的裁判,凭一个 60 分,推翻了三位裁判的一致意见。 这不是裁判 J4 的错 :- 他只是习惯用比较宽的尺度表达判断。错的是把分数直接相加这个做法。
既然每位裁判的数字尺度无法统一,那就不去统一它。 让每位裁判自由使用自己习惯的尺度,本会只取用他给出的先后次序, 再把各裁判所给的名次相加。
| J1 | J2 | J3 | 名次积分 | 最终名次 | |
|---|---|---|---|---|---|
| P1 | 1 | 1 | 2 | 4 | 第一名 |
| P2 | 2 | 3 | 1 | 6 | 第二名 |
| P3 | 3 | 2 | 3 | 8 | 第三名 |
每位裁判按本项目的评分标准,为每一队打出各项分数,加总为该队在该位裁判心中的原始分。
场地记录的扣分(超时、失误、违规等)由扣分台记录, 从每一位裁判给该队的总分中同额扣除,不是只扣一次。 这样扣分对每位裁判的判断都产生同样的影响,不会因为扣在谁身上而产生偏差。
系统自动依照该裁判的最终分高低,排出这位裁判自己的名次:最高分第 1 名,其次第 2 名,依此类推。 裁判不需要、也不能直接填写名次;名次由分数推导,避免与分数不一致。
如果某位裁判给两队完全相同的最终分,代表他确实认为两队不相上下。 此时这两队共享名次的平均值:并列第 3 名的两队,各记 3.5; 三队并列第 3 名,各记 4。
因为第 1 名记 1 分、第 2 名记 2 分,所以分数越低代表越多裁判把这一队排在越前面。
多数情况下,名次积分已能分出清楚的高低。少数情况下会出现两队以上积分相同, 此时依下列顺序逐级裁定,每一级都以「人的判断」为依据,而不是再引入新的数学公式:
两队积分同为 8 分:
| J1 | J2 | J3 | 名次积分 | 裁判票 | 支持的裁判 | 裁定 | |
|---|---|---|---|---|---|---|---|
| P1 | 1 | 3 | 4 | 8 | 1 | J1 | 第二名 |
| P2 | 3 | 2 | 3 | 8 | 2 | J2、J3 | 第一名 |
极少数情况下,连裁判票也会打平,而且是以一种特别的方式打平: 甲胜乙、乙胜丙、丙又胜甲 :- 像剪刀、石头、布一样首尾相接,找不到起点。 这个现象称为孔多塞循环。
| J1 | J2 | J3 | 名次积分 | 裁判票 | 支持的裁判 | |
|---|---|---|---|---|---|---|
| P1 | 1 | 4 | 4 | 9 | 1 | J1 |
| P2 | 2 | 2 | 5 | 9 | 1 | J2 |
| P3 | 3 | 3 | 3 | 9 | 1 | J3 |
循环无法靠票数解开,此时比较各队所获得的最好的一个名次:
| J1 | J2 | J3 | 名次积分 | 裁判票 | 最佳单项名次 | 最终名次 | |
|---|---|---|---|---|---|---|---|
| P1 | 1 | 4 | 4 | 9 | 1 | 第 1 名(J1 给) | 第一名 |
| P2 | 2 | 2 | 5 | 9 | 1 | 第 2 名(J2 给) | 第二名 |
| P3 | 3 | 3 | 3 | 9 | 1 | 第 3 名(J3 给) | 第三名 |
L2 依然是「人的判断」:它问的是「哪一队曾经被某一位裁判认为是最好的」,而不是任何新的算式。
若两队连所获得的整组名次都完全相同(例如一队得 1、3、5,另一队得 3、1、5), 则裁判团对这两队的评价在客观上无从分辨。此时系统不作取舍,判定为并列,交由委员会决定:
并列是合法的比赛结果,不需要强行分出高低。出现并列时,其后的名次按并列所占用的位置顺延:
| 队伍 | 名次积分 | 最终名次 | 说明 |
|---|---|---|---|
| A | 5 | 第 1 名 | |
| B | 7 | 第 2 名 | |
| C | 9 | 第 3 名 | 三队并列第 3 名,占用第 3、4、5 三个位置 |
| D | 9 | 第 3 名 | |
| E | 9 | 第 3 名 | |
| F | 12 | 第 6 名 | 第 4、5 名从缺,直接跳至第 6 名 |
| G | 14 | 第 7 名 |
若本项目设定「只公开前 N 名」,则并列于第 N 名的队伍会一并公开,不会因为名额而遗漏其中任何一队。
正式成绩单共两页,横向 A4:
| 栏位 | 意义 |
|---|---|
| S | 该裁判给这一队的原始分(扣分前) |
| D | 扣分 |
| F | 该裁判给这一队的最终分(= S - D) |
| R | 该裁判据此排出的名次。出现 .5 表示该裁判将两队并列 |
| TPR | 名次积分 = 各裁判 R 之和,低者名次在前 |
只列出发生同分的组别,逐组说明:各裁判所给名次、L1 裁判票与支持的裁判姓名、 L2 名次序列、裁定层级(L1/L2/L3),以及最终名次。 若本项目没有同分,本页会明确注明「本项目无同分情况」。
答:本模式不以总分排名。请见第一部分 1.3 与 1.4:分数相加会让识别差距大的裁判取得过高的份量,因此本会采用名次积分制。请查阅成绩单第一页的 R 栏,即可看到每位裁判实际把贵队排在第几。
答:那等于把已经排除掉的问题重新请回来。同分裁定的每一级(L1 裁判票、L2 最佳单项名次)问的都是「裁判怎么看」,而不是「分数多少」。
答:那位裁判给两队完全相同的最终分,代表他认为两队不相上下。两队共享第 3、4 名的平均值 3.5。详见第二部分第三步。
答:不是。并列代表裁判团对两队的评价在积分、票数与名次组合上完全一致,客观上无从分辨。此时强行分出高低反而不忠实。委员会仍可决定人工裁定,但必须记录理由并印在成绩单上。
答:因为名次是各裁判各自排出来的。若只扣一次,扣分就只会影响其中一位裁判的排序,形成偏差。
本模式采用名次积分制,主要目的之一,是消除不同裁判之间 识别差距宽窄不同所造成的票权差异。 然而,现行的扣分制度是在本评分模式制定之前, 已由竞赛委员会订定并对外公布的比赛规则,因此评分系统必须依照既定规则执行: 扣分从每一位裁判给予该队的原始分中同额扣除,再据此产生该裁判的最终排名。
以下用两位裁判对同样三位选手的评分说明。两位裁判的排序完全相同: P3 最好、P2 第二、P1 第三; 区别只在于裁判 A 使用较窄的分数范围,而裁判 B 使用较宽的分数范围。
| 选手 | 裁判 A 识别差距较窄 |
裁判 A 名次 | 裁判 B 识别差距较宽 |
裁判 B 名次 |
|---|---|---|---|---|
| P1 | 79 | 3 | 70 | 3 |
| P2 | 81 | 2 | 82 | 2 |
| P3 | 83 | 1 | 91 | 1 |
现在假设 P3 因比赛规则受到 5 分扣分。 同样的 5 分,从两位裁判给予 P3 的分数中分别扣除:
| 选手 | 裁判 A 扣分后 |
裁判 A 名次 | 裁判 B 扣分后 |
裁判 B 名次 |
|---|---|---|---|---|
| P1 | 79 | 2 | 70 | 3 |
| P2 | 81 | 1 | 82 | 2 |
| P3 | 83 - 5 = 78 | 3 (排名变了) | 91 - 5 = 86 | 1 (排名没影响) |
固定扣分属于机械且可预测的规则:只要发生指定违规,系统便依既定数值自动扣除。 然而,裁判并不是机械系统。尤其是熟悉赛制的裁判,会知道自己的原始分数在形成最终名次之前, 还会受到固定扣分的影响。
这会产生一个值得注意的人为互动。 如果某位裁判心中已经明确认为甲队应排在乙队之前, 但同时知道甲队存在一个即将被系统扣除的固定分数, 那么他可能会有意识或无意识地扩大两队之间的原始分差, 使扣分之后的最终排序仍然符合自己原先的判断。
因此,固定分数扣除除了受到不同裁判原有 识别差距 的影响之外,也可能反过来改变裁判使用分数尺度的方式。 部分裁判可能完全不作调整; 部分裁判则可能为了保护自己心中的排序而扩大分差。 结果是不同裁判之间的数字尺度可能进一步分化。
此外,这一影响并不止于名次积分。 由于 L1 裁判票及 L2 名次序列同样以扣分后的裁判名次为依据, 扣分所产生的尺度效应会沿着后续裁定层级继续传递。
当多位裁判各自排出名次之后,仍然存在一个重要问题: 这些名次应该怎样汇总,才能产生最终结果?
常见的做法大致可以分成两种思路: 名次积分(Positional Rank-Sum) 与 多数决(Pairwise / Majority Preference)。 两者都尊重裁判所给出的先后次序,但它们所回答的,其实是两个不同的问题。
| 比较项目 | 名次积分 Positional Rank-Sum |
多数决 Pairwise / Majority |
|---|---|---|
| 核心问题 | 哪一队在整个裁判团的所有排名中, 获得最靠前的整体位置? | 如果把两队进行一对一比较, 哪一队得到较多裁判支持? |
| 重视什么 | 整体共识、稳定性、持续获得高评价 | 两队之间直接比较时的多数意见 |
| 较有利于 | 很少被裁判排到后方、 在不同观察角度下都保持高水平的表现 | 能够在一对一比较中, 明确取得多数裁判支持的表现 |
| 可能出现的问题 | 最终结果可能不是每一次一对一比较中的多数胜者 | 可能出现甲胜乙、乙胜丙、丙又胜甲的循环, 无法产生唯一顺序 |
| 较适合的情境 | 多队同时竞争、表演艺术、技术表现、 需要综合多个裁判观点的比赛 | 一对一竞赛、淘汰赛、直接对决、 或明确要求多数意见决定胜负的情境 |
扯铃比赛并不是一场「A 对 B」的直接决斗。 同一个项目中通常有多支队伍先后完成自己的演出, 裁判必须同时观察技术、稳定性、创新、团队互动、整体完成度等不同面向, 最后对整组参赛队伍形成判断。
因此,多队互比,最终成绩首先应该回答的,不是:
而是:
这就是名次积分所衡量的东西。
假设五位裁判评价两支表现都非常优秀的队伍:
| 队伍 | J1 | J2 | J3 | J4 | J5 | 名次积分 |
|---|---|---|---|---|---|---|
| A | 1 | 1 | 1 | 5 | 5 | 13 |
| B | 2 | 2 | 2 | 2 | 2 | 10 |
A 获得三位裁判的第一名,但同时被另外两位裁判排到第五名。 B 没有任何一位裁判把它排第一,却得到五位裁判一致的第二名。
这并不代表多数决不重要。 相反,多数决表达的是一种非常直觉的人类公平观:
在真正的一对一比赛中,这个问题尤其重要。 如果比赛本身就是 A 与 B 的直接对决, 五位裁判中三位认为 A 较好, 观众通常会自然期待 A 获胜。
因此,多数决特别适合处理直接比较的问题。 但当参赛者增加到三队以上时, 多数意见不一定能够组成一个完整而稳定的顺序。
Mode A 并没有完全选择其中一种,而把另一种舍弃。 相反,本模式让两种公平原则分别承担不同的工作:
许多比赛采用舍极取中平均法(Discard Extremes and Average the Middle): 舍去最高与最低分,只取中间的分数平均。本会不采用此法。 本部分说明原因,不是因为它「算错了」,而是因为它所回答的问题, 与本会想要回答的问题并不相同。
五位裁判分别给出:
| 裁判 | 分数 | 处理 |
|---|---|---|
| J1 | 72 | 最低分,舍去 |
| J2 | 85 | 计入 |
| J3 | 88 | 计入 |
| J4 | 90 | 计入 |
| J5 | 94 | 最高分,舍去 |
最终成绩为 87.67 分。五位裁判进场,三位裁判的判断进入结果。
舍极取中是一种对抗异常值(outlier)的统计思想, 在物理测量中非常合理。同一个物体重复测量五次:
如果我们相信被测物体存在一个固定的「真实值」, 那么 24.7 很可能只是一次受到干扰的错误读数,舍去它是合理的。 因为系统真正想知道的不是「每一台仪器读出了什么」,而是:
当同样的逻辑被应用到人身上,问题的性质就改变了。 比赛中的五位裁判,不是五台重复测量同一个客观数值的仪器; 他们是五位经过大会认可、被赋予独立判断权的人。
大会邀请他们担任裁判,本身已经表达了一项制度上的信任:
五位裁判给出:
72 是明显的极端值。但单凭这五个数字,我们无法知道第五位裁判为什么给 72。可能是:
如果第五位裁判恰好是唯一识别出某个关键技术失误的人, 那么舍极取中所做的就不是「消除错误」,而是:
这说明:多数一致,并不自动等于正确;极端少数,也并不自动等于错误。
舍极取中的原意是降低异常值造成的偏差。但它必须依赖另一个假设: 越接近群体中心的判断越值得相信,越偏离中心的判断越可能有问题。 这本身就是一种偏向,可称为中央倾向偏差 (central tendency bias),或更直接地说:共识偏向。
结果可能是:四位裁判都没有发现一个关键问题,第五位发现了。 正因为他看见了别人没看见的东西,他反而成为异常值,然后被系统删除。 此时制度所奖励的,不是洞察力,而是接近群体。
有一种常见的期待是:舍极取中既然删掉了最高与最低分, 应该也能顺带解决识别差距的问题。 事实并非如此。它一分也没有解决,而且还额外造成一个新的问题。
识别差距的定义就是一位裁判所使用的最低分与最高分之间的距离。 距离越大,他的分数就越容易落在全场的最高或最低:
| 裁判 | 最低给分 | 最高给分 | 识别差距 | 在舍极取中之下 |
|---|---|---|---|---|
| A | 60 | 93 | 33(很宽) | 两端几乎都被舍去 |
| B | 73 | 85 | 12 | 大多保留 |
| C | 75 | 87 | 12 | 大多保留 |
以下五位裁判对五位选手的排序完全相同:P1 > P2 > P3 > P4 > P5。 五个人没有任何意见分歧。唯一的差别是 J5 的识别差距为 36 分, 而 J1 至 J4 都只有 8 分。
| 选手 | J1 | J2 | J3 | J4 | J5 识别差距 36 |
最终成绩 |
|---|---|---|---|---|---|---|
| P1 | 84 | 83 | 85 舍 | 82 舍 | 96 舍 | 84.00 |
| P2 | 82 | 81 | 83 | 80 舍 | 88 舍 | 82.00 |
| P3 | 80 | 79 | 81 舍 | 78 舍 | 80 计入 | 79.67 |
| P4 | 78 | 77 | 79 舍 | 76 | 70 舍 | 77.00 |
| P5 | 76 | 75 | 77 舍 | 74 | 60 舍 | 75.00 |
这是更关键的一点。舍去最高与最低之后,剩下的三个分数依然是原始分, 而系统依然把它们相加求平均。
识别差距造成的不等票权,发生在「把原始分相加求平均」这个动作里, 而不是发生在极端值里。因此,剩下的三位裁判之间, 谁的识别差距较宽,谁在这个平均值里依然拥有较大的影响力: 第一部分 1.3 与 1.4 所描述的现象,在舍极取中之后原封不动地继续存在, 只是参与的裁判从五位减少为三位。
真正能消除识别差距的做法只有两种:改用名次(本会所采用的方式, 完全不使用分数尺度),或为每位裁判做尺度标准化(仍属分数制, 另有其自身的问题)。删除极端值不属于其中任何一种。
五位裁判若全部经过大会认可,原则上他们都拥有正式的判断权。 但采用舍极取中之后,系统又建立了第二层判断:与其他人距离太远的意见不被采纳。 于是形成一种奇特的结构:
如果某位裁判确实违反规则、明显误判、存在利益冲突或不具备专业能力, 大会当然应该调查、训练、警告,必要时取消其资格。 但这是人员资格与监督问题, 不应该由一个数学公式在暗中完成。
舍极取中并不是错误的数学方法。在合适的场景中,它是非常优秀的工具。 真正的问题是:我们正在处理的对象究竟是什么?
| 把裁判视为 | 测量仪器 | 独立判断者 |
|---|---|---|
| 系统要回答 | 五个测量之中,哪个数值最接近真实值? | 这五位经过认可的裁判,整体上如何评价参赛者? |
| 不同意见是 | 杂讯,应当排除 | 判断的一部分,应当计入 |
| 追求的是 | 中央共识 | 集体判断 |
| 极端值代表 | 可能是错误读数 | 可能是错误,也可能是洞察 |
数学无法仅凭「它比较极端」,就判断这是哪一种。