沙巴州扯铃协会 Sabah Diabolo Association

评分模式 A :- 名次积分制计算办法

Mode A · Rank-Points Scoring :- How the Result Is Calculated

适用对象:参赛单位、教练、领队、裁判、工作人员 │ 本文说明成绩如何产生,以及同分如何裁定。

本会正式比赛的评分模式 A,不是把各裁判的分数加起来比大小,而是采用 名次积分制。这份说明分五个部分:先说明为什么不用总分,再说明名次积分怎么算, 接着说明同分时如何裁定,最后说明并列名次与成绩单的看法。

第一部分 为什么不用「总分」

1.1 只有一位裁判时,分数与名次其实是一样的

先从最简单的情况说起。如果全场只有一位裁判,那么用分数排还是用名次排,结果完全相同:

情况一(分差很小)总分名次 情况二(分差很大)总分名次
P1751 P1951
P3732 P3832
P2723 P2703
关键观念
比赛要产生的是名次,不是分差。P1 赢 P2 三分还是二十五分,颁的都是同一面金牌。 分差本身在决定谁第一、谁第二时,并不带有额外的意义。

1.2 识别差距 :- 人给分数时的盲点

问题出现在多位裁判的时候。要理解它,先要理解一个人类心理上的现象,这里称之为 识别差距(表现 · 识别 · 差距,即一个人心中「好一点」与「好很多」之间的距离)。

如果不指定范围,请三个人各自为同样三位选手打分,可能得到这样三组数据:

评分者选手甲选手乙选手丙识别差距
A6891 – 4(很窄)
B50809010 – 40(很宽)
C521305 – 25(中等)

首选某个测量制度其实也可以反映评分者某种程度的性格。默选窄尺度(识别差距小)的评分者倾向于保守、宽容、稳定。默选尺度宽者(识别差距大)倾向于严苛、对错分明、激进。

三个人的想法其实一样:甲最弱、乙居中、丙最好。但他们用来表达这个想法的数字尺度完全不同。 在各自的心里,A 的「6」、B 的「50」、C 的「5」表达的是同一件事。人类最擅长的是分辨排名 (比较好),不是准确用数字来表达真实有多少 “分别” 和 “距离” 来表达一个概念。 直觉的洞察和识别远超表面,甚至可以深至心理素质。

数学看不见这一点
人用数字表达感受、直觉。但数学不谈感受和直觉,只谈数值。问题就从这里开始。。

1.3 把分数相加时,识别差距大的裁判会「吃掉」其他裁判的票

假设两位裁判,两位选手。裁判 A 的识别差距窄,裁判 B 的识别差距宽:

裁判 A
窄(差距 5)
裁判 B
宽(差距 15)
总分结果
P17085155胜
P27570145
模拟一:裁判 A 选 P2,裁判 B 选 P1 :- 结果是 B 的意见胜出。
裁判 A裁判 B总分结果
P17070140
P27585160胜
模拟二:两位裁判都选 P2 :- 结果仍然是 B 的意见胜出。
这就是盲点
两位裁判都尽责地、准确地表达了自己的判断。但因为裁判 B 的识别差距是裁判 A 的三倍, 只要 B 选谁,谁就赢;裁判 A 的意见在这场比赛中等于没有作用。 比赛表面上有两位裁判,实际上只有一位在做决定。

1.4 实例:三位裁判都认为 P1 最好,总分却把 P1 排到最后

四位裁判、三位选手。前三位裁判的识别差距很窄,第四位很宽:

J1J2J3J4
差距很宽
总分总分名次各裁判名次名次积分积分名次
P181828060 303第三1 · 1 · 1 · 36第一
P280817995 335第一2 · 2 · 2 · 17第二
P379807890 327第二3 · 3 · 3 · 211第三
四位裁判中有三位把 P1 排在第一。总分制的结果是 P1 最后一名;名次积分制的结果是 P1 第一名。

一位识别差距宽的裁判,凭一个 60 分,推翻了三位裁判的一致意见。 这不是裁判 J4 的错 :- 他只是习惯用比较宽的尺度表达判断。错的是把分数直接相加这个做法。

1.5 解决办法:改为累计「名次」

既然每位裁判的数字尺度无法统一,那就不去统一它。 让每位裁判自由使用自己习惯的尺度,本会只取用他给出的先后次序, 再把各裁判所给的名次相加。

J1J2J3名次积分最终名次
P11124第一名
P22316第二名
P33238第三名
名次积分制的意义
它计算的是「有多少位裁判、以多前的位置,喜欢这一队」, 而不是「谁运气好、碰上一位尺度宽的裁判」。识别差距的问题因此完全消失: 每位裁判无论尺度宽窄,都只有一票的份量。

第二部分 名次积分制怎么算

第一步 各裁判独立评分

每位裁判按本项目的评分标准,为每一队打出各项分数,加总为该队在该位裁判心中的原始分。

第二步 扣分

场地记录的扣分(超时、失误、违规等)由扣分台记录, 从每一位裁判给该队的总分中同额扣除,不是只扣一次。 这样扣分对每位裁判的判断都产生同样的影响,不会因为扣在谁身上而产生偏差。

该裁判最终分 = 该裁判原始分 - 扣分

第三步 每位裁判排出自己的名次

系统自动依照该裁判的最终分高低,排出这位裁判自己的名次:最高分第 1 名,其次第 2 名,依此类推。 裁判不需要、也不能直接填写名次;名次由分数推导,避免与分数不一致。

裁判给出并列时:名次取平均(小数)

如果某位裁判给两队完全相同的最终分,代表他确实认为两队不相上下。 此时这两队共享名次的平均值:并列第 3 名的两队,各记 3.5; 三队并列第 3 名,各记 4。

为什么用小数,而不是都记 3 分?
若两队都记 3 分,这一栏的总和就会比其他裁判少,等于凭空送了这两队各一分。 取平均之后,每位裁判那一栏的总和永远相同(1+2+3+…), 不论他给几组并列,都不会影响他与其他裁判之间的份量平衡。

第四步 名次积分相加,低者胜

名次积分 = 各裁判所给名次之总和 → 积分最低者名次最前

因为第 1 名记 1 分、第 2 名记 2 分,所以分数越低代表越多裁判把这一队排在越前面。

第三部分 同分时如何裁定

多数情况下,名次积分已能分出清楚的高低。少数情况下会出现两队以上积分相同, 此时依下列顺序逐级裁定,每一级都以「人的判断」为依据,而不是再引入新的数学公式:

L1 裁判票:有多少位裁判偏好这一队

两队积分同为 8 分:

J1J2J3名次积分裁判票支持的裁判裁定
P113481J1第二名
P232382J2、J3第一名
J1 偏好 P1,J2 与 J3 偏好 P2。三位裁判中有两位偏好 P2,故 P2 名次在前。

孔多塞循环(Condorcet cycle)

极少数情况下,连裁判票也会打平,而且是以一种特别的方式打平: 甲胜乙、乙胜丙、丙又胜甲 :- 像剪刀、石头、布一样首尾相接,找不到起点。 这个现象称为孔多塞循环。

J1J2J3名次积分裁判票支持的裁判
P114491J1
P222591J2
P333391J3
三队积分同为 9 分,裁判票同为 1 票。P1 胜 P2、P2 胜 P3、P3 又胜 P1 :- 循环。
这不是系统出错
循环之所以出现,正是因为本制度尊重每位裁判各自的判断,而没有把所有人压缩成一个数字。 一旦压缩成一个数字,循环就看不见了 :- 但那并不代表分歧不存在,只代表它被掩盖了。 能够看见循环,正说明这套制度忠实地反映了裁判们真实的意见分布。

L2 最佳单项名次

循环无法靠票数解开,此时比较各队所获得的最好的一个名次:

J1J2J3名次积分裁判票最佳单项名次最终名次
P114491第 1 名(J1 给)第一名
P222591第 2 名(J2 给)第二名
P333391第 3 名(J3 给)第三名
P1 曾获得全场同分队伍中最高的一个名次(第 1 名),故名次在前。若最佳名次也相同,则比次佳、再比第三佳。

L2 依然是「人的判断」:它问的是「哪一队曾经被某一位裁判认为是最好的」,而不是任何新的算式。

L3 真正的并列

若两队连所获得的整组名次都完全相同(例如一队得 1、3、5,另一队得 3、1、5), 则裁判团对这两队的评价在客观上无从分辨。此时系统不作取舍,判定为并列,交由委员会决定:

第四部分 并列名次与名次顺延

并列是合法的比赛结果,不需要强行分出高低。出现并列时,其后的名次按并列所占用的位置顺延:

队伍名次积分最终名次说明
A5第 1 名
B7第 2 名
C9第 3 名三队并列第 3 名,占用第 3、4、5 三个位置
D9第 3 名
E9第 3 名
F12第 6 名第 4、5 名从缺,直接跳至第 6 名
G14第 7 名
举例
两队并列第 1 名 → 没有第 2 名,下一队为第 3 名。
奖项的颁发依此名次办理;并列各队所获名次相同,奖项亦相同。

若本项目设定「只公开前 N 名」,则并列于第 N 名的队伍会一并公开,不会因为名额而遗漏其中任何一队。

第五部分 如何看成绩单

正式成绩单共两页,横向 A4:

第一页 全裁判名次总表

栏位意义
S该裁判给这一队的原始分(扣分前)
D扣分
F该裁判给这一队的最终分(= S - D)
R该裁判据此排出的名次。出现 .5 表示该裁判将两队并列
TPR名次积分 = 各裁判 R 之和,低者名次在前

第二页 同分裁定说明

只列出发生同分的组别,逐组说明:各裁判所给名次、L1 裁判票与支持的裁判姓名、 L2 名次序列、裁定层级(L1/L2/L3),以及最终名次。 若本项目没有同分,本页会明确注明「本项目无同分情况」。

「非正式成绩」与「正式成绩」
成绩单在成绩定案之前印出,会盖上非正式成绩字样,供大会内部协调使用; 定案之后印出的才盖上正式成绩。
另请注意:定案不等于公布。公布是另一个步骤,公布后参赛单位与公众才看得到。

第六部分 常见问题

问:我这一队总分明明最高,为什么不是第一名?

答:本模式不以总分排名。请见第一部分 1.3 与 1.4:分数相加会让识别差距大的裁判取得过高的份量,因此本会采用名次积分制。请查阅成绩单第一页的 R 栏,即可看到每位裁判实际把贵队排在第几。

问:名次积分相同时,为什么不干脆比总分?

答:那等于把已经排除掉的问题重新请回来。同分裁定的每一级(L1 裁判票、L2 最佳单项名次)问的都是「裁判怎么看」,而不是「分数多少」。

问:为什么会出现 3.5 这样的名次?

答:那位裁判给两队完全相同的最终分,代表他认为两队不相上下。两队共享第 3、4 名的平均值 3.5。详见第二部分第三步。

问:并列是不是代表大会不愿意做决定?

答:不是。并列代表裁判团对两队的评价在积分、票数与名次组合上完全一致,客观上无从分辨。此时强行分出高低反而不忠实。委员会仍可决定人工裁定,但必须记录理由并印在成绩单上。

问:扣分为什么要从每一位裁判的分数里都扣?

答:因为名次是各裁判各自排出来的。若只扣一次,扣分就只会影响其中一位裁判的排序,形成偏差。

附注 扣分制度中的「识别差距」效应

本模式采用名次积分制,主要目的之一,是消除不同裁判之间 识别差距宽窄不同所造成的票权差异。 然而,现行的扣分制度是在本评分模式制定之前, 已由竞赛委员会订定并对外公布的比赛规则,因此评分系统必须依照既定规则执行: 扣分从每一位裁判给予该队的原始分中同额扣除,再据此产生该裁判的最终排名。

需要特别说明的数学现象
固定分数的扣分虽然对每位裁判扣除相同的数值, 但由于不同裁判的识别差距并不相同, 相同的扣分不一定会对每位裁判的排名产生相同程度的影响。 因此,扣分这一环节会在一定程度上重新引入名次积分制原本希望排除的「识别差距」问题。

以下用两位裁判对同样三位选手的评分说明。两位裁判的排序完全相同: P3 最好、P2 第二、P1 第三; 区别只在于裁判 A 使用较窄的分数范围,而裁判 B 使用较宽的分数范围。

选手 裁判 A
识别差距较窄
裁判 A 名次 裁判 B
识别差距较宽
裁判 B 名次
P1 79 3 70 3
P2 81 2 82 2
P3 83 1 91 1
扣分前,两位裁判的判断完全一致:P3 > P2 > P1。 差别只是两位裁判表达判断时所使用的数字尺度不同。

现在假设 P3 因比赛规则受到 5 分扣分。 同样的 5 分,从两位裁判给予 P3 的分数中分别扣除:

选手 裁判 A
扣分后
裁判 A 名次 裁判 B
扣分后
裁判 B 名次
P1 79 2 70 3
P2 81 1 82 2
P3 83 - 5 = 78 3 (排名变了) 91 - 5 = 86 1 (排名没影响)
P3 同样被扣 5 分:在裁判 A 的排序中由第 1 名降至第 3 名; 在裁判 B 的排序中则仍然保持第 1 名。
为什么会出现这种情况?
裁判 A 原本给 P1、P2、P3 的分数为 79、81、83,三队之间的距离很窄。 对他而言,5 分已经足以跨越两个名次。

裁判 B 则给出 70、82、91,三队之间的距离较宽。 同样扣除 5 分以后,P3 仍然高于 P2,因此名次完全不变。

换言之,相同的扣分数值,并不等于相同的排名影响。
固定扣分与裁判评分行为的互动

固定扣分属于机械且可预测的规则:只要发生指定违规,系统便依既定数值自动扣除。 然而,裁判并不是机械系统。尤其是熟悉赛制的裁判,会知道自己的原始分数在形成最终名次之前, 还会受到固定扣分的影响。

这会产生一个值得注意的人为互动。 如果某位裁判心中已经明确认为甲队应排在乙队之前, 但同时知道甲队存在一个即将被系统扣除的固定分数, 那么他可能会有意识或无意识地扩大两队之间的原始分差, 使扣分之后的最终排序仍然符合自己原先的判断。

机械规则可以预测,人类判断会适应规则
例如,一位裁判原本认为两队表现只相差约 2 分, 但知道其中一队随后会被固定扣 5 分。 如果他仍然坚持该队应该排在前面, 他可能不再使用原本的 2 分差距, 而主动留下超过 5 分的「缓冲距离」。

此时,原始评分所表达的就不再只是 「两队表现实际相差多少」, 而同时混入了 「为了让扣分后名次仍符合我的判断,需要留下多少空间」。

因此,固定分数扣除除了受到不同裁判原有 识别差距 的影响之外,也可能反过来改变裁判使用分数尺度的方式。 部分裁判可能完全不作调整; 部分裁判则可能为了保护自己心中的排序而扩大分差。 结果是不同裁判之间的数字尺度可能进一步分化。

需要明确区分
这里并不是建议裁判以扩大分差的方式预先抵消扣分, 也不是认为裁判应当主动修正系统规则。 裁判原则上仍应依照评分标准,如实评价现场表现。

本说明提出这一现象,只是为了说明: 当一个完全可预测的固定扣分机制 与一个由人进行主观评分的系统结合时, 人的评分行为本身可能会受到规则存在的影响。 因此,这也是固定分数扣除无法完全脱离 「识别差距」问题的另一层原因。

此外,这一影响并不止于名次积分。 由于 L1 裁判票及 L2 名次序列同样以扣分后的裁判名次为依据, 扣分所产生的尺度效应会沿着后续裁定层级继续传递。

第七部分 两种名次汇总逻辑:名次积分与多数决

当多位裁判各自排出名次之后,仍然存在一个重要问题: 这些名次应该怎样汇总,才能产生最终结果?

常见的做法大致可以分成两种思路: 名次积分(Positional Rank-Sum) 与 多数决(Pairwise / Majority Preference)。 两者都尊重裁判所给出的先后次序,但它们所回答的,其实是两个不同的问题。

没有一种制度在所有情况下都是绝对「最好」
名次积分与多数决代表的是两种不同、而且都合理的公平观。

名次积分重视的是: 「哪一队在整个裁判团中,获得最稳定、最靠前的整体评价?」
多数决重视的是: 「如果把两队单独拿出来比较,哪一队得到较多裁判支持?」

因此,制度的选择必须配合比赛本身的性质,而不是单纯问哪一种数学方法比较先进。

7.1 两种制度问的是不同的问题

比较项目 名次积分
Positional Rank-Sum
多数决
Pairwise / Majority
核心问题 哪一队在整个裁判团的所有排名中, 获得最靠前的整体位置? 如果把两队进行一对一比较, 哪一队得到较多裁判支持?
重视什么 整体共识、稳定性、持续获得高评价 两队之间直接比较时的多数意见
较有利于 很少被裁判排到后方、 在不同观察角度下都保持高水平的表现 能够在一对一比较中, 明确取得多数裁判支持的表现
可能出现的问题 最终结果可能不是每一次一对一比较中的多数胜者 可能出现甲胜乙、乙胜丙、丙又胜甲的循环, 无法产生唯一顺序
较适合的情境 多队同时竞争、表演艺术、技术表现、 需要综合多个裁判观点的比赛 一对一竞赛、淘汰赛、直接对决、 或明确要求多数意见决定胜负的情境

7.2 为什么名次积分更适合作为扯铃比赛的主要排名方式

扯铃比赛并不是一场「A 对 B」的直接决斗。 同一个项目中通常有多支队伍先后完成自己的演出, 裁判必须同时观察技术、稳定性、创新、团队互动、整体完成度等不同面向, 最后对整组参赛队伍形成判断。

因此,多队互比,最终成绩首先应该回答的,不是:

「A 和 B 单独比较时,有多少裁判选择 A?」

而是:

「综合所有裁判的完整排名之后,哪一队最稳定地处于前列?」

这就是名次积分所衡量的东西。

例子:高峰表现,与整体共识

假设五位裁判评价两支表现都非常优秀的队伍:

队伍 J1 J2 J3 J4 J5 名次积分
A 1 1 1 5 5 13
B 2 2 2 2 2 10

A 获得三位裁判的第一名,但同时被另外两位裁判排到第五名。 B 没有任何一位裁判把它排第一,却得到五位裁判一致的第二名。

两种制度会看到不同的「优秀」
如果只问 A 与 B 谁得到较多裁判支持, A 会以 3 比 2 胜出。

但名次积分看到的是另一件事情: B 在所有观察角度下都被认为是稳定的顶尖表现, 而 A 的评价则出现明显分歧。

对于需要多位裁判从不同专业角度共同评价的表演型比赛, 这种整体位置的一致性本身就是有意义的信息。

7.3 多数决仍然有非常重要的公平意义

这并不代表多数决不重要。 相反,多数决表达的是一种非常直觉的人类公平观:

如果多数裁判都认为 A 比 B 好,为什么最终却由 B 排在 A 前面?

在真正的一对一比赛中,这个问题尤其重要。 如果比赛本身就是 A 与 B 的直接对决, 五位裁判中三位认为 A 较好, 观众通常会自然期待 A 获胜。

因此,多数决特别适合处理直接比较的问题。 但当参赛者增加到三队以上时, 多数意见不一定能够组成一个完整而稳定的顺序。

多数意见可能形成循环
例如三支队伍之间可能出现:

A 胜 B
B 胜 C
C 又胜 A

每一次一对一比较都有多数意见, 但把三个多数意见放在一起, 却没有办法回答「到底谁应该排第一」。

这就是前文所说明的 孔多塞循环(Condorcet cycle)。

7.4 为什么 Mode A 同时保留两种原则

Mode A 并没有完全选择其中一种,而把另一种舍弃。 相反,本模式让两种公平原则分别承担不同的工作:

为什么这样的组合适合扯铃比赛
扯铃属于多队、多人、多面向评价的表演型竞赛, 并不是连续的一对一淘汰赛。

因此,Mode A 首先以名次积分寻找 「整个裁判团最稳定认可的优秀表现」; 只有当这个指标无法区分高低时, 才使用多数裁判的直接偏好作为下一层判断。

换句话说,本模式并不是认为 「整体共识一定比多数意见重要」, 而是认为在扯铃这一类比赛中: 整体共识适合作为主要排序原则, 多数意见适合作为无法区分时的第一层补充原则。
从投票理论来看
任何把多个人的不同排序汇总成一个最终顺序的制度, 都必须在不同的公平原则之间作出取舍。 不存在一种方法能够在所有可能情况下, 同时满足所有人对于「公平」的直觉。

因此,本模式的目标并不是宣称名次积分是唯一正确的方法, 而是选择一种与本比赛性质最吻合、能够稳定执行、 容易解释、并可完整审计的排序原则。
本模式对此的立场
名次积分制能够消除不同裁判原始评分尺度在汇总时产生的不等票权, 但无法同时消除一个已经以固定原始分数定义的外部扣分规则所产生的尺度效应。

本项扣分办法属于竞赛委员会在本评分模式制定之前已经公布的比赛规则, 因此 Mode A 不对其重新定义,而是如实执行既定规则。 本说明将这一现象明确列出,是为了让参赛单位、裁判及委员会能够完整理解 评分制度本身的作用范围与其数学边界。

第八部分 为什么不采用「舍极取中平均法」

许多比赛采用舍极取中平均法(Discard Extremes and Average the Middle): 舍去最高与最低分,只取中间的分数平均。本会不采用此法。 本部分说明原因,不是因为它「算错了」,而是因为它所回答的问题, 与本会想要回答的问题并不相同。

8.1 什么是舍极取中

五位裁判分别给出:

裁判分数处理
J172最低分,舍去
J285计入
J388计入
J490计入
J594最高分,舍去
(85 + 88 + 90)÷ 3 = 87.67

最终成绩为 87.67 分。五位裁判进场,三位裁判的判断进入结果。

8.2 它原本要解决的问题:仪器的杂讯

舍极取中是一种对抗异常值(outlier)的统计思想, 在物理测量中非常合理。同一个物体重复测量五次:

19.9 20.1 20.0 19.8 24.7

如果我们相信被测物体存在一个固定的「真实值」, 那么 24.7 很可能只是一次受到干扰的错误读数,舍去它是合理的。 因为系统真正想知道的不是「每一台仪器读出了什么」,而是:

这些重复测量背后,最可能的真实数值是什么?
这个方法背后的假设
单次极端数据可能不可靠;一群彼此接近、重复出现的数据,更可能接近真实值。

8.3 但裁判不是测量仪器

当同样的逻辑被应用到人身上,问题的性质就改变了。 比赛中的五位裁判,不是五台重复测量同一个客观数值的仪器; 他们是五位经过大会认可、被赋予独立判断权的人。

大会邀请他们担任裁判,本身已经表达了一项制度上的信任:

我们相信你的专业、经验与判断能力,因此邀请你参与决定比赛结果。
盲点与矛盾: 舍极取中说: 「我们希望你独立判断; 但如果你的判断与其他人相差太远,我们将直接删除你的判断。」

8.4 极端,不等于错误

五位裁判给出:

90 91 90 92 72

72 是明显的极端值。但单凭这五个数字,我们无法知道第五位裁判为什么给 72。可能是:

数学看得见什么,看不见什么
数学只知道:72 离其他数字很远。
数学并不知道:72 是错的。

「异常」是统计位置,不是正确与错误的证明。

如果第五位裁判恰好是唯一识别出某个关键技术失误的人, 那么舍极取中所做的就不是「消除错误」,而是:

删除正确的少数判断,保留错误的多数判断。

这说明:多数一致,并不自动等于正确;极端少数,也并不自动等于错误。

8.5 它没有消除偏差,只是换了一种偏差

舍极取中的原意是降低异常值造成的偏差。但它必须依赖另一个假设: 越接近群体中心的判断越值得相信,越偏离中心的判断越可能有问题。 这本身就是一种偏向,可称为中央倾向偏差 (central tendency bias),或更直接地说:共识偏向。

用一种偏差,去控制另一种偏差
系统不再偏向「分数特别高或特别低的人」, 却转而偏向与多数人意见接近的人。

于是它所寻找的,其实不是「最准确的判断」,而是「最常见的判断」。 它擅长寻找共同意见,却无法证明共同意见就是正确答案。

结果可能是:四位裁判都没有发现一个关键问题,第五位发现了。 正因为他看见了别人没看见的东西,他反而成为异常值,然后被系统删除。 此时制度所奖励的,不是洞察力,而是接近群体。

8.6 舍极取中并不能解决「识别差距」

有一种常见的期待是:舍极取中既然删掉了最高与最低分, 应该也能顺带解决识别差距的问题。 事实并非如此。它一分也没有解决,而且还额外造成一个新的问题。

其一:识别差距大的裁判,本来就最容易被判为「极端」

识别差距的定义就是一位裁判所使用的最低分与最高分之间的距离。 距离越大,他的分数就越容易落在全场的最高或最低:

裁判 最低给分 最高给分 识别差距 在舍极取中之下
A 60 93 33(很宽) 两端几乎都被舍去
B 73 85 12 大多保留
C 75 87 12 大多保留
识别差距越宽的裁判,越经常成为「极端值」。这不是因为他判断得不好, 只是因为他习惯用比较大的数字距离表达同样的判断。
实例:五位裁判意见完全一致,其中一位却被删除了八成

以下五位裁判对五位选手的排序完全相同:P1 > P2 > P3 > P4 > P5。 五个人没有任何意见分歧。唯一的差别是 J5 的识别差距为 36 分, 而 J1 至 J4 都只有 8 分。

选手 J1J2J3J4 J5
识别差距 36
最终成绩
P1 8483 85 舍82 舍 96 舍 84.00
P2 8281 8380 舍 88 舍 82.00
P3 8079 81 舍78 舍 80 计入 79.67
P4 7877 79 舍76 70 舍 77.00
P5 7675 77 舍74 60 舍 75.00
「舍」= 该分数被舍去。五位裁判的排序完全一致, J5 与其他四位没有任何意见分歧,只是使用了较宽的数字尺度。
J5 的判断,五次之中有四次被删除
J5 与全体裁判的意见完全一致,却在五位选手之中被删除了四位: 删除率 80%。

他唯一被保留的一次是 P3:那恰恰是他唯一没有强烈意见的一位选手。 他觉得好的,他给全场最高;他觉得不好的,他给全场最低,于是两端都被删除。

J5 虽然坐在裁判席上,却几乎从未真正参与决定成绩。 而这与他判断得准不准完全无关:他没有判断错,他只是数字用得比较开。
另一个值得注意的数字
舍极取中在每一位选手身上都固定舍去 5 份判断中的 2 份, 无论裁判团意见多么一致,都有 40% 的判断被丢弃。 上表五位选手共 25 份判断,其中 10 份从未进入成绩。

这不是异常时才启动的保护机制,而是每一次都在执行的常态。
其二:删掉极端值之后,识别差距仍然完整存在

这是更关键的一点。舍去最高与最低之后,剩下的三个分数依然是原始分, 而系统依然把它们相加求平均。

舍极取中改变的是「平均几个分数」,
不是「平均的是原始分」。

识别差距造成的不等票权,发生在「把原始分相加求平均」这个动作里, 而不是发生在极端值里。因此,剩下的三位裁判之间, 谁的识别差距较宽,谁在这个平均值里依然拥有较大的影响力: 第一部分 1.3 与 1.4 所描述的现象,在舍极取中之后原封不动地继续存在, 只是参与的裁判从五位减少为三位。

两句话的总结
舍极取中对识别差距完全无效:

1. 它先把识别差距最宽的裁判,当成「异常」反复删除;
2. 然后在剩下的裁判之间,让识别差距继续照常运作。

换句话说,它既没有解决问题,还顺手删掉了一位合格的裁判。

真正能消除识别差距的做法只有两种:改用名次(本会所采用的方式, 完全不使用分数尺度),或为每位裁判做尺度标准化(仍属分数制, 另有其自身的问题)。删除极端值不属于其中任何一种。

8.7 谁在判断评判?极端与失格,是两件事

五位裁判若全部经过大会认可,原则上他们都拥有正式的判断权。 但采用舍极取中之后,系统又建立了第二层判断:与其他人距离太远的意见不被采纳。 于是形成一种奇特的结构:

裁判判断运动员,而「平均值」在判断裁判。

如果某位裁判确实违反规则、明显误判、存在利益冲突或不具备专业能力, 大会当然应该调查、训练、警告,必要时取消其资格。 但这是人员资格与监督问题, 不应该由一个数学公式在暗中完成。

一个更清楚的原则
裁判的资格,应由制度决定;
裁判的判断,则应由评分制度忠实记录。


一旦某人仍然是正式裁判,他的合法判断不应该仅仅因为与多数意见相距较远, 就自动变成零票。

8.8 最终是一个哲学选择

舍极取中并不是错误的数学方法。在合适的场景中,它是非常优秀的工具。 真正的问题是:我们正在处理的对象究竟是什么?

把裁判视为 测量仪器 独立判断者
系统要回答 五个测量之中,哪个数值最接近真实值? 这五位经过认可的裁判,整体上如何评价参赛者?
不同意见是 杂讯,应当排除 判断的一部分,应当计入
追求的是 中央共识 集体判断
极端值代表 可能是错误读数 可能是错误,也可能是洞察

数学无法仅凭「它比较极端」,就判断这是哪一种。

否则会形成一种奇怪的制度语言
「我们相信你的专业能力,因此邀请你成为裁判。请你独立判断。
但如果你的独立判断与其他人相差太远,我们将不会计算你的判断。」

换一种更直接的说法:
请独立判断,但不要独立得太远。
本会的立场
本会的制度精神是:尊重每一位正式裁判的独立专业判断,并给予每一位裁判平等的裁决权。 因此:

不因为一位裁判属于多数或少数,而改变他的裁决权;
不因为他的数字表达较宽或较窄,而改变他的影响力;
也不因为他的判断成为极端值,就让他的声音从比赛结果中消失。


五位裁判被邀请,就应该有五份判断进入最终结果。

这不是因为五个人一定同样聪明,也不是因为五个人一定都会正确, 而是因为, 大会已经在比赛开始之前,正式决定把裁决权交给这五个人。
附带说明:名次积分制如何处理同样的问题
本会采用的名次积分制,并不需要删除任何裁判的判断, 就已经解决了识别差距所造成的不等票权, 因为它只取用每位裁判的先后次序,不取用他的分数尺度。 一位裁判即使给出 50 分或 95 分,他对结果的影响力都是一票,不多也不少。

换句话说:舍极取中用「删除」来处理极端; 名次积分制用「换一种计量单位」来处理极端。 前者让一位裁判消失,后者让每一位裁判都留下。