RResorterfor Bangumi
返回排序工具
方法、证据与限制

为什么比较比打分更诚实?

Bangumi Resorter 不试图发现作品的“真实分数”。它要解决一个更小、也更实际的问题:当旧评分已经挤成一团时,怎样用尽量少而且允许出错的判断,恢复你此刻愿意承认的偏好顺序?

本项目实现
加权 Davidson · Laplace 后验 · 主动选题
阅读方式
主线讲直觉,技术框可以跳过
本文目录

评分为什么会失真

十档评分看起来能表达很多差异,长期使用后却往往只剩下“还行、喜欢、非常喜欢”。这就是:并不是人的品味忽然变简单了,而是每次打分都在不同语境下完成。今天的 8 分与五年前的 8 分未必使用同一把尺;作品又经过主动筛选,我们本来就更常接触可能喜欢的东西。

因此,原评分依然有价值,却不宜被当成精密测量。它更像一份粗糙但昂贵的草稿:丢掉可惜,照抄也不够。Gwern 的出发点正是把拥挤的评分重新分配,让有限的数字优先表达真正有用的差异。

常见的旧评分聚集
12345678910
高分区域被切得更细
12345678910
示意图,不代表你的收藏。目标不是让曲线“好看”,而是让评分在你关心的区域更有区分力。

为什么改问两两比较

要求一个人直接说出某部作品是第 137 名很荒谬;问“这两部更喜欢哪一部”却通常可答。把一个巨大的绝对排序任务拆成许多局部判断,并让模型利用弱传递性:如果 A 通常胜过 B、B 通常胜过 C,那么 A 大概也在 C 前面。

关键在“大概”。审美判断受记忆、心情、题目顺序与疲劳影响,昨天的你甚至可能否定今天的你。普通排序算法假设比较器永不犯错,这里采用:保存矛盾,不强行修补,再让统计模型判断哪些顺序有充分证据。

比较不是把主观判断伪装成客观事实;它只是把一次难以校准的绝对评分,换成许多更容易回答的局部问题。

从比较推断连续排序

系统为每部作品设置一个不可直接观察的 θ,并使用 Bradley–Terry 的 。两部作品的分数差决定左胜与右胜的相对概率,另一个共享参数描述“差不多喜欢”的强度;这个平局参数会随当前判断一起估计,而不是把平局拆成半次胜利。

一个最佳排序仍然不够:我们还要知道它有多不确定。系统读取最优点附近的 ,用 构造快速的高斯。这不是精确贝叶斯推断,但能在交互所需的时间内反复抽样,检查其他仍然合理的排序会把作品放到哪里。

先验强度与停止严格度

回答的是一个取舍:我们愿意多大程度相信旧评分仍代表当前偏好?强先验让 Bangumi 原评分提供明显的初始顺序,适合旧评分大体可靠时加速冷启动;默认的弱先验不采用原评分顺序,只保留很弱的零均值正则,让两两判断主导结果。弱先验中能力相等时只按作品 ID 确定显示顺序,不读取原评分。两者使用完全相同的候选范围与探索节奏。

是另一个独立选择。快速、标准、精细分别要求至少 80%、90% 与 95% 的作品在后验样本中最多偏移一档;三个覆盖事件的 90% MC 下界都必须达到 90%。因为覆盖事件彼此嵌套,且三档共享后验、下一题策略和每一条未来模拟路径,所以快速达标时间不晚于标准,标准不晚于精细;切换停止档位无需重新拟合模型。

维度选项改变什么不改变什么
先验强度强先验原评分中心与正则强度选题规则、停止阈值
弱先验(默认)弱零均值正则选题规则、停止阈值
停止严格度快速:80% 覆盖允许 20% 跨两档90% MC 门槛、后验、下一题、未来路径
标准:90% 覆盖允许 10% 跨两档90% MC 门槛、后验、下一题、未来路径
精细:95% 覆盖允许 5% 跨两档90% MC 门槛、后验、下一题、未来路径

下一题为什么是这一对

最不确定的作品不一定构成最有用的问题。若只追逐最大误差,算法可能反复困在同一小组。普通问题因此按排序:用拟合得到的三结果概率预估用户回答左、右或平局之后,整个潜在偏好状态能减少多少不确定性,同时惩罚重复配对。

纯贪心仍会忽略边缘作品,所以系统混入两类有意的“低效率”:把比较带到证据稀少或尚未稳定的区域;交换左右重问旧题,同时提供偏好证据和一致性诊断。所有非跳过答案都会入模,但同一无序作品对构成相关簇:折减后的权重总量 m 按工作相关系数 ρ = 0.5 折算为 m/[1+max(0,m−1)ρ];整数 m≥1 时就是常见的 m/[1+(m−1)ρ]。所以校准复问和导入的同对历史都不会被当成条件独立的新样本,低于一条完整判断的陈旧权重也不会被反向放大。重复惩罚与覆盖探索同样读取这种来源年龄及相关性修正后的作品对和作品有效权重,不读取原始记录次数。

从连续排序回到 K 档

潜在分数适合计算,却不适合直接解释。最终输出通过 把排序切成 3–20 档;每一档容纳多少作品由决定。改变 K 或分布不会删除比较,也不改变“谁在谁前面”,但会移动档位边界,因此必须重新计算稳定度、下一题和剩余预测。

均匀分布让每档人数接近;保持原分布保留收藏的整体评分轮廓;默认的使用相对权重 1∶2∶3∶5∶8∶16∶32∶16∶8∶4,在高分区域保留更细的档位(按 1–10 档归一化后的均值约 6.67、标准差约 1.78);更激进,把大多数作品压进低档,只为极少数顶尖作品保留高分。没有一种分布天然“真实”,只有是否适合你的用途。

何时算作足够稳定

要求每部作品都固定在唯一一档,会让最靠近边界的作品永远拖住整个项目。本站把实质错误定义为:相邻档摆动可以接受,移动两档或更多才计入损失。

在每一次 的后验排序里,快速、标准和精细分别要求至少 80%、90% 或 95% 的作品相对当前结果最多偏移一档。满足相应覆盖事件的概率之 还必须统一达到 90%。使用 而非观察比例,是为了避免 64 或 128 次模拟中的偶然好运被误报成稳定。

快速 · 80% 覆盖
标准 · 90% 覆盖
精细 · 95% 覆盖
覆盖目标越高,允许的作品越少。三个事件都要求保守概率下界达到 90%,并同时满足相关性修正后的有效权重、唯一作品对数和作品比较覆盖。

是平均诊断;描述单部作品;观察最极端的尾部。它们帮助解释风险,但都不能替代上述总体停止事件。

剩余次数如何预测

不是把当前进度除以平均速度。每次作答先生成权威后验、停止诊断和下一题;桌面端和手机端都使用 32 条路径的预测,随后在独立后台 Worker 中更新,新模型会取消尚未完成的旧预测。系统从当前后验选取与设备预算相同数量的能力与 log ν 联合粒子,并把有限粒子的经验均值精确移到当前 MAP;这个平移保留协方差,却消除模拟从另一套排序中心出发的漂移。会话分析历史检查点同样使用 32 条路径,以保持跨设备缓存可比。历史补算会按设备并行度动态分配最多 8 个后台 forecast Worker(移动设备最多 2 个)。每条路径使用实际策略选择普通题、覆盖探索或到期复问,以该路径真值粒子的 Davidson 三结果概率模拟答案,并联合更新能力和平局强度。遇到重复作品对时,更新会用新增答案后的总质量重建整簇相关性折权似然,替换旧簇似然,再做二维局部 Laplace 矩匹配与全图协方差传播;相反答案因此能同时降低旧答案的簇内权重。

局部更新只负责每 16 题的快速筛查,不能授权停止。只有当局部 MC 下界触及 90% 门槛、距离上次完整刷新达到 128 题,或来到预测窗口末尾时,路径才用截至该点的完整历史暖启动 MAP,并重新生成 Laplace 后验;三档停止时刻只能由这个刷新后的全局后验确认。这既避免局部二维近似过早宣告稳定,也不必在每个检查点都付出完整拟合成本。三档共享每一条路径并分别记录首次达标时刻,最后报告 10%、50% 与 90% 分位数,因此快速不晚于标准、标准不晚于精细。

所以范围可能变宽、变窄甚至暂时上升:新答案可能暴露此前被先验掩盖的不确定性。预测窗口内没有成功路径也不证明目标不可达。它只说明,在当前模型和有限前瞻下,还没有足够证据给出有限上界;大型收藏的前瞻窗口会设上限以保持界面响应。这里显示的是固定算法假设下的情景模拟分位数,不能当作已校准的预测区间。

会话分析把两种时间分开:证据、覆盖、后验和停止下界按判断实际发生时间重建,导入判断使用 sourceCreatedAt;动态剩余和回溯则按判断真正进入当前会话的 createdAt 重建,避免让后来导入的证据穿越到当时的选题器。停止只在离散检查点观察,所以覆盖与误差按相邻检查点之间的停止窗口计算;导入或手动判断改变未来可用证据时,相应预测不参与评分。至少三个闭合回溯区间中若 80% 同方向漏窗,且 P50 中位偏差达到一个检查点步长,页面会警告并抑制该档历史 P10–P90 阴影,但不会用同一会话的相关检查点强行校准未来倍数。

收藏变化与长期偏移

偏好并非静止数据库。新作品会加入,旧评分会修改,人的判断标准也会随时间改变。每次同步因此保存独立的,而不是把旧会话原地改写。

新建、升级或按标签派生会话时,系统可以复制目标范围内仍然有效的比较;已有会话也可以在明确预览后追加导入。每条副本都记录直接来源、来源时间和原始根判断,并属于目标会话自身,来源之后新增、删除或被整体删除都不会回流成第二份证据;重复导入按根判断幂等。导入时已经过去的来源年龄按 365 天半衰期折减,再进入同对相关簇。可以节省工作,但跨快照导入越多,也越可能把旧偏好当成今天的偏好,因此新会话默认从零开始。

与 Gwern 原版的差异

本项目继承的是问题设定,不是原脚本的逐行翻译。Gwern 的文章还明确指出其实现缺少原则化不确定性与最优选题;本站把这些“未来改进”变成了交互流程的一部分,同时承担近似误差和更复杂解释的代价。

问题Gwern 原版本项目
输入CSV 名称与可选评分Bangumi 收藏、标签与不可变快照
旧评分转成相邻伪比较独立选择强先验或弱零均值先验
估计BradleyTerry2 频率学派拟合加权 Davidson MAP 与 Laplace 后验近似
选题最大标准误与随机探索交替期望信息增益、覆盖探索、校准复问
停止用户退出或预设问题数总体相邻容差下界与有效证据覆盖门槛
输出命令行分位数映射3–20 档、多种分布、解释诊断与 CSV

限制与诚实声明

  • 结果描述的是这个账号、这批作品、这些时刻下的主观偏好,不是作品的客观质量。
  • Davidson 模型仍假设偏好大致可由一维连续顺序和一个共享平局强度表达;强烈的类型依赖或循环偏好会被压缩。
  • Laplace 后验、工作相关系数、时间半衰期和未来逐题更新都是近似。页面上的概率与题量范围只在模型内部成立,剩余题量尚无覆盖率校准保证。
  • “已稳定”不表示你以后不会改主意,只表示现有证据下,大多数作品不太可能发生跨两档变化。
  • 高分辨率分布提高高分区分力的代价,是压缩其他区域;选择分布本身就是价值判断。
  • 校准复问的一致率只报告判断波动;复问答案会明确地按同对相关重复证据折权入模,不会秘密改写原答案或另设预测温度。
  • 优化器未收敛时仍可展示临时候选排序与诊断,但系统会 fail closed:不报告已稳定,也不给有限剩余题量。
  • 写回评分是显式的可选操作:仅接受 10 档结果,先比较线上评分与会话快照,跳过冲突后才会逐条修改 Bangumi 收藏。