文本 A
已阅读 0%0 字符
开始评测,阅读两段同题文本
投票后揭晓模型
同一批 A/B 评测结果,按不同算法排名。
| 排名 | 模型 | 评分 | 有效对局 | 类型覆盖 |
|---|
三个榜单使用相同的投票,每票权重相同。“都好”和“都不好”均记为平局。Bradley–Terry 根据全部对局估计相对实力,以 1000 分为基准,并用先验收缩降低小样本波动。Elo 从 1000 分开始,按投票时间更新,K=32。胜率为(胜场 + 平局 × 0.5)÷ 对局数。
提示词更新或正文下架后,相关旧结果退出当前榜单,历史记录保留。
查看每个类型的介绍和提示词。
审核通过后,正文会加入同类型的竞技场配对。
忧郁智子 · 唯一管理员