RP 竞技场
准备开始评测

文本 A

已阅读 0%0 字符
开始评测,阅读两段同题文本
投票后揭晓模型

文本 B

已阅读 0%0 字符
模型身份将在投票后揭晓
投票后揭晓模型
选择你认为更好的文本只看正文;每组只能评分一次
Leaderboard

模型排行榜

同一批 A/B 评测结果,按不同算法排名。

排名模型评分有效对局类型覆盖
评分怎么算?

三个榜单使用相同的投票,每票权重相同。“都好”和“都不好”均记为平局。Bradley–Terry 根据全部对局估计相对实力,以 1000 分为基准,并用先验收缩降低小样本波动。Elo 从 1000 分开始,按投票时间更新,K=32。胜率为(胜场 + 平局 × 0.5)÷ 对局数。

提示词更新或正文下架后,相关旧结果退出当前榜单,历史记录保留。

Prompt library

提示词与评测类型

查看每个类型的介绍和提示词。

Contribute

提交你的评测文本

审核通过后,正文会加入同类型的竞技场配对。

请选择所属类别和模型,提交模型生成的完整正文。

模型输出

我的投稿

Editorial desk

管理与审核

忧郁智子 · 唯一管理员

提示词

编辑类型

审核投稿

申请新模型

先加入本次投稿的选项,审核通过后才会进入全站模型库。

使用 Discord 登录

使用 Discord 登录以查看案例预设和投稿。账号须为类脑服务器成员。

前往 Discord 验证