japanese llm jp kuci
这是 S1MB 英文套件中的一个基准,取自 japanese-llm-jp-kuci 子集。从作者给出的若干备选里选一个,返回每个备选的概率分布,主指标取「选中项上的目标概率质量」,越高越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
这是 S1MB 英文套件中的一个基准,取自 japanese-llm-jp-kuci 子集。从作者给出的若干备选里选一个,返回每个备选的概率分布,主指标取「选中项上的目标概率质量」,越高越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
评估集信息
- 所属套件
- S1MB
- 分组
- 公开 NLP 数据集
- 决策类型
- Choice · 选择
- 样本量
- 100 个 case
- 判断数
- 100
- 主指标
- 选中项的目标概率质量(越高越好)
- 优化方向
- 越高越好
- 参评模型
- 0 个
这个评估集测什么
这是 S1MB 英文套件中的一个基准,取自 japanese-llm-jp-kuci 子集。从作者给出的若干备选里选一个,返回每个备选的概率分布,主指标取「选中项上的目标概率质量」,越高越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
在该评估集上的模型成绩(0 个)
暂无模型在该评估集上的公开成绩。