跳转到内容

Score:分级评分

Score 给内容按 2–10 个有序、带描述的等级打分。和 Choice 的区别:等级之间有顺序(严重程度、质量、情感强度),因此答案是一个可以比较、可以加权合并的数值。

{
"type": "score",
"instructions": "用户的沮丧程度",
"criteria": [
"平静,只是陈述事实",
"不满但克制",
"愤怒,用词激烈"
]
}
  • criteria有序数组:索引 0 是最低级,最后一个最高级
  • 等级数 2–10(官方文档,2026-09-22 核验)
  • 每个等级都要写可区分的描述——描述质量直接决定分数质量
{
"type": "score",
"score": 1.0,
"legend": { "0": "平静…", "1": "不满…", "2": "愤怒…" },
"probabilities": { "0": 0.0, "1": 1.0, "2": 0.0 },
"confidence": 1.0
}
字段 含义
score 各等级概率的加权均值,因此可以是小数(如 1.4 表示“介于不满与愤怒之间,偏不满”)
legend 等级号 → 描述的回显,方便日志与展示
probabilities 每个等级的概率分布
confidence 分布集中度;方差大的分布(如 0.5/0.5)置信度低
  • 内容分级审核:对 UGC 按风险等级打分再决定放行/复审/下线——见内容分级
  • 组合评分(composite scoring):官方模式——把一个复杂判断拆成多个原子 Score,在你的代码里按自己控制的权重合并(经官方 llms.txt 索引核验)。权重属于业务逻辑,不必也不应交给模型
  • 实体对齐:官方 Cookbook 用一个三级 Score(合并 / 保留不链 / 交人工)完成两份啤酒目录 450 个候选对的实体对齐——三个等级恰好对应三种可执行动作,无需拟合阈值
  • 候选集合无序(部门、数据源、技能名)→ 用 Choice
  • 候选集合有序且你要的是“程度” → 用 Score
  • 只要一个是非判断 → 用 Noul

下一页:Noul:是非概率