Score:分级评分
Score 给内容按 2–10 个有序、带描述的等级打分。和 Choice 的区别:等级之间有顺序(严重程度、质量、情感强度),因此答案是一个可以比较、可以加权合并的数值。
{ "type": "score", "instructions": "用户的沮丧程度", "criteria": [ "平静,只是陈述事实", "不满但克制", "愤怒,用词激烈" ]}criteria是有序数组:索引 0 是最低级,最后一个最高级- 等级数 2–10(官方文档,2026-09-22 核验)
- 每个等级都要写可区分的描述——描述质量直接决定分数质量
{ "type": "score", "score": 1.0, "legend": { "0": "平静…", "1": "不满…", "2": "愤怒…" }, "probabilities": { "0": 0.0, "1": 1.0, "2": 0.0 }, "confidence": 1.0}| 字段 | 含义 |
|---|---|
score |
各等级概率的加权均值,因此可以是小数(如 1.4 表示“介于不满与愤怒之间,偏不满”) |
legend |
等级号 → 描述的回显,方便日志与展示 |
probabilities |
每个等级的概率分布 |
confidence |
分布集中度;方差大的分布(如 0.5/0.5)置信度低 |
- 内容分级审核:对 UGC 按风险等级打分再决定放行/复审/下线——见内容分级
- 组合评分(composite scoring):官方模式——把一个复杂判断拆成多个原子 Score,在你的代码里按自己控制的权重合并(经官方 llms.txt 索引核验)。权重属于业务逻辑,不必也不应交给模型
- 实体对齐:官方 Cookbook 用一个三级 Score(合并 / 保留不链 / 交人工)完成两份啤酒目录 450 个候选对的实体对齐——三个等级恰好对应三种可执行动作,无需拟合阈值
与 Choice 的选择
Section titled “与 Choice 的选择”下一页:Noul:是非概率。