能力总览
Jev 的全部能力围绕三种题型展开。一条请求可以同时问多个问题(官方称可并行提问,包括“投机问题”),每个问题独立返回类型化答案。
| 题型 | 问什么 | 答案包含 | 置信度 |
|---|---|---|---|
| Choice | 从 ≤255 个定义好的选项中选一个 | choice + 每个选项的 probabilities |
✅ 有 |
| Score | 按 2–10 个有序等级打分 | score(概率加权均值,可为小数)+ legend + probabilities |
✅ 有 |
| Noul | 是非问题 | noul(“是”的概率 0–1) |
❌ 无 |
三种题型的公共字段:
instructions:给模型的问题描述(自然语言)criteria:选项/等级/判据的枚举定义——这是“类型安全”的来源:答案空间在你这边定义
一次请求的 questions 里可以放多个问题,共享同一段 state。官方 Cookbook 给出的示例:对一篇 GDPR 文章同时问 13 个监管问题,合并为一次调用比逐条调用便宜 12.2 倍、快 10.0 倍,且答案不变(官方数据,2026-09-21 经官方 llms.txt 索引核验)。
官方还支持 speculative fan-out 模式:把“可能相关”的问题一并发出,由你的代码决定用哪些答案——适合分支很多的判断树。
置信度(confidence)怎么读
Section titled “置信度(confidence)怎么读”官方文档明确:confidence 不是概率,也不是准确率,而是答案分布形状的统计量——分布越集中,置信度越高。正确用法:
- 答案告诉你“是什么”(
choice/score/noul) - 置信度告诉你“要不要直接执行”——低置信度转人工或降级处理
官方专门提供了 Confidence-gated routing 模式(经官方 llms.txt 索引核验),本站应用场景的四个案例全部基于它。
usage 与成本
Section titled “usage 与成本”每个响应带 usage: { input_tokens, output_tokens }。计费口径(官方 models 页,2026-09-22 核验):
- 输入 $0.042 / 百万 token,输出免费
- 单请求上限 64k token;
state+ 最长问题 ≤ 32k token - 限流:250k token/s + 1200 请求/分钟(429 触发,官方注明可能调整)
什么时候不该用它
Section titled “什么时候不该用它”见能力边界:文本生成、开放域问答、需要长推理链的任务都不适合。判断“适不适合”的快速检查清单也在那一页。