跳转到内容
原创教程官方文档整理

Jev Score 实操:给问题影响程度写可复核的评分标准

一套单维度锚点与可逐条复核的优先级候选表。

适用场景把“高、中、低”改成可观察的评分锚点,拆开影响与证据充分程度,保留小数分数和人工预期,形成可解释的优先级建议。

来源 · JevLog 编辑部Intermediate15 分钟

把“高、中、低”改成可观察的评分锚点,拆开影响与证据充分程度,保留小数分数和人工预期,形成可解释的优先级建议。

来源 · JevLog 编辑部 · 本站原创

原文封面 · TypeSafe AI

原文封面 · TypeSafe AI

2026-10-02 新增:依据当前官方文档整理,附本站编写练习。未做真实服务调用;来源首次发布日期未确认。

“很重要”对不同人含义不同。这里只评任务受阻程度,不把收入、客户级别和情绪混成一个分数。先让复核者能一致理解标准,再考虑模型。

  • 下载 impact-rubric.csv,两人先独立标注四条虚构报告。

  • 调用代码需 typesafe-sdk 和密钥;人工检查评分表无需调用 API。

  • 官方文档

  • 官方文档

JevLog 原创流程图,非产品截图或实测结果。

JevLog 原创流程图,非产品截图或实测结果。

维度是“问题对完成当前任务的阻碍程度”。写明用户情绪、客户等级和支付金额不参与。缺少具体任务时另标资料不足,不把语气强烈当成影响大。

0:正常完成;1:已知替代路径可完成;2:没有陈述的替代路径。每档描述可观察条件,避免“低、中、高”三个空标签。Noul 独立检查资料是否够,避免缺信息混入最高级。

from typesafe_sdk import TypeSafeClient, Score, Noul
with TypeSafeClient() as client:
result = client.system_one("Export fails in Safari but succeeds in Chrome.", {
"impact": Score(instructions="How much does this block completion of the stated task?",
criteria=["Task works normally", "A stated workaround completes the task", "No stated workaround completes the task"]),
"context": Noul(instructions="Does the report describe a concrete task and a failure?")
})
answer = result.scores["impact"]
print(answer.score, answer.probabilities, answer.confidence)
print(result.nouls["context"].noul)

三档的分数区间是 0 到 2,可落在档位之间。存原始 score、probabilities、confidence,显示时才保留两位小数。不要因为界面四舍五入让路由规则悄悄变掉。

两人都评的同一组,差异按“任务定义不一致”“是否存在替代路径”“证据缺失”记录。人都不一致时先改标准。样例中“什么都不能用”需要补具体行为,不能直接判最高档。

输出 case_id、rubric_version、原始分数、资料状态与建议优先级。事故升级要由监控、影响范围和负责人确认。换锚点后重跑同组并保存变更原因,便于结果对比。

练习样例:下载 impact-rubric.csv,可在本地练习;非本站实测结果。

一套单维度锚点与可逐条复核的优先级候选表。

  • 更多档位不等于更准确,含糊五档往往比清楚三档难标。
  • 评分不能证明事故、赔偿资格或业务权限。
  • 每档有可观察条件,缺信息另有出口。
  • 原始分布、小数分和人工分歧都保留。

来源边界:依据所列公开来源整理;本站未复现演示。分类结果需人工复核,不会自动执行。

不能。它对应有序档位的位置,三档为 0 到 2;展示映射由业务定义。