Jev Score 实操:给问题影响程度写可复核的评分标准
一套单维度锚点与可逐条复核的优先级候选表。
适用场景把“高、中、低”改成可观察的评分锚点,拆开影响与证据充分程度,保留小数分数和人工预期,形成可解释的优先级建议。
把“高、中、低”改成可观察的评分锚点,拆开影响与证据充分程度,保留小数分数和人工预期,形成可解释的优先级建议。
来源 · JevLog 编辑部 · 本站原创

原文封面 · TypeSafe AI
2026-10-02 新增:依据当前官方文档整理,附本站编写练习。未做真实服务调用;来源首次发布日期未确认。
背景 / 问题
Section titled “背景 / 问题”“很重要”对不同人含义不同。这里只评任务受阻程度,不把收入、客户级别和情绪混成一个分数。先让复核者能一致理解标准,再考虑模型。
JevLog 原创流程图,非产品截图或实测结果。
1. 只选一个评分维度
Section titled “1. 只选一个评分维度”维度是“问题对完成当前任务的阻碍程度”。写明用户情绪、客户等级和支付金额不参与。缺少具体任务时另标资料不足,不把语气强烈当成影响大。
2. 写低到高的锚点
Section titled “2. 写低到高的锚点”0:正常完成;1:已知替代路径可完成;2:没有陈述的替代路径。每档描述可观察条件,避免“低、中、高”三个空标签。Noul 独立检查资料是否够,避免缺信息混入最高级。
from typesafe_sdk import TypeSafeClient, Score, Noulwith TypeSafeClient() as client: result = client.system_one("Export fails in Safari but succeeds in Chrome.", { "impact": Score(instructions="How much does this block completion of the stated task?", criteria=["Task works normally", "A stated workaround completes the task", "No stated workaround completes the task"]), "context": Noul(instructions="Does the report describe a concrete task and a failure?") }) answer = result.scores["impact"] print(answer.score, answer.probabilities, answer.confidence) print(result.nouls["context"].noul)3. 保留小数与分布
Section titled “3. 保留小数与分布”三档的分数区间是 0 到 2,可落在档位之间。存原始 score、probabilities、confidence,显示时才保留两位小数。不要因为界面四舍五入让路由规则悄悄变掉。
4. 先看人工分歧
Section titled “4. 先看人工分歧”两人都评的同一组,差异按“任务定义不一致”“是否存在替代路径”“证据缺失”记录。人都不一致时先改标准。样例中“什么都不能用”需要补具体行为,不能直接判最高档。
5. 评分只给建议
Section titled “5. 评分只给建议”输出 case_id、rubric_version、原始分数、资料状态与建议优先级。事故升级要由监控、影响范围和负责人确认。换锚点后重跑同组并保存变更原因,便于结果对比。
练习样例:下载 impact-rubric.csv,可在本地练习;非本站实测结果。
一套单维度锚点与可逐条复核的优先级候选表。
- 更多档位不等于更准确,含糊五档往往比清楚三档难标。
- 评分不能证明事故、赔偿资格或业务权限。
- 每档有可观察条件,缺信息另有出口。
- 原始分布、小数分和人工分歧都保留。
来源边界:依据所列公开来源整理;本站未复现演示。分类结果需人工复核,不会自动执行。
Score 能直接当百分制吗?
Section titled “Score 能直接当百分制吗?”不能。它对应有序档位的位置,三档为 0 到 2;展示映射由业务定义。