公开评测怎么读
资料核查:2026-09-21。 以下整理公开报告与实验代码,JevCN 尚未独立复现。实验结论属于对应版本、数据集与运行条件,不等于通用能力保证。
官方工作流评测
跳转到“官方工作流评测”TypeSafe Evals比较安全事件、智能体轨迹、发票处理和客户服务等工作流中的准确性、成本与耗时,汇总对各项任务等权处理。
阅读时特别注意:其参考标签来自模型共识,并非独立人工标注的绝对真值。应查看单任务结果和评判设置,再判断自己的任务是否相似。
独立评测与工具
跳转到“独立评测与工具”工具选择与拒答
跳转到“工具选择与拒答”baibizhe/jev-decision-benchmarks围绕 MetaTool、When2Call 和 BFCL V4 的工具选择与拒答任务提供报告和结果资料。
值得检查:候选工具是否一致、是否允许“不调用”、是否用了示例提示,以及比较对象是同环境重跑还是引用论文数字。这些条件会改变“谁更好”的含义。
中文与英文检索重排
跳转到“中文与英文检索重排”zhuyansen/jev-search-rerank-eval在 Agent Skills Hub 目录上比较关键词、向量检索、Jev 重排与排序融合,包含中文、英文和混合查询。
作者报告显示,在该实验中,Jev 单独重排并不稳定优于较强的向量基线;融合两种排序信号更有帮助。项目还分别检查 Jev 参与标注与不参与标注时的结果,展示了“模型给自己打分”可能产生的偏差。这个反例很有价值:接入重排器并不自动带来提升。
概率校准与失败记录
跳转到“概率校准与失败记录”AbdelStark/jev-benchmarks提供面向概率输出的评估工具,关注校准、选择性风险、延迟与原始预测记录。适合研究阈值调整后自动处理覆盖率和错误率的变化,而不只看单一准确率。
JevCN 建议的中文评估记录
跳转到“JevCN 建议的中文评估记录”下面是社区建议的记录模板,不是已经完成的测试结果。
| 记录项 | 最少保留什么 |
|---|---|
| 任务与数据 | 来源、授权、脱敏方式、样本数、类别分布;单列中文、混合语言和歧义样本 |
| 版本 | SDK 版本、请求的模型名、响应中的实际模型版本、代码提交 |
| 输入 | 状态、问题、选项、评价标准与阈值,保留能够复现的脱敏样例 |
| 对照 | 规则基线或现有方案;使用相同测试集和执行预算 |
| 质量 | 分类别指标、误判和拒答;排序任务记录 NDCG 等适用指标 |
| 概率 | 检查分数与实际正确率的对应关系,不直接把高置信度当成高正确率 |
| 运行 | 请求区域、并发、P50/P95、超时与重试;失败请求不从统计中消失 |
| 成本 | 按实测用量和当时价格计算,包含其他模型、检索与重试 |
先固定留出的测试集,再调评价标准与阈值。重复在测试集上挑选最好的提示,会让报告高估真实效果。