跳转到内容

公开评测怎么读

资料核查:2026-09-21。 以下整理公开报告与实验代码,JevCN 尚未独立复现。实验结论属于对应版本、数据集与运行条件,不等于通用能力保证。

TypeSafe Evals比较安全事件、智能体轨迹、发票处理和客户服务等工作流中的准确性、成本与耗时,汇总对各项任务等权处理。

阅读时特别注意:其参考标签来自模型共识,并非独立人工标注的绝对真值。应查看单任务结果和评判设置,再判断自己的任务是否相似。

baibizhe/jev-decision-benchmarks围绕 MetaTool、When2Call 和 BFCL V4 的工具选择与拒答任务提供报告和结果资料。

值得检查:候选工具是否一致、是否允许“不调用”、是否用了示例提示,以及比较对象是同环境重跑还是引用论文数字。这些条件会改变“谁更好”的含义。

zhuyansen/jev-search-rerank-eval在 Agent Skills Hub 目录上比较关键词、向量检索、Jev 重排与排序融合,包含中文、英文和混合查询。

作者报告显示,在该实验中,Jev 单独重排并不稳定优于较强的向量基线;融合两种排序信号更有帮助。项目还分别检查 Jev 参与标注与不参与标注时的结果,展示了“模型给自己打分”可能产生的偏差。这个反例很有价值:接入重排器并不自动带来提升。

AbdelStark/jev-benchmarks提供面向概率输出的评估工具,关注校准、选择性风险、延迟与原始预测记录。适合研究阈值调整后自动处理覆盖率和错误率的变化,而不只看单一准确率。

JevCN 建议的中文评估记录

跳转到“JevCN 建议的中文评估记录”

下面是社区建议的记录模板,不是已经完成的测试结果

记录项 最少保留什么
任务与数据 来源、授权、脱敏方式、样本数、类别分布;单列中文、混合语言和歧义样本
版本 SDK 版本、请求的模型名、响应中的实际模型版本、代码提交
输入 状态、问题、选项、评价标准与阈值,保留能够复现的脱敏样例
对照 规则基线或现有方案;使用相同测试集和执行预算
质量 分类别指标、误判和拒答;排序任务记录 NDCG 等适用指标
概率 检查分数与实际正确率的对应关系,不直接把高置信度当成高正确率
运行 请求区域、并发、P50/P95、超时与重试;失败请求不从统计中消失
成本 按实测用量和当时价格计算,包含其他模型、检索与重试

先固定留出的测试集,再调评价标准与阈值。重复在测试集上挑选最好的提示,会让报告高估真实效果。

准备做自己的实验?从中文实践路线选择一个小任务,并通过贡献指南分享可复查的记录。