固定 DEV benchmark
22 cases合成、可复现,单轮运行
这是一套合成、可复现的 DEV benchmark,用于验证调查流程、证据覆盖与失败边界,不代表生产环境准确率。
低层 judge 分数与诊断得分不作为招聘或产品 KPI 展示。
评测不仅判断结果,也保留取证过程和失败原因。
完整分数保留在内部实验 artifacts,公开页面呈现可解释的结论。
Final V8 在全部案例中触达至少一项关键证据,说明受控工具取证链路能够工作。
已收集证据没有稳定进入最终引用,Evidence 到用户可核验结论之间仍有断层。
部分运行在 contract 边界终止。项目保留这些失败,用于定位 runtime 与表达层问题。
当前评测支持继续研究证据投影和综合表达,不支持把结果解释为生产环境准确率。
评测可信度依赖边界说明,而不是单一数字。