PORTFOLIO V1.0 · FINAL V8 EVALUATION

用固定案例检查 Agent 是否真的收集证据

这是一套合成、可复现的 DEV benchmark,用于验证调查流程、证据覆盖与失败边界,不代表生产环境准确率。

Harness V8gpt-5.6-solsingle-run
01 / 结果概览

公开展示聚焦调查与证据覆盖

低层 judge 分数与诊断得分不作为招聘或产品 KPI 展示。

指标 01

固定 DEV benchmark

22 cases合成、可复现,单轮运行
指标 02

关键证据触达

22 / 22每案至少收集一项 Gold key evidence
指标 03

完整证据覆盖

14 / 22收集完整 Gold key-evidence set
指标 04

受控工具调用

40全部为只读 investigation tool calls
02 / 方法

从固定 Gold 到 Failure Taxonomy

评测不仅判断结果,也保留取证过程和失败原因。

01Fixed Gold Dataset
02Agent Run
03Evidence Scoring
04Blind Judge
05Failure Taxonomy
06Iteration
03 / 发现

Final V8 暴露的系统边界

完整分数保留在内部实验 artifacts,公开页面呈现可解释的结论。

Evidence Collection 已形成

Final V8 在全部案例中触达至少一项关键证据,说明受控工具取证链路能够工作。

Citation projection 仍需加强

已收集证据没有稳定进入最终引用,Evidence 到用户可核验结论之间仍有断层。

Limitation contract 暴露边界

部分运行在 contract 边界终止。项目保留这些失败,用于定位 runtime 与表达层问题。

Grounded synthesis 是下一阶段课题

当前评测支持继续研究证据投影和综合表达,不支持把结果解释为生产环境准确率。

04 / 限制

如何理解这些结果

评测可信度依赖边界说明,而不是单一数字。

  • Final V8 只运行一轮,未做 multi-seed 或 3×22。
  • 数据来自合成、可复现 fixture,不是真实企业生产流量。
  • LLM query selection 与 Blind Judge 都可能存在采样方差。
  • Evidence collection 强于 citation 与 grounded synthesis。