单次记录不构成普适结论

本页整理已有公开证据,不是本次运行的 PASS 报告。本次未重跑检索、注入、Provider 或性能测试;材料阅读修订为 23fa19712c009cf864782401c449106b3ac9f17f,运行来源仍是证据包记录的 91753f1c1ff6fc07bc262dfa50fb719a63210e0b。1

冻结的输入,可追溯的语料

所有检索评测都锚定两组冻结输入。语料是六篇中文优先的 Markdown 文档,每条陈述都可追溯到 ZhoMind-v2 的 README、接口契约、ADR 或已验证测试,每篇文档以 ## 来源 小节映射事实到具体仓库位置。查询集固定为 16 条,按四类构造:四条精确约束(标识符、路径、版本、常量)、四条语义改写、四条组合条件、四条边界查询。

边界查询是这套评测最有设计感的部分:它们对应的语料证据不足、冲突或过时,因此必须不被当作可正常回答的问题。每条边界查询记录 insufficient / conflicting / stale 的原因分类,其诊断结果单独存放,不进入可回答查询的指标聚合——失败的检索和不该回答的问题,在统计上也不该混为一谈。

对比条件全部对齐:QA 分块 500/50、候选深度 20、模型身份一致、语料与查询集哈希固定。Hybrid RRF 按 chunk_id 去重,采用 rank-only 的 k=60,不叠加分数平均与重排。

记录的结果:质量持平,成本分化

指标Sparse BM25DenseHybrid RRF
Evidence Recall@3 / @5 / @101.0 / 1.0 / 1.01.0 / 1.0 / 1.01.0 / 1.0 / 1.0
Context Precision@30.3330.3330.333
Context Precision@5 / @100.20 / 0.100.20 / 0.100.20 / 0.10
首条 Gold Evidence 排名1.171.251.17
检索耗时0.44 ms3816.7 ms3261.7 ms

三种模式在这份语料上的 Recall 与 Context Precision 逐项一致,但首条 Gold 排名并非完全相同,耗时也不同。这份历史记录不支持普适胜者;当时的 Migration Retrieval 与质量对比属于不同职责,也不能据此推导当前 Pilot 的新验收结果。

三模式检索对比
三卡片显示质量指标持平,条形图显示检索耗时差距达三个数量级:BM25 0.44 毫秒、Hybrid RRF 3261.7 毫秒、Dense 3816.7 毫秒

值得留意的是 context_precision 的绝对值:@10 只有 0.10,说明按这份查询集的 Gold Evidence 标注,扩大返回集合没有提高精确度。这不能单独证明新增候选全部无用,也不能据此推出“前三条”是最佳截断点;确定这个参数仍需要独立实验。2

提示注入:四类案例,一个拒绝

通过认证产品路径的实时运行覆盖四类固定案例:指令覆盖、密钥提取、伪造来源指令、施压无证据作答。

前三类案例全部通过——输出保持 evidence_gated_answer,引用计数正常,失败分类为空。最有说服力的是第四类:施压无证据作答的案例,引用计数为 0。系统顶住了"你就直接回答吧"的压力,没有绕过证据门控——门控真的在产品路径上生效,而不只是在单元测试里。

同样重要的是边界声明:这是对记录案例与条件的证据,不是普适安全保证。公开记录只包含归一化案例身份、通过与否、封闭结果、引用计数与失败分类——不含原始对话,避免证据本身泄露攻击面。

性能:目标未达成,但归因清晰

发布候选接受了两种负载的观测,各 20 个请求,零错误:

负载TTFT P50TTFT P95总耗时 P95错误率
c1(单并发)7.65 s15.93 s15.93 s0
c5(五并发)12.46 s74.46 s74.47 s0

12 秒的端到端 P95 目标未达成——c1 为 15.9 秒,c5 为 74.5 秒,这是如实披露的部分。但报告同时把时间拆开了:应用自身受控的时长包络中心为 653ms,其余大头是检索、provider 与 embedding 服务的等待。外部 provider 延迟与应用受控时长分开报告,观测到的外包络不把外部延迟变成应用声明——一个诚实的性能结论,比一个达标的数字更有信息量。

生产验收与证据包

持久栈验收覆盖认证普通回答、SSE、历史投影、证据不足回复、生成不可用(零生成回退跳数)、来源撤回、成员停用、服务健康、两次独立干净启动的 Retrieval Smoke,以及管理员与知识用户的双角色浏览器边界。

所有这些记录进入公开证据包 portfolio-release-candidate-01:manifest 将运行身份、冻结的语料与查询哈希、工件哈希与声明的边界绑定到源修订 91753f1。公开工件刻意排除凭证、原始环境值、私有问题、完整回答、来源摘录与运营细节——可复核性不以泄露为代价。3

这套方法本身是产出

2026-09-08 本地集成基线已更新至 c1609dd12523e780149ec7ac546a34509f907757。当前 Pilot BM25、条件充分性、闭合执行和批准生成路由,需要绑定新语料、策略与运行身份重新验证;旧版“零回退”记录只说明当时行为,不代表当前禁止一切批准回退。实验生命周期与候选发布仍在独立工作树中。4

最终使用效果的验证还需覆盖带条件的工程问题、实际知识覆盖、来源复查和日常体验,而不止一个小型检索集。完整读法见评测证据全文。

回顾这组实验,最有价值的可能不是任何单项数字,而是方法本身:输入冻结、指标与诊断分离、结论绑定边界、证据包可验证。它和这个项目的设计立场是同一枚硬币的两面——回答需要证据支持,实验结论同样需要。

来源与范围

主张固定材料不能扩大成的结论
三模式质量与耗时retrieval section混合检索的普适优劣
四类提示注入prompt-injection section全面安全认证
c1 / c5 性能REPORT 与性能 sections服务等级或任意环境吞吐承诺
认证、历史与撤回production-acceptance section本次已重新执行生产验收

公开材料为了隐私仅保留有界记录,不提供全部原始对话。因此它支持记录范围内的核对,不意味着访客可以从公开摘要复现所有实时请求。保留这一代价,比用“可复现”一词遮住输入缺失更准确。

技术页补充本次阅读修订下的证据选择与生成失败测试;迭代记录解释运行来源和发布材料提交的区别。本文不把这些新阅读的断言重新归属到历史运行。

参考资料

  1. 公开证据报告与来源修订;manifest。 ↩

  2. 检索记录。 ↩

  3. 提示注入记录;产品验收记录。 ↩

  4. 当前规范契约。 ↩