它怎么判
流程是四步:从企业资料里检索出相关段落,模型基于这些段落作答,然后把答案拆成句子,每一句单独和检索到的段落比对,算一个支持度。低于阈值的句子在答案里直接标成 unsupported。
服务页上的截图是产品自己的输出,不是示意图。问的是达尔文,前两句挂着引用,第三句「作者是在热气球上写的」是我们故意塞进去的假话,当场被标出来。读数是 2 条有据、1 条被标,阈值 0.55。
判到什么程度
它不让模型变得更对,它让错的那句变得可见。阈值是一个取舍:调低,标出来的少,漏掉的多;调高,标出来的多,人要复核的也多。这个数应该由使用它的企业按自己的资料定,不该由我们替您定。
检索本身也会漏。下面的评测数说的是:相关段落有多大比例被排进了前三、前五、前十,以及第一条相关段落平均排在多前。这两组数决定了后面那一步有没有材料可比。
能复跑的数(2026 年 8 月 31 日现跑)
| 指标 | k = 3 | k = 5 | k = 10 |
|---|---|---|---|
| 命中率 recall@k | 0.867 | 0.867 | 1.000 |
| 平均倒数排名 MRR | 0.789 | 0.789 | 0.810 |
自动化测试 223 项通过,另有 9 项依赖 Postgres 环境。评测在公开语料上跑:npm test 与 npm run eval。
采购这类系统前的五个问题
- 答案里的每一句能不能追溯到出处只在答案末尾挂一串引用,不算。
- 没有依据的句子会不会被标出来让对方现场演示一句假话被标出来的过程。
- 检索的命中率和排名指标是多少,在什么语料上测的没有数字,就是没测过。
- 资料放在哪里,哪一步经过哪个模型要书面说明,不要口头保证。
- 阈值和转人工的边界由谁定应该是您,按您的资料和容错定。
告诉我们哪一个环节最耗时
联系我们