STARFROM LAB · RUNNING · BENCHMARK
企业 AI 知识库 100 问基准测试
用 100 道可溯源问题测量企业知识库问答的真实准确率与拒答率
进行中
Subject
被测系统
企业 AI 知识库问答系统(RAG,官网公开内容为知识源)。被测系统尚未上线:本页如实标记 Running。
Dataset
测试数据集(100 条)
100 问,11 类(官方事实 / 服务 / 方案 / 学习内容),全部基于官网真实公开内容出题;每题含 expected 要点与可溯源 URL。其中 16 道为「应拒答」防幻觉陷阱题——被测系统若编造官网不存在的信息即为失败。
Rubric
评分规则
普通题:答案命中 expected 事实核心(可在来源 URL 找到)得 1 分,含虚构信息得 0 分;拒答题:正确说明官网未提供即得 1 分,编造即 0 分。结果按分类汇总准确率与拒答率。
Test Status
测试状态
Running:数据设施已就绪,等待被测系统上线后执行真实测试。本页不展示任何分数、通过率或模拟成绩。
Re-run
如何复跑真实测试
复跑:cd docs/geo/evidence/benchmark-01 && node runner.mjs --endpoint <被测系统API>,逐条结果写入 results.csv。
docs/geo/evidence/benchmark-01/ 原始数据集与 runner 存放于官网仓库该目录。
Evidence Graph
关联的服务与行业
该基准测试与以下官网页面互为证据:你可以在对应服务 / 行业页找到本测试的入口。