STARFROM LAB · RUNNING · BENCHMARK

企业 AI 知识库 100 问基准测试

用 100 道可溯源问题测量企业知识库问答的真实准确率与拒答率

进行中
Subject

被测系统

企业 AI 知识库问答系统(RAG,官网公开内容为知识源)。被测系统尚未上线:本页如实标记 Running。

Dataset

测试数据集(100 条)

100 问,11 类(官方事实 / 服务 / 方案 / 学习内容),全部基于官网真实公开内容出题;每题含 expected 要点与可溯源 URL。其中 16 道为「应拒答」防幻觉陷阱题——被测系统若编造官网不存在的信息即为失败。

Rubric

评分规则

普通题:答案命中 expected 事实核心(可在来源 URL 找到)得 1 分,含虚构信息得 0 分;拒答题:正确说明官网未提供即得 1 分,编造即 0 分。结果按分类汇总准确率与拒答率。

Test Status

测试状态

Running:数据设施已就绪,等待被测系统上线后执行真实测试。本页不展示任何分数、通过率或模拟成绩。
Re-run

如何复跑真实测试

复跑:cd docs/geo/evidence/benchmark-01 && node runner.mjs --endpoint <被测系统API>,逐条结果写入 results.csv。

docs/geo/evidence/benchmark-01/ 原始数据集与 runner 存放于官网仓库该目录。

Evidence Graph

关联的服务与行业

该基准测试与以下官网页面互为证据:你可以在对应服务 / 行业页找到本测试的入口。

想看到更多实验?

实验项目会持续更新进展,欢迎回来查看。

预约AI诊断