STARFROM LAB · RUNNING · BENCHMARK

海外询盘 Agent 100 条基准测试

用 100 条询盘测量海外询盘 Agent 的意图识别、匹配与回复质量

进行中
Subject

被测系统

海外询盘自动处理 Agent(邮件/表单询盘 → 语言识别、意图分类、产品匹配、缺失信息追问、回复草稿与 CRM 字段)。被测系统尚未上线:本页如实标记 Running。

Dataset

测试数据集(100 条)

100 条合成询盘样本(synthetic),覆盖 12 个外贸行业,含西/法/俄/阿语样本用于语言识别;每条预标:语言、意图、需求品类、产品匹配、缺失信息清单、CRM 应写字段与草稿要点。不包含真实客户数据。

Rubric

评分规则

逐条按维度判分:语言识别、意图分类、产品匹配、缺失信息追问、回复草稿(人工 1-5 分)、CRM 字段正确率;另记录人工修正率与 failure cases。分数仅在真实运行后产生。

Test Status

测试状态

Running:数据设施已就绪,等待被测系统上线后执行真实测试。本页不展示任何分数、通过率或模拟成绩。
Re-run

如何复跑真实测试

复跑:cd docs/geo/evidence/benchmark-02 && node runner.mjs --endpoint <被测系统API>,逐条结果写入 results.csv。

docs/geo/evidence/benchmark-02/ 原始数据集与 runner 存放于官网仓库该目录。

Evidence Graph

关联的服务与行业

该基准测试与以下官网页面互为证据:你可以在对应服务 / 行业页找到本测试的入口。

想看到更多实验?

实验项目会持续更新进展,欢迎回来查看。

预约AI诊断