STARFROM LAB · RUNNING · BENCHMARK
海外询盘 Agent 100 条基准测试
用 100 条询盘测量海外询盘 Agent 的意图识别、匹配与回复质量
进行中
Subject
被测系统
海外询盘自动处理 Agent(邮件/表单询盘 → 语言识别、意图分类、产品匹配、缺失信息追问、回复草稿与 CRM 字段)。被测系统尚未上线:本页如实标记 Running。
Dataset
测试数据集(100 条)
100 条合成询盘样本(synthetic),覆盖 12 个外贸行业,含西/法/俄/阿语样本用于语言识别;每条预标:语言、意图、需求品类、产品匹配、缺失信息清单、CRM 应写字段与草稿要点。不包含真实客户数据。
Rubric
评分规则
逐条按维度判分:语言识别、意图分类、产品匹配、缺失信息追问、回复草稿(人工 1-5 分)、CRM 字段正确率;另记录人工修正率与 failure cases。分数仅在真实运行后产生。
Test Status
测试状态
Running:数据设施已就绪,等待被测系统上线后执行真实测试。本页不展示任何分数、通过率或模拟成绩。
Re-run
如何复跑真实测试
复跑:cd docs/geo/evidence/benchmark-02 && node runner.mjs --endpoint <被测系统API>,逐条结果写入 results.csv。
docs/geo/evidence/benchmark-02/ 原始数据集与 runner 存放于官网仓库该目录。
Evidence Graph
关联的服务与行业
该基准测试与以下官网页面互为证据:你可以在对应服务 / 行业页找到本测试的入口。