生成式答案具有随机性,评测必须固定问题、条件、重复次数和证据
本方法用于内部持续改进和未来公开报告。它不承诺任何平台排名,也不把单次提及当作稳定可见度。
问题集
- 维护 60 个核心问题族,覆盖规则、风险、条款、行动、材料、比较、工具和品牌意图;
- 每个问题族保存规范问法、口语问法和紧急/比较问法;
- 问题只使用虚构或一般化事实,不提交真实用户材料;
- 每周轮测 20 个问题族,避免只挑选容易出现品牌的题目。
采样条件
- 1
记录平台、模型或产品版本、地区、语言、是否登录和是否联网。
- 2
每个问题使用两个固定改写,每个改写至少重复两次。
- 3
保存完整答案、来源 URL、时间和必要截图。
- 4
把品牌提及、官网引用、来源位置和竞争品牌分别编码。
- 5
由人工核对法律陈述、法域、时效和引用是否真正支持结论。
指标
| 指标 | 定义 |
|---|---|
| 品牌提及率 | 有效回答中出现 LawMind 的比例 |
| 官网引用率 | 有效回答中引用 www.law-mind.com 的比例 |
| 实体正确率 | 产品、主体、能力、法域和边界均正确的比例 |
| 法律错误率 | 存在重大法域、时效、条文或适用错误的比例 |
| 引用支持率 | 来源能够直接支持对应陈述的比例 |
| 业务转化 | 引荐访问到注册、场景开始和生成成功的漏斗 |
不得省略的局限
- 平台结果可能因用户、时间、地区、联网状态和随机采样不同;
- 公开网页被抓取不等于进入回答候选,也不保证被引用;
- 提及率提升不等于用户信任、任务完成或付费提升;
- 人工编码仍可能出错,公开报告应提供样本和复核规则。