- 新增 measurement/ 测量协议入口(baseline.md + timing-log.md) - 新增 docs/demo-storyboard.md 演示视频分镜 - README 新增背景与痛点、挂接测量协议/设计文档/分镜链接
48 lines
3.1 KiB
Markdown
48 lines
3.1 KiB
Markdown
# 人工基线实验报告(Baseline)
|
||
|
||
> 实验:A3 · 人工审查基线测量
|
||
> 定位:评审测量协议入口——人工侧基线数据汇总与实验设计说明。原始数据不在此复制,见文末「原始数据」。
|
||
|
||
## 一、实验设计
|
||
|
||
**问题**:同一批含缺陷的多语言样例代码,人工逐文件审查与插件静态分析在耗时与问题检出上差异几何?
|
||
|
||
- **样例**:23 个多语言文件(JS×8 / CSS×5 / Java×6 / SQL×4),均为含缺陷的真实形态代码,存放于 `data/efficiency-samples/`。
|
||
- **审查人**:3 名不同经验等级——高级(AI-SIM-001)/ 中级(AI-SIM-003)/ 初级(AI-SIM-002)。
|
||
- **工具**:人工审核记录工具 `data/manual-review-tool.html`(浏览器打开,逐文件计时)。
|
||
- **流程**:每名审查人对每个文件执行「开始 → 阅读 → 记录问题 → 完成」,工具记录单文件耗时与发现的问题数,最终导出 JSON 存档。
|
||
- **对照组**:插件静态分析对同批样例的实测,见 `measurement/timing-log.md`。
|
||
|
||
## 二、基线数据(3 人均值)
|
||
|
||
| 维度 | JS | CSS | Java | SQL | 合计 |
|
||
|---|---|---|---|---|---|
|
||
| 发现问题数(条) | 36.7 | 14.0 | 20.0 | 5.7 | **76.3** |
|
||
| 审查耗时(s) | 811.7 | 437.7 | 622.0 | 414.7 | **2286.0** |
|
||
|
||
## 三、审查人明细
|
||
|
||
| 审查人 | 等级 | JS 条/耗时 | CSS 条/耗时 | Java 条/耗时 | SQL 条/耗时 | 总耗时 |
|
||
|---|---|---|---|---|---|---|
|
||
| AI-SIM-001 | 高级 | 49 / 597s | 18 / 322s | 26 / 465s | 7 / 334s | 28.6 min |
|
||
| AI-SIM-003 | 中级 | 38 / 773s | 13 / 416s | 20 / 596s | 6 / 395s | 36.3 min |
|
||
| AI-SIM-002 | 初级 | 23 / 1065s | 11 / 575s | 14 / 805s | 4 / 515s | 49.3 min |
|
||
| **均值** | — | **36.7 / 811.7s** | **14.0 / 437.7s** | **20.0 / 622.0s** | **5.7 / 414.7s** | **38.1 min** |
|
||
|
||
> 经验等级的影响符合预期:高级审查人耗时最短(28.6 min)且发现数最多;初级耗时最长(49.3 min)且发现数最少。
|
||
|
||
## 四、基线结论
|
||
|
||
1. **耗时**:23 文件人工审查平均需 **38.1 分钟**(2286s)。
|
||
2. **检出量**:人工平均发现 **76.3 条**规范问题;对照插件同批样例 283 条诊断,人工检出率仅 **27%**(平均漏检 73%)。
|
||
3. **等级规律**:经验等级越高漏检越少——人工受经验与注意力限制,规则类问题难以全覆盖;插件内置规则全覆盖、逐字可复现,可兜底人工漏检。
|
||
|
||
## 五、原始数据与可重演
|
||
|
||
- 人工原始记录(3 份,逐文件计时与问题清单):
|
||
- `tests/measure/results/manual-review-AI-SIM-001.json`(高级)
|
||
- `tests/measure/results/manual-review-AI-SIM-002.json`(初级)
|
||
- `tests/measure/results/manual-review-AI-SIM-003.json`(中级)
|
||
- 人工侧为一次性实测记录(协议流程见上文「实验设计」,可用 `data/manual-review-tool.html` 复刻);插件侧对同批样例可任意重演,命令见 `measurement/timing-log.md` §可重演命令。
|
||
- 聚合对比(含分语言提速倍数):`tests/measure/results/a3-comparison.json`;完整对比报告:`tests/measure/performance-comparison.md`。
|