- 新增 measurement/ 测量协议入口(baseline.md + timing-log.md) - 新增 docs/demo-storyboard.md 演示视频分镜 - README 新增背景与痛点、挂接测量协议/设计文档/分镜链接
3.1 KiB
3.1 KiB
人工基线实验报告(Baseline)
实验:A3 · 人工审查基线测量 定位:评审测量协议入口——人工侧基线数据汇总与实验设计说明。原始数据不在此复制,见文末「原始数据」。
一、实验设计
问题:同一批含缺陷的多语言样例代码,人工逐文件审查与插件静态分析在耗时与问题检出上差异几何?
- 样例:23 个多语言文件(JS×8 / CSS×5 / Java×6 / SQL×4),均为含缺陷的真实形态代码,存放于
data/efficiency-samples/。 - 审查人:3 名不同经验等级——高级(AI-SIM-001)/ 中级(AI-SIM-003)/ 初级(AI-SIM-002)。
- 工具:人工审核记录工具
data/manual-review-tool.html(浏览器打开,逐文件计时)。 - 流程:每名审查人对每个文件执行「开始 → 阅读 → 记录问题 → 完成」,工具记录单文件耗时与发现的问题数,最终导出 JSON 存档。
- 对照组:插件静态分析对同批样例的实测,见
measurement/timing-log.md。
二、基线数据(3 人均值)
| 维度 | JS | CSS | Java | SQL | 合计 |
|---|---|---|---|---|---|
| 发现问题数(条) | 36.7 | 14.0 | 20.0 | 5.7 | 76.3 |
| 审查耗时(s) | 811.7 | 437.7 | 622.0 | 414.7 | 2286.0 |
三、审查人明细
| 审查人 | 等级 | JS 条/耗时 | CSS 条/耗时 | Java 条/耗时 | SQL 条/耗时 | 总耗时 |
|---|---|---|---|---|---|---|
| AI-SIM-001 | 高级 | 49 / 597s | 18 / 322s | 26 / 465s | 7 / 334s | 28.6 min |
| AI-SIM-003 | 中级 | 38 / 773s | 13 / 416s | 20 / 596s | 6 / 395s | 36.3 min |
| AI-SIM-002 | 初级 | 23 / 1065s | 11 / 575s | 14 / 805s | 4 / 515s | 49.3 min |
| 均值 | — | 36.7 / 811.7s | 14.0 / 437.7s | 20.0 / 622.0s | 5.7 / 414.7s | 38.1 min |
经验等级的影响符合预期:高级审查人耗时最短(28.6 min)且发现数最多;初级耗时最长(49.3 min)且发现数最少。
四、基线结论
- 耗时:23 文件人工审查平均需 38.1 分钟(2286s)。
- 检出量:人工平均发现 76.3 条规范问题;对照插件同批样例 283 条诊断,人工检出率仅 27%(平均漏检 73%)。
- 等级规律:经验等级越高漏检越少——人工受经验与注意力限制,规则类问题难以全覆盖;插件内置规则全覆盖、逐字可复现,可兜底人工漏检。
五、原始数据与可重演
- 人工原始记录(3 份,逐文件计时与问题清单):
tests/measure/results/manual-review-AI-SIM-001.json(高级)tests/measure/results/manual-review-AI-SIM-002.json(初级)tests/measure/results/manual-review-AI-SIM-003.json(中级)
- 人工侧为一次性实测记录(协议流程见上文「实验设计」,可用
data/manual-review-tool.html复刻);插件侧对同批样例可任意重演,命令见measurement/timing-log.md§可重演命令。 - 聚合对比(含分语言提速倍数):
tests/measure/results/a3-comparison.json;完整对比报告:tests/measure/performance-comparison.md。