# 人工基线实验报告(Baseline) > 实验:A3 · 人工审查基线测量 > 定位:评审测量协议入口——人工侧基线数据汇总与实验设计说明。原始数据不在此复制,见文末「原始数据」。 ## 一、实验设计 **问题**:同一批含缺陷的多语言样例代码,人工逐文件审查与插件静态分析在耗时与问题检出上差异几何? - **样例**:23 个多语言文件(JS×8 / CSS×5 / Java×6 / SQL×4),均为含缺陷的真实形态代码,存放于 `data/efficiency-samples/`。 - **审查人**:3 名不同经验等级——高级(AI-SIM-001)/ 中级(AI-SIM-003)/ 初级(AI-SIM-002)。 - **工具**:人工审核记录工具 `data/manual-review-tool.html`(浏览器打开,逐文件计时)。 - **流程**:每名审查人对每个文件执行「开始 → 阅读 → 记录问题 → 完成」,工具记录单文件耗时与发现的问题数,最终导出 JSON 存档。 - **对照组**:插件静态分析对同批样例的实测,见 `measurement/timing-log.md`。 ## 二、基线数据(3 人均值) | 维度 | JS | CSS | Java | SQL | 合计 | |---|---|---|---|---|---| | 发现问题数(条) | 36.7 | 14.0 | 20.0 | 5.7 | **76.3** | | 审查耗时(s) | 811.7 | 437.7 | 622.0 | 414.7 | **2286.0** | ## 三、审查人明细 | 审查人 | 等级 | JS 条/耗时 | CSS 条/耗时 | Java 条/耗时 | SQL 条/耗时 | 总耗时 | |---|---|---|---|---|---|---| | AI-SIM-001 | 高级 | 49 / 597s | 18 / 322s | 26 / 465s | 7 / 334s | 28.6 min | | AI-SIM-003 | 中级 | 38 / 773s | 13 / 416s | 20 / 596s | 6 / 395s | 36.3 min | | AI-SIM-002 | 初级 | 23 / 1065s | 11 / 575s | 14 / 805s | 4 / 515s | 49.3 min | | **均值** | — | **36.7 / 811.7s** | **14.0 / 437.7s** | **20.0 / 622.0s** | **5.7 / 414.7s** | **38.1 min** | > 经验等级的影响符合预期:高级审查人耗时最短(28.6 min)且发现数最多;初级耗时最长(49.3 min)且发现数最少。 ## 四、基线结论 1. **耗时**:23 文件人工审查平均需 **38.1 分钟**(2286s)。 2. **检出量**:人工平均发现 **76.3 条**规范问题;对照插件同批样例 283 条诊断,人工检出率仅 **27%**(平均漏检 73%)。 3. **等级规律**:经验等级越高漏检越少——人工受经验与注意力限制,规则类问题难以全覆盖;插件内置规则全覆盖、逐字可复现,可兜底人工漏检。 ## 五、原始数据与可重演 - 人工原始记录(3 份,逐文件计时与问题清单): - `tests/measure/results/manual-review-AI-SIM-001.json`(高级) - `tests/measure/results/manual-review-AI-SIM-002.json`(初级) - `tests/measure/results/manual-review-AI-SIM-003.json`(中级) - 人工侧为一次性实测记录(协议流程见上文「实验设计」,可用 `data/manual-review-tool.html` 复刻);插件侧对同批样例可任意重演,命令见 `measurement/timing-log.md` §可重演命令。 - 聚合对比(含分语言提速倍数):`tests/measure/results/a3-comparison.json`;完整对比报告:`tests/measure/performance-comparison.md`。