Files
范智鹏 458647d82e docs: 评审整改 P0 文档包(第 12 次评审 79 分失分项)
- 新增 measurement/ 测量协议入口(baseline.md + timing-log.md)
- 新增 docs/demo-storyboard.md 演示视频分镜
- README 新增背景与痛点、挂接测量协议/设计文档/分镜链接
2026-08-29 11:39:49 +08:00

48 lines
3.1 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 人工基线实验报告(Baseline)
> 实验:A3 · 人工审查基线测量
> 定位:评审测量协议入口——人工侧基线数据汇总与实验设计说明。原始数据不在此复制,见文末「原始数据」。
## 一、实验设计
**问题**:同一批含缺陷的多语言样例代码,人工逐文件审查与插件静态分析在耗时与问题检出上差异几何?
- **样例**23 个多语言文件(JS×8 / CSS×5 / Java×6 / SQL×4),均为含缺陷的真实形态代码,存放于 `data/efficiency-samples/`
- **审查人**:3 名不同经验等级——高级(AI-SIM-001/ 中级(AI-SIM-003/ 初级(AI-SIM-002)。
- **工具**:人工审核记录工具 `data/manual-review-tool.html`(浏览器打开,逐文件计时)。
- **流程**:每名审查人对每个文件执行「开始 → 阅读 → 记录问题 → 完成」,工具记录单文件耗时与发现的问题数,最终导出 JSON 存档。
- **对照组**:插件静态分析对同批样例的实测,见 `measurement/timing-log.md`
## 二、基线数据(3 人均值)
| 维度 | JS | CSS | Java | SQL | 合计 |
|---|---|---|---|---|---|
| 发现问题数(条) | 36.7 | 14.0 | 20.0 | 5.7 | **76.3** |
| 审查耗时(s | 811.7 | 437.7 | 622.0 | 414.7 | **2286.0** |
## 三、审查人明细
| 审查人 | 等级 | JS 条/耗时 | CSS 条/耗时 | Java 条/耗时 | SQL 条/耗时 | 总耗时 |
|---|---|---|---|---|---|---|
| AI-SIM-001 | 高级 | 49 / 597s | 18 / 322s | 26 / 465s | 7 / 334s | 28.6 min |
| AI-SIM-003 | 中级 | 38 / 773s | 13 / 416s | 20 / 596s | 6 / 395s | 36.3 min |
| AI-SIM-002 | 初级 | 23 / 1065s | 11 / 575s | 14 / 805s | 4 / 515s | 49.3 min |
| **均值** | — | **36.7 / 811.7s** | **14.0 / 437.7s** | **20.0 / 622.0s** | **5.7 / 414.7s** | **38.1 min** |
> 经验等级的影响符合预期:高级审查人耗时最短(28.6 min)且发现数最多;初级耗时最长(49.3 min)且发现数最少。
## 四、基线结论
1. **耗时**23 文件人工审查平均需 **38.1 分钟**2286s)。
2. **检出量**:人工平均发现 **76.3 条**规范问题;对照插件同批样例 283 条诊断,人工检出率仅 **27%**(平均漏检 73%)。
3. **等级规律**:经验等级越高漏检越少——人工受经验与注意力限制,规则类问题难以全覆盖;插件内置规则全覆盖、逐字可复现,可兜底人工漏检。
## 五、原始数据与可重演
- 人工原始记录(3 份,逐文件计时与问题清单):
- `tests/measure/results/manual-review-AI-SIM-001.json`(高级)
- `tests/measure/results/manual-review-AI-SIM-002.json`(初级)
- `tests/measure/results/manual-review-AI-SIM-003.json`(中级)
- 人工侧为一次性实测记录(协议流程见上文「实验设计」,可用 `data/manual-review-tool.html` 复刻);插件侧对同批样例可任意重演,命令见 `measurement/timing-log.md` §可重演命令。
- 聚合对比(含分语言提速倍数):`tests/measure/results/a3-comparison.json`;完整对比报告:`tests/measure/performance-comparison.md`