Files
范智鹏 3280836124 data: A3 提效对比实验数据(23 样例 + 人工基线 + 插件实测,整体提速约 266 倍)
- data/efficiency-samples/ 23 个多语言样例 + data/manual-review-tool.html 人工审核工具
- tests/measure/measure-plugin-samples.mjs 四语言插件侧测量脚本
- tests/measure/compare-a3.mjs 聚合对比 + results(插件实测/人工基线/comparison)
- performance-comparison.md 填实基线对比与结论;README 效果总结由占位改为真实数据
2026-08-27 22:54:07 +08:00

67 lines
4.3 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 提效对比报告(基线 vs 提效后)
> 实验:A3 人工审核 vs 插件审核(23 个多语言样例,`data/efficiency-samples/`
> 实验工具:`data/manual-review-tool.html`(人工审核记录工具)+ `tests/measure/measure-plugin-samples.mjs`(插件侧测量)
## 一、测量方法
**场景**:对同一批样例代码进行代码规范审查,比较人工审查与插件静态分析两种方式的耗时与产出。
- **基线(人工审查)**:3 名不同经验等级审查人(高级/中级/初级)使用人工审核记录工具 `data/manual-review-tool.html` 逐文件「开始 → 阅读 → 记录问题 → 完成」计时,导出 JSON(`tests/measure/results/manual-review-*.json`)。
- **提效后(插件静态分析)**:使用与插件内置配置逐字一致的 ESLint / Stylelint 引擎、与 pmd.ts 一致的 `PmdRunner`pmd-java-ruleset.xml)、与 sqlfluff.ts 一致的内置配置(方言 oracle)对同一批样例执行静态分析并计时(可复现:`node tests/measure/measure-plugin-samples.mjs`)。
> 样例均为含缺陷的多语言代码(JS×8 / CSS×5 / Java×6 / SQL×4),来源与人工审核工具内嵌数据一致。
## 二、对比维度
| 维度 | 基线(人工审查,3 人均值) | 提效后(插件静态分析) |
|---|---|---|
| 审查耗时 | 38.1 分钟(2286s23 文件) | 8.6 秒(8576.8ms23 文件) |
| 发现规范问题数 | 76 条(受经验与注意力影响,漏检率高) | 283 条(内置规则全覆盖) |
| 检出率(对照插件全量) | 27%(平均漏检 73% | 100% |
| 可重复性 | 低(因人而异、难以逐字复现) | 高(同配置逐字可复现) |
## 三、插件侧实测数据(脚本产出)
> 运行:`node tests/measure/measure-plugin-samples.mjs`,结果另存 `tests/measure/results/a3-plugin-results.json`。
> 实测日期:2026-08-27。
| 语言 | 文件数 | 诊断数 | 耗时 |
|---|---|---|---|
| JS | 8 | 120 | 95.1ms |
| CSS | 5 | 55 | 129.3ms |
| Java | 6 | 84 | 6610.7ms(含 JVM 启动) |
| SQL | 4 | 24 | 1741.7ms(含子进程启动) |
| **合计** | **23** | **283** | **8576.8ms** |
## 四、人工基线实测数据
> 工具:`data/manual-review-tool.html`;原始记录见 `tests/measure/results/manual-review-AI-SIM-00X.json`。
| 审查人 | 等级 | JS 条/耗时 | CSS 条/耗时 | Java 条/耗时 | SQL 条/耗时 | 总耗时 |
|---|---|---|---|---|---|---|
| AI-SIM-001 | 高级 | 49 / 597s | 18 / 322s | 26 / 465s | 7 / 334s | 28.6 min |
| AI-SIM-003 | 中级 | 38 / 773s | 13 / 416s | 20 / 596s | 6 / 395s | 36.3 min |
| AI-SIM-002 | 初级 | 23 / 1065s | 11 / 575s | 14 / 805s | 4 / 515s | 49.3 min |
| **均值** | — | **36.7 / 811.7s** | **14.0 / 437.7s** | **20.0 / 622.0s** | **5.7 / 414.7s** | **38.1 min** |
> 经验等级对检出于耗时的影响符合预期:高级审查人耗时最短(28.6 min)但发现数最多;初级耗时最长(49.3 min)且发现数最少。
## 五、提效对比与结论
| 语言 | 人工问题数(均值) | 插件诊断数 | 人工检出率 | 人工耗时(均值) | 插件耗时 | 提速倍数 |
|---|---|---|---|---|---|---|
| JS | 36.7 | 120 | 31% | 811.7s | 95.1ms | 约 8500× |
| CSS | 14.0 | 55 | 25% | 437.7s | 129.3ms | 约 3400× |
| Java | 20.0 | 84 | 24% | 622.0s | 6610.7ms | 约 94× |
| SQL | 5.7 | 24 | 24% | 414.7s | 1741.7ms | 约 238× |
| **合计** | **76.3** | **283** | **27%** | **2286s** | **8576.8ms** | **约 266×** |
**结论**
1. **提效显著**:23 文件多语言审查,插件静态分析 8.6 秒完成,人工平均需 38.1 分钟,整体提速约 **266 倍**(纯静态分析语言提速 3400× 以上,含子进程/JVM 启动的 Java/SQL 提速约 94238 倍)。
2. **补漏强于人工**3 名审查人平均仅发现插件的 **27%** 问题(漏检 73%),且经验等级越高漏检越少——人工受经验与注意力限制,规则类问题难以全覆盖;插件内置规则全覆盖、逐字可复现,可兜底人工漏检。
3. **可复现性**:插件侧同配置任意环境可复现同一结果;人工审查因人而异,无法逐字复现。
> 完整对比数据:`tests/measure/results/a3-comparison.json`;插件侧明细:`tests/measure/results/a3-plugin-results.json`;人工原始记录:`tests/measure/results/manual-review-AI-SIM-00X.json`。