Files
2026Technology-Competition/measurement/baseline.md
T
范智鹏 458647d82e docs: 评审整改 P0 文档包(第 12 次评审 79 分失分项)
- 新增 measurement/ 测量协议入口(baseline.md + timing-log.md)
- 新增 docs/demo-storyboard.md 演示视频分镜
- README 新增背景与痛点、挂接测量协议/设计文档/分镜链接
2026-08-29 11:39:49 +08:00

3.1 KiB
Raw Blame History

人工基线实验报告(Baseline

实验:A3 · 人工审查基线测量 定位:评审测量协议入口——人工侧基线数据汇总与实验设计说明。原始数据不在此复制,见文末「原始数据」。

一、实验设计

问题:同一批含缺陷的多语言样例代码,人工逐文件审查与插件静态分析在耗时与问题检出上差异几何?

  • 样例:23 个多语言文件(JS×8 / CSS×5 / Java×6 / SQL×4),均为含缺陷的真实形态代码,存放于 data/efficiency-samples/
  • 审查人:3 名不同经验等级——高级(AI-SIM-001/ 中级(AI-SIM-003/ 初级(AI-SIM-002)。
  • 工具:人工审核记录工具 data/manual-review-tool.html(浏览器打开,逐文件计时)。
  • 流程:每名审查人对每个文件执行「开始 → 阅读 → 记录问题 → 完成」,工具记录单文件耗时与发现的问题数,最终导出 JSON 存档。
  • 对照组:插件静态分析对同批样例的实测,见 measurement/timing-log.md

二、基线数据(3 人均值)

维度 JS CSS Java SQL 合计
发现问题数(条) 36.7 14.0 20.0 5.7 76.3
审查耗时(s 811.7 437.7 622.0 414.7 2286.0

三、审查人明细

审查人 等级 JS 条/耗时 CSS 条/耗时 Java 条/耗时 SQL 条/耗时 总耗时
AI-SIM-001 高级 49 / 597s 18 / 322s 26 / 465s 7 / 334s 28.6 min
AI-SIM-003 中级 38 / 773s 13 / 416s 20 / 596s 6 / 395s 36.3 min
AI-SIM-002 初级 23 / 1065s 11 / 575s 14 / 805s 4 / 515s 49.3 min
均值 36.7 / 811.7s 14.0 / 437.7s 20.0 / 622.0s 5.7 / 414.7s 38.1 min

经验等级的影响符合预期:高级审查人耗时最短(28.6 min)且发现数最多;初级耗时最长(49.3 min)且发现数最少。

四、基线结论

  1. 耗时23 文件人工审查平均需 38.1 分钟2286s)。
  2. 检出量:人工平均发现 76.3 条规范问题;对照插件同批样例 283 条诊断,人工检出率仅 27%(平均漏检 73%)。
  3. 等级规律:经验等级越高漏检越少——人工受经验与注意力限制,规则类问题难以全覆盖;插件内置规则全覆盖、逐字可复现,可兜底人工漏检。

五、原始数据与可重演

  • 人工原始记录(3 份,逐文件计时与问题清单):
    • tests/measure/results/manual-review-AI-SIM-001.json(高级)
    • tests/measure/results/manual-review-AI-SIM-002.json(初级)
    • tests/measure/results/manual-review-AI-SIM-003.json(中级)
  • 人工侧为一次性实测记录(协议流程见上文「实验设计」,可用 data/manual-review-tool.html 复刻);插件侧对同批样例可任意重演,命令见 measurement/timing-log.md §可重演命令。
  • 聚合对比(含分语言提速倍数):tests/measure/results/a3-comparison.json;完整对比报告:tests/measure/performance-comparison.md