评审真实性增强:前端硬规则+人工启动方案+文档-实现三级校验

- 前端存在性硬规则:detectFrontend 源码级判定,web形态无真实前端/不可访问 → 实现完整度封顶50%(CLI/插件豁免)
- verify 多态:build_status 支持 done/failed/done_no_ui,前端按钮新增「无前端」
- 人工启动方案:评审环境自动启动失败 → awaiting_browse 暂停,评委手动启动后填 service_url 走 /verify-browse 恢复(SSRF 信任评委确认地址)
- Gitea 稳定性:clone 自动重试×3(525抖动)+ 每队独立 token 回退(全局账号失效兜底)
- A 阶段报告备份:feature_inventory.__stageA_report 防 B 阶段维度重复累积/A维度丢失
- tryTest 依赖预装:Python 项目自动 pip install(测试不再因缺依赖误判失败)
- 运行验证压缩静态维度:前端缺失+测试失败 → 静态纸面维度封顶50%(防原型拿高分)
- 文档-实现三级校验:claim-consistency 注入运行时证据(构建/测试/前端),识别「代码有但跑不起来」的虚报(逸飞冲天 61%→25%)
- 赛事文档:中期20%+最终80%(AI=人工总分)、评审表/评审规则/赛事说明/07设计同步
- 清空 review_snapshots 测试污染数据,保留当前正式分(零号158/逸飞冲天126)
- 测试 446 全通过(后端435+前端11)
This commit is contained in:
hangshuo652
2026-09-01 08:44:56 +08:00
parent f8b4e9d44d
commit 1b89743d77
43 changed files with 3362 additions and 290 deletions
@@ -283,6 +283,8 @@ A 阶段完成时写入**部分 ai_report**(含 A 维度 + scoreA),`a_done
| `entries` 表 | migration 新增 `score_a REAL DEFAULT 0`、`score_b REAL DEFAULT 0`、`stage_b_status TEXT DEFAULT ''`''=未执行 / done / failed / skipped)、`project_understanding TEXT DEFAULT ''`(§2.7 项目理解文档 JSON,A 每次重评覆盖) |
| `review_snapshots` | migration 新增 `score REAL`(含迟交扣分的 final_score,多次评审聚合用,2026-08-19 |
| `entries` 表 | migration 新增 `benchmark_json TEXT DEFAULT ''`(决赛圈基准证据按 entry 落库,2026-08-19 |
| `entries` 表 | migration 新增 `feature_inventory TEXT DEFAULT ''`(全量功能发现结果 JSON 数组,2026-08-27 |
| `ai_report.dimensions[n]` | 实现类维度子 Agent 返回的定向追踪 `checks` 数组(feature/entry/depth/evidence/reason2026-08-27 P1 修正) |
| `standards.max_score` | **不改**(仅上传校验上限,非实际满分,不影响出分) |
## 4. 影响面
@@ -0,0 +1,89 @@
# 07 人工评审设计方案
> 版本:2026-08-31
> 状态:设计定稿
> 关联:AI 评审机制(`docs/AI评审机制说明.md`
## 1. 背景与定位
技术大赛分**中期评价**与**最终评价**两个阶段,成绩按 **2:8** 加权合成。最终评价阶段采用 **AI 评审 + 人工评审双轨制**:发表会上各参赛队伍通过 PPT、视频、现场讲解对项目进行说明与演示,人工评审据此进行独立评分。中期评价仅由 AI 完成,不涉及人工评审。
**AI 与人工的定位**
| 评委 | 负责 | 无法覆盖 |
|:-----|:-----|:--------|
| AI 评审(独立评委)| 静态真伪:代码、构建、测试、功能发现、文档一致性 | 演示表达、口头答辩、专家判断 |
| 人工评审(独立评委)| 发表会表现:演示、答辩、创新价值、AI 过程可信度 | 全量代码审查 |
两者**完全独立评分**(人工不覆盖 AI 分、不设 AI 争议复核维),最终**直接相加**成总分。
## 2. 总分构成
| 阶段 | 权重 | 评审方式 |
|:-----|:---:|:---------|
| **中期评价** | 20% | **仅 AI 评审**(无人工)|
| **最终评价** | 80% | AI 评审 + 人工评审 |
**最终成绩 = 中期评价(20%)+ 最终评价(80%)**
| 赛道 | AI 评审 | 人工评审 | 最终小计 |
|:----:|:------:|:------:|:------:|
| 赛道一 | 12维 / 200 | 8维 / 200 | 400 |
| 赛道二 | 8维 / 100 | 6维 / 100 | 200 |
**最终小计 = AI 分 + 人工分**(直接相加)。**AI 与人工总分一致**(赛道一各 200、赛道二各 100)。人工评审由 5 名评委独立打分取平均。
## 3. 人工评审维度设计原则
1. **真实性维度占比压低**:发表会无现场演示环节(仅 PPT/视频/讲解),真实度不好评价——现场真实性维度占比两赛道均控制在 **10%**
2. **全维度分值 ≥5**:避免出现 2/3 分的琐碎维度,保证每个维度有实际考察分量。
3. **按赛道差异化**:赛道一聚焦 AI 协作过程(Agent 开发核心),赛道二聚焦提效验证(IDE 提效核心)。
4. **剔除不可靠评价项**:团队协作(无法从发表会证明)、产品体验(无法现场体验)不纳入。
## 4. 赛道一:人工评审(8 维 / 200 分)
| # | 维度 | 分值 | 采分点 |
|:-:|:-----|:----:|:-------|
| 1 | 现场真实性验证 | 20 | 视频/提交核验:功能展示与提交代码一致、数据可信 |
| 2 | 演示完整性 | 30 | 核心功能是否展示到位、覆盖 README 声称功能 |
| 3 | **AI 协作真实性** | 40 | 讲解的 AI 使用过程 vs 提交的 AI 日志吻合;人主导 + AI 辅助 |
| 4 | **AI 工具链理解** | 30 | 对 Agent 架构、LLM 调用、工具选择/降级的口头理解深度 |
| 5 | 答辩与技术深度 | 40 | 实现原理理解、架构讲解、对评委质疑的回应质量 |
| 6 | 演示与表达 | 20 | PPT 质量、讲解逻辑、语言清晰、时间控制 |
| 7 | 创新与价值 | 10 | 场景真实价值、Agent 不可替代性、技术先进性 |
| 8 | 问题与改进意识 | 10 | 主动讲局限、改进计划、对评审意见的接纳 |
| | **合计** | **200** | |
## 5. 赛道二:人工评审(6 维 / 100 分)
| # | 维度 | 分值 | 采分点 |
|:-:|:-----|:----:|:-------|
| 1 | 现场真实性验证 | 10 | 视频/提交核验:IDE 集成展示与提交一致、数据可信 |
| 2 | 演示完整性 | 20 | 核心集成场景是否展示到位 |
| 3 | **提效验证** | 30 | 提效幅度有真实对比数据支撑、基准可信 |
| 4 | 答辩与技术深度 | 20 | IDE 集成技术原理(LSP/Webview/命令等)、质疑回应 |
| 5 | 演示与表达 | 10 | PPT、讲解、时间控制 |
| 6 | 创新与价值 | 10 | 场景价值、提效价值、ROI |
| | **合计** | **100** | |
## 6. 赛道差异说明
| 差异点 | 赛道一 | 赛道二 |
|:------|:-------|:-------|
| 核心考察 | AI 协作过程真实性 | 提效验证 |
| 专属维度 | AI 协作真实性(40) + AI 工具链理解(30) | 提效验证(30) |
| 总分制 | 200(与 AI 一致)| 100(与 AI 一致)|
## 7. 实施要点(待后续实现)
- **评分录入**:发表会后评委按维度打分表录入(前端表单)。
- **数据落库**:新增人工评审记录表(entry_id、赛道、各维度分、评委、发表会日期)。
- **总分合成**:最终成绩 = 中期 AI(20%)+ 最终(AI + 人工)(80%);人工取 5 名评委平均分。
- **展示**:前端发表会评分页 + 详情页显示中期 AI 分、最终 AI 分/人工分、最终成绩。
- **PDF 报告**:评审报告增加中期评价与人工评审部分。
## 8. 已知边界
1. 人工评审的"现场真实性"因无现场演示,仅能核验视频/PPT 与提交一致性,**无法完全验证 demo 真伪**——故占比仅 10%。
2. 人工评分受评委主观性影响,采用 **5 名评委独立打分取平均**缓解。
3. 最终成绩由中期 AI(20%)+ 最终 AI/人工(80%)加权合成,AI 与人工在最终评价中占比相同;权重比例需在试运行后校准。