Files
hangshuo652 6a2419d4a4 L2考核落地:人才测评整合为L2考核track,新增查重初筛与e2e验证
- 新增 L2考核 track(7维标准/100分):选题难度赋分cap、功能完整性地板线、合格判定
- 人才测评整合进 L2考核:移除 L2/L3 两级认定与 question_id 机制
- 新增 l2-topics 选题元数据服务与 config/l2-topics.json(11命题题+自选题)
- 新增查重初筛 plagiarism-detect(MD5精确比对+归一化相似度+提交行为,仅告警)
- 修复 L2 维度 DIM_FILE_FILTERS 缺失导致 AI 协作记录证据漏喂
- e2e:修复 Windows spawn、DB 隔离,L2 用例 27 项全绿
2026-08-23 20:58:56 +08:00

211 lines
12 KiB
JSON
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
{
"version": "2026-08-23",
"note": "L2考核选题元数据。maxScoreCap=共通100分+难度赋分;funcBreakdown 为功能完整性30分的题目专属拆分,注入该维度子Agent promptacceptance 为验收基准要点;sampleData 为题目专属样本数据要求。",
"selfTopic": {
"id": "self",
"title": "自选题",
"difficulty": 0,
"maxScoreCap": 100,
"minTests": 3,
"funcBreakdown": "按 README 声明且不低于登记范围的功能清单逐项核对:核心闭环(输入处理→核心逻辑→结果呈现)完整性与各模块实现质量综合评定",
"acceptance": [
"功能模块≥3个(用户可感知的独立功能单元,工具函数与界面装饰不计)",
"整体规模明显超出单脚本范畴(通常数百行及以上)",
"README 功能声明不得低于事前登记范围的核心功能,未经登记更新的缩减按未实现计"
],
"sampleData": "全部数据须脱敏或虚构,禁止真实业务/客户数据"
},
"topics": [
{
"id": "01",
"title": "年度满意度调查数据的自动处理与分析",
"group": "business",
"difficulty": 2,
"maxScoreCap": 100,
"minTests": 3,
"funcBreakdown": "模板管理5分(上传+自动识别+确认)/ 数据导入与统计10分(导入+多维度统计+年度对比)/ 权限区分5分(两种角色隔离)/ 看板展示5分(图表+下钻)/ 智能分析5分(薄弱维度识别+改善建议)",
"acceptance": [
"模板可变应对:样本模板A正确解析为合格线,列名/列数不同的模板B也能解析为满分",
"统计正确性:小样本手算结果与系统一致,小数位规则统一定义且可对齐",
"年度对比:2年维度名不同仍能正确对齐",
"权限隔离:部门管理员不可查看其他部门明细,实现方式在AGENTS.md说明",
"分析深度:识别得分最低维度为合格线,识别下降趋势+给出可量化改善建议为满分"
],
"sampleData": "至少2个年度模拟Excel(多Sheet),含正常数据与边界数据(空值/重复/维度名不一致/评分越界等)"
},
{
"id": "02",
"title": "年度面谈问卷生成与数据分析",
"group": "business",
"difficulty": 3,
"maxScoreCap": 105,
"minTests": 3,
"funcBreakdown": "规则配置与低分识别10分 / 面谈问卷生成10分 / 面谈数据导入5分 / 看板展示5分(智能分析分数含在上述各项中不单独计分)",
"acceptance": [
"低分规则至少2种可配置(绝对阈值/前年比下降/部门特异性,建议3种),支持组合与预览判断理由",
"问卷基于低分维度生成,内容可编辑;按部门/职级定制为满分项",
"话题分类:10条标注样本准确率≥60%合格线、≥80%满分(口径自定须在设计文档写明)",
"共性问题提取:植入5个高频话题检出≥3个合格线",
"改善建议针对具体部门、可量化可执行"
],
"sampleData": "至少2个年度满意度调查Excel + 至少30条面谈记录(覆盖5个话题分类、3个部门)"
},
{
"id": "03",
"title": "人事制度RAG检索系统",
"group": "business",
"difficulty": 4,
"maxScoreCap": 110,
"minTests": 5,
"funcBreakdown": "必达25分:文档上传与解析5 / 基础检索10 / 无法回答处理5 / 追问5。加分5分任选其一:检索策略切换 / 检索质量可视化 / Chunk管理 / 制度间关联 / 分析看板(多项实现仍计5分,深度可在其他维度体现)",
"acceptance": [
"基础检索:5个已知答案问题命中≥3个合格线、5个全中带精确出处为满分",
"无法回答检测:无关问题明确表示无法回答、不编造",
"出处引用:文档名/章节/页码(Word无页码用章节+段落序号)真实可定位",
"追问:至少1次连续追问保持上下文",
"中日文混合检索:同一提问可含中日文混用",
"评分型指标口径自定但须在设计文档写明"
],
"sampleData": "至少3份模拟制度文档(中/日文各≥1份),多级章节结构,含可关联交叉引用"
},
{
"id": "04",
"title": "合同智能审查",
"group": "business",
"difficulty": 3,
"maxScoreCap": 105,
"minTests": 5,
"funcBreakdown": "合同上传与信息提取5 / 审查等级判断5 / 条款提取与风险标记10 / 审批流程5 / 盖章审批5(签约到期提醒、分析报告分数含在上述各项中)",
"acceptance": [
"信息提取:名称/签约方/金额/签订日期/合同类型/有效期等字段正确",
"审查等级:按金额阈值(<10万简易/≥10万且<100万标准/≥100万严格-律师模拟邮件)判断正确",
"风险标记:违约金过高(>20%基线)、管辖地不利等不利条款标记,阈值在规则库显式定义可调整",
"审批流程:等级不同审批路径不同,审查完成自动通知发起人(模拟即可)",
"到期管理:距到期≤30天标识待续签、已过期状态正确"
],
"sampleData": "至少5份模拟合同PDF(含正常与有问题合同、不同金额场景),必须含「距到期日≤30天」与「已过期」样本各≥1份"
},
{
"id": "05",
"title": "法规信息自动收集爬虫",
"group": "business",
"difficulty": 3,
"maxScoreCap": 105,
"minTests": 3,
"funcBreakdown": "数据源管理5 / 信息自动收集10 / 增量采集5 / 结果展示5 / 定期报告5",
"acceptance": [
"增量采集:同一内容不重复采集,更新后能再次采集",
"内容提取:法规名称/发布机关/发布日期/施行日期/发布类型/摘要/原文链接正确提取",
"关键词筛选:包含词+排除词组合筛选正确,影响度三级可区分",
"错误处理:无效URL记录日志、重试后跳过不影响其他数据源",
"定时调度以配置项或计划任务形式体现即可,验收允许手动触发",
"影响度评估口径自定须在设计文档写明,ground truth 标注清单格式规范随样本提交"
],
"sampleData": "至少3个不同结构的模拟目标网页HTML"
},
{
"id": "06",
"title": "外部环境风险信息的自动收集与分析",
"group": "business",
"difficulty": 3,
"maxScoreCap": 105,
"minTests": 3,
"funcBreakdown": "信息源管理5 / 自动信息收集5 / 增量采集5 / 智能分类10 / 风险仪表盘5",
"acceptance": [
"多源采集:至少2种信息源类型(RSS/网页/API",
"风险分类:5领域分类准确率≥50%合格线、≥80%满分(20条标注测试数据)",
"影响度评估:高/中/低可区分,与标注一致率≥65%",
"全局关键词:高关注/普通两级,包含排除规则同时生效",
"定期报告:Markdown日报/周报自动生成、历史可查,趋势基于≥2个时间周期数据对比"
],
"sampleData": "模拟信息源HTML/RSS≥3个(覆盖不同风险领域),条目含不同发布日期以支撑趋势;API源附mock脚本"
},
{
"id": "07",
"title": "需求文档AI评审工具",
"group": "review-tool",
"difficulty": 3,
"maxScoreCap": 105,
"minTests": 3,
"funcBreakdown": "文档导入与解析4 / 歧义检测8 / 一致性检查5 / 编写规范检查5 / 可测试性评估4 / 评审报告与规则外置4",
"acceptance": [
"歧义检测:植入10处歧义词检出≥6处合格线,全检且误报≤2为满分",
"矛盾检测:植入2组矛盾至少检出1组,报告引用双方条目原文",
"可测试性评估:正确标识植入的不可测试需求并附改写建议",
"编写规范检查:基于《需求文档编写标准》配置执行,标准A/B两套切换检出结果变化",
"证据型报告:每个问题定位到章节编号并摘录原文,Critical/Major/Minor分级+通过结论",
"规则外置:检查规则在独立配置文件维护,不改代码可增改"
],
"sampleData": "2份模拟需求说明书(1正常约10条编号需求;1植入≥20处已知问题)+ 缺陷标注清单 + 标准配置A/B两套"
},
{
"id": "08",
"title": "设计书AI评审工具",
"group": "review-tool",
"difficulty": 4,
"maxScoreCap": 110,
"minTests": 3,
"funcBreakdown": "导入与解析5 / 规范符合性检查5 / 需求追溯矩阵10 / 接口一致性检查5 / 矩阵可视化与报告5",
"acceptance": [
"必备章节检查:配置的必备章节缺失全部检出,附应包含内容提示",
"追溯矩阵:10条需求正确建立≥8条映射合格线,未覆盖需求与孤儿设计两类均能标出",
"接口一致性:植入2处矛盾至少检出1处并引用双方定义原文",
"文档格式规范:《设计书格式标准》A/B两套切换检出结果变化",
"证据型报告:分级+定位+通过结论,矩阵表格可视化"
],
"sampleData": "需求清单1份(10条编号需求)+ 模拟设计书1份(植入章节缺失×2、未覆盖×2、孤儿设计×1、接口矛盾×2、格式违规≥2处)+ 缺陷标注清单 + 格式标准A/B两套"
},
{
"id": "09",
"title": "代码AI评审工具",
"group": "review-tool",
"difficulty": 3,
"maxScoreCap": 105,
"minTests": 3,
"funcBreakdown": "扫描配置与执行3 / secrets检测6 / LLM调用专项检查7 / 空值防护检查5 / 编码规约检查4 / 报告与门禁5",
"acceptance": [
"secrets检测:植入8处硬编码密钥检出≥6处合格线,误报≤1为满分",
"LLM调用检查:无保护的LLM调用100%标记,完全无保护Critical/仅缺降级Major",
"空值防护:典型裸访问模式检出率≥70%",
"编码规约:《编码规约》A/B两套切换检出结果变化,条款全部外置不得硬编码",
"证据型报告:定位到 文件名:行号,Critical/Major附修复示例代码,存在Critical输出不通过"
],
"sampleData": "小型模拟项目代码包(≥10个源码文件,植入硬编码密钥×8、LLM无保护×3、空值裸访问×4、规约违规×4)+ 缺陷标注清单 + 规约A/B两套"
},
{
"id": "10",
"title": "测试用例AI评审工具",
"group": "review-tool",
"difficulty": 4,
"maxScoreCap": 110,
"minTests": 3,
"funcBreakdown": "测试集导入与解析3 / 需求覆盖分析7 / 断言强度审查9 / 边界完整性提示2 / 基准符合性检查4 / 质量评级报告5",
"acceptance": [
"覆盖缺口:10条需求中正确找出未覆盖需求≥7条合格线、全部且无误报为满分",
"弱断言检测:植入8个弱断言检出≥5个合格线、≥7个且无误报为满分",
"无断言测试:100%标记并附最小断言补充建议",
"基准符合性:《测试基准》A/B两套切换检出结果变化,覆盖阈值可配置",
"质量评级:每用例A/B/C评级,C级附针对性改进建议"
],
"sampleData": "需求清单1份(10条编号需求)+ 测试代码集(≥20个用例,植入无断言×3、弱断言×8、要素缺失或命名违规×3)+ 缺陷标注清单 + 基准A/B两套"
},
{
"id": "11",
"title": "成果物AI评审工具",
"group": "review-tool",
"difficulty": 2,
"maxScoreCap": 100,
"minTests": 3,
"funcBreakdown": "成果物清单配置5 / 存在性核对8 / 要素齐全性检查8 / 交叉一致性检查5 / 准入报告与结论4",
"acceptance": [
"存在性核对:植入的3处缺失文件全部检出,逐项核对表清晰",
"要素齐全检查:README缺失要素正确检出,同义词扩展命中(安装vs部署)",
"交叉一致性:README技术栈声明 vs 实际依赖文件不一致处检出并引用双方内容",
"清单可切换:加载另一套清单模板正常工作",
"准入结论:Critical缺失(如源代码缺失)直接判定不通过"
],
"sampleData": "残缺模拟项目提交包(故意缺文件、README缺要素、技术栈声明与依赖不一致)+ 缺陷标注清单 + 备用清单模板一套"
}
]
}