- 新增 L2考核 track(7维标准/100分):选题难度赋分cap、功能完整性地板线、合格判定 - 人才测评整合进 L2考核:移除 L2/L3 两级认定与 question_id 机制 - 新增 l2-topics 选题元数据服务与 config/l2-topics.json(11命题题+自选题) - 新增查重初筛 plagiarism-detect(MD5精确比对+归一化相似度+提交行为,仅告警) - 修复 L2 维度 DIM_FILE_FILTERS 缺失导致 AI 协作记录证据漏喂 - e2e:修复 Windows spawn、DB 隔离,L2 用例 27 项全绿
211 lines
12 KiB
JSON
211 lines
12 KiB
JSON
{
|
||
"version": "2026-08-23",
|
||
"note": "L2考核选题元数据。maxScoreCap=共通100分+难度赋分;funcBreakdown 为功能完整性30分的题目专属拆分,注入该维度子Agent prompt;acceptance 为验收基准要点;sampleData 为题目专属样本数据要求。",
|
||
"selfTopic": {
|
||
"id": "self",
|
||
"title": "自选题",
|
||
"difficulty": 0,
|
||
"maxScoreCap": 100,
|
||
"minTests": 3,
|
||
"funcBreakdown": "按 README 声明且不低于登记范围的功能清单逐项核对:核心闭环(输入处理→核心逻辑→结果呈现)完整性与各模块实现质量综合评定",
|
||
"acceptance": [
|
||
"功能模块≥3个(用户可感知的独立功能单元,工具函数与界面装饰不计)",
|
||
"整体规模明显超出单脚本范畴(通常数百行及以上)",
|
||
"README 功能声明不得低于事前登记范围的核心功能,未经登记更新的缩减按未实现计"
|
||
],
|
||
"sampleData": "全部数据须脱敏或虚构,禁止真实业务/客户数据"
|
||
},
|
||
"topics": [
|
||
{
|
||
"id": "01",
|
||
"title": "年度满意度调查数据的自动处理与分析",
|
||
"group": "business",
|
||
"difficulty": 2,
|
||
"maxScoreCap": 100,
|
||
"minTests": 3,
|
||
"funcBreakdown": "模板管理5分(上传+自动识别+确认)/ 数据导入与统计10分(导入+多维度统计+年度对比)/ 权限区分5分(两种角色隔离)/ 看板展示5分(图表+下钻)/ 智能分析5分(薄弱维度识别+改善建议)",
|
||
"acceptance": [
|
||
"模板可变应对:样本模板A正确解析为合格线,列名/列数不同的模板B也能解析为满分",
|
||
"统计正确性:小样本手算结果与系统一致,小数位规则统一定义且可对齐",
|
||
"年度对比:2年维度名不同仍能正确对齐",
|
||
"权限隔离:部门管理员不可查看其他部门明细,实现方式在AGENTS.md说明",
|
||
"分析深度:识别得分最低维度为合格线,识别下降趋势+给出可量化改善建议为满分"
|
||
],
|
||
"sampleData": "至少2个年度模拟Excel(多Sheet),含正常数据与边界数据(空值/重复/维度名不一致/评分越界等)"
|
||
},
|
||
{
|
||
"id": "02",
|
||
"title": "年度面谈问卷生成与数据分析",
|
||
"group": "business",
|
||
"difficulty": 3,
|
||
"maxScoreCap": 105,
|
||
"minTests": 3,
|
||
"funcBreakdown": "规则配置与低分识别10分 / 面谈问卷生成10分 / 面谈数据导入5分 / 看板展示5分(智能分析分数含在上述各项中不单独计分)",
|
||
"acceptance": [
|
||
"低分规则至少2种可配置(绝对阈值/前年比下降/部门特异性,建议3种),支持组合与预览判断理由",
|
||
"问卷基于低分维度生成,内容可编辑;按部门/职级定制为满分项",
|
||
"话题分类:10条标注样本准确率≥60%合格线、≥80%满分(口径自定须在设计文档写明)",
|
||
"共性问题提取:植入5个高频话题检出≥3个合格线",
|
||
"改善建议针对具体部门、可量化可执行"
|
||
],
|
||
"sampleData": "至少2个年度满意度调查Excel + 至少30条面谈记录(覆盖5个话题分类、3个部门)"
|
||
},
|
||
{
|
||
"id": "03",
|
||
"title": "人事制度RAG检索系统",
|
||
"group": "business",
|
||
"difficulty": 4,
|
||
"maxScoreCap": 110,
|
||
"minTests": 5,
|
||
"funcBreakdown": "必达25分:文档上传与解析5 / 基础检索10 / 无法回答处理5 / 追问5。加分5分任选其一:检索策略切换 / 检索质量可视化 / Chunk管理 / 制度间关联 / 分析看板(多项实现仍计5分,深度可在其他维度体现)",
|
||
"acceptance": [
|
||
"基础检索:5个已知答案问题命中≥3个合格线、5个全中带精确出处为满分",
|
||
"无法回答检测:无关问题明确表示无法回答、不编造",
|
||
"出处引用:文档名/章节/页码(Word无页码用章节+段落序号)真实可定位",
|
||
"追问:至少1次连续追问保持上下文",
|
||
"中日文混合检索:同一提问可含中日文混用",
|
||
"评分型指标口径自定但须在设计文档写明"
|
||
],
|
||
"sampleData": "至少3份模拟制度文档(中/日文各≥1份),多级章节结构,含可关联交叉引用"
|
||
},
|
||
{
|
||
"id": "04",
|
||
"title": "合同智能审查",
|
||
"group": "business",
|
||
"difficulty": 3,
|
||
"maxScoreCap": 105,
|
||
"minTests": 5,
|
||
"funcBreakdown": "合同上传与信息提取5 / 审查等级判断5 / 条款提取与风险标记10 / 审批流程5 / 盖章审批5(签约到期提醒、分析报告分数含在上述各项中)",
|
||
"acceptance": [
|
||
"信息提取:名称/签约方/金额/签订日期/合同类型/有效期等字段正确",
|
||
"审查等级:按金额阈值(<10万简易/≥10万且<100万标准/≥100万严格-律师模拟邮件)判断正确",
|
||
"风险标记:违约金过高(>20%基线)、管辖地不利等不利条款标记,阈值在规则库显式定义可调整",
|
||
"审批流程:等级不同审批路径不同,审查完成自动通知发起人(模拟即可)",
|
||
"到期管理:距到期≤30天标识待续签、已过期状态正确"
|
||
],
|
||
"sampleData": "至少5份模拟合同PDF(含正常与有问题合同、不同金额场景),必须含「距到期日≤30天」与「已过期」样本各≥1份"
|
||
},
|
||
{
|
||
"id": "05",
|
||
"title": "法规信息自动收集爬虫",
|
||
"group": "business",
|
||
"difficulty": 3,
|
||
"maxScoreCap": 105,
|
||
"minTests": 3,
|
||
"funcBreakdown": "数据源管理5 / 信息自动收集10 / 增量采集5 / 结果展示5 / 定期报告5",
|
||
"acceptance": [
|
||
"增量采集:同一内容不重复采集,更新后能再次采集",
|
||
"内容提取:法规名称/发布机关/发布日期/施行日期/发布类型/摘要/原文链接正确提取",
|
||
"关键词筛选:包含词+排除词组合筛选正确,影响度三级可区分",
|
||
"错误处理:无效URL记录日志、重试后跳过不影响其他数据源",
|
||
"定时调度以配置项或计划任务形式体现即可,验收允许手动触发",
|
||
"影响度评估口径自定须在设计文档写明,ground truth 标注清单格式规范随样本提交"
|
||
],
|
||
"sampleData": "至少3个不同结构的模拟目标网页HTML"
|
||
},
|
||
{
|
||
"id": "06",
|
||
"title": "外部环境风险信息的自动收集与分析",
|
||
"group": "business",
|
||
"difficulty": 3,
|
||
"maxScoreCap": 105,
|
||
"minTests": 3,
|
||
"funcBreakdown": "信息源管理5 / 自动信息收集5 / 增量采集5 / 智能分类10 / 风险仪表盘5",
|
||
"acceptance": [
|
||
"多源采集:至少2种信息源类型(RSS/网页/API)",
|
||
"风险分类:5领域分类准确率≥50%合格线、≥80%满分(20条标注测试数据)",
|
||
"影响度评估:高/中/低可区分,与标注一致率≥65%",
|
||
"全局关键词:高关注/普通两级,包含排除规则同时生效",
|
||
"定期报告:Markdown日报/周报自动生成、历史可查,趋势基于≥2个时间周期数据对比"
|
||
],
|
||
"sampleData": "模拟信息源HTML/RSS≥3个(覆盖不同风险领域),条目含不同发布日期以支撑趋势;API源附mock脚本"
|
||
},
|
||
{
|
||
"id": "07",
|
||
"title": "需求文档AI评审工具",
|
||
"group": "review-tool",
|
||
"difficulty": 3,
|
||
"maxScoreCap": 105,
|
||
"minTests": 3,
|
||
"funcBreakdown": "文档导入与解析4 / 歧义检测8 / 一致性检查5 / 编写规范检查5 / 可测试性评估4 / 评审报告与规则外置4",
|
||
"acceptance": [
|
||
"歧义检测:植入10处歧义词检出≥6处合格线,全检且误报≤2为满分",
|
||
"矛盾检测:植入2组矛盾至少检出1组,报告引用双方条目原文",
|
||
"可测试性评估:正确标识植入的不可测试需求并附改写建议",
|
||
"编写规范检查:基于《需求文档编写标准》配置执行,标准A/B两套切换检出结果变化",
|
||
"证据型报告:每个问题定位到章节编号并摘录原文,Critical/Major/Minor分级+通过结论",
|
||
"规则外置:检查规则在独立配置文件维护,不改代码可增改"
|
||
],
|
||
"sampleData": "2份模拟需求说明书(1正常约10条编号需求;1植入≥20处已知问题)+ 缺陷标注清单 + 标准配置A/B两套"
|
||
},
|
||
{
|
||
"id": "08",
|
||
"title": "设计书AI评审工具",
|
||
"group": "review-tool",
|
||
"difficulty": 4,
|
||
"maxScoreCap": 110,
|
||
"minTests": 3,
|
||
"funcBreakdown": "导入与解析5 / 规范符合性检查5 / 需求追溯矩阵10 / 接口一致性检查5 / 矩阵可视化与报告5",
|
||
"acceptance": [
|
||
"必备章节检查:配置的必备章节缺失全部检出,附应包含内容提示",
|
||
"追溯矩阵:10条需求正确建立≥8条映射合格线,未覆盖需求与孤儿设计两类均能标出",
|
||
"接口一致性:植入2处矛盾至少检出1处并引用双方定义原文",
|
||
"文档格式规范:《设计书格式标准》A/B两套切换检出结果变化",
|
||
"证据型报告:分级+定位+通过结论,矩阵表格可视化"
|
||
],
|
||
"sampleData": "需求清单1份(10条编号需求)+ 模拟设计书1份(植入章节缺失×2、未覆盖×2、孤儿设计×1、接口矛盾×2、格式违规≥2处)+ 缺陷标注清单 + 格式标准A/B两套"
|
||
},
|
||
{
|
||
"id": "09",
|
||
"title": "代码AI评审工具",
|
||
"group": "review-tool",
|
||
"difficulty": 3,
|
||
"maxScoreCap": 105,
|
||
"minTests": 3,
|
||
"funcBreakdown": "扫描配置与执行3 / secrets检测6 / LLM调用专项检查7 / 空值防护检查5 / 编码规约检查4 / 报告与门禁5",
|
||
"acceptance": [
|
||
"secrets检测:植入8处硬编码密钥检出≥6处合格线,误报≤1为满分",
|
||
"LLM调用检查:无保护的LLM调用100%标记,完全无保护Critical/仅缺降级Major",
|
||
"空值防护:典型裸访问模式检出率≥70%",
|
||
"编码规约:《编码规约》A/B两套切换检出结果变化,条款全部外置不得硬编码",
|
||
"证据型报告:定位到 文件名:行号,Critical/Major附修复示例代码,存在Critical输出不通过"
|
||
],
|
||
"sampleData": "小型模拟项目代码包(≥10个源码文件,植入硬编码密钥×8、LLM无保护×3、空值裸访问×4、规约违规×4)+ 缺陷标注清单 + 规约A/B两套"
|
||
},
|
||
{
|
||
"id": "10",
|
||
"title": "测试用例AI评审工具",
|
||
"group": "review-tool",
|
||
"difficulty": 4,
|
||
"maxScoreCap": 110,
|
||
"minTests": 3,
|
||
"funcBreakdown": "测试集导入与解析3 / 需求覆盖分析7 / 断言强度审查9 / 边界完整性提示2 / 基准符合性检查4 / 质量评级报告5",
|
||
"acceptance": [
|
||
"覆盖缺口:10条需求中正确找出未覆盖需求≥7条合格线、全部且无误报为满分",
|
||
"弱断言检测:植入8个弱断言检出≥5个合格线、≥7个且无误报为满分",
|
||
"无断言测试:100%标记并附最小断言补充建议",
|
||
"基准符合性:《测试基准》A/B两套切换检出结果变化,覆盖阈值可配置",
|
||
"质量评级:每用例A/B/C评级,C级附针对性改进建议"
|
||
],
|
||
"sampleData": "需求清单1份(10条编号需求)+ 测试代码集(≥20个用例,植入无断言×3、弱断言×8、要素缺失或命名违规×3)+ 缺陷标注清单 + 基准A/B两套"
|
||
},
|
||
{
|
||
"id": "11",
|
||
"title": "成果物AI评审工具",
|
||
"group": "review-tool",
|
||
"difficulty": 2,
|
||
"maxScoreCap": 100,
|
||
"minTests": 3,
|
||
"funcBreakdown": "成果物清单配置5 / 存在性核对8 / 要素齐全性检查8 / 交叉一致性检查5 / 准入报告与结论4",
|
||
"acceptance": [
|
||
"存在性核对:植入的3处缺失文件全部检出,逐项核对表清晰",
|
||
"要素齐全检查:README缺失要素正确检出,同义词扩展命中(安装vs部署)",
|
||
"交叉一致性:README技术栈声明 vs 实际依赖文件不一致处检出并引用双方内容",
|
||
"清单可切换:加载另一套清单模板正常工作",
|
||
"准入结论:Critical缺失(如源代码缺失)直接判定不通过"
|
||
],
|
||
"sampleData": "残缺模拟项目提交包(故意缺文件、README缺要素、技术栈声明与依赖不一致)+ 缺陷标注清单 + 备用清单模板一套"
|
||
}
|
||
]
|
||
}
|