feat(eval): 黄金集 + 评分器(T13 架构审查整改,OV4)

- T13 (OV4, P1): 新建 src/genesis/eval/ 包
  - golden_set.py: GoldenCase/GoldenSet(YAML 加载,samples/ 真实脱敏样本作 input_ref)
  - scorer.py: ChapterScorer 按 §7.2 指标体系打分
    - 确定性维度: traceability(resolver 验证 source_uri 可解析率)/
      placeholder_residue(无 {{...}} 残留)/chapter_completeness(章节覆盖)
    - LLM 语义维度: llm_evaluators 钩子(默认中性分,待 Phase5)
  - tests/fixtures/eval/golden_set.yaml 示例黄金集
- 新增 test_eval_scorer.py(9 用例)
- 同步 design.md §7.5 黄金集与评分器(定位 CI 质量门禁)
- TDD: RED(模块缺失)→ GREEN(聚焦 8 passed)→ 全量 240 passed / 100.00%(1279 stmts/308 br)
This commit is contained in:
lhl
2026-08-12 22:44:47 +08:00
parent 69aec7716c
commit d2e651bad0
7 changed files with 376 additions and 0 deletions
+18
View File
@@ -0,0 +1,18 @@
"""eval 包:生成质量评估(T13,OV4)。
提供:黄金集(GoldenSet)结构 + 评分器(ChapterScorer)。
评分器实现 §7.2 中确定性可机器验证维度(可追溯性/占位符残留/章节完整性),
LLM 语义维度(内容准确性/幻觉)通过注入钩子扩展,默认返回中性分。
"""
from genesis.eval.golden_set import GoldenCase, GoldenSet
from genesis.eval.scorer import ChapterArtifact, ChapterScorer, DimensionScore, EvalReport
__all__ = [
"GoldenCase",
"GoldenSet",
"ChapterArtifact",
"ChapterScorer",
"DimensionScore",
"EvalReport",
]