docs: 记录里程碑2.5 Task9 实现验证日志
This commit is contained in:
@@ -32,3 +32,4 @@
|
||||
| 2026-08-09 03:20 | 测试验证 | 里程碑2 Task8 实现:真实样本集成测试。创建 tests/test_real_samples.py(3 个端到端用例,各样本缺失时 pytest.skip:新規開発→機能一覧 存在且 int rows+DB定義;追加改修→tables 非空且至少一表有数据行;自由記述→存在 extraction_method="llm_from_free_text" 的表);全量验证 39 passed(含 3 个样本用例);真实样本产物: 新規開発 6 表全 openpyxl(機能一覧9/画面一覧7/帳票一覧5/DB定義20/IF定義3/バッチ一覧3); 追加改修 2 表 openpyxl(機能10/画面7)+ 改修ポイント 以 FREE_TEXT 分类改 1 行(MIXED 折叠落观察已确认); 自由記述 3 表全 llm_from_free_text 各 1 行; 3 样本均 0 批注、无空 sheet。调研结论:MIXED 已知缺口#1 在真实样本未触发断言失败(无断言触发),按 brief 保持弱断言 | tests/test_real_samples.py | deepseek-v4-flash-free |
|
||||
|
||||
| 2026-08-09 03:30 | 整体迭代 | 里程碑2 最终评审修正(must-fix x2):① find_header_row 结果未传入 extract_table(恒 header_row=0,标题行置上的 sheet 会损坏表头)→ excel_parser.py 结构化路径改用 find_header_row(filled) 并 <0 回落 0;② cell_formatting 死代码(CellValue.formatting 恒 None,取消线/背景色到不了下游)→ extract_table 新增可选 formatting_map 参数,excel_parser 遍历 ws.iter_rows 构建 fmt_map 传入。tests/test_excel_parser.py 新增 2 用例(标题行表头定位、strikethrough 回填);pytest 全量 41 passed | src/genesis/parsers/excel_parser.py, src/genesis/parsers/table_extractor.py, tests/test_excel_parser.py | deepseek-v4-flash-free |
|
||||
| 2026-08-09 03:59 | Agent 实现 | 里程碑2.5 Task9 实现:段落分割器 split_paragraphs(MIXED 完整段落解析第一步,纯函数)。新建 src/genesis/parsers/paragraph_splitter.py(_is_blank_row 行空白判定 + split_paragraphs(matrix)→list[(start,end)] 含端点 0-based,以全空行为界返回段落区间,空矩阵→[])与 tests/test_paragraph_splitter.py(5 用例:空矩阵/单段落无空行/中间空行分割/尾部空行不产生多余段落/前导空行从首个非空行开始);TDD 验证 RED(ModuleNotFoundError: No module named 'genesis.parsers.paragraph_splitter')→ GREEN(5 passed);pytest 全量 46 passed(41 baseline + 5 新增);不依赖 openpyxl 与 data_models;提交 34ef28b | src/genesis/parsers/paragraph_splitter.py, tests/test_paragraph_splitter.py | deepseek-v4-flash-free |
|
||||
|
||||
Reference in New Issue
Block a user