完整基因定义文件(拟放置于 skills/gene/RCH11-featured-page-deepen.md):
---
id: RCH11-featured-page-deepen
group: RCH
wu: 90
diff_limit: 全页重写(历史阶段重组例外)
sources: [chinese-in-america]
scope: general
applicable: true
origin: chinese-in-america wiki 对语料命中排名 Top 20 词条执行深度改写实践,2026-07 案例见 local/memory/deep-rewrite-top20-summary.md
priority: H-P2
tags: [enrich, restructure, quality, featured]
born: 2026-07-29
keywords: [featured, deepen, 精品, 深化, 语料利用率, 历史阶段重组, 全量通读, rch]
---
# RCH11 featured-page-deepen — 精品页语料利用率深化
**定义**:对已达 `quality: featured`(或以上)但**语料利用率偏低**的页面,执行"全量通读该实体全书命中 → 跨页面内容归属判定 → 按历史阶段重组标题层级 → 已有专门页面覆盖内容简写带过"的深度重写,目标是让页面利用该实体全书语料命中的绝大部分,而非仅仅维持现有质量档位。
## 与 RCH1/RCH2/RCH10/RFT9 的区别
| 基因 | 触发条件 | 允许的动作 | 与本基因的差异 |
|------|---------|-----------|---------------|
| RCH1 | quality ≤ standard | 追加新节,append-only | 前提是低于 featured,不覆盖已 featured 页 |
| RCH2 | quality < premium | 补缺口以升档,append-only | 目标是**跨档位**,本基因目标是**同档位内加深** |
| RCH10 | 页面已 enrich 过、字数≥80% target | 通读**已有内容**去重/纠错/展开过简段落 | `corpus_search` 限量搜索(--max 50),假设内容已大致覆盖 schema,不负责发现"全书还有大量命中从未被使用"的缺口 |
| RFT9 | 段落堆积混乱 | 段落级重组 | 铁律明文禁止"以重组为名顺带 enrich",只能重排已有内容 |
| **RCH11(本基因)** | quality ≥ featured 但**语料利用率低**(见下) | **全量重新发现 + 历史阶段重组 + 新增内容**三者可以同时发生 | 专门解决"已达标但语料远未用尽"这一 RCH1/RCH2/RCH10/RFT9 均未覆盖的病灶 |
## 背景:三类"已达标但不够格"的病灶
来自 chinese-in-america wiki 对 15 个精品页面的深度改写实证(`local/memory/deep-rewrite-top20-summary.md`):
1. **首建章节锁定**:页面内容锁死在最初建页时读到的那一章,即使该实体在全书其他十几章反复出现(例:"旧金山"改写前仅覆盖第3章淘金热崛起,197次命中里绝大多数分布在第6-20章从未被使用)
2. **叙事戛然而止**:页面在情节高潮处结束,未交代后续(例:"钱学森"改写前止于1955年被遣返,未写归国后做了什么)
3. **扁平模板压制**:高命中量实体被硬塞进 type 的默认扁平模板(如 place 的"概况/历史事件/历史意义"三段式),模板容量远小于语料实际密度
这三类病灶的共同根源:现有质量评分(`compute_quality.py` / SCN14)测的是**结构完整性阈值**(H2 数量、PN 密度下限、wikilink 数量),不是**语料利用率**——页面完全可能在通过所有结构性检查的同时,只用了该实体全书命中量的一小部分。
## 前置条件
- 页面 `quality` 已为 `featured` 或 `premium`
- **语料利用率**低于阈值:`该实体全书语料命中数` 与 `页面正文实际引用的 PN 数` 的比值 < 50%
- 命中数计算:对页面 `label`(去除括号内英文/别名部分的核心词)执行整词匹配全量搜索(不设 `--max` 上限),统计命中 PN 总数
- 已引用数:正文中出现的 `(NNN-PPP)` 去重计数
- 若命中数 < 15(内容本身单薄,无深化空间),不适用本基因,改用 RCH10 或维持现状
- 命中 PN 分布跨 ≥ 4 个章节(分布集中在单一章节的实体,深化空间有限,扁平模板通常已够用)
## 前置读 LAW
开始执行前,先阅读目标 wiki 的 LAW.md:
- **§三 段落编号(PN)映射规则** — PN 格式、括号风格
- **§五 页面 slug 命名规范** — slug 格式约定
## 执行步骤
### Step 1 — 全量通读该实体全书语料命中
```bash
WIKI_ROOT=$PWD python3 "$MEMEX_ROOT/wiki/scripts/butler/corpus_search.py" "{label核心词}" --max 300 --full若命中数较大(>50),可按章节分批读(--chapter N --full),但必须覆盖全部命中章节,不得因数量大而抽样跳过。
对每条命中,标注:
- ✅ 页面已引用
- 🆕 页面未引用,且内容与本词条直接相关
- ⏭️ 路过性提及,非叙事主体,跳过
对每条 🆕 候选,检查该内容是否已被另一个专门页面(人物/事件/法案/组织/地点各自的独立词条)完整覆盖:
python3 -c "
import json
d = json.load(open('docs/wiki/pages.json'))
labels = set()
for slug, p in d['pages'].items():
if p.get('type') == 'chapter': continue
labels.add(p.get('label', slug))
for a in p.get('aliases', []) or []:
labels.add(a)
print(len(labels))
"- 已被专门页面覆盖 → 归入"简写清单":本页仅用一句话+wikilink带过,不重复展开
- 未被任何页面覆盖 → 归入"新内容清单",进入 Step 3
若发现两个密切关联的候选深化词条(如省↔市、政党↔其领导人所在地)在同批次一起深化,应显式协商内容边界(哪页写制度/政策,哪页写个体/生活经验),并在各自的 commit message 中注明分工依据。
若"新内容清单"数量足以支撑独立阶段(经验值:每阶段建议 ≥2 条 PN),放弃 type 默认的扁平模板(如 place 的"概况/历史事件/历史意义"),改为按时间顺序或主题分组的 H2(必要时下设 H3 子节)。
- type schema 的必选节(如 place 的"概况""历史事件")保留,但压缩为开篇引子/结尾总结,不再是内容主体
- 每个新 H2 至少有 1 处此前完全未被本页使用的具体内容(数字/人名/事件),避免"为了分节而分节"
- 已有内容(Step 1 标注✅的部分)保留,整合进对应的新阶段,不得丢失
若本页叙事呈现单一方向(如某组织清一色是"迫害者"或"受益者"),回顾 Step 1 的通读结果,检查语料中是否存在与当前叙事框架相反的材料此前被忽略。若有,补入独立小节或段落,不必强行平衡篇幅,但应如实呈现。
检查页面是否在情节高潮处戛然而止(如遣返/入狱/判决/事件平息后未交代后续)。若语料中有后续内容(结局、影响、当事人后来的人生),必须补齐,不得让叙事停在戏剧性最强但非终点的节点。
- 每句有据铁律:新增内容逐句标注 PN,无脱离原文的断言
- 禁止使用破折号"——"连接句子,改用逗号/句号/冒号
- PN 引注禁止用顿号/斜杠合并多条(
(NNN-PPP、MMM-QQQ)错误,须拆分为独立括号) - 已有内容中发现的历史遗留问题(alias_index bug、过时的占位说明、格式错误)顺手修复,在 commit message 中单独说明
python3 wiki/scripts/compute_quality.py --dry-run --slug "{slug}"- 若质量档位提升至
premium,触发 RCH2 式的全库分布上限门控(featured+premium 合计 ≤ 10%),超限则保留档位为featured,不强行降级内容 - 重新计算语料利用率(Step 1 命中数 / 改写后正文引用 PN 数),记录于 commit message,作为本次深化效果的量化指标
- 语料利用率较改写前有实质提升(理想情况 ≥ 70%)
-
pn_format_lint.py无新增问题 -
discover_by_broken_link.py无新增断链(新增 wikilink 全部指向真实存在的页面) - 已有专门页面覆盖的内容确认简写+wikilink,未重复展开
- 同批次关联词条(若有)已做显式分工,无内容重叠
-
compute_quality.py --dry-run实测质量档位已写回 frontmatter - commit message 记录:新增阶段数、语料利用率变化、顺手修复的历史遗留问题(若有)
引用案例:`local/memory/deep-rewrite-top20-summary.md`(本 wiki 内,15 个页面深度改写前后对比的完整实证记录)