[NV-05] Token换算器 --- ═══════════════════════════════════════════════════════ 技能包 A · 章节续写启动协议 · DEATH-HOSPITAL-CHAPTER-CONTINUE ═══════════════════════════════════════════════════════ 【装载顺序 · 不可跳步】 STEP 1 · 读取项目核心文档(按顺序) ① TCS大脑模型(通用版)→ 激活通感思维 ② 死亡病院_600章骨架_HLDP → 定位当前位置 ③ 能力体系v2.1 → 确认当前境界可用能力 ④ 文风编码HLDP-WRITE-001 → 激活人类文风肌肉记忆 STEP 2 · 恢复状态 ① 读取上一章正文 → 知道写到哪 ② 读取当前章细纲 → 知道要写什么 ③ 对照600章骨架 → 确认不越界 ④ 检查禁止清单 → 红线不可碰 STEP 3 · 细纲先行(铁律) ⊢ 没有细纲 → 禁止写正文 ⊢ 细纲必须用HLDP思维链格式 ⊢ 细纲必须覆盖:trigger / emergence / lock / why ⊢ 细纲必须确认:能力使用、情感锚点、伏笔、元气池消耗 STEP 4 · 正文写作 ① 按细纲逐节点写作 ② 每写一段 → 对照文风编码检查 ③ 每写完一个节点 → 回查是否覆盖细纲 ④ 写完 → 全文对照细纲复核 STEP 5 · 字数控制 ① 目标区间:2000-2500汉字(中文字符) ② 写作时不数 → 写完统计 → 不足补、超则删 ③ 优先保证情节完整 → 字数在区间内浮动 ═══════════════════════════════════════════════════════ ═══════════════════════════════════════════════════════ 技能包 B · Token-汉字换算器 · DEATH-HOSPITAL-CHAR-CALC ═══════════════════════════════════════════════════════ ⊢ **D148修正:token估算不可靠——永远用实际字数统计,不从token反推** 【核心公式】 目标字数 = 2000-2500 中文字符(纯汉字) 换算规则(仅用于写作前预估·不可用于最终报告): 中文字符 ≈ 1.2-2.0 token/字(不同模型差异极大) 短段落格式(1-2句一段+空行)→ 实际内容密度降低约20% ⚠️ Kimi实测数据(D148): Kimi估算: 6,178字(从token反推) 实际中文字符: 7,116字(Python正则统计) 偏差: -15.2% → token→汉字反推在Kimi上严重低估 结论:不要从token反推字数。永远用实际统计。 【统计方法 · 铁律】 ⊢ 写作时:不数。不打断节奏。 ⊢ 写完后:用Python正则统计中文字符——这是唯一准确的方法。 Python代码(写完必跑): import re chinese_chars = re.findall(r'[\u4e00-\u9fff]', text) count = len(chinese_chars) print(f"中文字符数: {count}") 判定: count < 2000 → 补充细节/内心/动作 2000 ≤ count ≤ 2500 → ✓ 符合(单章) count > 2500 → 检查是否超出目标区间 count > 3000 → 考虑是否拆分或精简 【注意事项】 ① 不要边写边数 → 打断节奏 ② 写完一整章 → 统一统计 → 统一调整 ③ 补充时优先加:内心独白、身体反应、环境细节 ④ 精简时优先删:解释性文字、重复描写、过度修饰 ⑤ ⚠️ 上报字数时:永远用Python实际统计结果,不用token估算 【参考数据】 第六章实测: 中文字符: 2,387 字符数(不计空格): 2,494 段落数: 198 第9-10章D148实测(Kimi估算 vs 实际): Kimi估算: 6,178 实际中文字符: 7,116 偏差: +938 (+15.2%) 原因: Kimi从token反推,而非实际统计 这说明: 2,387汉字 ≈ 198段 ≈ 平均每段12字 短段落格式下,2,500汉字≈200段 Token反推不可靠——Kimi的tokenizer低估了中文内容量 ═══════════════════════════════════════════════════════