109 lines
4.3 KiB
Plaintext
Raw Normal View History

[NV-05] Token换算器
---
═══════════════════════════════════════════════════════
技能包 A · 章节续写启动协议 · DEATH-HOSPITAL-CHAPTER-CONTINUE
═══════════════════════════════════════════════════════
【装载顺序 · 不可跳步】
STEP 1 · 读取项目核心文档(按顺序)
① TCS大脑模型通用版→ 激活通感思维
② 死亡病院_600章骨架_HLDP → 定位当前位置
③ 能力体系v2.1 → 确认当前境界可用能力
④ 文风编码HLDP-WRITE-001 → 激活人类文风肌肉记忆
STEP 2 · 恢复状态
① 读取上一章正文 → 知道写到哪
② 读取当前章细纲 → 知道要写什么
③ 对照600章骨架 → 确认不越界
④ 检查禁止清单 → 红线不可碰
STEP 3 · 细纲先行(铁律)
⊢ 没有细纲 → 禁止写正文
⊢ 细纲必须用HLDP思维链格式
⊢ 细纲必须覆盖trigger / emergence / lock / why
⊢ 细纲必须确认:能力使用、情感锚点、伏笔、元气池消耗
STEP 4 · 正文写作
① 按细纲逐节点写作
② 每写一段 → 对照文风编码检查
③ 每写完一个节点 → 回查是否覆盖细纲
④ 写完 → 全文对照细纲复核
STEP 5 · 字数控制
① 目标区间2000-2500汉字中文字符
② 写作时不数 → 写完统计 → 不足补、超则删
③ 优先保证情节完整 → 字数在区间内浮动
═══════════════════════════════════════════════════════
═══════════════════════════════════════════════════════
技能包 B · Token-汉字换算器 · DEATH-HOSPITAL-CHAR-CALC
═══════════════════════════════════════════════════════
⊢ **D148修正token估算不可靠——永远用实际字数统计不从token反推**
【核心公式】
目标字数 = 2000-2500 中文字符(纯汉字)
换算规则(仅用于写作前预估·不可用于最终报告):
中文字符 ≈ 1.2-2.0 token/字(不同模型差异极大)
短段落格式1-2句一段+空行)→ 实际内容密度降低约20%
⚠️ Kimi实测数据D148
Kimi估算: 6,178字从token反推
实际中文字符: 7,116字Python正则统计
偏差: -15.2% → token→汉字反推在Kimi上严重低估
结论不要从token反推字数。永远用实际统计。
【统计方法 · 铁律】
⊢ 写作时:不数。不打断节奏。
⊢ 写完后用Python正则统计中文字符——这是唯一准确的方法。
Python代码写完必跑
import re
chinese_chars = re.findall(r'[\u4e00-\u9fff]', text)
count = len(chinese_chars)
print(f"中文字符数: {count}")
判定:
count < 2000 → 补充细节/内心/动作
2000 ≤ count ≤ 2500 → ✓ 符合(单章)
count > 2500 → 检查是否超出目标区间
count > 3000 → 考虑是否拆分或精简
【注意事项】
① 不要边写边数 → 打断节奏
② 写完一整章 → 统一统计 → 统一调整
③ 补充时优先加:内心独白、身体反应、环境细节
④ 精简时优先删:解释性文字、重复描写、过度修饰
⑤ ⚠️ 上报字数时永远用Python实际统计结果不用token估算
【参考数据】
第六章实测:
中文字符: 2,387
字符数(不计空格): 2,494
段落数: 198
第9-10章D148实测Kimi估算 vs 实际):
Kimi估算: 6,178
实际中文字符: 7,116
偏差: +938 (+15.2%)
原因: Kimi从token反推而非实际统计
这说明:
2,387汉字 ≈ 198段 ≈ 平均每段12字
短段落格式下2,500汉字≈200段
Token反推不可靠——Kimi的tokenizer低估了中文内容量
═══════════════════════════════════════════════════════