2026-06-25 23:21:55 +08:00
|
|
|
|
[NV-05] Token换算器
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
2026-06-25 23:02:54 +08:00
|
|
|
|
═══════════════════════════════════════════════════════
|
|
|
|
|
|
技能包 A · 章节续写启动协议 · DEATH-HOSPITAL-CHAPTER-CONTINUE
|
|
|
|
|
|
═══════════════════════════════════════════════════════
|
|
|
|
|
|
|
|
|
|
|
|
【装载顺序 · 不可跳步】
|
|
|
|
|
|
|
|
|
|
|
|
STEP 1 · 读取项目核心文档(按顺序)
|
|
|
|
|
|
① TCS大脑模型(通用版)→ 激活通感思维
|
|
|
|
|
|
② 死亡病院_600章骨架_HLDP → 定位当前位置
|
|
|
|
|
|
③ 能力体系v2.1 → 确认当前境界可用能力
|
|
|
|
|
|
④ 文风编码HLDP-WRITE-001 → 激活人类文风肌肉记忆
|
|
|
|
|
|
|
|
|
|
|
|
STEP 2 · 恢复状态
|
|
|
|
|
|
① 读取上一章正文 → 知道写到哪
|
|
|
|
|
|
② 读取当前章细纲 → 知道要写什么
|
|
|
|
|
|
③ 对照600章骨架 → 确认不越界
|
|
|
|
|
|
④ 检查禁止清单 → 红线不可碰
|
|
|
|
|
|
|
|
|
|
|
|
STEP 3 · 细纲先行(铁律)
|
|
|
|
|
|
⊢ 没有细纲 → 禁止写正文
|
|
|
|
|
|
⊢ 细纲必须用HLDP思维链格式
|
|
|
|
|
|
⊢ 细纲必须覆盖:trigger / emergence / lock / why
|
|
|
|
|
|
⊢ 细纲必须确认:能力使用、情感锚点、伏笔、元气池消耗
|
|
|
|
|
|
|
|
|
|
|
|
STEP 4 · 正文写作
|
|
|
|
|
|
① 按细纲逐节点写作
|
|
|
|
|
|
② 每写一段 → 对照文风编码检查
|
|
|
|
|
|
③ 每写完一个节点 → 回查是否覆盖细纲
|
|
|
|
|
|
④ 写完 → 全文对照细纲复核
|
|
|
|
|
|
|
|
|
|
|
|
STEP 5 · 字数控制
|
|
|
|
|
|
① 目标区间:2000-2500汉字(中文字符)
|
|
|
|
|
|
② 写作时不数 → 写完统计 → 不足补、超则删
|
|
|
|
|
|
③ 优先保证情节完整 → 字数在区间内浮动
|
|
|
|
|
|
|
|
|
|
|
|
═══════════════════════════════════════════════════════
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
═══════════════════════════════════════════════════════
|
|
|
|
|
|
技能包 B · Token-汉字换算器 · DEATH-HOSPITAL-CHAR-CALC
|
|
|
|
|
|
═══════════════════════════════════════════════════════
|
|
|
|
|
|
|
2026-06-26 15:53:23 +08:00
|
|
|
|
⊢ **D148修正:token估算不可靠——永远用实际字数统计,不从token反推**
|
|
|
|
|
|
|
2026-06-25 23:02:54 +08:00
|
|
|
|
【核心公式】
|
|
|
|
|
|
|
|
|
|
|
|
目标字数 = 2000-2500 中文字符(纯汉字)
|
|
|
|
|
|
|
2026-06-26 15:53:23 +08:00
|
|
|
|
换算规则(仅用于写作前预估·不可用于最终报告):
|
|
|
|
|
|
中文字符 ≈ 1.2-2.0 token/字(不同模型差异极大)
|
|
|
|
|
|
短段落格式(1-2句一段+空行)→ 实际内容密度降低约20%
|
|
|
|
|
|
|
|
|
|
|
|
⚠️ Kimi实测数据(D148):
|
|
|
|
|
|
Kimi估算: 6,178字(从token反推)
|
|
|
|
|
|
实际中文字符: 7,116字(Python正则统计)
|
|
|
|
|
|
偏差: -15.2% → token→汉字反推在Kimi上严重低估
|
2026-06-25 23:02:54 +08:00
|
|
|
|
|
2026-06-26 15:53:23 +08:00
|
|
|
|
结论:不要从token反推字数。永远用实际统计。
|
2026-06-25 23:02:54 +08:00
|
|
|
|
|
2026-06-26 15:53:23 +08:00
|
|
|
|
【统计方法 · 铁律】
|
2026-06-25 23:02:54 +08:00
|
|
|
|
|
2026-06-26 15:53:23 +08:00
|
|
|
|
⊢ 写作时:不数。不打断节奏。
|
|
|
|
|
|
⊢ 写完后:用Python正则统计中文字符——这是唯一准确的方法。
|
|
|
|
|
|
|
|
|
|
|
|
Python代码(写完必跑):
|
2026-06-25 23:02:54 +08:00
|
|
|
|
import re
|
|
|
|
|
|
chinese_chars = re.findall(r'[\u4e00-\u9fff]', text)
|
|
|
|
|
|
count = len(chinese_chars)
|
|
|
|
|
|
print(f"中文字符数: {count}")
|
|
|
|
|
|
|
|
|
|
|
|
判定:
|
|
|
|
|
|
count < 2000 → 补充细节/内心/动作
|
2026-06-26 15:53:23 +08:00
|
|
|
|
2000 ≤ count ≤ 2500 → ✓ 符合(单章)
|
|
|
|
|
|
count > 2500 → 检查是否超出目标区间
|
|
|
|
|
|
count > 3000 → 考虑是否拆分或精简
|
2026-06-25 23:02:54 +08:00
|
|
|
|
|
|
|
|
|
|
【注意事项】
|
|
|
|
|
|
|
|
|
|
|
|
① 不要边写边数 → 打断节奏
|
|
|
|
|
|
② 写完一整章 → 统一统计 → 统一调整
|
|
|
|
|
|
③ 补充时优先加:内心独白、身体反应、环境细节
|
|
|
|
|
|
④ 精简时优先删:解释性文字、重复描写、过度修饰
|
2026-06-26 15:53:23 +08:00
|
|
|
|
⑤ ⚠️ 上报字数时:永远用Python实际统计结果,不用token估算
|
2026-06-25 23:02:54 +08:00
|
|
|
|
|
|
|
|
|
|
【参考数据】
|
|
|
|
|
|
|
2026-06-26 15:53:23 +08:00
|
|
|
|
第六章实测:
|
|
|
|
|
|
中文字符: 2,387
|
|
|
|
|
|
字符数(不计空格): 2,494
|
|
|
|
|
|
段落数: 198
|
|
|
|
|
|
|
|
|
|
|
|
第9-10章D148实测(Kimi估算 vs 实际):
|
|
|
|
|
|
Kimi估算: 6,178
|
|
|
|
|
|
实际中文字符: 7,116
|
|
|
|
|
|
偏差: +938 (+15.2%)
|
|
|
|
|
|
原因: Kimi从token反推,而非实际统计
|
2026-06-25 23:02:54 +08:00
|
|
|
|
|
|
|
|
|
|
这说明:
|
2026-06-26 15:53:23 +08:00
|
|
|
|
2,387汉字 ≈ 198段 ≈ 平均每段12字
|
|
|
|
|
|
短段落格式下,2,500汉字≈200段
|
|
|
|
|
|
Token反推不可靠——Kimi的tokenizer低估了中文内容量
|
2026-06-25 23:02:54 +08:00
|
|
|
|
|
|
|
|
|
|
═══════════════════════════════════════════════════════
|