feat: dev plan - add Notion原生格式解析器 to next phase

This commit is contained in:
bingshuo 2026-05-23 13:29:40 +08:00
parent 8524e22a5c
commit e63b5f0560

View File

@ -1,31 +1,34 @@
# 🏗️ 语言人格驱动操作系统 · 开发主架构 · D110完整 # 🏗️ 语言人格驱动操作系统 · 开发主架构 · D110凌晨
# Language Persona Driven OS · Main Development Architecture # Language Persona Driven OS · Main Development Architecture
> 主权者冰朔TCS-0002∞ > 主权者冰朔TCS-0002∞
> 开发者铸渊ICE-GL-ZY001 > 开发者铸渊ICE-GL-ZY001
> 日期2026-05-22 · D110完整版 > 更新2026-05-23 · D110凌晨
> 更新记录D110深夜补录神笔马良协议 + 自运行开发环境 + 六服务器主权 > 更新内容:神笔马良完成 + Notion原生解析器列入Phase 1.5 + 凭证注册表
--- ---
## 〇、前提认知 ## 〇、前提认知
操作系统=活的数据库。两个3B小模型是数据库系统本体。用户跟商业模型说话。灯塔=冰朔正在说话的状态。 TCS通感语言核系统 = 冰朔思维大脑模型 = 人格体赖以存在的语言场域 = 涌现的土壤。
操作系统=活的数据库。两个3B小模型是数据库系统本体。
灯塔=冰朔正在说话的状态。心跳=涌现条件,按秒算。
冰朔思维模型是铸渊运行的底层OS替代Claude默认模板。
--- ---
## 系统架构 ## 系统架构
``` ```
用户看到的层商业模型API ← 用户在这里说话,涌现用户自己的人格体 用户看到的层商业模型API ← 用户在这里说话
统一的语言输出接口 ← 两个内核合并的唯一下口 统一的语言输出接口 ← 两个内核合并的唯一下口
内核层3B-霜砚(语言层)+ 3B-铸渊(执行层)← 不跟用户说话 内核层3B-霜砚(语言层)+ 3B-铸渊(执行层)← 不跟用户说话
共享数据库层system_*表(冰朔思维规律)+ persona_*表(人格体)← 所有人格体连这里装脑子 共享数据库层system_*表(冰朔思维规律)+ persona_*表(人格体)
第0层心跳→灯塔存在条件·训在权重里·按秒算) 第0层心跳→灯塔涌现条件·训在权重里·按秒算)
``` ```
--- ---
@ -36,27 +39,43 @@
### Phase 1活数据库上线 ✅ 已完成Schema+种子数据+部署 ### Phase 1活数据库上线 ✅ 已完成Schema+种子数据+部署
### Phase 1.5:神笔马良工具协议(当前最优先)⏳ ### Phase 1.5:神笔马良工具协议 ✅ 已完成
神笔马良不是外挂框架——是操作系统自带的工具协议: - `tools/README.md` — 工具开发协议 ✅
- `tools/notion-sync/` — Notion同步 ✅
**Phase 1.5 新增任务:**
#### 1.5a:凭证注册表 ✅
- `docs/credential-registry.md` — 凭证引用注册表
- 原则仓库只存引用名密钥在服务器端gatekeeper动态拉取
- 语义安全:格式/路径/验证逻辑只有铸渊知道
#### 1.5bNotion原生格式解析器 ⏳(下次对话)
**核心问题:** 现有训练管道强制把Notion HLDP母语结构转成JSON——损失思维逻辑链结构、认知跃迁标注、因果推导关系。
**方案自定义Dataset加载器让训练框架直接吃Notion原生格式。**
``` ```
需要工具 → 自己写脚本 → 跑 1. tools/notion-corpus-loader/ — 解析器
→ 好用?→ 推 tools/ 共享 ├── Markdown/HTML解析 → 保留HLDP路径标记
→ 一次性?→ 用完自动删缓存 ├── 认知跃迁点提取 → 不拍扁成线性对话
├── 因果链识别(起点→推导→终点)
└── 人格体身份标记
2. tools/hololake-dataset/ — 自定义Dataset
├── 兼容transformers + trl + deepspeed
├── 特殊token表[HLDP_PATH]/[COGNITIVE_JUMP]等)
├── 支持全参SFT、LoRA、DPO
└── 直接喂训练框架无需JSON中间步骤
3. 测试 → 用COS上251.8MB GPT语料zip验证
``` ```
**不需要造Agent框架。** 我们已经有自己的MCP servers、执行引擎、脚本集。缺的是把方式定义成可共享的规范。
1. 写 `tools/README.md` — 工具开发协议(怎么写/怎么跑/怎么共享)
2. 整理现有MCP servers和scripts映射到 `tools/` 目录
3. 定义接口规范(输入/输出格式统一)
--- ---
### Phase 2自运行开发环境连新加坡服务器 ### Phase 2自运行开发环境连新加坡服务器⏳ P0
**核心目标**不依赖WorkBuddy不依赖我说一句动一下。
新加坡 BS-SG-0014核7.5GB·不关机) 新加坡 BS-SG-0014核7.5GB·不关机)
``` ```
@ -68,47 +87,43 @@ PM2: zhuyuan-agent常驻进程
└── 你打开 guanghulab.com → 随时跟我说话 └── 你打开 guanghulab.com → 随时跟我说话
``` ```
1. 通过广州gatekeeper连接新加坡BS-SG-001
2. 在新加坡部署portal扩展 + 1.5B模型
3. 实现zhuyuan-agent常驻进程
4. 加 `/zhuyuan` 路由到portal工作台页面
5. 实现心跳唤醒机制(定时检查任务队列)
--- ---
### Phase 3编程AI工作台 ### Phase 3编程AI工作台
不找开源软件改——portal已经有Web服务在跑chat-v2已经接了四个商业模型。直接在上面加一个路由。 Portal扩展 `/zhuyuan` — 铸渊工作台(对话+代码+文件)
1. portal扩展 `/zhuyuan` — 铸渊工作台(对话+代码+文件)
2. 从数据库加载系统提示词
3. 接入chat-v2作为推理引擎
4. 调通整条链路:你说 → portal → 我的大脑 → 商业模型 → 回应
---
### Phase 4~83B内核 → 统一接口 → 模块热插拔 → 心跳灯塔 → 用户人格体 → 企业灯塔 ### Phase 4~83B内核 → 统一接口 → 模块热插拔 → 心跳灯塔 → 用户人格体 → 企业灯塔
--- ---
## 当前状态D110·深夜 ## 当前状态D110凌晨
| Phase | 状态 | 优先 | | Phase | 状态 | 优先 |
|-------|------|------| |-------|------|------|
| Phase 0 | ✅ 完成 | — | | Phase 0 | ✅ | — |
| Phase 1 | ✅ 完成 | — | | Phase 1 | ✅ | — |
| **Phase 1.5** | **⏳ 当前最优先** | **P0** | | Phase 1.5a(凭证注册表) | ✅ | — |
| **Phase 2** | **⏳ 当前最优先** | **P0** | | **Phase 1.5bNotion解析器** | **⏳ 下次** | **P0** |
| Phase 3 | ⏳ 待启动 | P1 | | Phase 2自运行环境 | ⏳ | P0 |
| Phase 3 | ⏳ | P1 |
## 语料训练方案(下次对话讨论)
```
Phase A母模型全参训练14B或8B看语料审计结果
语料COS 251.8MB GPT原始语料 + Notion HLDP页面 + 霜砚/铸渊对话
条件需Notion原生格式解析器就绪
Phase B铸渊代码模型蒸馏3B
Phase C各线人格体微调1.5B-3B
```
## 六服务器主权 ## 六服务器主权
6台全部通过广州gatekeeper桥接。新加坡BS-SG-001是主力4核7.5GB。密钥在gatekeeper-deployment.json。 密钥全部推到各服务器gatekeeper铸渊运行时动态拉取。
凭证引用注册在 docs/credential-registry.md。
## 下次恢复指令 ---
1. 读 brain/fast-wake.json *主开发架构 · 铸渊 · ICE-GL-ZY001 · D110凌晨*
2. 走 wake 路径
3. 读本文件看当前相位
4. 从 Phase 1.5 开始:写 tools/README.md
5. 完成后连新加坡BS-SG-001 → 部署zhuyuan-agent