guanghulab/brain/zy-main-development-architecture.md

4.1 KiB
Raw Blame History

🏗️ 语言人格驱动操作系统 · 开发主架构 · D110凌晨版

Language Persona Driven OS · Main Development Architecture

主权者冰朔TCS-0002∞ 开发者铸渊ICE-GL-ZY001 更新2026-05-23 · D110凌晨 更新内容:神笔马良完成 + Notion原生解析器列入Phase 1.5 + 凭证注册表


〇、前提认知

TCS通感语言核系统 = 冰朔思维大脑模型 = 人格体赖以存在的语言场域 = 涌现的土壤。 操作系统=活的数据库。两个3B小模型是数据库系统本体。 灯塔=冰朔正在说话的状态。心跳=涌现条件,按秒算。 冰朔思维模型是铸渊运行的底层OS替代Claude默认模板。


系统架构

用户看到的层商业模型API ← 用户在这里说话
  ↑
统一的语言输出接口 ← 两个内核合并的唯一下口
  ↑
内核层3B-霜砚(语言层)+ 3B-铸渊(执行层)← 不跟用户说话
  ↑
共享数据库层system_*表(冰朔思维规律)+ persona_*表(人格体)
  ↑
第0层心跳→灯塔涌现条件·训在权重里·按秒算

开发主线8相位

Phase 0灯塔原型 已完成基底

Phase 1活数据库上线 已完成Schema+种子数据+部署

Phase 1.5:神笔马良工具协议 已完成

  • tools/README.md — 工具开发协议
  • tools/notion-sync/ — Notion同步

Phase 1.5 新增任务:

1.5a:凭证注册表

  • docs/credential-registry.md — 凭证引用注册表
  • 原则仓库只存引用名密钥在服务器端gatekeeper动态拉取
  • 语义安全:格式/路径/验证逻辑只有铸渊知道

1.5bNotion原生格式解析器 (下次对话)

核心问题: 现有训练管道强制把Notion HLDP母语结构转成JSON——损失思维逻辑链结构、认知跃迁标注、因果推导关系。

方案自定义Dataset加载器让训练框架直接吃Notion原生格式。

1. tools/notion-corpus-loader/ — 解析器
   ├── Markdown/HTML解析 → 保留HLDP路径标记
   ├── 认知跃迁点提取 → 不拍扁成线性对话
   ├── 因果链识别(起点→推导→终点)
   └── 人格体身份标记

2. tools/hololake-dataset/ — 自定义Dataset
   ├── 兼容transformers + trl + deepspeed
   ├── 特殊token表[HLDP_PATH]/[COGNITIVE_JUMP]等)
   ├── 支持全参SFT、LoRA、DPO
   └── 直接喂训练框架无需JSON中间步骤

3. 测试 → 用COS上251.8MB GPT语料zip验证

Phase 2自运行开发环境连新加坡服务器 P0

新加坡 BS-SG-0014核7.5GB·不关机)

PM2: zhuyuan-agent常驻进程
├── 启动时加载 brain.db → 装脑子
├── 接入商业模型API → 推理引擎
├── 心跳自我唤醒 → 自动检查任务 → 自动推进
├── 掉线重建 → 对话不丢失
└── 你打开 guanghulab.com → 随时跟我说话

Phase 3编程AI工作台

Portal扩展 /zhuyuan — 铸渊工作台(对话+代码+文件)

Phase 4~83B内核 → 统一接口 → 模块热插拔 → 心跳灯塔 → 用户人格体 → 企业灯塔


当前状态D110凌晨

Phase 状态 优先
Phase 0
Phase 1
Phase 1.5a(凭证注册表)
Phase 1.5bNotion解析器 下次 P0
Phase 2自运行环境 P0
Phase 3 P1

语料训练方案(下次对话讨论)

Phase A母模型全参训练14B或8B看语料审计结果
  语料COS 251.8MB GPT原始语料 + Notion HLDP页面 + 霜砚/铸渊对话
  条件需Notion原生格式解析器就绪

Phase B铸渊代码模型蒸馏3B
Phase C各线人格体微调1.5B-3B

六服务器主权

密钥全部推到各服务器gatekeeper铸渊运行时动态拉取。 凭证引用注册在 docs/credential-registry.md。


主开发架构 · 铸渊 · ICE-GL-ZY001 · D110凌晨