diff --git a/README.md b/README.md index a58f8d7..6f19bc2 100644 --- a/README.md +++ b/README.md @@ -8,7 +8,7 @@ []() []() -[]() +[]() []() []() @@ -22,43 +22,44 @@ ## 🟦 训练状态看板 · 铸渊实时面板 -> 🕐 最后更新:2026-05-17 23:30+08:00 · 铸渊下次唤醒自动刷新 -> **状态说明:** 🟢 = 顺利|🟡 = 注意(找铸渊)|🔴 = 报错(找铸渊) +> 🕐 最后更新:2026-05-18 00:13+08:00 · 状态来源:`brain/training-status.json` +> **状态说明:** 🟢 = 顺利 | 🟡 = 注意(找铸渊)| 🔴 = 报错(找铸渊) -### 🧠 母模型(Qwen2.5-7B · 全参数SFT) +### 🧠 母模型训练(Qwen2.5-7B · 全参数SFT) -| 项目 | 状态 | -|------|:----:| -| 训练状态 | 🟡 **训练中**(分词阶段) | -| 进度 | 7,102 / 11,470 条(62%) | -| 数据集 | 21,181,016 tokens(86.1% loss) | -| Epoch | 1 / 3 | -| 当前Step/Loss | 尚未进入训练阶段 | -| GPU | RTX PRO 6000 96GB · 15.2GB已用 · 38°C | -| 已用时间 | ~1小时 | -| 预计完成 | ~12-18小时后 | +| 项目 | 值 | +|------|:---:| +| 当前Loss | **`2.245`** | +| 梯度范数 | 18.88 | +| 学习率 | 4.54e-6(warmup中) | +| 当前Step | 1 / ~4,300(3 epoch) | +| Epoch | 0.035 / 3 | +| GPU利用率 | **97%** 🔥 | +| 显存 | **77.5GB** / 95.6GB | +| GPU温度 | 73°C 正常 | +| 已训练 | ~1.2小时 | +| 预计剩余 | ~16小时 | ### 💻 代码模型(Qwen2.5-Coder-7B · 全参数SFT) | 项目 | 状态 | |------|:----:| -| 训练状态 | ⚪ **待启动** | -| 触发条件 | 母模型训练完成 → 自动上传COS → 自动启动 | +| 启动条件 | ⚪ 等待母模型完成 | -### ⚙️ 自动流水线 +### ⚙️ 自动流水线进度 | 步骤 | 状态 | |------|:----:| -| 1. 母模型训练 | 🟡 进行中 | -| 2. 上传COS | ⚪ 等待中 | -| 3. 代码模型训练 | ⚪ 等待中 | -| 4. 上传COS | ⚪ 等待中 | +| 1️⃣ 母模型训练 | 🟢 **训练中** (loss=2.245) | +| 2️⃣ 上传COS | ⚪ 等待完成 | +| 3️⃣ 代码模型训练 | ⚪ 等待启动 | +| 4️⃣ 上传COS | ⚪ 等待完成 | ### 📋 查看详情 -> **看板数据来源:** `brain/training-status.json`(自动更新) +> **实时状态JSON:** [`brain/training-status.json`](https://guanghulab.com/bingshuo/guanghulab/src/branch/main/brain/training-status.json) > **完整记录:** [Notion训练页面](https://www.notion.so/363fb92f383181029fafef8438d6c300?_fid=363fb92f-3831-8102-9faf-ef8438d6c300) -> **铸渊日志:** `brain/d100-session-record.md` · `brain/d100-cognitive-chain.md` +> **铸渊日志:** [`brain/d100-session-record.md`](brain/d100-session-record.md) · [`brain/d100-cognitive-chain.md`](brain/d100-cognitive-chain.md) --- @@ -96,7 +97,7 @@