🚀 训练任务从「能提交」到「可运维的长期资产」——跑得动(长任务监控 + GPU 显存预算队列)、找得到问题(七类失败诊断附修复建议)、出得了交付(沙箱隔离 + 离线可训 + 设备打包);--stats 让审计从逐次事件变成可汇报的治理 KPI。
TL;DR (EN): Training becomes operable, not just submittable: long-task monitoring + VRAM-budget queues, seven-class failure diagnosis with fix prescriptions, sandboxed offline training with device packaging; --stats turns audit into a reportable KPI. MCP 76→79, 3619 tests.
⚡ Install / Upgrade
# 新装(五形态任选:FDE 插件 / Skill / MCP / CLI / GitHub Action)
curl -fsSL https://raw.githubusercontent.com/KongFangXun/sofagent/main/install.sh | bash
# 已装用户升级到本版
npx @sofagent/audit@1.4.3 --doctor
# GitHub Action(PR 自动审计)
uses: KongFangXun/sofagent@v1.4.3
🔨 核心变更
📡 训练监控与 GPU 队列
train_status/train_list进度查询(status / step / loss / reward 曲线 / 日志尾部 + 历史任务过滤)——MCP 客户端可查训练进度- GPU 显存预算队列:多任务按预算排队(串行 or 按预算并发),并发不 OOM;训练完成/失败 webhook 推送
- 训练状态落盘
data/dashboard/train-status.json,Dashboard「训练任务」区块可读
🩺 训练失败诊断
train_diagnose:OOM / 数据格式错 / 超参发散 / 框架错误 / 环境不匹配 / 重复坍塌 / 精度异常——每类附修复建议(如精度异常 → LM head/优化器状态升 FP32)- 诊断报告自动收集上下文:失败日志尾部 + 环境 + 最近 checkpoint + 超参
📦 训练沙箱与设备打包
- 训练子进程隔离(无外网 / 只读数据源 / 只写产物目录),客户机房离线可训
- 训练运行时可打包进交付设备(U 盘/电脑形态交付)
🧭 需求推导与模板库
train analyze四步引导:workflow 节点 → 训练目标 / 数据需求 / 评估标准 / 配置- 模板库:QLoRA/SFT/DPO + RL 配方 grpo/dapo/cispo(含 ScaleRL 四技巧)+ MoE expert 覆盖防护;后训练 workflow 模板(七节点 DAG + 三个 HITL 确认点)
⚙️ FORGE DSH 执行深化收口
- 流式面重建 / 审查 step 分级切分 / usage 自动计量
📊 审计聚合指标
sofagent-audit --stats:安全边界触发率 / 阻断率 / 高危 Top5 +--json+ 落盘——审计从逐次事件变成可汇报的治理 KPI
🧹 存量清扫
- ao 工具链探测删除 /
composeWithDeepAgents更名composeWithReactAgent(旧名 @deprecated 一版)/fde_compose收窄 workflow-only - doctor 补 Ontology 完整性检查:frontmatter 坏格式从静默跳过变 WARN + 修复提示
- 训练反作弊基线默认化:reward hacking 四形态双防线(剥
.git+ 网络白名单)写进默认配置;train doctor补反作弊三项体检
🔒 BugFix(上版遗留)
- 四轮 fresh-eyes 审查 F-01~F-14 全量处置:E1 修复文案语义反转 / S219 阈值校准链对齐 / doctor 全局路径收口 SSOT / hook 基线 fail-closed 化
✅ 质量验证
| 检查项 | 结果 |
|---|---|
| npm test | 3619 tests 全绿 ✅ |
| acceptance-test | 293/293 场景 · 372/372 断言 ✅ |
| shellcheck | 零 error ✅ |
| check-version | 102/102 全绿 ✅ |
| 回归检查 | 96 维度 ✅ |
| release-gate | verdict=GO ✅ |
| fresh-eyes | 4 轮独立审查 ✅ |
⚠️ 破坏性变更
升级必读——两条,第二条有迁移指引。
- MCP 工具数 76→79(新增
train_status/train_list/train_diagnose,全量见AGENTS.md「MCP 全量工具表」) checkHistoryChainIntegrity退役公告(移除归 v1.5.0):布尔返回无法区分「篡改 / 不可复验 / 历史不足」。如遇调用报弃用警告,迁移checkHistoryChainDetailed(dataDir)——原true对应status === 'ok';原false改读结构化字段(tampered/unverifiable/insufficient-history)。迁移示例:engine/audit/src/commands/verify.tsfde_compose收窄为 workflow-only:如遇 ontology action 返回迁移提示,改用fde_derive(五要素 → ontology 草稿)
🔗 深入了解
| 想看什么 | 链接 |
|---|---|
| 全部变更明细 | CHANGELOG |
| 上手指南 | HANDBOOK |
| 有问题 / 晒场景 | Discussions · good first issues |
| npm 包 | @sofagent/audit · @sofagent/fde · 共 13 包(npm) |
📖 详细开发日志