官方用户手册蒸馏 · 19 章结构化知识库 · 从命令速查到完整作业工作流
SLURM 调度·GPU 深度学习·软件模块·数据管理·全量可溯源
SJTU HPC+AI 平台用户手册完整蒸馏 —— 以代码和作业脚本为中心的技术参考
手册为骨 · 脚本为肉 · 全量可溯源 · 精确到 flag 级别
本仓库将SJTU HPC+AI 平台的官方用户手册(27,383 行)与 GitHub 实操仓库、运维脚本、作业模板、使用经验蒸馏为一个统一的、结构化的 Claude Code Skill 知识库,覆盖从集群架构、SLURM 作业调度、Module 环境管理、文件系统与数据传输,到 GPU 深度学习、容器使用、REST API 编程的完整 HPC 技术链 —— 共 19 章。
核心设计理念:这是一个操作技能知识库,而非讲义教材。每章以「怎么做」为核心,精确到命令 flag 和 #SBATCH 参数级别,代码优先、参数全表、反模式标注、可溯源至原始手册章节和脚本文件。
| 数据源 | 角色 | 规模 | 特色 |
|---|---|---|---|
| 交我算用户手册 | 骨架 —— 完整集群架构、SLURM 参考、队列配置 | 27,383 行 | 按集群和功能组织,覆盖 5 大集群、40+ 队列 |
| 交我算简明手册 | 补充 —— HPC Studio、教程型内容 | 手册 PDF | 可视化平台、快速入门导向 |
| sjtu-hpc Skill | 血肉 —— 运维脚本、SLURM 模板、并行配置公式 | 15 篇参考 + 5 脚本 + 6 模板 | 可复用的完整工具链,经实测验证 |
| SJTU-SLURM Skill | SLURM 专项 —— 作业脚本模式、GPU/R/Python 模板 | GitHub 仓库 | 按语言和场景分类的作业模板 |
| 入门指导文件 | 辅助 —— 新手入门、教学练习、平台概览 | 3 份 PDF/DOCX | 平台架构速览、SSH 配置、Linux 基础 |
┌──────────────────────────────────────────────────────────────────────────┐
│ SJTU HPC+AI 平台 · 技术知识库 Skill │
│ 19 章 · 全量可溯源 · 精确到 flag 级别 │
├──────────────────┬───────────────────────┬───────────────────────────────┤
│ 平台与基础设施 (5 章) │ 作业调度与软件 (5 章) │ 进阶专题与 API (9 章) │
├──────────────────┼───────────────────────┼───────────────────────────────┤
│ Ch 1 平台概览与硬件 │ Ch 5 SLURM 作业提交 │ Ch 11 常见问题与排错 │
│ Ch 2 账号与集群登录 │ Ch 6 队列详解与资源选择 │ Ch 12 学科应用软件 │
│ Ch 3 文件系统与数据管理 │ Ch 7 软件模块与编译器 │ Ch 13 GPU 深度学习实战 │
│ Ch 4 数据传输 │ Ch 8 GPU 计算 │ Ch 14 并行配置与性能优化 │
│ │ Ch 9 HPC 可视化平台 │ Ch 15 计费标准与成本管理 │
│ │ Ch 10 容器使用 │ Ch 16 实用脚本与工具 │
│ │ │ Ch 17 进阶故障排查 │
│ │ │ Ch 18 Python/R 环境配置 │
│ │ │ Ch 19 HPC REST API │
└──────────────────┴───────────────────────┴───────────────────────────────┘
| 集群 | 类型 | 节点配置 | 文件系统 | 关键队列 |
|---|---|---|---|---|
| 思源一号 (Siyuan-1) | x86 CPU + A100/A800 GPU | 936 节点 × 64核/512G, 23 节点 × 4×A100 | /dssg (GPFS 23.8PB) | 64c512g, a100, a800, el9 |
| π 2.0 (Pi 2.0) | x86 CPU + V100 GPU | 656 节点 × 40核/192G, 8 DGX-2 | /lustre (25PB) | cpu, small, huge, 192c6t, dgx2 |
| AI 平台 | DGX-2 V100 | 8 节点 × 16×V100 32GB | /lustre | dgx2 |
| ARM 平台 | 鲲鹏 920 | 100 节点 × 128核/256G | /lustre | arm128c256g, scnet_arm |
| 致远一号 (Zhiyuan-1) | 昇腾 910B | 101 CPU 节点, Ascend NPU | Pacific 13.6PB | — |
| 命令/工具 | 章节 | 覆盖内容 |
|---|---|---|
| sbatch / squeue / scancel | Ch 5, 6 | 作业提交、状态查询、队列选择、完整 #SBATCH 参数 |
| sinfo / sacct / scontrol | Ch 5, 17 | 节点状态、历史报告、作业修改、故障排查 |
| srun / salloc | Ch 5 | 交互式作业、资源申请 |
| module (Lmod/Spack) | Ch 7 | 模块加载/搜索/卸载、编译器与 MPI 匹配 |
| scp / rsync / sshfs | Ch 4 | 数据传输、增量同步、远程挂载 |
| conda / pip | Ch 7, 18 | Python/R 环境管理、跨架构迁移 |
| singularity | Ch 10 | 容器构建、Docker→Singularity 转换 |
| nvidia-smi / nvitop | Ch 8, 13 | GPU 监控、显存管理 |
| torchrun / deepspeed | Ch 13 | DDP 多卡训练、ZeRO 优化 |
| quota / lfs quota / mmlsquota | Ch 3, 16 | 存储配额检查 |
.
├── SKILL.md # 主索引 —— 核心框架 · 19 章索引 · 主题索引 · 溯源指南
├── README.md # 本文件
│
├── chapters/ # 核心产出 —— 19 章独立知识单元
│ ├── ch01-platform-overview.md # 平台概览与硬件资源(5 大集群完整配置)
│ ├── ch02-account-login.md # 账号申请与集群登录(SSH 证书、2FA、免密配置)
│ ├── ch03-file-system.md # 文件系统与数据管理(Lustre/GPFS/Scratch/Union/ACL)
│ ├── ch04-data-transfer.md # 数据传输(并行传输、SSHFS 挂载、离线迁移)
│ ├── ch05-slurm-jobs.md # SLURM 作业提交与管理(Array/GPU/大内存/R 作业全模板)
│ ├── ch06-queue-partitions.md # 队列详解与资源选择(12 个队列完整参数)
│ ├── ch07-software-modules.md # 软件模块与编译器(GCC/Intel/MPI/数学库/Conda)
│ ├── ch08-gpu-computing.md # GPU 计算(CUDA/TensorFlow/A100/V100)
│ ├── ch09-hpc-studio.md # HPC 可视化平台(Jupyter/RStudio/MATLAB/ParaView/DeepSeek)
│ ├── ch10-container.md # 容器使用(Singularity 构建节点、Docker 转换)
│ ├── ch11-troubleshooting.md # 常见问题与排错(登录/作业/软件/代理)
│ ├── ch12-applications.md # 学科应用软件(GROMACS/LAMMPS/VASP/OpenFOAM/WRF 等)
│ ├── ch13-gpu-deep-learning.md # GPU 深度学习实战(PyTorch/DDP/DeepSpeed/MIG/OOM 策略)
│ ├── ch14-parallel-config.md # 并行配置与性能优化(worker 公式/超额订阅/targets 模板)
│ ├── ch15-billing-costs.md # 计费标准与成本管理(核时/卡时/存储/省钱策略)
│ ├── ch16-utility-scripts.md # 实用脚本与工具(5 脚本完整源码解析)
│ ├── ch17-advanced-troubleshooting.md # 进阶故障排查(错误码/监控/代理/fail2ban/bashrc 急救)
│ ├── ch18-python-r-env.md # Python/R 环境配置(Conda/GPU/R 并行/Jupyter/跨架构迁移)
│ └── ch19-hpc-api.md # HPC REST API(Token/SSH 证书/配额查询)
│
├── patterns.md # 13 个标准 SLURM 作业脚本模式
├── cheatsheet.md # 速查:命令·队列决策树·文件系统·SBATCH 参数·错误码
├── glossary.md # HPC 核心术语,附章节引用
│
├── books/ # 原始手册
│ ├── hpcmanual/auto/hpcmanual.md # 交我算用户手册(27,383 行)
│ └── hpcbriefmanual/auto/ # 交我算简明手册
│
└── books/manuals/ # 实操资料
└── sjtu-hpc/
├── references/ # 15 篇技术参考文档
├── scripts/ # 5 个运维脚本 + 3 个并行模板
│ ├── backup_to_union.sh # 数据归档(rsync + MD5)
│ ├── cost_estimate.py # 成本估算(12 队列完整定价)
│ ├── hpc-cleanup.sh # 会话清理(4 步检查)
│ ├── hpc-sync.sh # 项目同步(local↔HPC)
│ ├── quota_check.sh # 配额监控(lfs/mmlsquota 自动检测)
│ └── templates/ # config_parallel.py/.R / _targets_hpc.R
└── assets/ # 6 个 SLURM 作业模板
├── slurm-array.slurm # 阵列任务(4 种模式)
├── slurm-large-memory.slurm # 大内存(含内存估算指南)
├── slurm-python-cpu.slurm # Python CPU 作业
├── slurm-python-gpu.slurm # Python GPU 作业(A100)
├── slurm-r-cpu.slurm # R CPU 作业
└── slurm-r-parallel.slurm # R 并行作业(future/furrr)
# 方式 1: 手动克隆(推荐)
# sjtu-hpc即skill名
git clone https://github.com/MaybeBio/HPC-Skill ~/.claude/skills/sjtu-hpc
# 方式 2: 使用 npx
npx skills add MaybeBio/HPC-Skill -a claude-codeSkill 加载后,可直接在对话中查询或手动触发 /sjtu-hpc:
▸ 思源一号 a100 队列怎么提交 GPU 作业?
▸ 怎么查看作业排队原因?PD 很久了
▸ 写一个完整的 PyTorch DDP 多卡训练 SLURM 脚本
▸ Pi 2.0 和思源一号的数据传输节点分别是什么?
▸ 大内存任务应该选哪个队列?
▸ 如何用 conda 在超算上配置 GPU 深度学习环境?
▸ 作业报 node_fail 怎么办?
▸ 如何在本地和 HPC 之间同步项目代码?
| 查询类型 | 目标文件 | 响应特征 |
|---|---|---|
| 命令速查 | cheatsheet.md |
队列决策树 / SBATCH 参数表 / 文件系统矩阵 |
| SLURM 作业脚本 | chapters/ch05-slurm-jobs.md |
完整作业模板 + 内存估算 + Array 模式 |
| 队列选择 | chapters/ch06-queue-partitions.md |
12 队列完整参数 + GPU 配比 + 时间限制 |
| 数据传输 | chapters/ch04-data-transfer.md |
并行传输 / SSHFS / rsync 命令 |
| GPU 深度学习 | chapters/ch13-gpu-deep-learning.md |
CUDA 匹配 / DDP / DeepSpeed / OOM 策略 |
| 故障排查 | chapters/ch17-advanced-troubleshooting.md |
错误码速查 / 代理配置 / fail2ban / bashrc 急救 |
| 作业脚本模板 | patterns.md |
按场景分类的标准 SLURM 模板 |
| 并行配置公式 | chapters/ch14-parallel-config.md |
worker 计算公式 + 数学证明 |
| 成本估算 | chapters/ch15-billing-costs.md |
核时/卡时计费 + 省钱策略 |
| API 编程 | chapters/ch19-hpc-api.md |
Token 认证 / SSH 证书自动化 |
| 术语定义 | glossary.md |
精确定义 + 归属章节 |
| 系统学习 | SKILL.md → chapters/*.md |
Core Frameworks → Chapters → Patterns |
每章按统一模板组织,支持快速定位:
| 区域 | 内容 |
|---|---|
| Core Idea | 一句话说明本章解决什么问题 |
| 命令与参数全表 | 精确命令语法,全部 flag 和参数说明 |
| 作业脚本模板 | 可复制使用的完整 #SBATCH 脚本 |
| 集群差异速查 | 思源一号 / π2.0 / ARM 之间的关键差异 |
| 常见错误与反模式 | 标注 ❌ 错误 vs ✓ 正确的做法 |
| 内存/显存估算 | 数据大小 → 实际资源需求的换算公式 |
| Key Takeaways | 5-8 条必须记住的操作要点 |
每个命令、队列参数、作业脚本模板都可追溯回原始资料:
查询: "a100 队列 GPU 作业脚本"
→ SKILL.md 主题索引 → GPU 作业 → ch05, ch08, ch13
→ chapters/ch05-slurm-jobs.md → GPU 作业模板(含 CUDA 版本匹配)
→ chapters/ch13-gpu-deep-learning.md → PyTorch DDP + DeepSpeed
→ patterns.md → Python GPU 作业 (A100) 完整模板
→ 原始资产: manuals/sjtu-hpc/assets/slurm-python-gpu.slurm
→ 原始手册: books/hpcmanual/auto/hpcmanual.md Ch8 GPU 计算
三条追溯链路:
SKILL.md主题索引 → 话题 → 对应章节- 每章底部 Key Takeaways → 关键操作要点 + 关联章节
glossary.md→ 术语 → 归属章节引用
ch01 (平台概览) → ch02 (SSH 登录) → ch03 (文件系统)
→ ch05 (第一个 sbatch 作业) → ch07 (module 加载软件)
ch13 (CUDA 版本匹配) → ch05 (GPU 作业模板) → ch06 (a100/dgx2 队列选择)
→ ch08 (GPU 计算) → ch18 (Conda GPU 环境) → ch14 (多卡并行公式)
ch06 (队列与资源配置) → ch05 (Array 作业/MPI 多节点)
→ ch15 (成本估算) → ch04 (数据传输) → ch16 (项目同步脚本)
ch16 (实用脚本) → ch19 (REST API) → ch17 (监控与故障排查)
→ ch10 (容器化部署) → ch14 (并行配置模板)
ch07 (module 系统) → ch18 (Python/R conda 环境)
→ ch09 (HPC Studio/Jupyter) → ch10 (Singularity 容器)
本知识库基于以下资料补充整合而成:
| # | 来源 | 说明 |
|---|---|---|
| 1 | 交我算 HPC+AI 平台用户手册 | 上海交通大学网络信息中心官方用户手册(27,383 行),涵盖平台架构、SLURM 调度、软件环境、数据管理、GPU 计算等完整技术文档 |
| 2 | 交我算简明手册 | 平台官方简明使用指南(PDF),侧重 HPC Studio 可视化和快速入门 |
| 3 | sjtu-hpc Skill | 包含 15 篇技术参考文档、5 个运维脚本(backup/cost/cleanup/sync/quota)、6 个 SLURM 作业模板、3 个并行配置模板 |
| 4 | SJTU-SLURM Skill | GitHub 开源仓库,提供按语言(Python/R)和场景(Array/GPU/大内存)分类的作业脚本模板与内存估算指南 |
| 5 | Pi_GetStarted.pdf | π 2.0 集群入门介绍(2021),涵盖硬件配置、SLURM 基本命令、module 系统 |
| 6 | 交我算超算集群新手指导-20250307.pdf | 46 页新手指导幻灯片,涵盖平台架构、SSH 登录(含证书免密)、数据传输、SLURM 作业、module 使用 |
| 7 | lab-use-sjtu-hpc-2025.docx | 2025 年春季上机课实验指导,含 Pi 2.0 队列介绍和 BLAST 实操案例 |
基于SJTU HPC+AI 平台官方用户手册及相关开源资料整合。命令优先,精确到参数,全文可溯源。
交我算官网 · 用户手册 · HPC Studio · 计费系统 ·