Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

2 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

SJTU HPC+AI 平台 · 技术知识库 Skill

官方用户手册蒸馏 · 19 章结构化知识库 · 从命令速查到完整作业工作流

SLURM 调度 · GPU 深度学习 · 软件模块 · 数据管理 · 全量可溯源

Manual Claude Code Chapters Scripts Assets


SJTU HPC+AI 平台用户手册完整蒸馏 —— 以代码和作业脚本为中心的技术参考

手册为骨 · 脚本为肉 · 全量可溯源 · 精确到 flag 级别


目录


概述

本仓库将SJTU HPC+AI 平台的官方用户手册(27,383 行)与 GitHub 实操仓库、运维脚本、作业模板、使用经验蒸馏为一个统一的、结构化的 Claude Code Skill 知识库,覆盖从集群架构、SLURM 作业调度、Module 环境管理、文件系统与数据传输,到 GPU 深度学习、容器使用、REST API 编程的完整 HPC 技术链 —— 共 19 章

核心设计理念:这是一个操作技能知识库,而非讲义教材。每章以「怎么做」为核心,精确到命令 flag 和 #SBATCH 参数级别,代码优先、参数全表、反模式标注、可溯源至原始手册章节和脚本文件。

数据源 角色 规模 特色
交我算用户手册 骨架 —— 完整集群架构、SLURM 参考、队列配置 27,383 行 按集群和功能组织,覆盖 5 大集群、40+ 队列
交我算简明手册 补充 —— HPC Studio、教程型内容 手册 PDF 可视化平台、快速入门导向
sjtu-hpc Skill 血肉 —— 运维脚本、SLURM 模板、并行配置公式 15 篇参考 + 5 脚本 + 6 模板 可复用的完整工具链,经实测验证
SJTU-SLURM Skill SLURM 专项 —— 作业脚本模式、GPU/R/Python 模板 GitHub 仓库 按语言和场景分类的作业模板
入门指导文件 辅助 —— 新手入门、教学练习、平台概览 3 份 PDF/DOCX 平台架构速览、SSH 配置、Linux 基础

平台知识体系

全景图

┌──────────────────────────────────────────────────────────────────────────┐
│              SJTU HPC+AI 平台 · 技术知识库 Skill                           │
│                 19 章 · 全量可溯源 · 精确到 flag 级别                          │
├──────────────────┬───────────────────────┬───────────────────────────────┤
│  平台与基础设施 (5 章) │  作业调度与软件 (5 章)   │  进阶专题与 API (9 章)            │
├──────────────────┼───────────────────────┼───────────────────────────────┤
│ Ch  1 平台概览与硬件   │ Ch  5 SLURM 作业提交      │ Ch 11 常见问题与排错               │
│ Ch  2 账号与集群登录   │ Ch  6 队列详解与资源选择    │ Ch 12 学科应用软件                 │
│ Ch  3 文件系统与数据管理 │ Ch  7 软件模块与编译器     │ Ch 13 GPU 深度学习实战             │
│ Ch  4 数据传输        │ Ch  8 GPU 计算           │ Ch 14 并行配置与性能优化            │
│                      │ Ch  9 HPC 可视化平台      │ Ch 15 计费标准与成本管理            │
│                      │ Ch 10 容器使用           │ Ch 16 实用脚本与工具               │
│                      │                        │ Ch 17 进阶故障排查                 │
│                      │                        │ Ch 18 Python/R 环境配置            │
│                      │                        │ Ch 19 HPC REST API               │
└──────────────────┴───────────────────────┴───────────────────────────────┘

集群覆盖

集群 类型 节点配置 文件系统 关键队列
思源一号 (Siyuan-1) x86 CPU + A100/A800 GPU 936 节点 × 64核/512G, 23 节点 × 4×A100 /dssg (GPFS 23.8PB) 64c512g, a100, a800, el9
π 2.0 (Pi 2.0) x86 CPU + V100 GPU 656 节点 × 40核/192G, 8 DGX-2 /lustre (25PB) cpu, small, huge, 192c6t, dgx2
AI 平台 DGX-2 V100 8 节点 × 16×V100 32GB /lustre dgx2
ARM 平台 鲲鹏 920 100 节点 × 128核/256G /lustre arm128c256g, scnet_arm
致远一号 (Zhiyuan-1) 昇腾 910B 101 CPU 节点, Ascend NPU Pacific 13.6PB

核心命令覆盖

命令/工具 章节 覆盖内容
sbatch / squeue / scancel Ch 5, 6 作业提交、状态查询、队列选择、完整 #SBATCH 参数
sinfo / sacct / scontrol Ch 5, 17 节点状态、历史报告、作业修改、故障排查
srun / salloc Ch 5 交互式作业、资源申请
module (Lmod/Spack) Ch 7 模块加载/搜索/卸载、编译器与 MPI 匹配
scp / rsync / sshfs Ch 4 数据传输、增量同步、远程挂载
conda / pip Ch 7, 18 Python/R 环境管理、跨架构迁移
singularity Ch 10 容器构建、Docker→Singularity 转换
nvidia-smi / nvitop Ch 8, 13 GPU 监控、显存管理
torchrun / deepspeed Ch 13 DDP 多卡训练、ZeRO 优化
quota / lfs quota / mmlsquota Ch 3, 16 存储配额检查

仓库结构

.
├── SKILL.md                           # 主索引 —— 核心框架 · 19 章索引 · 主题索引 · 溯源指南
├── README.md                          # 本文件
│
├── chapters/                          # 核心产出 —— 19 章独立知识单元
│   ├── ch01-platform-overview.md      # 平台概览与硬件资源(5 大集群完整配置)
│   ├── ch02-account-login.md          # 账号申请与集群登录(SSH 证书、2FA、免密配置)
│   ├── ch03-file-system.md            # 文件系统与数据管理(Lustre/GPFS/Scratch/Union/ACL)
│   ├── ch04-data-transfer.md          # 数据传输(并行传输、SSHFS 挂载、离线迁移)
│   ├── ch05-slurm-jobs.md             # SLURM 作业提交与管理(Array/GPU/大内存/R 作业全模板)
│   ├── ch06-queue-partitions.md       # 队列详解与资源选择(12 个队列完整参数)
│   ├── ch07-software-modules.md       # 软件模块与编译器(GCC/Intel/MPI/数学库/Conda)
│   ├── ch08-gpu-computing.md          # GPU 计算(CUDA/TensorFlow/A100/V100)
│   ├── ch09-hpc-studio.md             # HPC 可视化平台(Jupyter/RStudio/MATLAB/ParaView/DeepSeek)
│   ├── ch10-container.md              # 容器使用(Singularity 构建节点、Docker 转换)
│   ├── ch11-troubleshooting.md        # 常见问题与排错(登录/作业/软件/代理)
│   ├── ch12-applications.md           # 学科应用软件(GROMACS/LAMMPS/VASP/OpenFOAM/WRF 等)
│   ├── ch13-gpu-deep-learning.md      # GPU 深度学习实战(PyTorch/DDP/DeepSpeed/MIG/OOM 策略)
│   ├── ch14-parallel-config.md        # 并行配置与性能优化(worker 公式/超额订阅/targets 模板)
│   ├── ch15-billing-costs.md          # 计费标准与成本管理(核时/卡时/存储/省钱策略)
│   ├── ch16-utility-scripts.md        # 实用脚本与工具(5 脚本完整源码解析)
│   ├── ch17-advanced-troubleshooting.md  # 进阶故障排查(错误码/监控/代理/fail2ban/bashrc 急救)
│   ├── ch18-python-r-env.md           # Python/R 环境配置(Conda/GPU/R 并行/Jupyter/跨架构迁移)
│   └── ch19-hpc-api.md               # HPC REST API(Token/SSH 证书/配额查询)
│
├── patterns.md                        # 13 个标准 SLURM 作业脚本模式
├── cheatsheet.md                      # 速查:命令·队列决策树·文件系统·SBATCH 参数·错误码
├── glossary.md                        # HPC 核心术语,附章节引用
│
├── books/                             # 原始手册
│   ├── hpcmanual/auto/hpcmanual.md    # 交我算用户手册(27,383 行)
│   └── hpcbriefmanual/auto/           # 交我算简明手册
│
└── books/manuals/                           # 实操资料
    └── sjtu-hpc/
        ├── references/                # 15 篇技术参考文档
        ├── scripts/                   # 5 个运维脚本 + 3 个并行模板
        │   ├── backup_to_union.sh     # 数据归档(rsync + MD5)
        │   ├── cost_estimate.py       # 成本估算(12 队列完整定价)
        │   ├── hpc-cleanup.sh         # 会话清理(4 步检查)
        │   ├── hpc-sync.sh            # 项目同步(local↔HPC)
        │   ├── quota_check.sh         # 配额监控(lfs/mmlsquota 自动检测)
        │   └── templates/             # config_parallel.py/.R / _targets_hpc.R
        └── assets/                    # 6 个 SLURM 作业模板
            ├── slurm-array.slurm      # 阵列任务(4 种模式)
            ├── slurm-large-memory.slurm  # 大内存(含内存估算指南)
            ├── slurm-python-cpu.slurm    # Python CPU 作业
            ├── slurm-python-gpu.slurm    # Python GPU 作业(A100)
            ├── slurm-r-cpu.slurm         # R CPU 作业
            └── slurm-r-parallel.slurm    # R 并行作业(future/furrr)

安装与使用

安装

# 方式 1: 手动克隆(推荐)
# sjtu-hpc即skill名
git clone https://github.com/MaybeBio/HPC-Skill ~/.claude/skills/sjtu-hpc

# 方式 2: 使用 npx
npx skills add MaybeBio/HPC-Skill -a claude-code

在 Claude Code 中调用

Skill 加载后,可直接在对话中查询或手动触发 /sjtu-hpc

▸ 思源一号 a100 队列怎么提交 GPU 作业?
▸ 怎么查看作业排队原因?PD 很久了
▸ 写一个完整的 PyTorch DDP 多卡训练 SLURM 脚本
▸ Pi 2.0 和思源一号的数据传输节点分别是什么?
▸ 大内存任务应该选哪个队列?
▸ 如何用 conda 在超算上配置 GPU 深度学习环境?
▸ 作业报 node_fail 怎么办?
▸ 如何在本地和 HPC 之间同步项目代码?

查询路由

查询类型 目标文件 响应特征
命令速查 cheatsheet.md 队列决策树 / SBATCH 参数表 / 文件系统矩阵
SLURM 作业脚本 chapters/ch05-slurm-jobs.md 完整作业模板 + 内存估算 + Array 模式
队列选择 chapters/ch06-queue-partitions.md 12 队列完整参数 + GPU 配比 + 时间限制
数据传输 chapters/ch04-data-transfer.md 并行传输 / SSHFS / rsync 命令
GPU 深度学习 chapters/ch13-gpu-deep-learning.md CUDA 匹配 / DDP / DeepSpeed / OOM 策略
故障排查 chapters/ch17-advanced-troubleshooting.md 错误码速查 / 代理配置 / fail2ban / bashrc 急救
作业脚本模板 patterns.md 按场景分类的标准 SLURM 模板
并行配置公式 chapters/ch14-parallel-config.md worker 计算公式 + 数学证明
成本估算 chapters/ch15-billing-costs.md 核时/卡时计费 + 省钱策略
API 编程 chapters/ch19-hpc-api.md Token 认证 / SSH 证书自动化
术语定义 glossary.md 精确定义 + 归属章节
系统学习 SKILL.mdchapters/*.md Core Frameworks → Chapters → Patterns

每章结构

每章按统一模板组织,支持快速定位:

区域 内容
Core Idea 一句话说明本章解决什么问题
命令与参数全表 精确命令语法,全部 flag 和参数说明
作业脚本模板 可复制使用的完整 #SBATCH 脚本
集群差异速查 思源一号 / π2.0 / ARM 之间的关键差异
常见错误与反模式 标注 ❌ 错误 vs ✓ 正确的做法
内存/显存估算 数据大小 → 实际资源需求的换算公式
Key Takeaways 5-8 条必须记住的操作要点

多源数据整合

可溯源性

每个命令、队列参数、作业脚本模板都可追溯回原始资料:

查询: "a100 队列 GPU 作业脚本"
  → SKILL.md 主题索引 → GPU 作业 → ch05, ch08, ch13
  → chapters/ch05-slurm-jobs.md → GPU 作业模板(含 CUDA 版本匹配)
  → chapters/ch13-gpu-deep-learning.md → PyTorch DDP + DeepSpeed
  → patterns.md → Python GPU 作业 (A100) 完整模板
  → 原始资产: manuals/sjtu-hpc/assets/slurm-python-gpu.slurm
  → 原始手册: books/hpcmanual/auto/hpcmanual.md Ch8 GPU 计算

三条追溯链路:

  1. SKILL.md 主题索引 → 话题 → 对应章节
  2. 每章底部 Key Takeaways → 关键操作要点 + 关联章节
  3. glossary.md → 术语 → 归属章节引用

使用路径建议

路径 1: 新手快速上手

ch01 (平台概览) → ch02 (SSH 登录) → ch03 (文件系统)
    → ch05 (第一个 sbatch 作业) → ch07 (module 加载软件)

路径 2: GPU 深度学习训练

ch13 (CUDA 版本匹配) → ch05 (GPU 作业模板) → ch06 (a100/dgx2 队列选择)
    → ch08 (GPU 计算) → ch18 (Conda GPU 环境) → ch14 (多卡并行公式)

路径 3: 大规模计算项目

ch06 (队列与资源配置) → ch05 (Array 作业/MPI 多节点)
    → ch15 (成本估算) → ch04 (数据传输) → ch16 (项目同步脚本)

路径 4: 运维与自动化

ch16 (实用脚本) → ch19 (REST API) → ch17 (监控与故障排查)
    → ch10 (容器化部署) → ch14 (并行配置模板)

路径 5: 环境与软件配置

ch07 (module 系统) → ch18 (Python/R conda 环境)
    → ch09 (HPC Studio/Jupyter) → ch10 (Singularity 容器)

参考资料来源

本知识库基于以下资料补充整合而成:

# 来源 说明
1 交我算 HPC+AI 平台用户手册 上海交通大学网络信息中心官方用户手册(27,383 行),涵盖平台架构、SLURM 调度、软件环境、数据管理、GPU 计算等完整技术文档
2 交我算简明手册 平台官方简明使用指南(PDF),侧重 HPC Studio 可视化和快速入门
3 sjtu-hpc Skill 包含 15 篇技术参考文档、5 个运维脚本(backup/cost/cleanup/sync/quota)、6 个 SLURM 作业模板、3 个并行配置模板
4 SJTU-SLURM Skill GitHub 开源仓库,提供按语言(Python/R)和场景(Array/GPU/大内存)分类的作业脚本模板与内存估算指南
5 Pi_GetStarted.pdf π 2.0 集群入门介绍(2021),涵盖硬件配置、SLURM 基本命令、module 系统
6 交我算超算集群新手指导-20250307.pdf 46 页新手指导幻灯片,涵盖平台架构、SSH 登录(含证书免密)、数据传输、SLURM 作业、module 使用
7 lab-use-sjtu-hpc-2025.docx 2025 年春季上机课实验指导,含 Pi 2.0 队列介绍和 BLAST 实操案例

基于SJTU HPC+AI 平台官方用户手册及相关开源资料整合。命令优先,精确到参数,全文可溯源。

交我算官网 · 用户手册 · HPC Studio · 计费系统 ·

About

Claude code skill for SJTU HPC operation & QA

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages