15 个参考仓库 · 9 章结构化知识库 · 从工具速查到跨组学工作流设计
Bulk多组学数据分析
RNA-seq·ChIP-seq·ATAC-seq·Hi-C·DNA-seq·Proteomics·Cancer Genomics·Multi-omics Integration
8 个组学领域 · 15 个社区精选仓库的完整参考 —— 以工具组合与分析决策为中心的技术参考
工具选择 · 流程设计 · 跨组学整合 · 全量可溯源
本仓库参考 15 个社区维护的组学资料(覆盖 RNA-seq、ChIP-seq、ATAC-seq、Hi-C、DNA-seq、Proteomics、Cancer Genomics、Multi-omics 共 8 个组学领域)整合为一个统一的、结构化的 Claude Code Skill 知识库,覆盖从单组学分析流程、工具选择到多组学整合策略的完整生物信息学工具链 —— 共 9 章 + 50 条术语 + 12 个分析模式 + 速查决策表。
核心设计理念:这是一个决策与代码编写技能,而非理论教材。每章以「如何选工具、如何组合流程」为核心,精确到参数 flag 级别,决策表优先、工具矩阵全表、反模式标注、可溯源至原始仓库。
| 维度 | 内容 |
|---|---|
| 组学领域 | RNA-seq, ChIP-seq, ATAC-seq, Hi-C, DNA-seq (SNP/CNV/Methylation), Proteomics |
| 整合方法 | MOFA, mixOmics/DIABLO, SNF, JIVE, CCA, RGCCA, iCluster, autoencoders |
| 专项应用 | Cancer Genomics & TCGA, Survival Analysis, Drug Target Discovery |
| 工具覆盖 | 200+ 生物信息学工具:DESeq2, MACS2, Juicer, GATK, MaxQuant 等 |
┌──────────────────────────────────────────────────────────────────────────┐
│ Multi-Omics Bulk Analysis · Decision-Writing Skill │
│ 9 章 · 全量可溯源 · 精确到 flag 级别 │
├─────────────────────┬────────────────────┬────────────────────────────────┤
│ 核心组学流程 (6 章) │ 整合与分析 (2 章) │ 专项应用 (1 章) │
├─────────────────────┼────────────────────┼───────────────────────────────┤
│ Ch 1 RNA-seq │ Ch 8 多组学整合 │ Ch 7 癌症基因组学 & TCGA │
│ DESeq2/edgeR/limma │ MOFA/DIABLO/SNF │ 生存分析/驱动基因/突变签名 │
│ │ JIVE/CCA/autoencoder│ │
│ Ch 2 ChIP-seq │ Ch 9 跨组学工作流 │ │
│ MACS2/IDR/DiffBind │ 5 个端到端模板 │ │
│ 模体分析/超增强子 │ 工具组合矩阵 │ │
│ │ 批次校正 │ │
│ Ch 3 ATAC-seq │ │ │
│ ENCODE 流程 │ │ │
│ 差异可及性/footprinting│ │ │
│ │ │ │
│ Ch 4 Hi-C & 3D 基因组│ │ │
│ Juicer/HiC-Pro │ │ │
│ TAD/loop 检测 │ │ │
│ │ │ │
│ Ch 5 DNA-seq │ │ │
│ 变异/CNV/SV/甲基化 │ │ │
│ │ │ │
│ Ch 6 Proteomics │ │ │
│ MaxQuant/DIA-NN │ │ │
│ DEP/limma │ │ │
└─────────────────────┴────────────────────┴────────────────────────────────┘
| 工具 | 组学领域 | 章节 | 用途 |
|---|---|---|---|
| DESeq2 / edgeR / limma-voom | RNA-seq | Ch 1 | 基因差异表达分析 |
| Salmon / Kallisto / STAR | RNA-seq | Ch 1 | 定量与比对 |
| MACS2 / SICER / epic2 | ChIP-seq / ATAC-seq | Ch 2, 3 | Peak calling(窄峰/宽峰) |
| DiffBind / csaw | ChIP-seq / ATAC-seq | Ch 2, 3 | 差异结合/差异可及性 |
| HOMER / MEME / gimmemotifs | ChIP-seq / ATAC-seq | Ch 2 | 模体富集分析 |
| ROSE / CREAM | ChIP-seq | Ch 2 | 超增强子鉴定 |
| IDR | ChIP-seq / ATAC-seq | Ch 2 | 重复间一致性评估 |
| Juicer / HiC-Pro / FAN-C | Hi-C | Ch 4 | Hi-C 数据处理 |
| cooltools / HiCcompare | Hi-C | Ch 4 | 区室/TAD/Loop 分析 |
| GATK / DeepVariant / Strelka2 | DNA-seq | Ch 5 | 变异检测(种系/体细胞) |
| ANNOVAR / VEP / SnpEff | DNA-seq | Ch 5 | 变异注释 |
| Bismark / minfi / methylKit | DNA-seq | Ch 5 | DNA 甲基化分析 |
| MaxQuant / FragPipe / DIA-NN | Proteomics | Ch 6 | 蛋白质鉴定与定量 |
| MOFA / MOFA2 | Multi-omics | Ch 8 | 无监督多组学因子分析 |
| DIABLO / mixOmics | Multi-omics | Ch 8 | 有监督多组学生物标志物发现 |
| SNF / iClusterPlus | Multi-omics | Ch 8 | 多组学聚类与癌症分型 |
| MultiAssayExperiment | Multi-omics | Ch 8, 9 | R 多组学数据容器 |
| TCGAbiolinks / TCGA2STAT | Cancer | Ch 7 | TCGA 数据获取 |
.
├── README.md # 本文件
├── SKILL.md # 主索引 —— 核心框架 · 9 章索引 · 主题索引 · 溯源指南
│
├── chapters/ # 核心产出 —— 9 章独立知识单元
│ ├── ch01-rna-seq-analysis.md # RNA-seq 分析生态:定量、差异分析、标准化、功能分析
│ ├── ch02-chip-seq-analysis.md # ChIP-seq 分析生态:peak calling、差异结合、模体分析、CUT&RUN
│ ├── ch03-atac-seq-analysis.md # ATAC-seq 分析流程:ENCODE 管线、差异可及性、footprinting
│ ├── ch04-hic-3d-genomics.md # Hi-C & 3D 基因组:7 阶段分析管线、TAD/loop 检测、Capture Hi-C
│ ├── ch05-dna-seq-variant-methylation.md # DNA-seq:变异检测、CNV/SV、突变签名、甲基化分析
│ ├── ch06-proteomics.md # 蛋白质组学:MaxQuant、DDA/DIA、差异蛋白分析
│ ├── ch07-cancer-genomics-tcga.md # 癌症基因组学 & TCGA:生存分析、驱动基因、分型策略
│ ├── ch08-multi-omics-integration.md # 多组学整合策略:MOFA、DIABLO、SNF、JIVE、autoencoder、方法选择指南
│ └── ch09-cross-omics-workflows.md # 跨组学工作流:5 个端到端模板、工具组合矩阵、批次校正
│
├── patterns.md # 12 个标准分析模式 (Salmon→DESeq2, MACS2→IDR→DiffBind, MOFA↔Clinical…)
├── cheatsheet.md # 速查:工具决策表 · 阈值与默认值 · 常见问题诊断
├── glossary.md # 50 组学分析核心术语,附章节引用
│
└── manuals/ # 原始资料 —— 15 个社区仓库 README
├── RNA-seq/
│ ├── crazyhottommy_RNA-seq-analysis_README.md
│ ├── mdozmorov_RNA-seq_README.md
│ └── mdozmorov_RNA-seq_notes_README.md
├── ChIP-seq/
│ ├── crazyhottommy_ChIP-seq-analysis.md
│ └── mdozmorov_ChIP-seq_notes_README.md
├── ATAC-seq/
│ └── reskejak_ATAC-seq_README.md
├── Hi-C/
│ ├── mdozmorov_HiC_data_README.md
│ └── mdozmorov_HiC_tools_README.md
├── DNA-seq/
│ ├── crazyhottommy_DNA-methylation-analysis_README.md
│ ├── crazyhottommy_DNA-seq-analysis_README.md
│ └── mdozmorov_SNP_notes_README.md
├── Proteomics/
│ └── crazyhottommy_awesome-proteomics_README.md
├── Cancer/
│ ├── mdozmorov_Cancer_notes_README.md
│ └── mdozmorov_TCGAsurvival_README.md
└── Multi-omics/
└── mikelove_awesome-multi-omics_README.md
# 方式 1: 手动克隆(推荐)
# bulk-omics为skill名
git clone https://github.com/MaybeBio/Bulk-Omics-Skill ~/.claude/skills/bulk-omics
# 方式 2: 使用 npx(不推荐)
# 同样文件夹名即skill名 bulk-omics,但只有SKILL.md文件,其余reference全无
npx skills add MaybeBio/Bulk-Omics-Skill -a claude-code
Skill 加载后,可直接在对话中查询或手动触发 /bulk-omics:
▸ RNA-seq 差异表达分析,DESeq2 vs edgeR 怎么选?
▸ ChIP-seq peak calling,broad peak 用什么工具?
▸ ATAC-seq 的标准 ENCODE 流程怎么跑?
▸ Hi-C 数据质量差怎么办?TAD 检测哪个工具更准?
▸ 体细胞突变检测,MuTect2 vs Strelka2 如何选择?
▸ 蛋白质组差异分析,DDA 和 DIA 哪个更适合?
▸ TCGA 数据做生存分析,完整流程是什么?
▸ 多组学整合,MOFA 和 DIABLO 各适合什么场景?
▸ 癌症分型:SNF 和 iClusterPlus 有何异同?
▸ 如何设计一个 RNA-seq + ChIP-seq + ATAC-seq 的三组学实验?
| 查询类型 | 目标文件 | 响应特征 |
|---|---|---|
| 工具选择 | cheatsheet.md |
决策表 / 对比赛 / 工具推荐矩阵 |
| 命令 & flag 语法 | chapters/ch*-*.md |
精确命令 + 完整 flag 表 |
| 多组学整合方法选择 | chapters/ch08-multi-omics-integration.md |
目标 → 方法 → 工具映射 |
| 端到端分析流程 | patterns.md |
Salmon→DESeq2 / MACS2→IDR→DiffBind / MOFA→Clinical 等 12 个模式 |
| 跨组学工作流 | chapters/ch09-cross-omics-workflows.md |
5 个端到端模板 + 工具组合矩阵 |
| 术语定义 | glossary.md |
50 个精确定义 + 归属章节 |
| 系统学习 | SKILL.md → chapters/*.md |
Core Frameworks → 各章节 → 参考文件 |
每章按统一模板组织,支持快速定位:
| 区域 | 内容 |
|---|---|
| Core Idea | 本章最核心的一件事 |
| Frameworks Introduced | 命名框架,精确到原文表述,含何时使用、如何使用 |
| Key Concepts | 5-10 个核心术语及精确定义 |
| Mental Models | 2-4 个思维工具("在 X 场景下使用 Y") |
| Anti-patterns | 常见错误做法及原因 |
| Code Examples | 关键命令和代码片段,保留精确语法 |
| Reference Tables | 工具对比表、参数矩阵、决策表 |
| Key Takeaways | 3-7 条必须记住的操作要点 |
| Connects To | 与其它章节的关联链 |
本技能基于以下 15 个社区维护的 GitHub 仓库整合而成:
| 仓库 | 作者 | 内容 |
|---|---|---|
| RNA-seq-analysis | crazyhottommy | RNA-seq 工具全景:QC、比对、定量、差异分析、可变剪切、融合基因、单细胞 |
| RNA-seq | mdozmorov | RNA-seq 工具与资源精选集合 |
| RNA-seq_notes | mdozmorov | RNA-seq 分析笔记与工具整理 |
| 仓库 | 作者 | 内容 |
|---|---|---|
| ChIP-seq-analysis | crazyhottommy | ChIP-seq 全覆盖:peak calling、差异分析、模体、超增强子、CUT&RUN、ATAC/DNase-seq、Hi-C |
| ChIP-seq_notes | mdozmorov | ChIP-seq 数据资源与分析工具详尽笔记 |
| 仓库 | 作者 | 内容 |
|---|---|---|
| ATAC-seq | reskejak | ENCODE/Kundaje 实验室管线,csaw 差异可及性 R 分析 |
| 仓库 | 作者 | 内容 |
|---|---|---|
| HiC_tools | mdozmorov | Hi-C 工具全目录:管线、QC、标准化、区室、TAD/loop、差异分析、可视化、ML |
| HiC_data | mdozmorov | Hi-C 公开数据资源与文献集合 |
| 仓库 | 作者 | 内容 |
|---|---|---|
| SNP_notes | mdozmorov | SNP/变异检测:GATK、DeepVariant、注释、突变签名、GWAS、CNV/SV |
| DNA-seq-analysis | crazyhottommy | DNA-seq 通用分析工具资源 |
| DNA-methylation-analysis | crazyhottommy | DNA 甲基化分析工具集 |
| 仓库 | 作者 | 内容 |
|---|---|---|
| awesome-proteomics | crazyhottommy | 蛋白质组学工具与学习资源 |
| 仓库 | 作者 | 内容 |
|---|---|---|
| Cancer_notes | mdozmorov | 癌症基因组学综合工具与数据库 |
| TCGAsurvival | mdozmorov | TCGA 生存分析脚本与数据准备 |
| 仓库 | 作者 | 内容 |
|---|---|---|
| awesome-multi-omics | mikelove | 核心仓库:多组学软件全目录,覆盖 CCA/因子分析/聚类/autoencoder/网络/模拟 + 综述论文集合 |
每个工具推荐和命令都可追溯回原始仓库:
查询: "MOFA 多组学因子分析"
→ cheatsheet.md → "Which Multi-omics Integration Method?"
→ ch08 Multi-omics Integration Strategies
→ 原始来源: mikelove/awesome-multi-omics — Factor analysis section
→ 原始文件: manuals/Multi-omics/mikelove_awesome-multi-omics_README.md
查询: "DESeq2 差异表达分析"
→ ch01 RNA-seq Analysis Ecosystem → Differential Expression
→ 原始来源: crazyhottommy/RNA-seq-analysis + mdozmorov/RNA-seq_notes
→ 原始文件: manuals/RNA-seq/*
三条追溯链路:
SKILL.md主题索引 → 话题 → 对应章节cheatsheet.md决策表 → 场景 → 工具推荐 → 章节引用- 每章
Connects To→ 交叉引用其它相关章节
ch01 (RNA-seq: DESeq2/edgeR) → ch02 (ChIP-seq: MACS2) → ch03 (ATAC-seq: ENCODE 流程)
→ ch08 (多组学整合方法选择) → ch09 (跨组学工作流模板)
ch01 (差异表达) → ch02 (TF binding peaks + motif) → ch03 (差异可及性)
→ ch09 (Workflow 1: Gene Regulation Triangulation → BETA/MARGE)
ch07 (TCGA 数据获取 + 生存分析) → ch05 (体细胞突变 + CNV)
→ ch08 (SNF/iClusterPlus 分型方法) → ch09 (Workflow 2: Cancer Subtyping)
ch04 (Hi-C 流程: Juicer → cooltools → TAD/Loop)
→ ch02 (ChIP-seq peaks + chromatin state) → ch03 (ATAC-seq 可及性)
→ ch09 (Workflow 4: 3D Genome + Epigenome Integration)
ch01 (预处理) + ch02 (预处理) + ch05 (预处理) → ch08 (MOFA 因子分析)
→ ch09 (Workflow 5: Multi-omics Factor Discovery → Clinical Correlation)
ch05 (GATK/DeepVariant 变异检测 + ANNOVAR 注释)
→ ch01 (eQTL: SNP-gene 关联) → ch02 (ChIP-seq TF 结合位点)
→ ch09 (Workflow 3: Variant → Multi-omics Functional Impact)
| 来源 | 仓库数 | 文件行数 | 已参考 | 覆盖率 |
|---|---|---|---|---|
| 社区精选仓库 | 15 | ~9,600 | 9 章 + 3 份参考文件 | 核心内容全覆盖 |
| 组学领域 | 8 | — | 全 8 类 + 整合专题 | 100% |
| 分析模式 | — | — | 12 个标准模式 | — |
| 关键术语 | — | — | 50 条(附章节引用) | — |
| 集成方法 | — | — | 10+ 种(MOFA/DIABLO/SNF/JIVE/CCA/AE…) | 主流全覆盖 |
⚠️ 待仓库更新,同步补充
基于 15 个社区维护 GitHub 仓库整合 · 代码优先 · 精确到 flag 级别 · 全文可溯源