官方文档蒸馏 · 55 章结构化知识库 · 从 API 速查到代码模板
scikit-learn v1.9.0·机器学习·代码参考·可溯源
scikit-learn v1.9.0 官方文档+代码示例的完整蒸馏 —— 以代码为中心的机器学习技术参考
用户指南为骨 · 示例代码为肉 · 全量可溯源
本仓库将 scikit-learn v1.9.0 官方文档(scikit-learn.cn 中文镜像)的 373 个源文件(用户指南 68 篇 + API 参考 + 词汇表 + 303 个代码示例)蒸馏为一个统一的、结构化的 Claude Code Skill 知识库,覆盖从线性模型、SVM、决策树到深度学习、强化学习、元学习的完整机器学习工具链 —— 共 55 章。
核心设计理念:这是一个代码编写技能,而非理论教材。每章以「如何用」为核心,代码优先、参数列优先级、反模式标注、可溯源至原始示例文件编号。
| 数据源 | 角色 | 文件数 | 特色 |
|---|---|---|---|
| 用户指南 (01–68) | 骨架 —— API 说明、参数指南、使用建议 | 68 | 按模型族/ML 阶段组织,涵盖所有估算器和参数 |
| 代码示例 (71–373) | 血肉 —— 可复用代码模板 | 303 | 完整 Python 脚本,真实数据集,最佳实践 |
┌───────────────────────────────────────────────────────────────────────┐
│ scikit-learn v1.9.0 · Code-Writing Skill │
│ 55 章 · 可溯源代码知识库 │
├──────────────────┬───────────────────────┬────────────────────────────┤
│ 监督学习 (17 章) │ 无监督学习 (9 章) │ 模型工程 (17 章) │
├──────────────────┼───────────────────────┼────────────────────────────┤
│ Ch 4 线性模型 │ Ch 22 高斯混合 │ Ch 32 交叉验证 │
│ Ch 5 LDA / QDA │ Ch 23 流形学习 │ Ch 33 网格搜索 │
│ Ch 6 核岭回归 │ Ch 24 聚类 │ Ch 34 分类阈值调优 │
│ Ch 7 SVM │ Ch 25 双聚类 │ Ch 35 指标与评分 │
│ Ch 8 SGD │ Ch 26 降维与分解 │ Ch 36 学习曲线 │
│ Ch 9 K近邻 │ Ch 27 协方差估计 │ Ch 37 元数据路由 (1.9 实验性) │
│ Ch 10 高斯过程 │ Ch 28 异常检测 │ Ch 38–40 模型解释 │
│ Ch 11 交叉分解 │ Ch 29 密度估计 │ Ch 41 可视化 │
│ Ch 12 朴素贝叶斯 │ Ch 30 无监督神经网络 │ Ch 42 回调 (1.9 实验性) │
│ Ch 13 决策树 │ │ Ch 44 流水线与列变换器 │
│ Ch 14 集成学习 │ │ Ch 45–52 数据变换 │
│ Ch 15 多分类 │ │ Ch 54–67 数据/计算/陷阱 │
│ Ch 16 特征选择 │ │ │
│ Ch 17 半监督学习 │ │ │
│ Ch 18 保序回归 │ │ │
│ Ch 19 概率校准 │ │ │
│ Ch 20 有监督神经网络│ │ │
└──────────────────┴───────────────────────┴────────────────────────────┘
| 主题 | 用户指南 | 示例文件 | 对应章节 |
|---|---|---|---|
| 线性回归 / Ridge / Lasso / ElasticNet | 04 | 215–249 (35 个) | Ch 4 |
| SVC / SVR / OneClassSVM / 核方法 | 07 | 354–368 (15 个) | Ch 7 |
| SGDClassifier / partial_fit / 在线学习 | 08 | 219, 244–247 | Ch 8, 59 |
| 随机森林 / HGBT / AdaBoost / Stacking | 14 | 149–172 (24 个) | Ch 14 |
| KMeans / DBSCAN / HDBSCAN / 层次聚类 | 24 | 90–118 (29 个) | Ch 24 |
| PCA / NMF / FastICA / KernelPCA / LDA | 26 | 135–146 (12 个) | Ch 26 |
| StandardScaler / OneHotEncoder / TargetEncoder | 46 | 338–346 (9 个) | Ch 46 |
| GridSearchCV / RandomizedSearchCV / Halving | 33 | 285–304 | Ch 33 |
| Pipeline / ColumnTransformer / FeatureUnion | 44 | 331–337 (7 个) | Ch 44 |
| CountVectorizer / TfidfVectorizer / HashingVectorizer | 45 | 369–372 (4 个) | Ch 45 |
| IsolationForest / LOF / OneClassSVM / EllipticEnvelope | 28 | 163, 180, 267, 272, 323, 324 | Ch 28 |
| CalibratedClassifierCV / calibration_curve | 19 | 77–81 (5 个) | Ch 19 |
| Callbacks (ProgressBar / ScoringMonitor) [1.9 新增] | 42 | 72, 83 | Ch 42 |
| FrozenEstimator [1.9 新增] | — | 195 | Ch 14 |
.
├── CLAUDE.md # 仓库说明与操作指引
├── README.md # 本文件
├── SKILL.md # 主索引 —— 核心框架 · 55 章索引 · 主题索引 · 可溯源性指南
│
├── chapters/ # 核心产出 —— 55 章独立知识单元
│ ├── ch04-linear-model.md # 线性模型(17 个估算器,35 个示例)
│ ├── ch07-svm.md # 支持向量机(8 个估算器,15 个示例,含源文件对照表)
│ ├── ch14-ensemble.md # 集成学习(19 个估算器,24 个示例)
│ ├── ch24-clustering.md # 聚类(16 个估算器,29 个示例)
│ ├── ch33-grid-search.md # 超参数调优(GridSearchCV / RandomizedSearchCV / Halving)
│ ├── ch46-preprocessing.md # 预处理(20+ 个变换器,9 个示例)
│ ├── ch63-common-pitfalls.md # 常见陷阱(数据泄露等 9 大问题)
│ └── ... (55 files total)
│
├── api-reference.md # 493 个 API 条目,按 55 个模块组织,附章节引用
├── examples-index.md # ~270 个代码示例全量索引(文件编号 · 演示内容 · 关键 API · 归属章节)
├── source-mapping.md # 章节 ↔ 源文件编号对照表(完整可溯源性)
├── patterns.md # 10 个可复用设计模式(Pipeline+GridSearch、HGBT、SGD 增量等)
├── cheatsheet.md # 速查:估算器选型 · 正则化方向 · 缩放器选择 · Tells & Smells
├── glossary.md # 核心术语字母排序,每术语附章节引用
│
└── version_1_9_0/ # 原始文档(373 个 Markdown 文件)
├── 01_install.md ~ 68_presentations.md # 用户指南 (68 篇)
├── 69_index.md # API 参考
├── 70_glossary.md # 词汇表
└── 71_example_index.md ~ 373_getting_started.md # 代码示例 (303 个)
# 方式 1: 手动克隆(推荐)
# sklearn即skill名
git clone https://github.com/MaybeBio/Sklearn-Skill ~/.claude/skills/sklearn
# 方式 2: 使用 npx
npx skills add MaybeBio/Sklearn-Skill -a claude-code原本规划skill名为/sklearn-v190,考虑到后续更新,暂统一为/sklearn
Skill 加载后,可直接在对话中查询或手动触发 /sklearn:
▸ SVC 的 C 和 gamma 参数怎么调?
▸ 文本分类的标准 pipeline 怎么写?
▸ 给我写一个随机森林 + 网格搜索 + 交叉验证的完整模板
▸ 数据有缺失值怎么办?SimpleImputer 和 KNNImputer 选哪个?
▸ 如何防止数据泄露?Pipeline 的正确用法?
▸ StandardScaler vs MinMaxScaler vs RobustScaler 什么时候用哪个?
▸ HistGradientBoosting 比 XGBoost 好用吗?
▸ 如何追踪代码示例的原始来源文件?
| 查询类型 | 目标文件 | 响应特征 |
|---|---|---|
| 估算器速查 | cheatsheet.md |
决策树 / 选型矩阵 / 默认超参 |
| API 签名与参数 | api-reference.md → 对应章节 |
精确签名 + 关键参数 + 章节引用 |
| 代码模板 | chapters/*.md |
完整 Python 代码(去掉绘图样板,保留模型逻辑) |
| 解决技术问题 | patterns.md |
When / How / Trade-offs |
| 查找示例来源 | examples-index.md |
文件编号 → API → 章节 |
| 溯源原始文档 | source-mapping.md |
章节 → 源文件编号列表 |
| 术语定义 | glossary.md |
精确定义 + 归属章节 |
| 系统学习主题 | chapters/*.md + SKILL.md |
Core Idea → Frameworks → Code → Takeaways |
每章按统一模板组织,支持快速定位:
| 区域 | 内容 |
|---|---|
| Core Idea | 1–2 句概括本章核心 |
| Frameworks Introduced | 估算器/类 → 适用场景 → 使用方法 → 关键参数 |
| Key Concepts | 术语定义(5–10 个) |
| Mental Models | 「当 X 时用 Y」 直觉规则 |
| Anti-patterns | 常见错误做法 + 为什么 + 正确做法 |
| Code Examples | 可运行的 sklearn 代码片段(每个标注演示内容) |
| Source Files | 主题 → 用户指南文件编号 → 示例文件编号对照表 |
| Key Takeaways | 3–8 条必须记住的结论 |
| Connects To | 与其他章节的关联 |
| 维度 | 用户指南 (01–68) | 代码示例 (71–373) |
|---|---|---|
| 定位 | API 参考与使用指南 | 可复用代码模板 |
| 内容特色 | 估算器说明、参数列表、数学公式、实践技巧 | 完整 Python 脚本、真实数据集、最佳实践 |
| 代码风格 | doctest 风格 (>>> from sklearn import svm) |
完整脚本(无 >>> 前缀) |
| 最适合 | 理解"用什么"和"参数怎么设" | 知道"代码怎么写" |
| 独特内容 | 估算器选型流程图 (67)、常见陷阱 (63)、计算性能 (60) | 各模型族全套代码示例、对比实验、可视化 |
每个代码片段都可追溯回原始源文件:
ch07-svm.md → Source Files 表:
| RBF C/gamma tuning | 07_svm.md | 359_plot_rbf_parameters.md |
查看原始完整示例:
cat version_1_9_0/359_plot_rbf_parameters.md
三个追溯文件形成完整链路:
source-mapping.md→ 章节 ← 用户指南 + 示例文件编号examples-index.md→ 每个示例文件 → 演示内容 + API + 章节api-reference.md→ 每个 API 条目 → 所属模块 + 章节引用
cheatsheet.md (估算器选型决策树)
→ patterns.md (10 个标准代码模板)
→ ch44-compose.md (Pipeline + ColumnTransformer)
→ ch33-grid-search.md (超参数调优)
分类任务: ch04 → ch07 → ch14 → ch15 → ch19 → ch35 回归任务: ch04 → ch07 → ch14 → ch18 → ch35 聚类任务: ch24 → ch26 → ch35 文本处理: ch45 → ch08 → ch12 → ch26 特征工程: ch46 → ch47 → ch44 → ch16
api-reference.md (按模块浏览全部 493 个 API)
→ 点击章节引用进入对应章节
→ 代码示例 + 参数说明 + 反模式
ch63-common-pitfalls.md (数据泄露、预处理顺序等 9 大陷阱)
→ ch44-compose.md (用 Pipeline 防止泄露)
→ ch32-cross-validation.md (正确评估)
→ ch62-model-persistence.md (模型保存与安全)
| 特性 | 章节 | 说明 |
|---|---|---|
| Callbacks (实验性) | Ch 42 | ProgressBar、ScoringMonitor、set_callbacks() |
| FrozenEstimator | Ch 14, 44 | 冻结已拟合估算器用于 Pipeline / GridSearchCV |
| Metadata Routing (实验性) | Ch 37 | set_fit_request、元数据显式路由 |
| TargetEncoder | Ch 46 | 高基数类别特征的目标编码 |
| Polars 支持 | Ch 65 | set_output(transform='polars') |
基于 scikit-learn v1.9.0 官方文档蒸馏。代码优先,全文可溯源。