Skip to content

Repository files navigation

scikit-learn v1.9.0 · Code-Writing Skill

官方文档蒸馏 · 55 章结构化知识库 · 从 API 速查到代码模板

scikit-learn v1.9.0 · 机器学习 · 代码参考 · 可溯源

License: BSD-3-Clause Claude Code Chapters API Entries Examples



scikit-learn v1.9.0 官方文档+代码示例的完整蒸馏 —— 以代码为中心的机器学习技术参考

用户指南为骨 · 示例代码为肉 · 全量可溯源


目录


概述

本仓库将 scikit-learn v1.9.0 官方文档(scikit-learn.cn 中文镜像)的 373 个源文件(用户指南 68 篇 + API 参考 + 词汇表 + 303 个代码示例)蒸馏为一个统一的、结构化的 Claude Code Skill 知识库,覆盖从线性模型、SVM、决策树到深度学习、强化学习、元学习的完整机器学习工具链 —— 共 55 章

核心设计理念:这是一个代码编写技能,而非理论教材。每章以「如何用」为核心,代码优先、参数列优先级、反模式标注、可溯源至原始示例文件编号。

数据源 角色 文件数 特色
用户指南 (01–68) 骨架 —— API 说明、参数指南、使用建议 68 按模型族/ML 阶段组织,涵盖所有估算器和参数
代码示例 (71–373) 血肉 —— 可复用代码模板 303 完整 Python 脚本,真实数据集,最佳实践

知识体系

全景图

┌───────────────────────────────────────────────────────────────────────┐
│                    scikit-learn v1.9.0 · Code-Writing Skill             │
│                          55 章 · 可溯源代码知识库                       │
├──────────────────┬───────────────────────┬────────────────────────────┤
│  监督学习 (17 章)  │  无监督学习 (9 章)     │  模型工程 (17 章)           │
├──────────────────┼───────────────────────┼────────────────────────────┤
│ Ch  4 线性模型     │ Ch 22 高斯混合         │ Ch 32 交叉验证              │
│ Ch  5 LDA / QDA   │ Ch 23 流形学习         │ Ch 33 网格搜索              │
│ Ch  6 核岭回归     │ Ch 24 聚类            │ Ch 34 分类阈值调优           │
│ Ch  7 SVM         │ Ch 25 双聚类           │ Ch 35 指标与评分             │
│ Ch  8 SGD         │ Ch 26 降维与分解       │ Ch 36 学习曲线               │
│ Ch  9 K近邻       │ Ch 27 协方差估计       │ Ch 37 元数据路由 (1.9 实验性)  │
│ Ch 10 高斯过程     │ Ch 28 异常检测         │ Ch 38–40 模型解释            │
│ Ch 11 交叉分解     │ Ch 29 密度估计         │ Ch 41 可视化                 │
│ Ch 12 朴素贝叶斯   │ Ch 30 无监督神经网络    │ Ch 42 回调 (1.9 实验性)       │
│ Ch 13 决策树      │                       │ Ch 44 流水线与列变换器        │
│ Ch 14 集成学习     │                       │ Ch 45–52 数据变换            │
│ Ch 15 多分类       │                       │ Ch 54–67 数据/计算/陷阱      │
│ Ch 16 特征选择     │                       │                              │
│ Ch 17 半监督学习   │                       │                              │
│ Ch 18 保序回归     │                       │                              │
│ Ch 19 概率校准     │                       │                              │
│ Ch 20 有监督神经网络│                       │                              │
└──────────────────┴───────────────────────┴────────────────────────────┘

知识点交叉覆盖

主题 用户指南 示例文件 对应章节
线性回归 / Ridge / Lasso / ElasticNet 04 215–249 (35 个) Ch 4
SVC / SVR / OneClassSVM / 核方法 07 354–368 (15 个) Ch 7
SGDClassifier / partial_fit / 在线学习 08 219, 244–247 Ch 8, 59
随机森林 / HGBT / AdaBoost / Stacking 14 149–172 (24 个) Ch 14
KMeans / DBSCAN / HDBSCAN / 层次聚类 24 90–118 (29 个) Ch 24
PCA / NMF / FastICA / KernelPCA / LDA 26 135–146 (12 个) Ch 26
StandardScaler / OneHotEncoder / TargetEncoder 46 338–346 (9 个) Ch 46
GridSearchCV / RandomizedSearchCV / Halving 33 285–304 Ch 33
Pipeline / ColumnTransformer / FeatureUnion 44 331–337 (7 个) Ch 44
CountVectorizer / TfidfVectorizer / HashingVectorizer 45 369–372 (4 个) Ch 45
IsolationForest / LOF / OneClassSVM / EllipticEnvelope 28 163, 180, 267, 272, 323, 324 Ch 28
CalibratedClassifierCV / calibration_curve 19 77–81 (5 个) Ch 19
Callbacks (ProgressBar / ScoringMonitor) [1.9 新增] 42 72, 83 Ch 42
FrozenEstimator [1.9 新增] 195 Ch 14

仓库结构

.
├── CLAUDE.md                          # 仓库说明与操作指引
├── README.md                          # 本文件
├── SKILL.md                           # 主索引 —— 核心框架 · 55 章索引 · 主题索引 · 可溯源性指南
│
├── chapters/                          # 核心产出 —— 55 章独立知识单元
│   ├── ch04-linear-model.md           # 线性模型(17 个估算器,35 个示例)
│   ├── ch07-svm.md                    # 支持向量机(8 个估算器,15 个示例,含源文件对照表)
│   ├── ch14-ensemble.md               # 集成学习(19 个估算器,24 个示例)
│   ├── ch24-clustering.md             # 聚类(16 个估算器,29 个示例)
│   ├── ch33-grid-search.md            # 超参数调优(GridSearchCV / RandomizedSearchCV / Halving)
│   ├── ch46-preprocessing.md          # 预处理(20+ 个变换器,9 个示例)
│   ├── ch63-common-pitfalls.md        # 常见陷阱(数据泄露等 9 大问题)
│   └── ... (55 files total)
│
├── api-reference.md                   # 493 个 API 条目,按 55 个模块组织,附章节引用
├── examples-index.md                  # ~270 个代码示例全量索引(文件编号 · 演示内容 · 关键 API · 归属章节)
├── source-mapping.md                  # 章节 ↔ 源文件编号对照表(完整可溯源性)
├── patterns.md                        # 10 个可复用设计模式(Pipeline+GridSearch、HGBT、SGD 增量等)
├── cheatsheet.md                      # 速查:估算器选型 · 正则化方向 · 缩放器选择 · Tells & Smells
├── glossary.md                        # 核心术语字母排序,每术语附章节引用
│
└── version_1_9_0/                     # 原始文档(373 个 Markdown 文件)
    ├── 01_install.md ~ 68_presentations.md   # 用户指南 (68 篇)
    ├── 69_index.md                           # API 参考
    ├── 70_glossary.md                        # 词汇表
    └── 71_example_index.md ~ 373_getting_started.md  # 代码示例 (303 个)

安装与使用

安装

# 方式 1: 手动克隆(推荐)
# sklearn即skill名
git clone https://github.com/MaybeBio/Sklearn-Skill ~/.claude/skills/sklearn 

# 方式 2: 使用 npx
npx skills add MaybeBio/Sklearn-Skill -a claude-code

在 Claude Code 中调用

原本规划skill名为/sklearn-v190,考虑到后续更新,暂统一为/sklearn

Skill 加载后,可直接在对话中查询或手动触发 /sklearn

▸ SVC 的 C 和 gamma 参数怎么调?
▸ 文本分类的标准 pipeline 怎么写?
▸ 给我写一个随机森林 + 网格搜索 + 交叉验证的完整模板
▸ 数据有缺失值怎么办?SimpleImputer 和 KNNImputer 选哪个?
▸ 如何防止数据泄露?Pipeline 的正确用法?
▸ StandardScaler vs MinMaxScaler vs RobustScaler 什么时候用哪个?
▸ HistGradientBoosting 比 XGBoost 好用吗?
▸ 如何追踪代码示例的原始来源文件?

查询路由

查询类型 目标文件 响应特征
估算器速查 cheatsheet.md 决策树 / 选型矩阵 / 默认超参
API 签名与参数 api-reference.md → 对应章节 精确签名 + 关键参数 + 章节引用
代码模板 chapters/*.md 完整 Python 代码(去掉绘图样板,保留模型逻辑)
解决技术问题 patterns.md When / How / Trade-offs
查找示例来源 examples-index.md 文件编号 → API → 章节
溯源原始文档 source-mapping.md 章节 → 源文件编号列表
术语定义 glossary.md 精确定义 + 归属章节
系统学习主题 chapters/*.md + SKILL.md Core Idea → Frameworks → Code → Takeaways

每章结构

每章按统一模板组织,支持快速定位:

区域 内容
Core Idea 1–2 句概括本章核心
Frameworks Introduced 估算器/类 → 适用场景 → 使用方法 → 关键参数
Key Concepts 术语定义(5–10 个)
Mental Models 「当 X 时用 Y」 直觉规则
Anti-patterns 常见错误做法 + 为什么 + 正确做法
Code Examples 可运行的 sklearn 代码片段(每个标注演示内容)
Source Files 主题 → 用户指南文件编号 → 示例文件编号对照表
Key Takeaways 3–8 条必须记住的结论
Connects To 与其他章节的关联

两大数据源

维度 用户指南 (01–68) 代码示例 (71–373)
定位 API 参考与使用指南 可复用代码模板
内容特色 估算器说明、参数列表、数学公式、实践技巧 完整 Python 脚本、真实数据集、最佳实践
代码风格 doctest 风格 (>>> from sklearn import svm) 完整脚本(无 >>> 前缀)
最适合 理解"用什么"和"参数怎么设" 知道"代码怎么写"
独特内容 估算器选型流程图 (67)、常见陷阱 (63)、计算性能 (60) 各模型族全套代码示例、对比实验、可视化

可溯源性

每个代码片段都可追溯回原始源文件:

ch07-svm.md → Source Files 表:
| RBF C/gamma tuning | 07_svm.md | 359_plot_rbf_parameters.md |

查看原始完整示例:
cat version_1_9_0/359_plot_rbf_parameters.md

三个追溯文件形成完整链路:

  1. source-mapping.md → 章节 ← 用户指南 + 示例文件编号
  2. examples-index.md → 每个示例文件 → 演示内容 + API + 章节
  3. api-reference.md → 每个 API 条目 → 所属模块 + 章节引用

使用路径建议

路径 1: 快速上手(选型 + 模板)

cheatsheet.md (估算器选型决策树)
    → patterns.md (10 个标准代码模板)
        → ch44-compose.md (Pipeline + ColumnTransformer)
            → ch33-grid-search.md (超参数调优)

路径 2: 按任务类型深入

分类任务: ch04 → ch07 → ch14 → ch15 → ch19 → ch35 回归任务: ch04 → ch07 → ch14 → ch18 → ch35 聚类任务: ch24 → ch26 → ch35 文本处理: ch45 → ch08 → ch12 → ch26 特征工程: ch46 → ch47 → ch44 → ch16

路径 3: 系统掌握全部 API

api-reference.md (按模块浏览全部 493 个 API)
    → 点击章节引用进入对应章节
        → 代码示例 + 参数说明 + 反模式

路径 4: 生产环境避坑

ch63-common-pitfalls.md (数据泄露、预处理顺序等 9 大陷阱)
    → ch44-compose.md (用 Pipeline 防止泄露)
        → ch32-cross-validation.md (正确评估)
            → ch62-model-persistence.md (模型保存与安全)

版本特性 (v1.9.0 新增)

特性 章节 说明
Callbacks (实验性) Ch 42 ProgressBar、ScoringMonitor、set_callbacks()
FrozenEstimator Ch 14, 44 冻结已拟合估算器用于 Pipeline / GridSearchCV
Metadata Routing (实验性) Ch 37 set_fit_request、元数据显式路由
TargetEncoder Ch 46 高基数类别特征的目标编码
Polars 支持 Ch 65 set_output(transform='polars')

基于 scikit-learn v1.9.0 官方文档蒸馏。代码优先,全文可溯源。

scikit-learn 官方 · scikit-learn.cn 中文镜像

About

Claude Code skill for Scikit-Learn,designed for machine learning Coding operation & QA

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors