仓库简介#
Scikit-learn 项目始于 2007 年,最初由 David Cournapeau 发起,随后 Matthieu Brucher 加入开发。2010 年,来自 INRIA(法国国家信息与自动化研究院) 的 Fabian Pedregosa、Gaël Varoquaux、Alexandre Gramfort 和 Vincent Michel 接手项目,并于 2010 年 2 月 1 日发布了首个公开版本。此后,项目保持约每 3 个月发布一个新版本的节奏,在全球开发者社区的共同推动下不断发展壮大,现已成为 Python 生态中最具影响力的传统机器学习开源项目之一。
Scikit-learn 它以统一的 fit / predict / transform API 设计、完善的文档和稳定的实现著称, 是入门机器学习学习与基线建模的首选。
适用人群#
- 机器学习初学者:提供统一且易于理解的 API,是学习传统机器学习算法的最佳入门工具之一。
- 数据分析师:可快速完成数据预处理、特征工程、模型训练与评估,提高数据分析和预测建模效率。
- 算法工程师:内置丰富的机器学习算法和模型选择工具,适用于模型开发、实验验证和性能优化。
- 科研人员与教育工作者:拥有完善的文档、丰富的示例和稳定的接口,广泛应用于学术研究、课程教学和实验演示。
使用方式#
pip install scikit-learn最小示例(随机森林分类):
from sklearn.ensemble import RandomForestClassifier
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
X, y = load_iris(return_X_y=True)
X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=0)
clf = RandomForestClassifier(n_estimators=100, random_state=0)
clf.fit(X_train, y_train)
print(clf.score(X_test, y_test))六大模块速览#
scikit-learn 官方主页把整个库的能力浓缩为 6 个核心模块,每个模块对应一类典型任务与一组算法。下面把它们与本站教程一一对应,方便按「任务视角」快速定位学习入口。本站没有的部分请直接参照「原站主页」。





