资讯动态

ML-For-Beginners 分类课程作业实战指南:探索并匹配 Scikit-learn 分类方法

发布时间:2026/9/10 5:53:57 来源:尧图企业网站定制
ML-For-Beginners 分类课程作业实战指南探索并匹配 Scikit-learn 分类方法【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners本指南针对 ML-For-Beginners 课程中 4-Classification 模块第一课分类简介的课后作业探索分类方法Explore classification methods完整解析任务要求与评估标准并结合本仓库中真实的分类课程、实验 Notebook 与可用数据集为你提供一份可复现的完成方案从 Scikit-learn 的监督学习方法清单中筛选分类算法将其与课程数据集、可提出的业务问题一一匹配最终产出一份解释数据集 × 算法 × 问题三角关系的对照表格。作业原文英文位于 4-Classification/1-Introduction/assignment.md希腊语译本即本文所依据的 translations/el/4-Classification/1-Introduction/assignment.md。作业任务解读一次分类方法寻宝该作业的核心指令非常明确到 Scikit-learn 的监督学习Supervised Learning文档中做一次寻宝式检索目标是找到分类方法——从 Scikit-learn 提供的大量监督学习算法中筛选出可以用于分类任务的技术匹配一个本课程数据集——从课程各章节的data目录中挑选数据集提出一个可以针对该数据集提出的问题——把分类落到具体的业务问题上选择一种分类技术——说明用哪个算法来解决上述问题产出交付物——制作一个电子表格spreadsheet或.doc文件中的表格并解释该数据集将如何与该分类算法配合工作。换言之这不是一个让你直接训练模型的编程作业而是一个方法调研与方案设计作业它训练的是你在算法库与数据之间建立正确映射的能力——这也是数据科学工作中最常被低估、却最关键的环节。完成此任务需要你先通读本课程的第一课 4-Classification/1-Introduction/README.md它建立了分类的基本概念二分类 vs 多分类、有监督学习并手把手完成了 cuisines 数据的清洗、食材分布分析与 SMOTE 过采样平衡。评分标准Rubric决定交付质量的三档红线原作业给出了非常具体的评分标准这是判断作业完成度的唯一依据务必逐条对照标准优秀Exemplary充分Adequate需改进Needs Improvement算法覆盖数量文档中呈现5 个算法的概览且每个都搭配一种分类技术文档中呈现3 个算法的概览且每个都搭配一种分类技术少于3 个算法且没有分类技术解释质量概览解释充分、详细概览解释充分、详细概览解释既不充分也不详细从 Rubric 可以看出两个硬性要求数量门槛至少 3 个算法才合格5 个算法才优秀。由于算法与技术是一一配对关系这意味着你的表格至少要有 3 行理想 5 行数据集 问题 算法的完整映射。质量门槛每行的解释必须说明为什么这个数据集与这个算法匹配而不是简单罗列算法名字。例如用 LogisticRegression 对 cuisines 数据集做多分类这样的表述是不够的你需要补充该数据集有 5 个菜系标签、约 2448 行、特征为 0/1 稀疏矩阵逻辑回归的 ovr 方案天然支持多分类之类的推理。方法库Scikit-learn 中有哪些分类技术可选作业要求你去 Scikit-learn 的监督学习文档中检索。以本课程 4-Classification/2-Classifiers-1/README.md 归纳的清单为准Scikit-learn 中包含分类技术的方法家族主要有线性模型Linear Models如LogisticRegression是线性分类的基础也是本课程第一个实验使用的算法支持向量机Support Vector MachinesSVC系列可通过选择 kernel 决定聚类方式随机梯度下降Stochastic Gradient DescentSGDClassifier适合大规模数据的线性分类最近邻Nearest NeighborsKNeighborsClassifier基于样本距离投票分类高斯过程Gaussian Processes概率化的非参数分类方法决策树Decision Trees基于特征划分规则的树形模型集成方法Ensemble MethodsRandomForestClassifier、AdaBoostClassifier、Voting Classifier 等组合多个基学习器多分类与多输出算法Multiclass and Multioutput处理多类/多标签/多输出分类场景的专门机制。此外课程 4-Classification/2-Classifiers-1/README.md 明确指出神经网络如MLPClassifier也可用于分类但超出本课程范围在作业中提及它作为不考虑的方案反而是加分推理详见下文推理过程一节。这套方法家族并非空泛列表——本课程后两课 4-Classification/2-Classifiers-1/README.md 与 4-Classification/3-Classifiers-2/README.md 已在同一份 cuisines 数据上实际实验了其中五类算法你可以直接引用这些实验结果作为你作业表格的技术匹配佐证算法课程实验配置测试集准确率课程实测关键参数LogisticRegressionmulti_classovr,solverliblinear约 80%classification report 的 accuracy 列multi_class、solverLinear SVCkernellinear,C10,probabilityTrue78.6%kernel、C正则化、probabilityKNeighborsClassifierC作为邻居数73.8%邻居数量SVC默认参数83.2%kernel 等RandomForestClassifiern_estimators10084.5%n_estimatorsAdaBoostClassifiern_estimators10072.4%n_estimatorsScikit-learn 官方文档提供的分类器对比图直观展示了不同算法在合成数据集上的决策边界差异——这正是同一份数据 不同算法 不同结果的直观证明也是你在作业解释中论述算法选择会影响模型质量的有力依据该图展示了 KNeighbors、SVC两种、GaussianProcessClassifier、DecisionTreeClassifier、RandomForestClassifier、MLPClassifier、AdaBoostClassifier、GaussianNB 与 QuadraticDiscrinationAnalysis 的对比结果图片出自 Scikit-learn 官方文档收录于本仓库 4-Classification/2-Classifiers-1/images/comparison.png。数据集仓库四份可用的课程数据集与匹配问题作业要求匹配本课程数据集。当前仓库中与分类主题相关的数据集及其分布如下1. 亚洲/印度菜系数据集首选路径4-Classification/data/cuisines.csv清洗平衡版见 4-Classification/data/cleaned_cuisines.csv结构2448 行、385 列其中 1 列是cuisine标签indian / chinese / thai / japanese / korean其余 384 列为 0/1 编码的食材存在性特征almond、garlic、ginger……可提出的问题多分类给定一组食材这道菜最可能属于哪个菜系可提出的问题二分类这道菜是印度菜indian还是不是印度菜匹配技术LogisticRegressionmulti_classovr、Linear SVC、SVC、RandomForest、KNN 均可——因为它是本课程分类实验的标准数据集有现成基准可对照。配合原理特征全部是 0/1 稀疏向量线性分类器逻辑回归、线性 SVC能高效地在高维稀疏空间划分决策边界标签是 5 个互斥类别属于多分类任务因此需要算法支持ovr一对多或multinomial方案。各菜系样本数极不均衡korean 799、indian 598、chinese 442、japanese 320、thai 289这也是作业中如何配合算法可以深入讨论的切入点——不均衡数据会偏向多数类需先用 SMOTE 平衡见 4-Classification/1-Introduction/README.md 的Balance the dataset章节最终五类均平衡到 799 条2. 美国南瓜数据集路径2-Regression/data/US-pumpkins.csv结构南瓜售价、品种、产地、日期等字段回归课程中用于预测价格可提出的问题二分类在给定价格区间下这个南瓜是橙色orange还是非橙色——这正是 2-Regression/4-Logistic/README.md 逻辑回归课提出的经典问题匹配技术LogisticRegression二分类为其原生设计、Linear SVC配合原理二分类问题只需一个决策边界逻辑回归本质为二分类设计输出 0~1 概率天然适配是/否问题。3. UFO 目击事件数据集路径3-Web-App/1-Web-App/data/ufos.csv结构目击时间、城市、州、国家、形状、持续时间、经纬度等字段可提出的问题多分类根据目击时长、经纬度和形状目击事件发生在哪个国家匹配技术LogisticRegression、KNeighborsClassifier经纬度天然适合距离度量配合原理该数据集在课程 3-Web-App/1-Web-App/README.md 中被用于训练一个预测目击国家的分类器并部署成 Web 应用是二分类/多分类均可的典型地理分类场景。4. 尼日利亚歌曲数据集路径5-Clustering/data/nigerian-songs.csv结构歌曲名、艺人、专辑、流派、发行年份、时长、流行度及 danceability、energy 等音频特征可提出的问题多分类根据 danceability、energy、loudness 等音频特征这首歌属于哪个流派匹配技术SVC、RandomForestClassifier、KNeighborsClassifier配合原理特征是连续的数值型音频指标树模型与 SVM 都能有效利用数值特征该数据集在课程 5-Clustering/1-Visualize/README.md 中已做过特征分布可视化便于你为表格补充论据。高阶加分项写出算法选择推理过程Rubric 的充分且详细要求解释质量而 4-Classification/2-Classifiers-1/README.md 中给出了一套可以移植到作业中的推理范式——针对用哪个分类器这个问题它的推理是神经网络太重本课程数据集虽干净但规模小数千行量级且在本地 Notebook 中训练神经网络对当前任务过重不用二分类器问题不是二分类因此排除one-vs-all式只有两个类别的设计决策树或逻辑回归可行决策树或用于多分类的逻辑回归都可能有效多分类提升决策树解决的是另一类问题它更适合非参数任务如构建排序对本任务不适用。你可以把这套推理写进作业表格的解释列——它展示的不是我选了 X 算法而是我为什么在候选集中排除 Y、保留 X。同理在 LogisticRegression 的参数层面Scikit-learn 的multi_class参数取值ovr使用一对多方案multinomial使用交叉熵损失后者仅受lbfgs、sag、saga、newton-cg求解器支持solver决定优化算法且并非所有 solver 都能与所有multi_class值配对——这些细节是体现详细解释的加分素材。交付物模板可直接套用的对照表结构作业要求的最终交付物是电子表格或.doc中的表格。下面是一个同时满足优秀档5 个算法 详细解释的结构模板其中各行的实验数据来自本课程真实 Notebook 与 README可直接改写为你自己的作业答案#数据集仓库路径可提出的分类问题分类技术数据集如何与该算法配合解释14-Classification/data/cuisines.csv给定食材组合判断菜系归属多分类LogisticRegressionmulti_classovr,solverliblinear384 维 0/1 稀疏特征 5 类标签ovr 方案将多分类拆为多个二分类liblinear 适合中小规模稀疏数据课程实测准确率约 80%2同上清洗后 4-Classification/data/cleaned_cuisines.csv同上的多分类问题换算法对比RandomForestClassifiern_estimators100树集成通过多棵随机树投票降低过拟合对 0/1 特征无需归一化课程实测为 84.5%是六个实验中最优32-Regression/data/US-pumpkins.csv给定价格等属性南瓜是否为橙色二分类LogisticRegression二分类是逻辑回归的原生场景输出概率可直接解释回归课程中已用同一数据集完成类似分类演示43-Web-App/1-Web-App/data/ufos.csv根据目击时长、经纬度等预测目击国家多分类SVC或 Linear SVC特征多为连续数值SVM 通过核函数在高维空间构造间隔最大的决策边界该数据集在 Web-App 课程中已被用于国家预测55-Clustering/data/nigerian-songs.csv根据音频特征预测歌曲流派多分类KNeighborsClassifier音频特征为连续数值KNN 直接基于特征空间的距离投票数值特征经过标准化后距离度量更有意义填表时注意两条原则一是每行都要独立成立一个数据集可以配多个算法但每个数据集 × 问题组合最好对应一个最合适的算法二是解释要落到数据特征与算法机制的匹配上比如稀疏特征、类别数、样本量、数值/类别型特征分布——这些正是本仓库各课程 README 反复强调的决策依据。检查清单提交前对照表格是否覆盖至少 3 个优秀档为 5 个算法每行是否同时包含数据集、可提出的问题、分类技术、配合原理四要素解释是否具体到特征结构如 0/1 稀疏、连续数值与算法机制如 ovr、核函数、树集成是否说明了排除某些算法的理由如神经网络过重、二分类器不适用是否可参照 4-Classification/1-Introduction/notebook.ipynb 与 4-Classification/1-Introduction/solution/notebook.ipynb 中的数据清洗与 SMOTE 平衡代码为你的表格补充数据预处理说明按上述模板与检查清单完成作业即可稳定命中 Rubric 的优秀档既满足 5 个算法 分类技术的数量要求也以数据集 × 问题 × 算法的映射逻辑满足解释充分且详细的质量要求。【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价