资讯动态

2.AI入门:从机器学习到生成式AI,普通人也能看懂(二)—— 机器学习入门

发布时间:2026/10/1 3:40:35 来源:尧图企业网站定制
系列导读这是一套面向零基础读者的AI入门系列文章。上一篇我们了解了什么是AI今天深入AI的核心技术——机器学习。一、什么是机器学习1.1 从一个生活例子说起假设你想预测房价有两种方法方法一传统编程规则驱动if 面积 100平米: 价格 面积 × 3万 else: 价格 面积 × 2.5万问题规则太简单考虑不周全预测不准。方法二机器学习数据驱动给计算机看10000条历史成交数据 - 100平米3室朝阳区地铁旁 → 500万 - 80平米2室海淀区学区 → 480万 - ... 计算机自己学习价格 f(面积, 房间数, 位置, 配套...)机器学习会自动发现各因素与价格的关系预测更准确。1.2 正式定义机器学习Machine Learning简称ML 让计算机从数据中自动学习规律并用学到的规律进行预测或决策的技术。用一个公式理解传统编程输入 规则 输出 机器学习输入 输出 规则模型二、机器学习的三种类型2.1 监督学习Supervised Learning有老师指导的学习数据带有标准答案。形象比喻就像学生做练习题每道题都有标准答案做完对照答案改正逐渐掌握规律。数据形式输入特征 → 标签答案 邮件内容 → 是否垃圾邮件 房屋信息 → 房价 图片像素 → 图片类别典型应用分类垃圾邮件识别、疾病诊断、图像分类回归房价预测、销量预测、股票走势2.2 无监督学习Unsupervised Learning没有老师指导自己发现数据中的结构。形象比喻就像给你一堆乱七八糟的物品让你自己分类整理没人告诉你该怎么分。数据形式输入特征 → 没有标签 用户行为数据 → 自动分群 文档内容 → 自动归类典型应用聚类用户分群、商品归类降维数据可视化、特征压缩异常检测欺诈识别、故障预警2.3 强化学习Reinforcement Learning通过试错学习好的行为给予奖励坏的行为给予惩罚。形象比喻就像训练小狗做对了给零食奖励做错了批评惩罚慢慢学会正确行为。学习过程智能体Agent ↓ 执行动作 环境Environment ↓ 返回奖励和新状态 智能体调整策略 ↓ 重复迭代 最终学会最优策略典型应用游戏AIAlphaGo、王者荣耀AI机器人控制自动驾驶决策推荐系统优化三、机器学习的工作流程一个完整的机器学习项目包含以下步骤3.1 数据收集数据是机器学习的燃料。数据来源公开数据集Kaggle、UCI等企业内部数据爬虫采集用户行为日志3.2 数据预处理原始数据通常脏乱差需要清洗。常见处理缺失值处理填充或删除异常值处理识别并处理数据标准化统一量纲编码转换文本转数字3.3 特征工程从原始数据中提取有用的特征。这是机器学习中最重要也最耗时的环节。举例预测房价原始特征地址文本提取特征是否学区、距地铁距离、周边配套数3.4 模型选择根据任务类型选择合适的算法任务类型常用算法二分类逻辑回归、SVM、决策树多分类随机森林、神经网络回归线性回归、XGBoost聚类K-Means、DBSCAN3.5 模型训练用训练数据让模型学习规律。训练过程 初始化模型参数 ↓ 用训练数据预测 ↓ 计算预测误差 ↓ 调整模型参数 ↓ 重复直到误差足够小3.6 模型评估用测试数据检验模型效果。常用指标分类任务准确率、精确率、召回率、F1分数回归任务均方误差MSE、R²分数3.7 模型部署将训练好的模型应用到实际业务中。四、常见机器学习算法简介4.1 线性回归最基础的回归算法拟合一条直线。y w₁x₁ w₂x₂ ... wₙxₙ b 例如房价 3万×面积 10万×房间数 50万×学区系数4.2 逻辑回归名字带回归实际用于分类。通过sigmoid函数将输出压缩到0-1之间表示概率P(y1) 1 / (1 e^(-z))4.3 决策树像玩20个问题游戏通过一系列判断得出结论。是否有毛发 / \ 是 否 / \ 是否有尾巴 是否有鳞片 / \ / \ 是 否 是 否 / \ / \ 狗 猫 鱼 蛇4.4 随机森林多棵决策树投票集思广益。就像问多个专家意见综合判断比单棵树更稳定。4.5 K-Means聚类将数据分成K个群组。算法步骤随机选择K个中心点将每个数据分配到最近的中心重新计算每个群的中心重复步骤2-3直到稳定五、机器学习 vs 深度学习很多人分不清这两个概念5.1 关系图人工智能AI └── 机器学习ML └── 深度学习DL深度学习是机器学习的一个分支。5.2 主要区别对比项传统机器学习深度学习特征处理人工设计特征自动学习特征数据需求相对较少需要大量数据计算资源普通CPU即可需要GPU加速可解释性较好较差黑盒适用场景结构化数据图像、语音、文本六、机器学习的实际案例案例1垃圾邮件识别输入邮件内容 处理提取关键词、分析发件人、检查链接 模型朴素贝叶斯分类器 输出是否垃圾邮件准确率95%案例2电商推荐输入用户浏览历史、购买记录、商品特征 处理协同过滤、特征工程 模型矩阵分解或深度学习 输出个性化推荐列表案例3信用评分输入收入、负债、还款历史、年龄... 处理特征标准化、缺失值填充 模型XGBoost集成模型 输出信用分数0-850七、入门机器学习需要学什么7.1 数学基础够用就行线性代数向量、矩阵运算概率统计概率分布、期望、方差微积分梯度、优化理解原理即可7.2 编程基础Python机器学习首选语言NumPy数值计算Pandas数据处理Matplotlib数据可视化7.3 机器学习框架Scikit-learn传统机器学习算法库TensorFlow/PyTorch深度学习框架7.4 学习路线建议第一步Python基础1-2周 ↓ 第二步数据处理1-2周 ↓ 第三步机器学习原理2-4周 ↓ 第四步实战项目持续八、动手实践机器学习完整流程让我们用一个完整的示例体验机器学习的全流程。8.1 环境准备pipinstallnumpy pandas scikit-learn matplotlib8.2 完整示例鸢尾花分类 机器学习入门实战鸢尾花分类 这是一个经典的监督学习分类案例 fromsklearn.datasetsimportload_irisfromsklearn.model_selectionimporttrain_test_splitfromsklearn.preprocessingimportStandardScalerfromsklearn.neighborsimportKNeighborsClassifierfromsklearn.metricsimportaccuracy_score,classification_reportimportpandasaspd# 1. 加载数据irisload_iris()print(数据集包含)print(f- 样本数量{len(iris.data)})print(f- 特征数量{iris.data.shape[1]})print(f- 类别{iris.target_names})# 转为DataFrame方便查看dfpd.DataFrame(iris.data,columnsiris.feature_names)df[target]iris.targetprint(\n前5条数据)print(df.head())# 2. 数据预处理Xiris.data yiris.target# 划分训练集和测试集80%训练20%测试X_train,X_test,y_train,y_testtrain_test_split(X,y,test_size0.2,random_state42)# 数据标准化scalerStandardScaler()X_train_scaledscaler.fit_transform(X_train)X_test_scaledscaler.transform(X_test)# 3. 选择并训练模型modelKNeighborsClassifier(n_neighbors3)model.fit(X_train_scaled,y_train)print(\n模型训练完成)# 4. 预测y_predmodel.predict(X_test_scaled)# 5. 评估accuracyaccuracy_score(y_test,y_pred)print(f\n模型准确率{accuracy:.2%})print(\n详细分类报告)print(classification_report(y_test,y_pred,target_namesiris.target_names))# 6. 预测新样本new_flower[[5.1,3.5,1.4,0.2]]# 新的鸢尾花数据new_flower_scaledscaler.transform(new_flower)predictionmodel.predict(new_flower_scaled)print(f\n新样本预测结果{iris.target_names[prediction[0]]})输出示例数据集包含 - 样本数量150 - 特征数量4 - 类别[setosa versicolor virginica] 前5条数据 sepal length (cm) sepal width (cm) petal length (cm) petal width (cm) target 0 5.1 3.5 1.4 0.2 0 1 4.9 3.0 1.4 0.2 0 ... 模型训练完成 模型准确率96.67% 详细分类报告 precision recall f1-score support setosa 1.00 1.00 1.00 10 versicolor 1.00 0.89 0.94 9 virginica 0.92 1.00 0.96 11 新样本预测结果setosa8.3 代码解读# 机器学习的标准流程# 1️⃣ 数据收集load_iris()# 加载数据集# 2️⃣ 数据预处理train_test_split()# 划分训练集和测试集StandardScaler()# 数据标准化# 3️⃣ 模型选择KNeighborsClassifier()# 选择K近邻算法# 4️⃣ 模型训练model.fit(X_train,y_train)# 用训练数据学习规律# 5️⃣ 模型预测model.predict(X_test)# 对新数据预测# 6️⃣ 模型评估accuracy_score()# 计算准确率九、小结机器学习 让计算机从数据中自动学习规律三种类型监督学习、无监督学习、强化学习工作流程数据收集→预处理→特征工程→模型训练→评估→部署深度学习是机器学习的分支擅长处理非结构化数据入门需要基础数学 Python 机器学习框架九、动手实践想真正理解机器学习最好的方式是动手实践。推荐入门项目泰坦尼克号生存预测Kaggle经典入门题房价预测回归问题鸢尾花分类分类问题这些项目都有公开数据集和大量教程非常适合入门。十、思考题监督学习、无监督学习、强化学习分别适合什么场景各举一个例子。为什么说数据是机器学习的燃料传统机器学习和深度学习各有什么优缺点如何选择下一篇预告我们将深入讲解监督学习——最常用的机器学习类型看看那些有标准答案的学习任务是如何完成的。标签机器学习AI入门监督学习无监督学习强化学习零基础版权声明本文为原创内容转载请注明出处。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑