机器学习入门:核心概念、发展史与建模流程详解
·
摘要:本文从人工智能三大概念入手,梳理AI、ML、DL的关系及学习方式差异;讲解样本、特征、标签等核心术语;解析有监督/无监督/强化学习分类、特征工程全流程,以及过拟合/欠拟合的成因与解决思路。适合机器学习初学者建立完整知识框架。
一、人工智能三大概念
1.1 什么是人工智能(AI)
人工智能是用计算机模拟人脑,让机器像人类一样理性思考和行动。核心公式:人工智能 = 数据 + 算法 + 算力
1.2 什么是机器学习(ML)
机器学习是让机器自动从数据中学习规律,而不是依靠人工编写if-else规则。经典流程:训练 → 预测 → 评估
1.3 什么是深度学习(DL)
深度学习是深度神经网络,通过多层神经元模拟复杂规律。
类比理解:
- AI:给你一张图片,让你判断是不是西瓜
- ML:基于大量西瓜图片、音频、视频,总结出"如何挑好西瓜"的规律(纹路、回弹声音、瓜蒂等)
- DL:结合西瓜的价格、产地、口感等搭建知识库(如麒麟西瓜的特点)
1.4 三者关系
- AI是目标,ML是实现AI的途径,DL是ML的一种方法
1.5 两种学习方式对比
基于规则的学习(if-else)
- 程序员根据经验手工编写规则
- 适合简单、规则明确的问题
- 缺点:无法应对图像、语音、NLP等复杂场景
基于模型的学习(机器学习)
- 编写算法,让机器从历史数据中学习规律
- 举例:房价预测,用一条直线拟合数据点,公式 y = kx + b,其中k是权重,b是偏置
二、应用领域与发展史
2.1 主要应用领域
用户分析、搜索引擎、信息推荐、图片识别、机器翻译、生物信息、多模态AR/VR等。
2.2 发展史上的重要节点
| 时期 | 关键事件 |
|---|---|
| 1956年 | 人工智能元年(达特茅斯会议) |
| 1962年 | Arthur Samuel跳棋程序战胜人类高手 |
| 1997年 | IBM深蓝战胜国际象棋冠军 |
| 2012年 | AlexNet开启深度学习时代 |
| 2016年 | AlphaGo战胜李世石 |
| 2017年 | Transformer框架诞生 |
| 2022年 | ChatGPT引爆AIGC发展 |
2.3 发展三要素
- 数据:燃料
- 算法:引擎
- 算力:加速器(CPU适合I/O密集型,GPU适合矩阵运算,TPU专为神经网络设计)
三、核心术语
| 术语 | 解释 |
|---|---|
| 样本 | 一行数据就是一个样本,多个样本组成数据集 |
| 特征 | 一列数据就是一个特征,也称为属性 |
| 标签/目标值 | 模型要预测的那一列数据 |
| 训练集 | 用于训练模型(通常占70%~80%) |
| 测试集 | 用于评估模型(通常占20%~30%) |
特征的理解:特征是从数据中抽取出来的、对预测结果有用的信息。例如房价预测中,面积、地段、房龄等都是特征。
四、算法分类(四种学习方式)
4.1 有监督学习
- 输入数据有特征 + 有标签(需要人工标注)
- 分为两类:
- 分类:目标值不连续(如:判断是猫还是狗)
- 回归:目标值连续(如:预测房价)
4.2 无监督学习
- 输入数据有特征 + 无标签(不需要标注)
- 根据样本相似性进行聚类,发现数据内部结构
- 应用:用户分群、商品推荐
4.3 半监督学习
- 部分数据有标签,部分没有
- 流程:专家标注少量数据 → 训练模型 → 套用未标注数据 → 专家校验改善
- 优点:大幅降低人工标注成本(如医学影像辅助诊断)
4.4 强化学习
- 四要素:Agent(智能体)+ 环境 + 动作 + 奖励
- 原理:智能体不断与环境交互,通过试错获得最大累计奖励
- 应用:AlphaGo围棋、游戏AI、无人驾驶
类比理解:小孩子学走路,走几步给巧克力(奖励),摔倒了没有奖励,从而学会最优行走策略。
五、机器学习建模流程
- 获取数据:收集与任务相关的数据集
- 数据基本处理:处理缺失值、异常值
- 特征工程:提取、转换、预处理特征,让模型效果更好
- 模型训练:根据任务类型选择合适算法
- 模型评估:效果好就上线,效果不好则迭代优化
六、特征工程详解
特征工程是利用专业背景知识和技巧处理数据,让机器学习算法效果最好。数据和特征决定了机器学习的上限,模型和算法只是逼近这个上限。
| 操作 | 定义 | 特点 |
|---|---|---|
| 特征提取 | 从原始数据中提取有用信息,转为特征向量 | 文本、图片需转为行列形式 |
| 特征预处理 | 消除量纲影响(归一化、标准化) | 让不同特征对模型影响一致 |
| 特征降维 | 减少特征维度,保留主要信息 | 会改变原始数据 |
| 特征选择 | 从众多特征中挑选重要特征 | 不改变原始数据 |
| 特征组合 | 多个特征合并为一个新特征 | 如:面积 = 长×宽 |
七、模型拟合问题
7.1 基本概念
- 拟合:模型对样本点的模拟情况
- 泛化:模型在新数据集上的表现能力
7.2 欠拟合(Under-fitting)
- 表现:训练集差,测试集也差
- 原因:模型过于简单,学习能力不足
- 解决:增加模型复杂度、增加特征
7.3 过拟合(Over-fitting)
- 表现:训练集很好,测试集很差
- 原因:模型过于复杂、数据不纯、训练数据太少
- 解决:正则化、增加数据量、简化模型
类比理解:
- 欠拟合:机器只学到"天鹅有白色羽毛",把黑天鹅都认错了
- 过拟合:机器把所有白天鹅的特征都记住了,但遇到黑天鹅就识别不了
7.4 奥卡姆剃刀原则
给定两个具有相同泛化误差的模型,较简单的模型更可取。
八、总结
本文梳理了机器学习从概念到实践的完整基础框架:
- 三大概念:AI是目标,ML是途径,DL是方法
- 学习方式:基于规则 vs 基于模型
- 算法分类:有监督、无监督、半监督、强化学习
- 特征工程:提取、预处理、降维、选择、组合
- 拟合问题:欠拟合(太简单)和过拟合(太复杂)
学习建议:理解这些概念后,建议动手实践一个简单项目(如用Scikit-learn做房价预测),把理论转化为代码,才能真正掌握。
如果本文对你有帮助,欢迎点赞、收藏、关注,后续持续更新机器学习实战内容!
更多推荐



所有评论(0)