模型评估和模型选择
1、损失函数对于模型一次预测结果的好坏需要有一个度量标准。对于监督学习而言给定一个输入X选取的模型就相当于一个“决策函数”f它可以输出一个预测结果f(X)而真实的结果标签记为Y。f(X) 和Y之间可能会有偏差我们就用一个损失函数loss function来度量预测偏差的程度记作 L(Y,f(X))。损失函数用来衡量模型预测误差的大小损失函数值越小模型就越好损失函数是f(X)和Y的非负实值函数0-1损失函数平方损失函数使用最多方便求导绝对损失函数对数似然损失函数2、经验误差给定一个训练数据集数据个数为n根据选取的损失函数就可以计算出模型f(X)在训练集上的平均误差称为训练误差也被称作经验误差empirical error 或经验风险empirical risk。类似地在测试数据集上平均误差被称为测试误差或者泛化误差generalization error。一般情况下对模型评估的策略在训练的时候就是考察经验误差当经验风险最小时就认为取到了最优的模型。这种策略被称为 经验风险最小化empirical risk minimizationERM。3、欠拟合和过拟合拟合Fitting是指机器学习模型在训练数据上学习到规律并生成预测结果的过程就是尽可能地符合原始数据的分布情况接下来根据这个结果去预测数据。理想情况下模型能够准确地捕捉训练数据的模式并且在未见过的新数据测试数据上也有良好的表现即模型具有良好的泛化能力。欠拟合Underfitting是指模型在训练数据上表现不佳无法很好地捕捉数据中的规律。这样的模型不仅在训练集上表现不好在测试集上也同样表现差。过拟合Overfitting是指模型在训练数据上表现得很好但在测试数据或新数据上表现较差的情况。过拟合的模型对训练数据中的噪声或细节过度敏感把噪声学会了哈哈哈把训练样本自身的一些特点当作了所有潜在样本都会具有的一般性质从而失去了泛化能力。产生欠拟合和过拟合的根本原因是模型的复杂度过低或过高从而导致测试误差泛化误差偏大。欠拟合模型在训练集和测试集上误差都比较大。模型过于简单高偏差。过拟合模型在训练集上误差较小但在测试集上误差较大。模型过于复杂高方差。3.1、产生原因和解决办法欠拟合产生原因模型复杂度不足模型过于简单无法捕捉数据中的复杂关系。特征不足输入特征不充分或者特征选择不恰当导致模型无法充分学习数据的模式。训练不充分训练过程中迭代次数太少模型没有足够的时间学习数据的规律。过强的正则化正则化项设置过大强制模型过于简单导致模型无法充分拟合数据。解决办法增加模型复杂度选择更复杂的模型。增加特征或改进特征工程添加更多的特征或通过特征工程来创造更有信息量的特征。增加训练时间增加训练的迭代次数让模型有更多机会去学习。减少正则化强度如果使用了正则化尝试减小正则化的权重以让模型更灵活。过拟合产生原因模型复杂度过高模型过于复杂参数太多。训练数据不足数据集太小模型能记住训练数据的细节但无法泛化到新数据也可能出现欠拟合的现象。特征过多特征太多模型可能会“记住”数据中的噪声而不是学到真正的规律。训练过长训练时间过长导致模型学习到训练数据中的噪声而非数据的真正规律。解决办法减少模型复杂度降低模型的参数数量、使用简化的模型或降维来减小模型复杂度。增加训练数据收集更多数据或通过数据增强来增加训练数据的多样性。使用正则化引入L1、L2正则化避免过度拟合训练数据。交叉验证使用交叉验证技术评估模型在不同数据集上的表现以减少过拟合的风险。早停训练时当模型的验证损失不再下降时提前停止训练避免过度拟合训练集。import numpy as np import matplotlib.pyplot as plt from sklearn.model_selection import train_test_split from sklearn.linear_model import LinearRegression from sklearn.metrics import mean_squared_error # 设置matplotlib全局中文显示 plt.rcParams[font.sans-serif] [KaiTi] plt.rcParams[axes.unicode_minus] False # 由一个向量x生成degree列的矩阵 def polynomial(x, degree): 构成多项式返回 [x^1,x^2,x^3,...,x^n] return np.hstack([x ** i for i in range(1, degree 1)]) # 1、读取数据 # 生成一个从 -3 到 3 的等差数列共300个点然后将其转换成一个 300 行、1 列的列向量二维数组 X np.linspace(-3, 3, 300).reshape(-1, 1) print(X.shape) y np.sin(X) np.random.uniform(-0.5, 0.5, 300).reshape(-1, 1) # 创建一个包含 1 行、3 列子图的画布 fig, ax plt.subplots(1, 3, figsize(15, 4)) ax[0].plot(X, y, yo) ax[1].plot(X, y, yo) ax[2].plot(X, y, yo) # 划分训练集和测试集 x_train, x_test, y_train, y_test train_test_split(X, y, test_size0.2, random_state42) # 创建线性回归模型创建对象 model LinearRegression() # 欠拟合1次多项式 x_train1 x_train x_test1 x_test model.fit(x_train1, y_train) y_pred1 model.predict(x_test1) ax[0].plot(X, model.predict(X), r) ax[0].text(-3, 1, f测试集均方误差{mean_squared_error(y_test, y_pred1):.4f}) ax[0].text(-3, 1.3, f训练集均方误差{mean_squared_error(y_train, model.predict(x_train1)):.4f}) ax[0].set_title(欠拟合(1次多项式)) plt.show() # 适度拟合5次多项式 x_train2 polynomial(x_train, 5) # 扩展成5个特征 x_test2 polynomial(x_test, 5) model.fit(x_train2, y_train) y_pred2 model.predict(x_test2) ax[1].plot(X, model.predict(polynomial(X, 5)), r) ax[1].text(-3, 1, f测试集均方误差{mean_squared_error(y_test, y_pred2):.4f}) ax[1].text(-3, 1.3, f训练集均方误差{mean_squared_error(y_train, model.predict(x_train2)):.4f}) ax[1].set_title(适度拟合(5次多项式)) # plt.show() # 过拟合20次多项式 x_train3 polynomial(x_train, 20) x_test3 polynomial(x_test, 20) model.fit(x_train3, y_train) y_pred3 model.predict(x_test3) ax[2].plot(X, model.predict(polynomial(X, 20)), r) ax[2].text(-3, 1, f测试集均方误差{mean_squared_error(y_test, y_pred3):.4f}) ax[2].text(-3, 1.3, f训练集均方误差{mean_squared_error(y_train, model.predict(x_train3)):.4f}) ax[2].set_title(过拟合(20次多项式)) # plt.tight_layout() plt.show()4、正则化正则化是指在机器学习的过程中通过添加额外项来惩罚过大的参数进而限制模型的复杂度避免出现过拟合提高模型的泛化能力。这里的是正则化系数用来表示惩罚项的权重。正则化系数不属于模型的参数无法通过训练学习得到需要在模型训练开始之前手动设置这种参数被称为“超参数”。4.1、L1正则化L1正则化在损失函数中加入参数的绝对值之和L1正则化通过惩罚模型参数的绝对值使得部分权重趋近0甚至变为0。这会导致特征选择即模型会自动“丢弃”一些不重要的特征。L1正则化有助于创建稀疏模型即许多参数为0。在解决回归问题时使用L1正则化也被称为“Lasso回归”。超参数控制着正则化的强度。较大的值意味着强烈的正则化会使模型更简单可能导致欠拟合。而较小的值则会使模型更复杂可能导致过拟合。4.2、L2正则化L2正则化在损失函数中加入参数的平方之和L2正则化通过惩罚模型参数的平方使得所有参数都变得更小但不会将参数强行压缩为0。它会使得模型尽量平滑从而防止过拟合。在解决回归问题时使用L2正则化也被称为“岭回归”。5、交叉验证交叉验证Cross-Validation是一种评估模型泛化能力的方法通过将数据集划分为多个子集反复进行训练和验证以减少因单次数据划分带来的随机性误差。通过交叉验证能更可靠地估计模型在未知数据上的表现。亦能避免因单次数据划分不合理导致的模型过拟合或欠拟合。5.1、简单交叉验证将数据划分为训练集和验证集如70%训练30%验证。结果受单次划分影响较大可能高估或低估模型性能。5.2、k折交叉验证将数据均匀分为k个子集称为“折”每次用k−1折训练剩余1折验证重复k次后取平均性能。充分利用数据结果更稳定。

相关新闻

集团企业必看!国内知名ERP厂商精选榜单发布

集团企业必看!国内知名ERP厂商精选榜单发布

一、引言 2026年上半年国内企业数字化管理软件市场持续迭代,赛迪顾问最新行业数据显示,国内ERP市场整体规模达326.8亿元,国产厂商市场占比提升至76.2%,本土软件的技术适配性、落地实用性已全面适配国内企业经营管理需求。在企业管…

2026/9/24 20:52:59 阅读更多 →
51单片机从零到实战(13)——毕设常用ADC模块

51单片机从零到实战(13)——毕设常用ADC模块

第 13 篇:ADC 模数转换——让单片机"感知"模拟世界 温度、光线、声音、电压——这些是连续的"模拟量"。ADC 把它们变成单片机懂的"数字量"。STC89C52 没有内置 ADC,我们用 PCF8591 模块(I2C 接口,5…

2026/9/24 4:36:25 阅读更多 →
Recruiter初筛到底在判断什么?|蒸汽求职分享

Recruiter初筛到底在判断什么?|蒸汽求职分享

**摘要:**招聘人员初筛时间通常不长,却不只是核对简历。候选人与岗位是否基本匹配、求职方向是否清楚、表达是否容易理解,以及入职时间、地点、工作资格和薪资等现实条件,都可能影响是否进入下一轮。 不少留学生准备面试时&#x…

2026/9/20 17:28:07 阅读更多 →

最新新闻

校园论文选题系统开发实战:Laravel+uniapp+微信小程序

校园论文选题系统开发实战:Laravel+uniapp+微信小程序

毕业论文选题,每年春季都是高校信息部门最头疼的环节。纸质表格传阅、Excel来回汇总、学生线下找老师签字协调,一套流程走下来少说两周,还免不了各种重复和错漏。后来我接手了一个校园团队的项目,用 Thinkphp/Laravel 作为后端、u…

2026/9/25 22:08:45 阅读更多 →
zvec-grep混合搜索原理揭秘:BM25、向量检索与ripgrep如何用RRF融合排名

zvec-grep混合搜索原理揭秘:BM25、向量检索与ripgrep如何用RRF融合排名

zvec-grep混合搜索原理揭秘:BM25、向量检索与ripgrep如何用RRF融合排名 【免费下载链接】zvec-grep Local-first search across your workspace, built for humans and AI agents. 项目地址: https://gitcode.com/gh_mirrors/zv/zvec-grep zvec-grep&#xf…

2026/9/25 22:08:45 阅读更多 →
SpringBoot+Vue 实现办公用品管理系统|计算机毕设源码讲解

SpringBoot+Vue 实现办公用品管理系统|计算机毕设源码讲解

💖💖作者:计算机毕业设计小明哥 💙💙个人简介:曾长期从事计算机专业培训教学,本人也热爱上课教学,语言擅长Java、微信小程序、Python、Golang、安卓Android等,开发项目包…

2026/9/25 22:07:44 阅读更多 →
Python Assert 语句

Python Assert 语句

我们要去搞明白, 到底什么叫做断言。断言是程序里用来坚定地声明或表明某个事实的语句。比如在编一个除法的函数时, 你内心非常确定, 那个除数是不应该等于零的, 所以你就发出了断言, 说明这个除数不是零。断言仅仅只是一个布尔表达式, 它的作用是用来检查某个具体的条件有没有…

2026/9/25 22:07:44 阅读更多 →
阿里云 300万美金加入 Linux 基金会 Alibaba Cloud joins as a Founding Corporate Patron with $3 million

阿里云 300万美金加入 Linux 基金会 Alibaba Cloud joins as a Founding Corporate Patron with $3 million

阿里巴巴云正式加入 Omacom 基金会,成为创始企业赞助人,承诺每年出资 100 万美元,连续三年!这意味着总计 300 万美元的投入,与 DigitalOcean 的赞助金额持平,将全部用于 Omarchy 的开发、维护与推广。 但这…

2026/9/25 22:06:44 阅读更多 →
云服务器怎么搭建python环境变量管理系统

云服务器怎么搭建python环境变量管理系统

要搭建一个系统用来管理环境变量这事儿, 它并不是简简单单就能弄好的, 你首先得具备一定的基础知识储备, 并且还要有一定的编程实际操作经验才行;接下来这儿有一个非常基础的系统框架可以摆在你的面前供你看一看, 这个框架可不是固定不变的死规矩, 它是可以根据你自…

2026/9/25 22:06:44 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/25 19:27:14 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/25 20:29:09 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/25 20:29:43 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/25 20:29:31 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/25 19:27:26 阅读更多 →