1.2 机器学习初体验课件 2024—2025学年清华大学版(2024)A版初中信息科技八年级下册
2025-03-16
|
28页
|
623人阅读
|
11人下载
普通
资源信息
| 学段 | 初中 |
| 学科 | 信息科技 |
| 教材版本 | 初中信息科技清华大学版A版八年级下册 |
| 年级 | 八年级 |
| 章节 | 第2节机器学习初体验 |
| 类型 | 课件 |
| 知识点 | - |
| 使用场景 | 同步教学-新授课 |
| 学年 | 2025-2026 |
| 地区(省份) | 全国 |
| 地区(市) | - |
| 地区(区县) | - |
| 文件格式 | PPTX |
| 文件大小 | 5.12 MB |
| 发布时间 | 2025-03-16 |
| 更新时间 | 2025-03-16 |
| 作者 | 53828171 |
| 品牌系列 | - |
| 审核时间 | 2025-03-16 |
| 下载链接 | https://m.zxxk.com/soft/51049441.html |
| 价格 | 2.00储值(1储值=1元) |
| 来源 | 学科网 |
|---|
内容正文:
1.2 机器学习初体验
走进机器学习世界
01
什么是机器学习?
假设家里养了一只名字为“AI”的小狗,一开始它谁都不认识,随着不断调教(在机器学习中被称为“训练” ),它慢慢能分辨主人和陌生人了,说明AI小狗具备了“学习”能力,在学习中自动改进了分辨能力。机器学习就类似编写这样一段具备学习能力的程序,通过训练使其得到某种智能。
小狗训练类比
1997年,“机器学习之父”美国卡内基梅隆大学汤姆·米切尔(Tom Mitchell)教授提出:“机器学习是对能通过经验自动改进的计算机算法的研究。”简单来说,机器学习就是让计算机通过数据经验自动改进算法。
机器学习的定义
第一个机器学习程序:西洋跳棋
1952年,IBM的程序员阿瑟·塞缪尔(Arthur Samuel)开发了一款西洋跳棋程序。该程序并非将下棋方法直接编程赋予计算机,而是赋予其一定学习能力,让它在下棋过程中自行总结赢棋方法或策略。
程序开发背景
塞缪尔用该程序下了许多盘棋,经过训练的程序表现出色。到1959年,这款程序打败了塞缪尔本人,3年后更是打败其所在州的跳棋冠军,实现了机器通过自我学习超越人类的突破。
自我学习成果
塞缪尔还创造了“机器学习”这一概念,并将其定义为“在没有明确编程指令的情况下赋予计算机学习能力的一个研究领域” 。
概念的创造
机器学习的三大特点
机器学习的最终结果是生成具备某种“智能”的模型。这个模型可以基于学习到的规律,对新的数据进行处理和预测,例如训练好的温度转换模型可以实现输入摄氏温度输出华氏温度的功能。
模型生成
机器学习需要大量的数据集合,即“数据集”。要训练怎样的模型,就要准备怎样的数据。例如训练温度转换模型,就需要准备很多类似“摄氏温度和华氏温度对应表”的数据,数据是机器学习的基础。
数据驱动
机器学习的“学习”过程,就是让程序通过大量数据训练,自动总结输入数据(X)和输出数据(Y)之间的映射关系,自动改进算法,不断优化模型以提升性能。
自动优化
传统编程与机器学习对比
02
温度转换的两种实现
在传统编程实现温度转换时,我们会直接使用固定的公式。例如将摄氏温度转换为华氏温度,代码如下:def celsius_to_fahrenheit(celsius): fahrenheit = celsius * 9/5 + 32 return fahrenheit。这里“fahrenheit = celsius * 9/5 + 32”就是事先给定的转换公式,程序按照这个固定规则执行转换任务。
机器学习实现温度转换则不同。它不需要事先给定公式,而是通过输入一组如“摄氏温度和华氏温度对应表”的数据,让程序从这些数据中“学习”规律,自动推导出转换公式。例如通过线性回归算法拟合出数据间的关系,这一过程体现了机器学习基于数据自动推导规则的特点。
传统编程:硬编码公式
机器学习:数据拟合公式
温度转换的两种实现
对比两种方式,机器学习的优势在于其灵活性和适应性。当面对复杂的数据关系或数据变化时,传统编程需要修改代码中的固定公式,而机器学习可以通过重新训练模型,利用新的数据来调整和优化公式,更好地适应不同情况。
机器学习的优势凸显
8
Excel趋势线实验
首先,我们将摄氏温度和华氏温度的数据整理好,在Excel中选中这些数据,插入散点图。通过散点图,我们可以直观地看到这些数据在平面直角坐标系中的分布情况,初步观察数据之间可能存在的关系。
创建散点图
在散点图上,我们为其添加趋势线。趋势线能够帮助我们更清晰地看出数据的变化趋势。添加趋势线后,我们可以进一步设置其格式。
添加趋势线
Excel趋势线实验
在设置趋势线格式时,勾选“趋势预测”中的“显示公式”和“显示R平方值”两个选项。此时,Excel会通过数据“回归”推导出一个公式,这个公式就是数据间的规律体现。而R平方值在0和1之间,它表示数据与公式的契合程度,数值越接近1,说明误差越小,数据与公式的拟合度越高。
显示公式与R平方值
机器学习的基本流程
03
数据准备:质量决定上限
格式规范同样不容忽视。对于温度数据集,若数据格式不统一,比如有的温度数据以整数形式记录,有的以小数形式记录,或者日期格式不一致等,会使模型难以处理数据。规范的数据格式能让模型更高效地读取和分析数据,确保数据的一致性和准确性,为模型训练提供坚实基础。
在机器学习中,数据清洗至关重要。以温度数据集为例,如果数据中存在错误值或缺失值,如温度记录出现负数摄氏度但不符合实际场景,或者某些数据缺失,会严重影响模型训练。错误数据可能导致模型学习到错误的规律,缺失数据则使模型无法全面学习数据中的关系,最终降低模型的准确性。
格式规范的意义
数据清洗的重要性
12
模型搭建:算法选择之道
在模型搭建时,要根据问题的特点选择合适的算法。对于温度转换这种输入和输出呈现线性关系的问题,线性回归算法就非常合适。因为它能够很好地拟合这种线性关系,准确地预测结果。但如果问题的数据关系是非线性的,使用线性回归算法就无法得到准确的结果,需要选择其他更适合非线性关系的算法。
线性回归算法是一种简单且常用的算法。它的核心思想是找到一条能够表示数据(一个或多个输入值和输出值)之间关系的直线。在温度转换案例中,通过线性回归算法可以从摄氏温度和华氏温度的对应数据中,找出二者之间的线性关系,进而实现从摄氏温度到华氏温度的预测。
算法与问题匹配的逻辑
线性回归算法的特点
13
评估指标:R平方值解读
可以用射箭靶心来类比理解R平方值。如果把每次射箭的结果看作是模型的预测值,靶心看作是实际的理想值。当所有的箭都正中靶心时,就如同数据完全准确,R平方值为1;若箭偏离靶心较远,就像模型预测值与实际值误差较大,R平方值就接近于0。通过这种类比,能更直观地理解R平方值在评估模型误差方面的意义。
R平方值是评估模型准确度的重要指标,取值在0和1之间。它反映了通过模型得到的输出值和理想值之间的契合程度。在机器学习中,我们希望模型的R平方值尽可能接近1,这意味着模型的预测结果与实际结果的误差越小。
用射箭靶心类比误差评估
R平方值的概念
14
动手实践:温度预测模型
04
代码框架解析
在进行模型训练前,首先要加载数据集。通过特定的代码语句,我们可以将存储在特定路径下的数据集读取到程序中。例如,使用Python的pandas库中的read_csv函数,就可以轻松读取以CSV格式存储的温度转换数据集,为后续的模型训练提供数据支持。
数据集加载代码
1
模型训练代码是核心部分。以线性回归模型为例,我们需要导入相应的线性回归库,创建模型对象,然后使用fit函数对数据集进行训练。在这个过程中,模型会不断学习数据中摄氏温度和华氏温度之间的关系,调整自身参数以达到更好的拟合效果。
模型训练代码
2
代码框架解析
训练好模型后,需要将结果保存下来以便后续使用。利用Python的一些工具库,如joblib库,通过简单的代码语句就可以将训练好的模型保存为特定格式的文件。这样,下次使用时就无需重新训练模型,直接加载保存的模型文件即可。
结果保存代码
17
模型应用测试
经过模型的计算处理后,最终会输出预测结果。这个结果就是模型预测出的与输入摄氏温度相对应的华氏温度值。通过观察这个结果,我们可以直观地了解模型的应用效果,判断模型是否能够准确地进行温度转换预测。
获取预测结果
在模型应用测试环节,首先要输入新的温度值。我们可以在程序运行时,通过控制台输入一个新的摄氏温度值,这个值将作为模型的输入数据,用于测试模型的预测能力。
输入新温度值
输入新温度值后,模型会根据之前训练学习到的规律对输入值进行处理。在这个过程中,模型会运用其内部的算法和参数,对输入的摄氏温度进行计算,尝试预测出对应的华氏温度。
模型预测过程
逆向思维挑战
希望同学们积极发挥逆向思维,勇于探索。尝试运用所学知识,对模型进行调整和训练,努力实现“华氏→摄氏”模型的构建,这不仅能加深对机器学习的理解,还能锻炼大家的创新思维和实践能力。
鼓励积极探索
在构建新模型时,参数调整是关键。由于输入输出关系发生了变化,模型的参数也需要相应调整。例如,线性回归模型中的系数等参数可能需要重新计算和设置,以适应新的转换关系。
参数调整要点
现在我们面临一个新的挑战,即如何训练“华氏→摄氏”的模型。首先要明确思考方向,我们需要将之前模型中的输入和输出数据进行互换,也就是把华氏温度作为输入,摄氏温度作为输出。
华氏→摄氏模型思考方向
机器学习的现实应用
05
身边的AI助手
语音识别助手在日常生活中应用广泛,比如我们常用的手机语音助手,像苹果的Siri、小米的小爱同学等。当你说出“播放音乐”“查询天气”等指令时,它们能快速识别并执行操作。据统计,全球有超过数十亿人在使用这类语音识别助手,极大地提高了信息获取和操作的便捷性。
图像分类助手也随处可见,例如一些拍照识图软件。当你拍摄一朵不认识的花,通过这类软件就能快速识别出花的种类。在医疗领域,图像分类技术还能辅助医生对X光、CT等影像进行分析,帮助更准确地诊断病情,提高诊断效率和准确性。
语音识别助手
图像分类助手
身边的AI助手
智能翻译助手打破了语言交流的障碍,像百度翻译、有道翻译等APP。在你出国旅行或者阅读外文资料时,只需输入文字或拍照,就能快速得到准确的翻译结果。据相关数据显示,这些智能翻译助手每天处理的翻译请求数以亿计,促进了跨语言的沟通与交流。
智能翻译助手
22
技术伦理初探
数据隐私至关重要,我们在网络上的各种行为,如购物记录、浏览历史等都涉及个人隐私。一旦数据泄露,可能导致个人信息被滥用,比如收到大量垃圾邮件、遭遇诈骗等。近年来,多起数据泄露事件引起社会广泛关注,如某知名社交平台曾泄露大量用户信息,给用户带来极大困扰。
算法偏见会带来严重的社会影响。例如一些招聘算法可能存在性别或种族偏见,导致某些群体在求职中受到不公平对待。在司法领域,若算法存在偏见,可能影响案件的公正判决。研究表明,部分算法在评估信用风险时,对特定群体存在明显的不公平倾向。
数据隐私的重要性
算法偏见的危害
技术伦理初探
应对技术伦理问题的措施:一方面,政府应加强立法监管,制定严格的数据保护和算法规范法律。另一方面,企业要加强自律,建立完善的隐私保护和算法审核机制。同时,我们每个人也应提高隐私保护意识,共同营造健康的技术发展环境。
课程总结与延伸
06
核心知识图谱
传统编程基于人为设定的数据规则实现功能,机器学习基于数据自动推导规则。例如温度转换,传统编程用事先给出的公式,机器学习通过数据“学习”得出公式。
与传统编程区别
机器学习是人工智能中的重要技术,是对能通过经验自动改进的计算机算法的研究。如汤姆·米切尔教授提出:“机器学习是对能通过经验自动改进的计算机算法的研究” ,李宏毅博士通俗总结为找到一个实现特定功能的函数。
机器学习定义
核心知识图谱
包括数据准备,收集相关数据集;模型搭建,选择合适算法利用库实现;模型训练与评估,用数据优化模型并以R平方值等评估;模型应用,将训练好的模型用于实际问题解决。
基本流程
01、
线性回归是回归分析中简单方法,通过数据拟合直线表示输入输出关系;R平方值衡量模型预测值与实际值吻合程度,取值在0到1之间,越接近1误差越小。
关键概念
02、
拓展学习路径
Python有多个机器学习库,如Scikit-learn,提供丰富的机器学习算法和工具;TensorFlow,用于深度学习的开源框架;PyTorch,灵活且高效的深度学习库,助力搭建和训练复杂模型。
Python库推荐
01
Matplotlib是常用的数据可视化库,能绘制各种图表;Seaborn基于Matplotlib,提供更美观的可视化风格;Tableau是专业可视化工具,无需编程基础,方便探索和展示数据。
可视化学习工具
02
28
$$
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。