Spark机器学习的一些概念整理

本文介绍了机器学习中的核心概念,包括监督式学习与无监督式学习的区别,常见的分类算法如线性回归、逻辑回归及决策树等,还有聚类与协同过滤等算法的应用场景。

(文章主要来自于学习整理,好记心不如烂笔头,先记上后面再完善,欢迎大家指正交流)


监督式学习:使用有标签的训练数据(也就是已知结果的数据点)进行学习,对训练样本集外的数据进行标记(分类)预测,训练样本的标记(分类)是已知的,因此岐义性低。
 
无监督式学习:使用没有标签的训练数据(也就是已知结果的数据点)进行学习对没有概念标记(分类)的训练样本进行学习,以发现训练样本集中的结构性知识。训练标记(分类)是未知的,因此岐义性高。聚类就是典型的无监督学习
 
分类算法:
分类算法是一类监督式机器学习算法,它根据已知标签的样本来预测其它样本所属的类别,分类与回归是监督式学习的二种主要形式,监督式学习指算法尝试使用有标签的训练数据(也就是已知结果的数据点)根据对象的特征预测结果,分类与回归的区别在于预测的变量的类型:在分类中,预测的变量是离散的(也就是一个有限集中的值,叫做类别);比如:垃圾邮件与非垃圾邮件,在回归中,预测的变量是连续的,比如:根据年龄与体重预测一个人的身高


线性回归:
线性回归指用特征的线性组和来预测输出值


逻辑回归:
逻辑回归是一种二元分类方法,用来寻找一个分隔阴性与阳性示例的线性分隔平面


决策树:
决策树以节点树的形式表示,每个节点基于数据的特征作出一个二元决定(比如:这个人的年龄是否大于20?),而树的每个叶子节点则包含一种预测结果(例如:这个人是否会买一个商品?),决策树的吸引力在于模型本身容易检查,既可以进行分类也可以进行回归,一组决策树的组合称为随机森林,


聚类:
聚类是一种无监督式学习算法,用于将对象分到具有高度相似性的聚类中,主要用于数据探索以及异常检测


协同过滤:
协同过滤是一种根据用户对各种产品的交互与评分来推荐新产品的推荐系统技术,只需要输入一系列用户/产品交互记录:无论是“显式”的交互(例如:在购物网站上进行评分)还是“隐式”的(例如用户访问了一个产品的页面但没有对产品评分)交互都可以,仅仅根据这些交互,协同过滤算法就能够知道那些产品之间比较相似以及那些用户之间比较相似,然后做出推荐


过度拟合(overfitting)问题,阅读:http://blog.csdn.net/xuxurui007/article/details/9259903

内容概要:本报告基于寻汇与万事达卡在2026年联合发布的《超越自动化:定义智能体驱动的全球支付》白皮书,系统分析了AI智能体在B2B跨境支付领域的应用与发展。报告指出,传统跨境支付存在效率低、人工干预多、合规风险高等问题,当前正从数字化、数据化迈向“自主化”新阶段。AI智能体可在授权下自主完成支付、换汇、合规审核、对账等全流程操作,核心技术包括深度强化学习、自然语言处理和图神经网络,用于路径优化、合规解析与异常检测。报告揭示了决策可解释性不足、跨系统协同标准缺失、安全审计机制缺位三大研究空白,并探讨了法律责任归属、监管碎片化、数据主权与技术可靠性四大现实挑战。寻汇与万事达卡的合作构建了“智能体编排引擎”与全球合规决策网络,首次提出L0-L5的智能体自主化等级框架,推动行业标准化。预计2026至2027年将实现首批大规模商业部署,提升支付效率超30%。; 适合人群:金融科技研究人员、AI技术开发者、跨境支付行业从业者、企业财资管理人员及政策监管机构相关人员。; 使用场景及目标:①理解AI智能体在跨境支付中的技术架构与应用场景;②把握自主化支付的演进趋势与商业化前景;③为金融机构和技术公司布局AI驱动型支付系统提供战略参考;④助力监管机构制定适应智能体时代的合规框架。; 阅读建议:本报告兼具技术深度与产业视野,建议结合白皮书原文及相关技术文献对照研读,重点关注智能体决策逻辑、合规实现机制与跨系统集成方案,并关注后续试点项目的实际成效与监管反馈。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值