非负矩阵分解:原理、算法与应用
1. 引言
矩阵分解或因子分析在高维现实世界数据的分析中是一项重要任务。奇异值分解(SVD)是矩阵分解的经典方法,它能以平方误差给出实值矩阵的最优低秩近似。不过,许多应用领域,如信息检索、模式识别和数据挖掘,需要处理的是二进制数据而非实值数据。
在现实生活中,很多数据或物理信号,像像素强度、振幅谱、文本语料库、基因表达、空气质量信息和出现次数等,自然地由非负数表示。在分析这类数据的混合时,各个成分的非负性是一个合理的约束条件。目前有多种技术可用于分析此类数据,例如非负主成分分析(PCA)、非负独立成分分析(ICA)和非负矩阵分解(NMF)。这些技术的目标都是将给定的非负数据表示为一组非负基的非负线性组合。
NMF,也被称为非负矩阵近似或正矩阵分解,是一种无监督学习方法,用于将矩阵分解为两个元素均为非负的矩阵的乘积。在NMF中,非负约束可防止基函数之间相互抵消,并产生基于部分的表示。NMF已成为执行多种任务的成熟方法,包括图像和非负信号的盲源分离(BSS)、光谱恢复、特征提取、降维、分割和聚类、语言建模、文本挖掘、神经生物学(基因分离)以及基因表达谱分析等。
NMF问题可描述为:给定一个非负矩阵 $X$,找到非负矩阵因子 $A$ 和 $S$,使得根据某个代价函数,$X$ 和 $AS$ 之间的差异度量最小,即:
$X = AS$
其中,$X \in R^{m×n}$,系数矩阵 $A \in R^{m×k}$,源矩阵 $S \in R^{k×n}$,$A$ 和 $S$ 中的元素均为非负,并且 $S$ 中的行在某种程度上可能具有统计相关性。通常,为了进行数据缩减,会选择 $km + kn \ll mn$。
超级会员免费看
订阅专栏 解锁全文

2411

被折叠的 条评论
为什么被折叠?



