聚类分析
聚类是一种无监督学习,聚类的方法几乎可以应用于所有对象。 聚类分析根据聚类算法将数据或样本对象划分成两个以上的子集。 每一个子集称为一个簇,簇中对象因特征属性值接近而彼此相似。不同簇对象之间则彼此存在差异。 把相似的对象归于统一组,不同对象归于不同组。需要一种相似度的计算方法 相似度的计算方法 Manhattan Distance(曼哈顿距离)(l1范数) Euclidean Distance(欧式距离),距离测度中简单直观的适合于二、三维的距离测度(l2范数): d=∑i=1n(xi−yi)2d=\sqrt{\sum_{i=1}^n(x_i-y_i)^2} d=i=1∑n(xi−yi)2 Minkowski Distance(闵可夫斯基距离),可以理解为n维空间的欧式距离: d=∑i=1n(xi−yi)qqd=\sqrt[q]{\sum_{i=1}^n(x_i-y_i)^q} d=qi=1∑n(xi−yi)q Cosine Distance(余弦距离)(n维向量夹角) Mahalanobis Distance马氏距离 聚类分析方法 划分法(Par...
产生和加载数据集
速查表pdf 文本数据读写 python 读取文件常用的一种方式是 open()函数,open 里写文件的路径,读取后返回一个文件对象,借助 file_obj.read()函数可以调取出文件对象的数据(返回字符串),这种情况下要记得使用 close 函数把读取的文件关闭,以免造成损害。 另外一种读取文件的方法是利用 with 关键词来打开文件建立对象,打开的文件对象会在 with 区块内跳出时关闭文件对象。 逐行读取文件 逐行读取的第一种方法是直接通过循环对文件对象进行操作,每次读取出的一行行末的换行符可通过 restrip()函数删除 第二种方法是直接调用文件对象的 readline()方法,该方法将会返回一个字符串组成的列表,列表中每一个字符串包含一行,且有结尾换行符。通过对返回列表的操作可以实现对数据的组合 file_obj=open("D:/test.txt")data=file_obj.read()print(data)for line in file_obj: print(line) #print(line.strip())#...
