纯python实现机器学习之kNN算法示例-创新互联
前面文章分别简单介绍了线性回归,逻辑回归,贝叶斯分类,并且用python简单实现。这篇文章介绍更简单的 knn, k-近邻算法(kNN,k-NearestNeighbor)。
创新互联是一家集网站建设,珠晖企业网站建设,珠晖品牌网站建设,网站定制,珠晖网站建设报价,网络营销,网络优化,珠晖网站推广为一体的创新建站企业,帮助传统企业提升企业形象加强企业竞争力。可充分满足这一群体相比中小企业更为丰富、高端、多元的互联网需求。同时我们时刻保持专业、时尚、前沿,时刻以成就客户成长自我,坚持不断学习、思考、沉淀、净化自己,让我们为更多的企业打造出实用型网站。k-近邻算法(kNN,k-NearestNeighbor),是最简单的机器学习分类算法之一,其核心思想在于用距离目标最近的k个样本数据的分类来代表目标的分类(这k个样本数据和目标数据最为相似)。
原理
kNN算法的核心思想是用距离最近(多种衡量距离的方式)的k个样本数据来代表目标数据的分类。
具体讲,存在训练样本集, 每个样本都包含数据特征和所属分类值。
输入新的数据,将该数据和训练样本集汇中每一个样本比较,找到距离最近的k个,在k个数据中,出现次数做多的那个分类,即可作为新数据的分类。
如上图:
需要判断绿色是什么形状。当k等于3时,属于三角。当k等于5是,属于方形。
因此该方法具有一下特点:
- 监督学习:训练样本集中含有分类信息
- 算法简单, 易于理解实现
- 结果收到k值的影响,k一般不超过20.
- 计算量大,需要计算与样本集中每个样本的距离。
- 训练样本集不平衡导致结果不准确问题
接下来用oython 做个简单实现, 并且尝试用于约会网站配对。
python简单实现
def classify(inX, dataSet, labels, k): """ 定义knn算法分类器函数 :param inX: 测试数据 :param dataSet: 训练数据 :param labels: 分类类别 :param k: k值 :return: 所属分类 """ dataSetSize = dataSet.shape[0] #shape(m, n)m列n个特征 diffMat = np.tile(inX, (dataSetSize, 1)) - dataSet sqDiffMat = diffMat ** 2 sqDistances = sqDiffMat.sum(axis=1) distances = sqDistances ** 0.5 #欧式距离 sortedDistIndicies = distances.argsort() #排序并返回index classCount = {} for i in range(k): voteIlabel = labels[sortedDistIndicies[i]] classCount[voteIlabel] = classCount.get(voteIlabel, 0) + 1 #default 0 sortedClassCount = sorted(classCount.items(), key=lambda d:d[1], reverse=True) return sortedClassCount[0][0]
分享标题:纯python实现机器学习之kNN算法示例-创新互联
文章分享:http://cdiso.cn/article/dcjcgi.html