机器学习面试题 3:某超市研究销售记录发现买啤酒的人很大概率也会买尿布,这属于数据挖掘的哪类问题?

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

该题考查数据挖掘问题类型。超市发现买啤酒者常买尿布,属于关联规则发现。关联规则用支持度和置信度衡量强度,支持度是两者同时出现次数占总记录比例,置信度是同时出现次数占前者出现次数比例。答案为A。

🔎

延伸解读

关联规则的核心度量

关联规则用支持度和置信度衡量强度。支持度是两者同时出现的概率,置信度是条件概率。例如,啤酒→尿布的支持度是两者同时出现的记录数占总记录的比例,置信度是同时出现次数占啤酒出现次数的比例。支持度和置信度越高,规则越强。

与聚类、分类的区别

聚类是无监督学习,将相似对象分组,无需预定义类别;分类是监督学习,需事先知道类别,用训练数据学习后对新数据分类。关联规则发现则是在数据中寻找项之间的关联模式,不涉及分组或预测,而是发现频繁共现的规则。

实际应用中的注意事项

关联规则挖掘可能产生大量无意义规则,需结合业务背景筛选。支持度和置信度阈值需合理设置,过高可能遗漏弱关联,过低则规则过多。此外,置信度不反映规则的方向性,如啤酒→尿布与尿布→啤酒的置信度不同,需根据业务目标选择。

Q&A

超市发现买啤酒的人很大概率也会买尿布,这属于数据挖掘的哪类问题?

这属于关联规则发现。

什么是关联规则?请用啤酒和尿布的例子说明。

关联规则是形如X→Y的规则,其中X和Y是不相交的非空集合。在啤酒和尿布的例子中,{啤酒}→{尿布}就是一条关联规则,表示购买啤酒的人也会购买尿布。

关联规则的支持度(support)是如何定义的?

支持度定义为support(X→Y) = |X∩Y|/N,即集合X和Y中的项在一条记录中同时出现的次数除以数据记录的总数。例如,support({啤酒}→{尿布}) = 啤酒和尿布同时出现的次数/数据记录数。

关联规则的置信度(confidence)是如何定义的?

置信度定义为confidence(X→Y) = |X∩Y|/|X|,即集合X和Y中的项在一条记录中同时出现的次数除以集合X出现的次数。例如,confidence({啤酒}→{尿布}) = 啤酒和尿布同时出现的次数/啤酒出现的次数。

支持度和置信度越高,关联规则越强吗?

是的,支持度和置信度越高,说明规则越强。关联规则挖掘就是挖掘出满足一定强度的规则。

聚类和分类有什么区别?

聚类是无监督学习,不需要训练数据,只根据相似度将相似的东西分到一组;分类是监督学习,需要从训练集中学习,然后对未知数据进行分类。

自然语言处理的主要应用范畴有哪些?

自然语言处理的主要应用包括文本朗读、语音识别、中文自动分词、词性标注、句法分析、自然语言生成、文本分类、信息检索、信息抽取、文字校对、问答系统等。

🏷️

标签

➡️

继续阅读