关联分析关心的是哪些对象经常在同一事务中出现。事务可以是一张购物篮、一次会话、一份设备告警组合或一次检查记录,项则是事务中的离散对象。算法擅长从大量组合里筛出值得查看的模式,但不会自动告诉人们为什么会共现,更不能把一条规则直接当成因果关系。
先把事务边界定义对,指标才有含义
同一个用户一周内的购买合并为一条事务,与每次结账分别作为事务,会得到不同结果。会话超时时间、退货如何处理、赠品是否计入、缺货商品怎样记录,也会改变项集频率。事务边界应与准备采取的行动一致:若要优化单次陈列,就不该把相隔多日的行为随意合并。
关联规则描述数据中的共同出现,不会证明一个商品、症状或事件导致另一个发生。
常见规则写成 X→Y,其中 X 与 Y 是不相交的项集。箭头表达条件方向,而不是时间先后或因果作用。X 可以理解为前件,Y 为后件。算法通常先找到满足频率要求的项集,再从这些项集中拆出前件与后件,因此频繁项集发现和规则生成是两个连续但不同的任务。

支持度、置信度与提升度各回答一个问题
| 指标 | 核心问题 | 计算直觉 | 单独使用的风险 |
|---|---|---|---|
| 支持度 | 组合在全部事务中有多常见 | X与Y共同出现的比例 | 偏向高频项,可能漏掉小众模式 |
| 置信度 | 出现X时Y有多常出现 | 共同出现数除以X出现数 | 会被Y本身的高基础率抬高 |
| 提升度 | X是否让Y相对更常见 | 置信度再除以Y的总体比例 | 小样本下可能波动很大 |
用五条示例事务说明:若某项 D 出现四次,某项 B 出现三次,D 与 B 同时出现三次,那么 D→B 的支持度是三除以五,置信度是三除以四;B 的总体比例为三除以五,所以提升度为置信度再除以该基础比例。这个例子显示,置信度必须与后件本身有多常见一起看。
方向改变时,置信度通常也会改变
X→Y 与 Y→X 使用同一个共同出现数,支持度相同,但分母分别是 X 和 Y 的出现数,因此置信度可能不同。提升度在两项情形下具有对称关系,却不意味着两个方向在业务上可互换。若行动是向已有 X 的对象推荐 Y,就应按这个条件方向评价覆盖、成本和结果。
- 先报告共同出现的实际事务数,防止百分比掩盖小样本。
- 再看支持度,确认模式具有足够覆盖。
- 比较置信度与后件基础率,避免高频项制造假惊喜。
- 用提升度、杠杆率等补充指标观察偏离独立的程度。
- 最后结合干预成本和错误代价决定是否值得行动。
Apriori通过反单调性砍掉不可能的分支
频繁项集有一个关键性质:如果一个项集达到最小支持度,它的任意非空子集也必然达到;反过来,只要某个子集不频繁,包含它的更大项集就不可能频繁。Apriori 先统计一项集,再连接得到候选二项集、三项集,逐层计数并剪枝。逻辑直观,适合解释算法,但候选数量很大时会消耗多轮扫描和存储。
候选连接也不能任意组合。构造 k 项候选时,通常让两个频繁的 k−1 项集共享有序前缀,并检查候选的所有 k−1 子集是否仍频繁。这个步骤减少明显不可能的候选。最小支持度越低,保留下来的分支越多;项种类很多且事务稀疏时,组合爆炸尤其明显。
- 优点:过程透明,候选和剪枝容易核对。
- 限制:可能多次扫描事务库,并生成大量中间集合。
- 适合:项数量受控、阈值不低、需要教学或审计的场景。
- 调优:利用垂直表示、分区或采样,但要说明近似带来的影响。
FP-Growth把共同前缀压进一棵树
FP-Growth 不显式枚举全部候选。它先统计频率并移除不达标项,再把每条事务中的剩余项按统一顺序排列,共同前缀可以共享树节点。随后针对某个后缀收集条件模式基,建立条件树并递归挖掘。事务前缀重复越多,压缩效果通常越明显;若数据几乎没有共享结构,树也可能变大。
| 比较角度 | Apriori | FP-Growth |
|---|---|---|
| 主要中间结构 | 逐层候选项集 | FP树与条件模式基 |
| 数据扫描 | 可能需要多轮 | 构树阶段扫描较少 |
| 理解难度 | 较直观 | 递归条件树更复杂 |
| 性能关键 | 候选数和计数效率 | 树压缩率与内存布局 |
频繁项集之后,规则数量仍会迅速增长
一个含 k 个项的频繁集合,可以用任意非空真子集作为前件,其补集作为后件,方向也会产生不同规则,候选数量随 k 指数增长。因而不能在发现频繁项集后无条件输出全部组合。最小置信度、提升度、最小计数、前件后件约束和业务禁配规则,都可以参与后续筛选。
阈值不存在适合所有任务的固定答案。提高支持度会让结果更稳定、更易管理,却可能漏掉低频高风险事件;降低阈值能够看到长尾,也更容易收获偶然组合。可以按项类型设置分层阈值,并把探索集与验证集分开,避免在同一批数据上不断调阈值直到出现一个好看的规则。
让规则跨时间和场景接受复核
在一个时间窗口发现的规则,应在后续窗口重新计算计数、置信度和提升度。若方向翻转或强度骤降,先检查促销、季节、上下架、采样方式与人群结构。对门店、地区、设备类型或用户群分层验证,可以发现总体规则其实由单一子群推动,也能识别合并数据产生的辛普森悖论风险。
最终应用还需要受控评估。陈列调整、推荐或预警可能改变行为本身,离线共现高不代表干预会带来增量收益。把规则放入小规模实验,观察转化、误报、用户负担和替代效应,并保留不采取行动的对照。关联分析最适合扮演线索生成器:它把庞大的组合空间缩小到可解释候选,而业务机制、时间验证与实验,才负责把候选变成可靠决策。
本文《从购物篮到可行动线索:关联规则的指标、算法与误判边界》由 xkmchenmu 发布于 xkmchenmu Blog。 转载请保留原文链接并注明出处。
支付宝扫一扫