详细内容或原文请订阅后点击阅览
量化用户行为模式以构建更好的预测功能
仅知道西雅图的一名 35 岁男性上个月点击了 12 次,就几乎无法告诉您他的意图。
来源:KDnuggets静态用户配置文件的问题
传统模型将用户视为固定实体,将复杂的决策者简化为人口统计数据和聚合指标。仅知道西雅图一名 35 岁男性上个月点击了 12 次,就几乎无法告诉你他的意图。这些宏观特征无法捕捉到每时每刻的变化,这些变化表明真正的兴趣或即将发生的流失。
基本行为模式(例如单击)忽略了操作之间的时间依赖性。当有人打开应用程序,在功能页面上暂停,然后在一小时内返回三次时,这个顺序揭示了犹豫或好奇。点击次数永远不会。研究表明,将用户行为模式建模为随时间变化的动作图可以捕获静态快照完全错过的预测信号。
我们需要实时更新的功能,反映用户浏览决策点时行为模式如何变化。静态配置文件是事后剖析,而动态行为特征则充当实时诊断,立即响应操作。
推进用户行为分析
超越点击计数需要量化行为细微差别的工程功能。我们不是问某人采取了多少次行动,而是询问这些行动如何在时间窗口内聚集、加速或停滞。三种核心技术将原始事件流转化为模型可以学习的特征。
测量行为速度
速度捕获特定时间间隔内行为的速度和强度。当您计算滑动窗口内的操作频率(无论是每小时、每天还是基于会话)时,您可以检测到与转化或活动相关的激增。在 10 分钟内提交五个查询的人与在一周内提交五个查询的人表现出不同的意图。基于会话的窗口往往最适合 SaaS 产品,而每小时窗口则适合高频交易平台。
跟踪加速度的功能所揭示的内容比原始计数更多。计算连续窗口之间的活动变化率。您会发现,速度变化通常比绝对会话计数更好地预测保留率。如果会话频率每周增加一倍,则这种加速信号表明您可以采取行动。将这些速度指标与新近度配对,以区分积极的探索和下降的活动。
评估功能使用深度
深度衡量人们使用特定工具或应用程序元素的彻底程度。它将表面级交互(例如登陆页面或打开模式)与深度交互(例如完成多步骤工作流程或访问高级设置)区分开来。您可以通过跟踪分层导航模式和特定功能的停留时间来量化深度。
在培训开始之前,进行探索性数据分析 (EDA) 以识别模式、差距和异常值。研究表明,43% 的首席运营官将数据质量视为他们的首要数据优先事项,这强化了为什么 EDA 在特征工程开始之前很重要。 EDA 通过准确显示哪些功能使用行为最相关来支持更强大的机器学习成果。此分析可帮助您确定驱动模型性能的深度信号的优先级,并丢弃与目标结果不相关的交互。
计算决策摩擦
比较预期路径长度与实际路径长度有助于检测不必要的弯路。如果最佳工作流程需要四个步骤,但人们平均需要七个步骤,那么这三步增量就成为一个特征。它可以帮助模型在客户流失发生之前预测需要干预的地方。
摩擦量化了表示挣扎的犹豫、回溯和重复尝试。您可以通过重复表单提交、放弃的工作流程或长时间悬停时间等指标来捕获它。这些通常可以预测下降或支持票量。构建跟踪反转操作的功能,例如多次向后导航或在相同的两个页面之间切换。
将物理动作映射为数字信号
物理环境中的心理原理直接转化为数字预测模型。实体环境中的人类行为提供了对自发决策的洞察,我们可以在线量化这些决策,并且相似之处是惊人的。研究表明,大约 73% 的购物者是在店内做出购买决定的,其中一些人是根据有吸引力的展示做出计划外购买的。
数字平台呈现出并行模式。突出的功能布局、视觉显着性和情境触发因素会推动自发参与,就像店内展示会推动计划外购买一样。通过设计捕获高显着 UI 元素曝光的功能(例如花在促销横幅上的时间或推荐位置后的点击次数),您可以量化自发的数字行为。
将这些交互建模为事件序列。当有人遇到某件特色商品并在几秒钟内发生转化时,这种时间上的接近反映了店内的冲动购买。当你根据这些微观模式训练预测模型时,它们可以预测哪些人最容易受到情境推动。这使得利用行为动力的实时个性化成为可能。
在预测建模中处理稀疏数据集
现实世界的行为数据极其稀疏。高级用户会生成丰富的事件流,但不频繁访问者和边缘情况交互的长尾在缺失值的数据集中占主导地位。传统方法会下采样或忽略这些稀疏行。当遇到新的或不规则的情况时,这会丢弃推理时所需的确切信号。
应用零膨胀嵌入
稀疏矩阵包含结构零(来自那些从未有机会互动的人)和来自那些选择不互动的人的真正零。解决方案是零膨胀指数族嵌入,它通过将每种类型建模为真正不感兴趣或缺乏暴露来区分这些情况。这种技术自然会减轻结构实例的重量,防止它们压垮您的特征空间。
当您的数据集包含大块不反映偏好的缺失值时,请实现零膨胀指数族嵌入。该模型了解哪些差距携带信息,哪些仅表明缺乏机会。最终,它应该提高稀疏片段的预测准确性,而不会人为地夸大特征值或失去可解释性。
挖掘频繁子轨迹
复杂的旅程会产生指数级的大序列空间,使得直接建模变得不可行。您可以通过识别频繁的子轨迹(个体之间重复出现的常见行为路径)来降低这种复杂性。通过应用使用轨迹相似性和序列聚类的频繁子轨迹挖掘算法,您可以在保留时间结构的同时压缩行为数据。
零售需求预测路线图
将这些技术应用于零售需求预测展示了它们的实用价值:
首先检测您的数据管道以捕获细粒度行为,例如产品页面访问、购物车添加、愿望清单更新和价格检查频率。
购物车放弃序列和结账逆转中明显出现摩擦。通过将特色产品植入视为端盖展示的在线等效物来映射物理到数字的并行,支持这种方法。然后,您可以在曝光后的紧张时间窗口内测量转化率。
对于稀疏数据集,应用零膨胀嵌入来处理具有最少购买历史记录的实例,确保您的模型能够推广到超级购物者之外。挖掘频繁的子轨迹,以确定导致购买的三到四个常见路径,并标记那些遵循高概率序列的路径,以进行有针对性的干预。
从静态档案到动态行为智能
该框架将嘈杂的事件日志转换为结构化特征,从而提高模型的准确性。目标是通过呈现可解释的行为模式并在新的操作流入时实现实时预测来提高可解释性。动态行为特征优于静态配置文件,因为它们反映了当前操作而不是过时的历史快照。
Cooper Adwin 是 Designerly Magazine 的助理编辑,在数据分析、软件基础设施和 AI 工具方面拥有 5 年以上的经验。 Cooper 专注于将技术数据工作流程和机器学习概念转化为数据科学界的结构化见解。
