提供3000多款全球软件/控件产品
针对软件研发的各个阶段提供专业培训与技术咨询
根据客户需求提供定制化的软件开发服务
全球知名设计软件,显著提升设计质量
打造以经营为中心,实现生产过程透明化管理
帮助企业合理产能分配,提高资源利用率
快速打造数字化生产线,实现全流程追溯
生产过程精准追溯,满足企业合规要求
以六西格玛为理论基础,实现产品质量全数字化管理
通过大屏电子看板,实现车间透明化管理
对设备进行全生命周期管理,提高设备综合利用率
实现设备数据的实时采集与监控
利用数字化技术提升油气勘探的效率和成功率
钻井计划优化、实时监控和风险评估
提供业务洞察与决策支持实现数据驱动决策
原创|行业资讯|编辑:陈俊吉|2017-02-13 13:09:05.000|阅读 413 次
概述:本期我们有幸采访到的嘉宾名叫兰锦池,2012年硕士毕业,概率论与数理统计专业,崇尚概率论和统计学解决问题的思想,喜爱折腾各种实际数据,愿意跟数据挖掘模型死磕。
# 慧都年终大促·界面/图表报表/文档/IDE等千款热门软控件火热促销中 >>
相关链接:
本期我们有幸采访到的嘉宾名叫兰锦池,2012年硕士毕业,概率论与数理统计专业,崇尚概率论和统计学解决问题的思想,喜爱折腾各种实际数据,愿意跟数据挖掘模型死磕。
现在他是一名资深工程师,主要负责用户行为分析和精准营销相关工作;曾做过某电信省公司的手机用户行为价值分群、手机终端升级概率预测模型、用户流失预警模型等。
在兰锦池看来,工作中最困难的还是数据源的采集和结构化数据的获取,比如曾经做用户的手机上网行为画像,需要采集手机上网日志数据,并转化为兴趣点数据。需要狮提出数据需求、采集规则、计算口径等非常详细的方案,期间还得与业务和数据采集部门深入合作。简而言之,就是,数据分析狮不仅仅是呆板的技术人员,而且能沟通协调、整合资源的多面手。
本期,他带来了一个电信用户分群案例,与大家分享。
1、业务问题背景
某省电信运营商e8套餐(宽带+固话)升级e9(宽带+固话+手机)的主要业务目标为针对e8客户加装电信C网号码并购买手机,升级为e9融合套餐或e9自主套餐用户。即,通过电信的自身的宽带客户资源,进行精准电话营销,促使用户购买手机,从而提升电信在手机市场的占有率。
2、数据理解:e8升e9的数据理解
3、确定分析对象
本环节关键点:
缩小分析基础客户群范围,从表中238万宽带客户中筛选出24万符合业务目标的e8客户,作为数据挖掘的基础客户群
具体步骤:
常用的数据挖掘基础客户群筛选维度如下:
分析对象筛选流程:
以e8升e9为例,根据前期业务和数据理解,本次挖掘的基本目标客户为e8用户,且在同账户下无C网手机。
具体数据样本选取路径如下:
注,具体操作方法:
4、变量筛选
以e8升e9案例中变量处理为例,具体筛选流程如下:
5、决策树模型的建立
(1)选择模型输入变量
根据数据准备阶段字段筛选结果选择了9个字段作为模型输入变量。CHAID节点对应的目标变量和预测变量设置,见下截图。
(2)模型输出结果
运行CHAID决策树节点后,Modeler会根据样本数据和输入变量训练决策树模型。虽然输入了9个变量但是CHAID决策树节点训练的模型最终生成决策树所选择的变量只有5个,分别是宽带在网时长(PD_PROM_FEE)、固话通话时长(VO_MOU_FIX_AVG)、固话ARPU(MB_FIX_ARPU_AVG)、宽带在网时长(PD_BB_TENURE)、宽带流量(VO_BB_VOL)。可以看出,这5个变量在都是具有重要业务含义的字段,基本符合建模目标。
(3)决策树输出的初步结果
下图,是决策树模型输出的结果,树状结构末端的每个“叶子”,代表一个细分用户群体。这个决策树结果共有17个“叶子”节点。
6、模型调优
e8升级e9模型中,决策树模型验证调优流程如下:
初步结果判定:
决策树结果共有17个“叶子”节点,用户细分群体偏多,部分群体的规模小,占比不足5%,因此需要根据各叶子节点的特征,对决策树的“叶子”进行修剪合并。
比如,上图中的节点1(套餐档位<=68元的用户),这个节点中的类别“1”用户占比仅0.56%,较全样本的整体类别“1”占比0.786%较低,说明套餐档位<=68元的用户都是质量较差的部分,加装3G手机的可能性较低。从选取营销目标用户的角度,对这类用户不需要进行深入分析,因此可以把该节点下面的三层节点都剪裁合并。
模型的调整和优化—子模型的建立
如果认为决策树的某个子节点对应的决策树规则不符合业务逻辑,则可选择该决策树节点下的样本再建立一个子模型,从新选择新的变量。
比如,对上述决策树模型的结果,在套餐档位为80~98元且宽带在网时长13个月以上的样本分了四个子节点,但是这四个节点的类别“1”占比并没有递增或者递减的规律,这在业务逻辑上很难解释。因此可针对该条件(套餐档位为80~98元且宽带在网时长13个月以上)的样本数据,再单独建立一个决策树模型。
决策树子模型的建立可参见如下截图。首先,利用Modeler的样本选择节点,选择套餐档位为80~98元且宽带在网时长13个月以上的样本数据;然后,在决策树模型的节点选择输入变量时,不要选择宽带在网时长的字段,即调整输入变量;这样Modeler会根据新选择的样本和输入变量建立一个新的决策树模型(见下图)。这就建立了一个更具有业务解释性的决策树子模型。
7、模型结果解释
具体分群的数据结果如下:
根据三个主要判断分群有效的原则,选择提升倍数在1.3以上、客户群规模占比5%以上的群体作为主要目标客户,一共4个客户群。上述的群划分规则即建模变量。
通过决策树模型筛选出目标用户群后,需要进一步根据不同细分目标群体的消费行为特征来推测客户的主要业务需求。此时需要根据e8升e9的业务目标,选择主要的字段来刻画客户特征。通常对客户群各变量的均值来进行描述,具体如下:
因此,具体客户特征总结描述如下:
转自:CDA数据分析师
本站文章除注明转载外,均为本站原创或翻译。欢迎任何形式的转载,但请务必注明出处、不得修改原文相关链接,如果存在内容上的异议请邮件反馈至chenjj@pclwef.cn
通过提供强大的3D CAD数据访问工具并适用于桌面、移动和Web的高级环境3D可视化发动机,HOOPS在提升造船设计和制造流程的效率方面发挥了重要作用。
HOOPS Luminate在汽车行业中的应用具有广泛的潜力和深远的影响。它通过提供高效的3D可视化、虚拟装配与拆解、性能分析、客户定制等功能,帮助汽车制造商在设计、生产和销售过程中提升效率、降低成本并提高产品质量。
在不断发展的软件开发世界中,使工具和框架与最新的平台版本保持同步至关重要,欢迎查阅~
全球航运业对国际贸易至关重要,全球 90% 以上的商品通过海运运输。准确监控和控制这些集装箱的移动对于维持高效的供应链至关重要。手动输入集装箱号码是这一程序的关键部分,它带来了相当大的挑战,例如人为错误和效率低下。
工业4.0优选产品 | 商业智能和绩效管理软件领导者,帮助企业成为业绩最佳的分析驱动型企业
SPSS Modeler工业4.0优选产品 | 在历史数据中发现规律以预测未来事件,做出更好的决策,实现更好的成效
IBM BigInsights for Apache Hadoop经济高效地存储、管理和分析大数据
IBM InfoSphere Streams高效捕获和分析动态数据的软件平台
InfoSphere DataStage助您发现、充实、集成和管理数据的整个生命周期
服务电话
重庆/ 023-68661681
华东/ 13452821722
华南/ 18100878085
华北/ 17347785263
客户支持
技术支持咨询服务
服务热线:400-700-1020
邮箱:sales@pclwef.cn
关注我们
地址 : 重庆市九龙坡区火炬大道69号6幢