第一章:为什么要学习商业数据分析?

1.1 从人工智能到协同智能:商业数据分析的价值

在5-10年前,大数据只被少数企业应用,人工智能也更多地是一个尚处于实验室中的概念,但是如今这些概念已经深刻地改变了我们的生活方式。上班路上,你喜欢的音乐APP为你准备好了适合今天的歌单;旅游时,入住的酒店会采用机器人为你配送所需要的洗漱用具;外出购物时,大小超市都有支持人脸识别的支付设备,真正实现了全流程的无接触支付;在家刷手机时,今日头条或者抖音也持续不断地推送那些让你放不下手机的新闻和视频。(#1)

在这些场景的背后,是企业对AI所能产生的巨大经济价值的认可。AI和数据分析帮助实现企业资源(音乐、新闻内容、产品)和用户需求之间的最佳匹配,而服务交互的自动化则让企业释放人力,从而用更少的成本获得了更好的效果,实现了企业资源配置的最优化。良好的体验可能会留住更多的用户,从而带来更多的购买转化,这就直接或者间接地为企业的营收带来增量,并能形成持续的竞争优势。

但在AI应用热潮高涨的同时,也始终存在着对AI的质疑。2019年知名调研机构IDC发布报告称,有超过50%的企业AI项目最终以失败告终,而缺乏底层的数据和相关人才的技术支持,是AI项目失败的最主要原因。AI应用在法律和道德问题上存在的缺陷也日益引人注目,过去几年国内引发了对“大数据杀熟”的热议,这是用户对于自身隐私权益日益重视的结果,《中华人民共和国个人信息保护法》也于2021年11月1日正式施行。全球范围内人脸识别技术在使用中出现“歧视”女性和有色人种,以及社交网站助长了虚假信息传播等社会问题,也都让各国开始通过立法等手段加强了对头部AI企业的监管。

在这样的大背景下,越来越多的企业和AI研究者开始倡导“协同智能”的理念,即结合AI对海量数据的计算力与人类对解决问题的创造力,形成取长补短的新型工作模式。人工智能领域专家吴恩达在2020年提到,当前99%的AI应用产生经济价值的方法都来自于一种模式,就是从输入到输出的规则匹配。自动化会让机器能够更有效地完成这些枯燥的重复性的工作,而人类则可以更好地做适合自己的工作,就是那些需要创造性地解决问题的部分。

“协同智能”理念也预示着未来AI如何影响我们的工作。如图1-1所示,若以与AI的不同关系作为划分基础,未来的一切工种无一例外地会被划入下列三个类别:

图1-1 协同智能下的三类工作角色

使用者(User):这将是未来最主流的AI工作场景,也是本书假定的目标读者群体,它涵盖了现有的商业数据分析师(以及相关的BI,数据运营)等岗位,以及任何需要用数据做出决策的职位。要在AI时代胜任使用者的角色,就需要了解AI应用背后的数据思维,能结合不同的商业场景和目标做出合理的数据应用分析和判断。在与AI合作的过程中,要能够给AI提供合适的数据源,并能够解释AI分析产出的结果。

建造者(Builder):AI技术的发展依赖于数据科学家的算法革新,未来这些AI的建造者将负责AI模型的效率优化和工程实现。本书中在思维部分介绍的概率方法,以及在第四章介绍的聚类、分类、回归、产品推荐、时间序列等进阶方法,将为想成为建造者的读者建立起对更高阶的AI方法的认知基础。

监管者(Supervisor):这类新兴的工作角色将在政府或第三方机构等担当对AI应用的法律及伦理监管,他们需要能对AI的社会性影响做合理评估,监管企业的算法规则和数据运用。本书在介绍各种分析方法中,也同样点出了这些方法可能存在的误差及风险,尤其是分析数据源如何影响分析结果,这些都将帮助对AI应用的直观理解。(#2)

可以预见的是在未来几年,企业和社会在认可数据和AI带来的价值的同时,在态度上也会日趋理性,从战略角度保持对AI的长期认可。短期来看,企业使用AI应该去找那些“挂得低的果实”(low-hanging fruit,意指投入小、见效快的切入点)。这个比喻看似简单通俗,却恰到好处,讲的就是数据分析和应用都要回归最核心的价值。数据最终的核心价值是优化决策,从数据的“原油”中精炼出让企业运转的“燃料”。本书所介绍的商业数据分析,就是以优化决策为核心目标,通过数据分析解决商业问题的思维,方法和工具的集合。我们也将从三个方面,让这个集合成为你AI时代职场的核心竞争力:

第一,理解商业模式,能用系统化的思维去理解问题,找到影响结果的可控因素,并通过设计实验来验证结论,最终能探寻业务策略和结果之间的因果关系。本书重点介绍了围绕商业模式搭建数字指标体系,并且将常见的分析问题拆分成三类典型问题。在探寻因果关系的过程中,循序渐进的将最必要了解的统计概念和方法嵌入到商业问题的大图中,能够让读者更清楚的明白统计指标在其中的意义。

早在2700年前的《孙子兵法》中,就已经提到了分析对于决策的价值:“夫未战而庙算胜者,得算多也;未战而庙算不胜者,得算少也。多算胜少算,而况于无算乎!吾以此观之,胜负见矣。”在“死生之地,存亡之道”的战场中,更全面有效的分析能帮助我们获得“胜算”,而在如今VUCA时代的企业经营中,我们则需要决策作为商业数据分析的起点和终点。不是以数据作为出发点,基于数据去推断能做的分析,而是围绕着所需要的决策,思考这个决策需要什么样的数据,获取并分析这些数据。

第二,熟练应用自己的数字化工具,对待不同的业务分析目标,能应用业务分析、用户分析以及可视化分析等工具,总结数据结论,呈现数据结果;对于AI分析方法(机器学习/深度学习等),能掌握“输入什么数据,输出什么结果,怎么业务应用”的核心。在分析方法中,本书通过Excel实操讲解各种数据分析方法的应用,特别是在机器学习类的方法中,从日常会使用的原始数据入手,用案例+公式+原理的方式讲清楚如何解题,尤其适合没有任何编程背景的读者学习。在数据呈现方面,本书选用了Tableau这个易于上手、可视化功能强大、且能应对复杂分析场景(如预测类工作)的工具,能让数据产品开发和日常工作汇报都事半功倍。

从关注底层代码和技术逻辑到应用落地的思路转变是也是AI行业大趋势的体现。《哈佛商业评论》曾在2012年发表文章称“数据科学家是21世纪最性感的职业”;而在2022年,文章作者达文波特(数据分析和人工智能方面的研究学者)和DJ Patil(数学家和计算机科学家,是美国政府第一位首席数据科学家)重新审视他们当年的判断。他们看到过往十年最重要的两个趋势是:第一,写代码已经不再是数据科学中的最核心的工作,越来越多的代码工作被自动化,而数据工作的重点逐渐转移到了如何将商业问题转化成分析模型的能力;第二,自动化的工具会带来更多的“全民数据科学家”,企业应该在组织内部提高数据分析和AI应用的能力,让业务能够实现自主决策。近年来市场上出现了多种自助式的AI分析产品,诸如Tableau和PowerBI这样的可视化工具也融合了预测分析功能,可以想象的是在不久的未来AI分析方法将如同今天我们使用Excel一样简单方便。

第三,能识别公司决策者和决策团队可能存在的思维误区,通过结构化的书面和文字表达及完善的数据论证影响企业的决策。数据报表、模型以及分析报告只是商业数据分析的产出交付物,高质量的交付物不代表着能带来最大化的决策影响,这背后依然离不开人与人之间的沟通和达成共识。把数据背后的故事讲清楚,把数据分析的假设和论证过程讲明白,尤其是将分析方法背后的统计预言准确的翻译成商业语言,这些都依赖于持续的思维和表达训练。本书特别介绍了以数据分析为主体的PPT设计和图形优化,在PPT中如何通过文字和图形突出结论,而避免通篇充斥着“心智”“体感”之类行业黑话,或者频繁使用“很好”“较差“”有问题“却没有数据支持及建议的沟通。若能从决策层开始自上而下的建立数据思维的话语体系,便可更广泛地推进到中高层管理者以及基层员工,进而能实现整个公司的数字化思维转型。

1.2 商业数据分析实现价值的四个步骤

为了理解商业数据分析的工作如何辅助决策和创造价值,我们将其核心流程抽象归纳为四个步骤(见图 1-2)。第一步是明确分析目标:目标既要回答“解决什么业务问题”,也要明确“以何种交付物呈现结论”,两者共同决定需要哪些数据。第二步是获取并整合相关数据,既包括从内部数据库抽取加工得到的交易与行为数据,也包括从外部获得的市场、竞品与消费者态度数据。第三步是根据问题类型,从业务分析、用户分析、可视化及进阶方法中选择合适工具,拆解问题、推导结论。第四步是推动业务策略落地,并通过复盘与实验迭代优化前述结论,完成单个分析项目的闭环;从长期看,这个流程会随市场与业务变化持续循环。

图 1-2 商业数据分析实现价值的四个步骤
图 1-2 商业数据分析实现价值的四个步骤

本章余下内容将以一个国内综合电商平台的用户经营分析项目为例,演示四步闭环。该平台在高速增长后面临流量红利见顶、外部获客成本上升的局面,决策层希望通过分析用户经营状况,找到可优化的方向。客户生命周期管理通常可拆成三个核心问题——获客、成长、留存,分别对应:新客从哪里来、怎样让他们留下;老客如何持续贡献 GMV;以及如何减少高价值老客流失。下面的分析将围绕这三问展开。(#1)

1.2.1 定义分析问题,明确分析产出

首先,将宽泛的“分析平台用户经营状况”拆成可回答的小问题。按照商业数据分析中最常见的三层问题结构,可归纳为:

  • WHAT 问题:当前用户经营处于什么水平?与过去几年相比,用户在购买金额、消费品类、城市结构等方面发生了什么变化?
  • WHY 问题:这些变化背后的原因是什么?是平台商品、价格、促销、服务体验的影响,还是外部竞争或用户结构变化所致?
  • HOW 问题:针对这些原因该做什么调整?如何验证调整确实带来了经营结果的改善?

这三类问题的难度和价值依次递增:WHAT 描述过去,WHY 总结规律,HOW 预测并干预未来。其中 HOW 商业价值最大,但回答 WHY 和 HOW 也需要更严谨的数据与实验设计。

接下来判断交付物形式。商业数据分析常见的交付物有三种:

  • 可视化报表(Dashboard):用指标与趋势图帮助业务方自助监控与诊断,适用于常态化监控场景。
  • 数据服务(DaaS):以规则、标签、模型评分等形式嵌入运营系统,实现自动化策略迭代。
  • 专项分析(Ad hoc analysis):围绕核心经营问题做拆解、验证与结论,通常以分析报告形式交付,用于支撑决策层共识。

在本项目中,初期以专项分析回答经营状况与改进方向,达成决策共识后,再搭建 Dashboard 持续监控关键指标,并通过 DaaS 将模型评分接入运营系统,实现自动化推荐与触达。

1.2.2 整合内部数据,拓展外部数据

解决问题所需的数据可按来源分为内部与外部两类(见图 1-4)。内部数据主要是线上行为与交易数据;外部数据则包括用户态度、竞品表现等定性或半定量数据。

图 1-4 商业数据分析问题的三层结构 WHAT/WHY/HOW
图 1-4 商业数据分析问题的三层结构 WHAT/WHY/HOW

从内部数据看,电商平台可沿用零售业的“人、货、场”框架拆分:

  • 人:用户注册时间、来源城市、年龄性别、打开 APP 的时段与时长等。
  • 货:商品品类、价格、销售额、促销力度、历史折扣等。
  • 场:APP 页面与模块的曝光、点击、转化路径等。

由于要回答“当前”经营状况,数据时间范围要足够长。本项目以最近一个完整年度(2019 年)为基础,以上一年(2018 年)为核心对照,并结合 2017–2019 年三年数据观察趋势。仅看行为数据无法解释动机,因此还配合了用户满意度调研与 NPS 数据;在法律允许范围内,也参考了主要竞品的同期表现。

最终,围绕用户经营这一核心问题,数据被整理成类似下表 1-1 的结构:每一行是一个用户,列上聚合了年龄、城市、交易金额、交易次数、品类偏好、满意度评分等信息。把底层订单加工到“用户级”是后续所有分析的前提。

表 1-1 电商平台用户分析表示例(脱敏示意)
用户ID年龄学历 婚姻状况居住城市首次购买年份 用户类型品类偏好 19年
下单次数
19年
交易额(元)
18年
下单次数
18年
交易额(元)
其他平台偏好平台满意度评分
U100134本科 已婚上海2016 老客服饰鞋包 / 家居家装 2713,584 187,325 综合电商A8.2
U204328硕士 未婚成都2019 新客手机数码 / 服饰鞋包 21,180 00 综合电商B7.5
U187641大专 已婚广州2017 老客家用电器 / 食品饮料 125,920 94,310 综合电商A6.8
蓝用户属性(含新增的首次购买年份 / 用户类型) 橙购买偏好与交易汇总 绿外部调研(竞品偏好 / 满意度)

说明:本表为脱敏示例,仅用于说明“人、货、场 + 外部态度”压到用户一行的结构。新增的「首次购买年份 / 用户类型」列是案例后续新老客拆分、R1/R2/R3、N1/N2 分组的基础字段。

1.2.3 选定分析方法,推导分析结论

数据完备后,进入分析推导。本案例涉及的数据量级大、拆分维度多,下面按“整体 → 老客 → 新客”的层次展开,每一层都先回答 WHAT,再追问 WHY,最后形成可验证的 HOW 假设。

第一步:整体增长与新老客贡献

从汇总数据看,平台 2018 年 GMV 为 1,831 亿元,2019 年达到 2,332 亿元,同比增长 27%;而 2017 到 2018 年的增速为 30%。整体仍在增长,但增速有所放缓(见表 1-2)。

表 1-2 电商平台 GMV 年度数据
年份当年 GMV(亿元)年同比(YOY)增长率
2017 年1,408—
2018 年1,83130%
2019 年2,33227%

以 2017 年为基期观察三年趋势:17→18 增长 30%((1831−1408)/1408),18→19 增长 27%((2332−1831)/1831)。整体正增长但增速放缓。

进一步按新老客拆分(见表 1-3),2019 年老客贡献 GMV 1,516 亿元,占总 GMV 的 65%,但对当年增量的贡献仅为 5%;新客贡献 GMV 816 亿元,占比 35%,却贡献了增量的 22%。简言之:老客是存量基本盘,新客是增长主要来源。

表 1-3 拆解新老客后的 GMV 数据
用户分层19年 GMV(亿元)19年 GMV 占比 19v18 增量(亿元)19v18 增量占比
(相对上年 GMV)
总计2,332100%50127%
新客81635%40822%
老客1,51665%935%

“增量占比”的分母统一为上年 GMV(1,831 亿元):新客 408/1831≈22%,老客 93/1831≈5%,合计 27% 即表 1-2 的 YOY 增速。注意这是“相对上年基数的增长贡献”,不是“在 501 亿增量中的份额”(若按后者口径,新客占 81%、老客占 19%)。

这一 WHAT 层结论把分析指向两个方向:老客为何几乎不增长、新客为何成为增量主力?只有分别回答这两个 WHY,才能提出有效的 HOW。(#2)

第二步:老客诊断——为什么老客增长乏力?

具体到本案例,我们沿着两条最直观的主线切分老客:一条是“时间”(用户与平台相处的年数,即站龄),一条是“钱”(消费金额与品类宽度)。之所以选这两条线,是因为“老客整体增长乏力”本身是个笼统问题——只有顺着时间和花的钱一路下钻,才能回答它背后真正的疑问:是长期老客在流失?是高价值客户没有守住?还是其实有一批老客在上行、只是被整体均值掩盖了?下面三个小节,就是沿这两条主线逐层下钻的结果。

(1)老客价值随“站龄”大幅提升,流失代价高

将老客按首次购买后的年数分组观察,会发现一个清晰的规律:用户留存越久,人均 GMV 越高,流失率越低。第 1 年新客的人均年 GMV 约为 1,100–1,200 元,而 5 年以上老客可达 9,000 元以上,相差约 7–9 倍;同时,5 年以上老客的次年流失率已降至 10% 以下,而第 1 年新客的次年流失率超过 50%。

表 1-4 老客站龄 × 人均年 GMV × 次年流失率(典型 / 示意)
站龄分组人均年 GMV(元)次年流失率
第 1 年1,15052%
第 2 年2,80036%
第 3 年5,10024%
第 4 年7,40016%
5 年以上9,2009%
第 1 年1,150
第 2 年2,800
第 3 年5,100
第 4 年7,400
5 年以上9,200
人均年 GMV 随站龄单调上升(条形长度示意,单位:元)

第 1 年与 5 年以上的锚点取自项目资料(首年约 1,100–1,200 元、5 年以上 >9,000 元且次年流失 <10%),中间各年数值为示意插值,仅用于说明“站龄越久、价值越高、流失越低”的单调趋势,上线前建议替换为真实分层数据或标注“示意”。

这说明:老客,尤其是长期老客,是平台最宝贵的资产。老客增长乏力,首先不是一个“增量”问题,而是一个“防止流失、保住存量”的问题。

(2)高价值老客集中度高,且存在下行与流失风险

按 2018 年消费金额将老客分为十档,前 20% 的高价值客户贡献了约 80% 的老客 GMV。但这群核心客户中,超过一半在 2019 年出现消费下行,约 16% 直接流失;两者合计损失的 GMV 远大于中低价值客户。也就是说,老客增长停滞的核心风险点,不是“中低价值客户没增长”,而是“高价值客户没有守住”。

表 1-5 老客价值集中度与核心客户风险
群体(按 18 年消费金额分层)占老客 GMV19 年表现
前 20% 高价值核心客户约 80%其中 >50% 出现消费下行,约 16% 直接流失
后 80% 中低价值客户约 20%整体平稳、增长有限

该表体现经典的“二八”分布,且限于老客内部:老客增长停滞的核心风险点并非中低价值客户没增长,而是前 20% 高价值核心客户没有守住——其核心群体中下行与流失合计损失的 GMV,远大于中低价值客户。人口/GMV 占比为项目典型值,建议上线前核对真实分层或标注“示意”。

0 10 20 30 40 50 0 20 40 60 80 100 单档 GMV 占比(%) 累计 GMV 占比(%) 第1组 第2组 第3组 第4组 第5组 第6组 第7组 第8组 第9组 第10组 每组 = 10% 老客(按 GMV 从高到低排序) 累计 80% 前 20% 老客 ≈ 80% 老客 GMV 单档 GMV 占比 累计 GMV 占比
图 1-5 老客 GMV 帕累托分布(按 GMV 从高到低十等分;数值为示意)

(3)上行的老客发生了什么行为变化?

在守住存量的同时,还要找出“什么样的老客会增长”。将 2019 年消费高于 2018 年的老客(R1 类)单独分析,发现他们的提升主要来自两个方面:购买频次增加和笔单价提高;而笔单价的提高,又与品类扩张高度相关——这类用户平均购买品类从 2018 年的约 6 个增加到 2019 年的超过 10 个。

表 1-6 上行老客(R1)的价值提升来源拆解
提升来源2018 → 2019 变化关键发现
购买频次年均下单笔数上升复购更密,是上行的基盘
笔单价单笔金额提高与品类扩张高度相关
购买品类数(均值)约 6 个 → 超过 10 个品类宽度显著增加,是频次与笔单价提升的共同驱动
新增品类贡献—家居家装 / 服饰鞋包 / 食品饮料贡献最大;高客单品类(3C 数码、家电、电脑办公)件单价溢价显著

R1 指 2019 年消费高于 2018 年的老客;“约 6 个 → 超过 10 个”取自项目资料,其余为方向性描述,建议上线前补入真实均值或标注“示意”。

进一步看新增品类分布,家居家装、服饰鞋包、食品饮料等品类对上行贡献最大。同时,价格分析显示,高价值老客在 3C 数码、家用电器、电脑办公等“高客单品类”上的件单价溢价显著;而在服饰、个护等新兴品类上的溢价相对较小。这意味着:品类扩张既包括“继续买更贵的高客单品类”,也包括“开始买平台此前供给不足的新兴品类”。

综合以上三点,老客策略可以形成一个清晰的假设:对高价值、长期老客,重点防止流失;在此基础上,通过品类推荐与会员权益刺激他们扩充购买品类、提升频次。

第三步:新客诊断——新客从哪里来,怎样才能留下?

(1)新客结构在变化:城市线级与首购品类同时迁移

2017–2019 年间,平台新客来源呈现明显下沉:一二线城市新客占比逐年下降,三到六线城市新客占比持续上升;同时,三到六线城市新客的人均首年 GMV 在上升,一二线城市反而略有下降。这意味着增量用户画像与早期用户不同:他们对价格更敏感,首购品类也更偏向服饰鞋包等日常消费品,而非 3C、家电等高客单品类。

这一变化对新客运营有两层含义:第一,获客与首购转化策略需要适配下沉市场;第二,不能指望新客复制早期“高客单 3C 首购”的路径,必须找到新的复购激发点。

表 1-7 新客城市线级结构变化(2017–2019,示意)
城市线级17 年新客占比18 年新客占比19 年新客占比19 年人均首年 GMV(元)
一二线55%48%41%1,050
三到六线45%52%59%1,180
一二线·1755%
一二线·1941%
三六线·1745%
三六线·1959%
新客来源下沉:三到六线占比上升、一二线下降(条形按 0–60% 刻度)

城市线级占比与人均首年 GMV 为示意值,用于说明“增量用户画像下沉”的方向;上线前建议替换为真实分层数据或标注“示意”。

(2)复购窗口:早期复购者价值更高,但只是相关而非因果

在新客中,将已经产生二次购买的 N2 用户按首购到复购的时间差分组,会发现一个强相关:首购后 1–2 周内复购的用户,其首年消费金额比 9–12 周才复购的用户高出 20% 以上;随着复购时间推迟,人均年 GMV 几乎单调下降。

表 1-8 复购时间差与首年价值(以 9–12 周为基准 100,示意)
首购→复购时间差相对人均年 GMV解读
1–2 周120价值最高,比 9–12 周高约 20%
3–4 周112次之
5–8 周105继续下降
9–12 周100基准
1–2 周120
3–4 周112
5–8 周105
9–12 周100
人均年 GMV 随复购时间推迟单调下降(条形按基准 120 刻度)

相对值为示意,仅用于呈现“越早复购、价值越高”的单调趋势;1–2 周比 9–12 周高约 20% 为项目典型值。该关系为相关信号而非因果,能否通过提前触达提升价值须由实验验证(见 1.2.4)。

但这里有一个关键的逻辑陷阱:这些数据只说明“早期复购者本身是更高质量的用户”,并不证明“如果我把所有新客都催着在 1–2 周内复购,他们的价值就会提高”。早期复购者可能是更刚需、更活跃、消费能力更强的人群——这是自我选择,不是干预结果。因此,1–2 周窗口更应被看作一个高价值识别信号与运营机会窗口,而不是已被证明的“催熟杠杆”。能否真正通过提前触达提升价值,必须交由实验验证。

(3)复购品类:首购品类最可能被复购,服饰鞋包是次强相关

再看复购品类与首购品类的关系:同一品类被复购的概率最高,矩阵对角线明显突出;而在跨品类中,服饰鞋包是最常见的二次购买品类。这说明,对新客的早期引导,应该优先基于“你首购的品类还有什么可买”,其次才是“服饰鞋包等高频日常品类”。

表 1-9 复购品类关联(示意归纳)
首购品类最常复购品类说明
手机数码手机数码同品类复购概率最高(矩阵对角线)
服饰鞋包服饰鞋包同品类强,且为跨品类次强
家居家装家居家装 / 服饰鞋包跨品类流向服饰鞋包
食品饮料食品饮料高频复购
同品类复购≈65%
跨品类复购≈35%
复购最强关联是同品类;跨品类中服饰鞋包最常见(占比为示意)

本表为基于项目发现的示意归纳,非完整品类矩阵;上线前建议补入真实复购转移概率或标注“示意”。

综合以上三点,新客策略的假设是:抓住首购后 1–2 周的关键窗口,结合首购品类与服饰鞋包做个性化推荐,帮助新客完成从 0 到 1、再从 1 到 2 的跨越。

第四步:从诊断到策略假设

到这一步,分析已经从 WHAT 推进到 WHY,并形成了可落地的 HOW 假设:

  • 老客策略假设:高价值老客是 GMV 基本盘,防止流失优先;对可上行的老客,通过高客单品类与新兴品类的推荐,结合会员激励,提升品类宽度与购买频次。
  • 新客策略假设:新客增量来自下沉市场与日常消费品首购,应在首购后 1–2 周内,通过首购品类相关推荐与服饰鞋包等高频品类完成复购转化。
  • 品类与供给策略假设:新兴品类与下沉市场价格带的供给丰富度,是新客留存与老客上行共同依赖的基础设施。

需要再次强调:这些只是经过数据诊断后形成的业务假设,而不是已经被证明的结论。把它们从假设变成可执行策略,需要第四步的验证与落地。

1.2.4 推进决策落地,复盘诊断结果

分析报告不是终点。商业数据分析的最大价值在于优化决策,而决策是否优化,最终要用实际经营结果来评估。

以新客策略为例,假设在没有任何干预时,每 100 个完成首购的新客中,有 20% 会在一年内复购两次以上。如果按照 1.2.3 的假设,从某月开始对首购新客在 1–2 周内推送品类相关推荐,并持续观察后续转化,可能会看到 N2 比例有所提升。但仅凭趋势变化不能归功于策略——大促、节假日、竞品变化都可能同时影响结果。

因此,有效的复盘必须依赖商业实验:随机抽取两组在用户特征、首购品类、城市线级、历史行为上尽量一致的新客,对其中一组施加“1–2 周窗口 + 品类推荐”的干预,另一组保持现有运营节奏或营销静默,最终以两组的 N2 转化率、首年 GMV 等指标差异来验证策略是否有效。老客的上行策略也应采用同样的实验方法,例如对高价值老客随机分组,验证品类推荐与会员权益组合的效果。

在验证有效后,项目进入规模化落地:通过 Dashboard 持续监控老客流失率、新客 N2 转化率、复购窗口转化率等核心指标;同时把推荐模型与用户标签以 DaaS 形式接入运营系统,实现自动化、个性化的用户触达。至此,从问题定义、数据整合、分析诊断、策略假设到实验验证与产品化落地,一个完整的商业数据分析闭环才得以形成。

1.3 商业数据分析的行业应用

上述电商平台的用户经营案例,是商业数据分析创造价值的场景中较为有代表性的一种。本节为读者精选了数据驱动业务增长的四个案例,它们分别代表了 CRM(通过用户数据提升营销效果,维持客户长期关系,实现用户全生命周期管理)、产品创新(从数据中挖掘潜在产品市场)、欺诈风控(金融或支付场景基于设备和用户行为防范黑产)和零售创新(线下零售依靠数据优化顾客体验,以及供应链和库存管理)。这四个案例分别来自银行、消费电子、移动金融以及传统零售四个行业,可以说从不同角度验证了数据分析的巨大价值。

本节案例地图

  • 1.3.1 中信银行 · 银行业 / CRM:用数据做立体化融合营销
  • 1.3.2 安克(Anker) · 消费电子 / 产品创新:借力亚马逊数据做跨境电商
  • 1.3.3 DataVisor · 移动金融 / 欺诈风控:无监督学习识别黑产团伙
  • 1.3.4 百联 · 传统零售 / 零售创新:数字化让线下零售活起来

1.3.1 中信银行用数据实现立体化的融合营销

商业数据分析在银行业有着巨大的应用潜力。银行业拥有足够的用户体量和底层数据量,而且对底层 IT 建设投入资源巨大,在数据的规范性和治理上要远好于消费品企业。银行遍布全国的网点门店,不仅能够获得对客户的更直接认知,也可以让数据分析有更多渠道的应用。

中信银行自 2016 年起就着力通过数据建立可持续优化的客户经营体系,从总行管理层入手深化了客户全生命周期管理的思维。在数字化系统上,银行建立了包含营销活动管理、精准营销模块、营销事件管理的零售 CRM 系统;同时围绕用户建立了五大类数据,分别是:

  • 特征数据:性别、职业、收入、年龄、资产、风险预警、房车信息
  • 行为数据:渠道偏好(手机或网点)、常访问的网点地址
  • 交易数据:信用卡消费水平、消费商户类别(如餐饮、美妆等)
  • 产品数据:投资、存款、贷款、保险等产品的持有数量、金额、种类等
  • 活动数据:参与的营销渠道(APP、微信、短信)、响应的活动类型等

在对理财到期客户的手机银行浏览数据分析中,银行发现:对比整体 60% 的理财到期续购率,在到期前曾浏览银行端理财产品的客户,续购率会提升到 70%。进一步的拆分发现,浏览投资理财类产品主要发生在理财到期 4 日以内;若选择购买,则购买行为发生在浏览行为 3 日内的概率是 90%。但另一方面,如果客户浏览的理财产品数量达到 4 个,却仍未出现购买行为,则客户在到期后流失的可能性为 75%。

银行基于这些数据设计了线上线下协同营销方法:首先通过短信提示客户购买的理财产品即将到期;接着根据用户的浏览信息,基于上述预测分析做分层触达。第一层是通过自动化触达为客户推荐相关产品;若客户没有响应,则根据其产品净值升级到「客户+权益」组合——即在指定时间内完成理财产品续购,即可获得机场 VIP 休息室、积分商城等增值权益。如果客户仍未购买,则将客户信息通过内部 CRM 系统推送给客户经理,由客户经理优先电话触达,配合产品与权益信息进行挽留。

数字化的协同营销极大精简了客户挽留的工作流程,且能实现对客户的智慧化经营策略。除线上线下协同营销之外,中信银行还拓展了社交式的金融营销,通过客户的家庭关系、社会关系以及产品中的契约关系挖掘潜在客户。在行内 2 家分行试点后,通过客户关系网络挖掘潜在私人银行客户 5000 人,转化成功率 13%,提升了 120 亿元 AUM。(#1)

案例要点 · 1.3.1

数据不只是看报表:银行把「浏览行为 → 续购/流失概率」转成了可执行的分层触达策略——自动化推荐 → 权益升级 → 客户经理电话,三层递进,把预测模型真正接进了业务流程,而非停在分析师的 PPT 里。

1.3.2 借力亚马逊数据,安克成就跨境电商传奇

移动电源市场有着巨大的价值潜力,据专业机构报告,该市场 2020 年的全球规模在 212 亿美元,而到了 2030 年则会达到 386 亿美元。经营于这个市场的许多品牌都默默无闻,但来自中国的安克(Anker)却是例外:自 2011 年在亚马逊销售以来,安克的销售额在五年内实现了 30 倍的增长,目前产品在 100 多个国家和地区畅销,坐拥 3000 万忠实用户,用户平均复购 2.7 次。

安克从 0 到 1 成长为移动电源市场上的新兴品牌,被许多中国同行称为「跨境电商之神」。但令人称道的是,它的创始人阳萌(Steven Yang)却没有任何电子制造业的经验——他曾是谷歌的一名软件工程师。一次偶然的机会,他为了帮助在亚马逊销售产品的朋友搭建了一套软件系统,在这个过程中,他对第三方公司在亚马逊平台的销售体系,特别是如何用亚马逊提供的各种数据找到新产品机会,有了深刻的理解。

在亚马逊虚拟货架的海量产品之中,他敏锐地发现了智能设备配件领域的市场机会。最早安克的产品主攻笔记本电池:在 2010 年左右,许多笔记本电池通常使用两三年之后就需要更换,而原装电池通常定价在 70–80 美金,许多杂牌电池价格便宜但质量不佳。笔记本电池成为安克成长的第一桶金;随后安克的管理团队又依靠类似的数据方法锁定了新的产品线,也就是智能手机的充电器。2012 年安克推出了应对苹果和安卓之间充电规范不同的双系统充电器,基于亚马逊平台上用户对该产品的反馈持续迭代,增加了口红造型以及各种配色,进一步奠定了安克作为第三方电池品牌的领导地位。

在安克成功的路上,亚马逊平台提供的各种数据成了公司决策的关键。一方面,亚马逊给卖家提供产品行为数据——用户从什么关键词而来、产品的曝光量和转化率、以及用户购买后的评价数据,这些都帮助安克实现产品创新。由于许多欧美消费者对当时泛滥在亚马逊上的杂牌充电设备抱怨颇多,为了不让顾客觉得安克的产品低质,团队在产品包装上都花足了心思。另一方面,亚马逊平台也提供了多种广告模式,熟悉平台规则的安克团队打造出了高投入产出的页面设计和促销方式,在亚马逊上搜索手机充电类关键词,都能在显著位置看到安克产品。

如今安克已经在谷歌和美国各大社交媒体上做了多种广告投放,充分吸纳多渠道的流量资源。从 2015 年开始,安克进军线下零售渠道,如今已有近 30% 的公司营收来自沃尔玛等商超。通过更全面的数字化营销手段,配合多样化的新产品,安克正成为消费电子领域一家具有独特影响力的品牌。

案例要点 · 1.3.2

安克的核心能力不是制造,而是「用平台数据发现需求 + 用用户反馈迭代产品」:从笔记本电池到双系统充电器,再到口红造型充电宝,每一步新品都来自对亚马逊搜索、曝光、评价数据的洞察。数据在这里直接驱动了产品创新。

1.3.3 DataVisor智能风控与欺诈者的数据攻防

在移动互联网及电商的发展过程中,各种形式的欺诈也日益增多。如今互联网欺诈已经形成了巨大的「黑色产业」,渗透到了账号注册、身份伪造和借贷支付等各个环节。在企业的营销活动中,各种羊毛党和黄牛党极大影响了用户体验和活动效果;而在支付相关场景中,通过系统漏洞非法盗用账户资金,或骗取用户账号购买游戏点卡等,可能给企业造成巨额经济损失。据有关机构统计,每年各种网络欺诈行为在金融、游戏、电商等行业造成的损失高达 4000 多亿元。

防范欺诈的难点,特别是当企业刚开始涉足交易或支付场景时,通常都缺乏足够的欺诈样本作为分析对象。没有足够的欺诈样本,就很难判断当前遇到的交易是否属于欺诈;只有累积足够多的「坏人」,才能更准确地区分好人与坏人。而这正是 DataVisor 专攻的领域:该公司以强大的无监督学习引擎(关于无监督学习,我们也将在第四章分析方法中做介绍)可同时分析数十亿账户与事件,无需标签和训练数据即可自动发掘恶意账户间的可疑关联和相似度,并即刻检测、捕获整个欺诈团伙。(#2)

DataVisor 要从人群中识别出看似正常、但背后又有潜在类似性的欺诈行为。它所利用的数据包括用户注册的时间、注册名是否有大写、IP 是否来自某个数据中心(可能使用了代理服务器)、使用的浏览器或手机系统版本等。黑产要想取得利润,就必须使用自动化工具进行批量化操作,这也给反欺诈者的防御提供了潜在线索。比如说表 1-10 是一批新注册用户的例子,可以看到他们在信用评分机构的评分都很高,也不在公司的黑名单库中,看起来似乎无懈可击。

表 1-10 Datavisor 用户样例数据(2017 年)
姓名年龄信用分邮件是否在黑名单
Irma H.45790IrmaH512@gmail.comNO
Carolyne F.27725CarolyneF119@GMAIL.COMNO
Celina P.34800CelinaP130@gmail.comNO

这三位用户单看每一项都「正常」:信用分高、不在黑名单。但细查会发现三处共性破绽——都申请了同一款信用卡产品、都使用老旧手机 iPhone 5、邮箱都是「名+姓+生日」的固定格式。这些共性正是机器批量注册、用虚假信息骗领信用卡的蛛丝马迹。

但经过细查,这些用户都申请了同样的信用卡产品,且使用的都是老旧手机 iPhone 5;特别是看似正常的邮箱,其实都是「名+姓+生日」的固定组合格式。这些都暴露了机器批量操作、利用旧手机和虚假信息去申请信用卡的欺诈行为所产生的蛛丝马迹。正因为这些千变万化的欺诈手段,如果始终依赖标签化处理已知欺诈行为、再去训练模型识别这些欺诈,就会让企业始终处于被动状态。

DataVisor 就是这样依靠从大量用户行为活动数据、设备指纹数据、交易数据、用户生成文本数据等原始数据,构建了覆盖用户全生命周期的风控产品体系,将前沿的机器学习技术落地应用于风控业务,保护了全球超过 42 亿的账户安全。

案例要点 · 1.3.3

反欺诈的关键矛盾是「没有足够坏样本就无法训练模型」。DataVisor 的解法是跳过标签,用无监督学习直接从行为、设备、文本的原始关联中揪出团伙——这对所有「坏样本稀缺」的风控场景都有借鉴意义。

1.3.4 百联数字化让零售活起来

百联集团拥有购物中心、超商、综合百货等核心业务,在全国 25 个省市约 7100 余家营业网点,涵盖了国际商贸流通集团现有的各种业态,如百货、标准超市、大卖场、便利店、购物中心、品牌折扣店、商业连锁和物流等。

根据德勤《中国零售企业数字化转型成熟度评估报告》,传统零售业在数字化平台运营、数字化客户体验以及全渠道触点上都还有较大的成长空间。传统零售企业普遍面临数据维度单一的问题:对消费者的理解停留在交易上,对其商品选择和消费动机缺乏认知,也因此无法对客户需求开展品牌选择和权益管理上的服务。

百联集团从 2015 年成立全渠道的电子商务公司,实现了线上数据和商品中台化管理,推进了会员和营销一体化建设。同时集团加强了底层数字化应用的科技创新,从人、货、场三个方面赋能前端的各种业态。遍布卖场各处的智能设备——包括采集客流的摄像头以及与顾客交互的智能终端——能将商场内的流量、转化、粘性和商品数据都进行自动化收集处理。与纯线上的流量相比,线下流量包含了进店人数、在店停留时长、密度分布等数据;在商品侧的漏斗则可以通过摄像头数据观察到「品类区域 → 货架停留 → 商品触达 → 购物交易」的实体漏斗,这些对于了解顾客的购物习惯和动机有着非常重要的意义。

在数字化转型的背景下,门店不再只是销售载体,而成为了围绕用户的数字化运营中心。基于智能设备的客户追踪,通过了解客户动线和偏好、记录客户场内信息,店内实时分析能提升消费者体验和减少库存遗失;店内的互动广告可以提供导购、增强互动娱乐性,并能通过活动形式打通百联集团整体的线上线下会员。配合人脸识别的自助结账设备,可以将用户加入会员、使用积分等功能变得更便利;而随着具备物联网功能的智能货架加入,不仅门店的库存管理可以得到改善、实现自动化监控与补货,更可能根据整体客户需求变化实现自动化的价格折扣。这些数字化的创新,使得百联集团在数字化消费体验和智能管理运营上日益高效,线上线下融合、提高单店坪效,真正让传统零售在互联网+的时代活起来。

案例要点 · 1.3.4

线下零售的数据金矿在「动线」:进店人数、停留时长、货架停留、转化漏斗——这些是纯线上没有的数据。百联用摄像头+智能终端把实体流量数字化,再用物联网货架做自动补货与动态定价,把门店变成了数字化运营中心。

总结与思考

本章我们介绍了商业数据分析在 AI 时代的价值,并且通过电商平台的应用案例讲述了数据分析落地实现价值的典型流程和场景。四个不同行业的场景案例则说明,数据分析并非是互联网行业独有的产物;互联网流量红利可能已经离我们远去,但拥有优秀的分析思维、能驾驭数字化工具、提升所参与业务的决策质量,将会给你的职场创造终身红利。

除了所列举的案例之外,商业数据分析也能在其他行业和业务场景中发挥独特的价值。在数字营销领域,数据分析可以帮助广告主优化投放,调整不同渠道(搜索引擎、信息流、微信朋友圈)广告投放的关键词及竞价策略。在舆情管理领域,对微博、小红书等社交媒体的语义理解、热点话题的影响分析,能够让企业及时应对公关危机和紧急事件。在制造行业,数据分析也在帮助生产厂商基于设备传感器数据对潜在的维修做出预警;而随着物联网的深入,这类分析将使得智能制造成为现实。

本章留给读者的思考题,也是我在企业培训时的一个互动题目。如果你走进某些银行网点,工作人员会用你的银行卡刷一下她所使用的平板,在这个平板上会出现有关你的各种信息标签,比如是否工资卡代发、是否信用卡持卡用户等等,工作人员也会基于此推测你可能要办理的业务或者提供针对性的服务。那么在未来的某一天,我们能否实现:当任何一个客户走进银行网点,不用和任何人员或设备接触,就能自动判断她要处理的业务?围绕这个问题,读者可以思考一下所需要的 IT 技术、数据资源,以及你能想到的用于判断所需业务的规则。

↑