在开始改写之前,我们先来看一个实际案例:
一家公司希望了解其产品的用户画像,因此在产品包装上印上了自家小程序的二维码,并通过多种方式鼓励用户扫码(例如验证真伪、学习使用方法等)。一旦用户扫描二维码,公司便可以从后台获取他们的基本信息,例如下图所示是对用户年龄分布的统计结果。
现在问题来了:哪一年龄段的人群是该产品的典型用户?
关于这个问题,我听到了三种不同的答案。
第一种观点认为是30至39岁,理由是该年龄段的柱状图最高。
第二种观点认为是25至29岁,因为尽管其高度次于30至39岁,但年龄跨度仅为前者的一半,更具代表性。
第三种观点则认为18至29岁的用户都是典型用户,原因与第二种观点类似。
那么,究竟哪种答案更准确呢?
大多数人的选择可能是第二种或第三种。起初我也认同这样的看法,认为产品的目标用户是“年轻人”,即15至34岁的人群。
然而,这个结论令我感到惊讶。因为根据常识判断,产品的典型用户应该是年纪较大的中年人。该产品属于健康食品,主打“排毒”“减肥”“降三高”“治便秘”“抗酸”等功能,除了“减肥”外,其余功能更符合中年人的需求。
数据结果却与常识相悖,这时我们应该相信数据还是常识?
这是我在一个项目中遇到的问题,确实让我困惑了一段时间。一方面有人认为“数据不会撒谎”,另一方面又有人说“调研时常识更重要”。
直到我回忆起一个二战的故事,才让问题变得清晰起来。
在二战期间,盟军战斗机遭受重大损失,于是盟军总部召集了物理学家和数学家来研究如何减少损失。他们统计了所有成功返航飞机的中弹位置,发现机翼部分中弹较为密集,而机身和机尾的中弹较少。因此,普遍建议加强机翼部分的防护。
然而,统计学家沃德提出相反观点,他认为应该加强机身和机尾部分。他解释说,所有样本都是成功返航的飞机,正是因为机翼受到攻击,机身和机尾未受密集攻击,才使这些飞机得以返航。军方采纳了他的建议,结果证明这一决策非常正确。
这个故事说明了“幸存者偏差”的概念:数据仅反映幸存者的特征,而非整体情况。
回到用户画像的例子,如果我们只依靠扫描过二维码的用户数据来判断产品用户特征,实际上忽略了那些使用了产品但未扫码的用户的数据。毕竟,并非所有用户都会扫码。
影响结果的因素有很多,比如不同年龄段的用户有不同的扫码习惯,扫码的用户未必是产品的真实用户,等等。因此,无法仅凭现有数据得出准确结论。
柏拉图在《理想国》中讲述了一个著名的比喻——“洞穴之喻”。设想有一个深洞,囚徒们只能看到洞壁上的影子,误以为影子是真实世界。数据就像洞壁上的影子,即便数据再精确,也无法全面反映真实世界。
相比之下,常识能从更多角度分析事物。大脑可以将看似无关的事物联系在一起,而这是数据难以实现的。
例如,迈克·亚当斯的研究发现,学生在考试前会编造“奶奶去世”的借口。这种现象用常识更容易解释,而用数据则显得复杂。
数据真正的价值在于正确的解读。即使数据真实,如果解读不当,也可能导致错误结论。例如,胡润百富榜中的低学历富豪比例高,但并不能简单推断学历与收入无关。还需要考虑更多维度的数据,如年龄、行业等。
本文并非否定数据的价值,而是强调要全面了解数据和信息。多了解一点,犯错的几率就会小一点。真正的科学发展需要认识到自己的不足,并不断探索。
数据虽有局限,但结合常识,可以帮助我们更好地理解现实。