你是如何被“大数据”洗脑的?

图灵汇官网

在我们讨论一个实际案例之前,让我们先来看一个有趣的现象:

一家公司希望通过收集用户数据来了解其产品的用户画像。他们在产品包装上添加了自家小程序的二维码,通过一些激励措施(例如扫码验证真伪、学习食用方法等)促使用户扫码。通过这种方式,公司可以收集用户的扫码信息,如年龄分布,从而更好地了解用户群体。

图片

现在的问题是:[b][color=#C30808]哪个人群才是该产品的典型用户?[/color][/b]

对于这个问题,我曾经听到过三种答案。

第一种认为是30-39岁的用户。理由很简单,因为这一年龄段的用户数量最多。

第二种认为是25-29岁的用户。尽管这个年龄段的数量不如30-39岁,但考虑到其年龄跨度较短,这一群体的集中度较高。

第三种则认为是18-29岁的用户。理由与第二种类似,不再赘述。

那么,究竟哪种答案更为准确?

大多数人的答案可能是第二种或第三种。最开始我也倾向于这样的结论,认为该产品的典型用户是“年轻人”。

然而,实际情况却让我感到惊讶。根据我的经验,该产品的典型用户应该是年纪稍大的中年人。该产品主打“排毒”、“减肥”、“降三高”、“治便秘”、“抗酸”等功能,这些功能更符合中年人的需求。

然而,数据结果与常识产生了冲突。这时,我们应该相信数据还是常识?

这个问题引发了我对数据和常识的理解。数据固然重要,但有时它并不能完全反映实际情况。这让我想起二战中的一个故事,关于幸存者偏差的概念。

在二战期间,盟军的战斗机在战斗中损失惨重,盟军总部调查了所有返航飞机的中弹位置,发现机翼部分中弹较多,而机身和机尾较少。因此,有人建议加强机翼防护。但统计学家沃德提出了不同的观点,认为应该加强机身和机尾。因为那些未能返航的飞机往往在机身和机尾中弹,而这些飞机的数据并未被记录。

这个故事说明了幸存者偏差的概念。数据只能展示幸存者的特征,而无法展示未幸存者的情况。因此,仅凭扫码用户的数据来判断产品的用户特征是有局限性的。有许多因素可能影响结果,例如不同年龄段的用户扫码习惯不同,甚至扫码的用户未必是产品的实际用户。

回到最初的问题,准确的答案是:[b][color=#C30808]无法仅通过扫码数据得出结论。[/color][/b]

在现实生活中,数据就像洞穴中的投影,试图用低维信息描述高维世界。但常识可以从多个角度分析事物。例如,人们可以通过观察“一根筷子折得断,十根筷子折不断”的现象,悟出“团结就是力量”的道理,而计算机则很难做到这一点。

此外,数据的解读至关重要。数据本身并不撒谎,但不正确的解读可能导致错误的结论。例如,一项研究发现,在考试临近时,学生请假的理由是“奶奶去世”,但这实际上可能是学生为了逃避考试而编造的借口。

总结来说,数据确实有其价值,但不能单独依赖数据来得出结论。多方面了解数据和信息,才能更接近真相。认识到自己的不足,并在实践中不断前进,才是科学发展的正确态度。

本文来源: 图灵汇 文章作者: 田燕妮