我们对大数据技术的应用经历了一个不断发展的过程。最初,Google 在搜索引擎中引入了大数据技术,如今,大数据技术已渗透到各行各业,从最初的高端应用发展为如今的普及化应用。
Google 最初发表大数据相关论文时,或许未曾预料到这一技术会开启一个新时代。今天,大数据和人工智能的成就离不开全球数百万人的共同努力,其中包括你和我。历史虽然可能由天才开启,但最终是由普通人共同创造的。作为大数据时代的参与者,我们正在书写历史。
作为全球最大的搜索引擎公司,Google 是公认的开创大数据技术的先锋。它存储了全球几乎所有可访问的网页,数量可能超过万亿规模,全部存储起来需要数万块磁盘。为了存储这些文件,Google 开发了 GFS(Google 文件系统),将数千台服务器上的数万块磁盘统一管理起来,形成一个文件系统,统一存储所有网页文件。
你可能会觉得,简单地存储所有网页文件并不是什么了不起的事情。然而,Google 存储这些网页文件是为了构建搜索引擎,需要对所有文件中的单词进行词频统计,然后根据 PageRank 算法计算网页排名。Google 需要对这些磁盘上的文件进行计算处理,这是一项复杂的任务。基于这些需求,Google 进一步开发了 MapReduce 大数据计算框架。
在此之前,Yahoo 是最知名的搜索引擎之一。但凭借大数据技术和 PageRank 算法,Google 提升了搜索引擎的用户体验,吸引了大量用户。因此,当 Google 发表了 GFS 和 MapReduce 论文后,Yahoo 成为最早关注这些论文的公司之一。
Doug Cutting 根据 Google 论文开发了 Hadoop,随后 Yahoo 邀请他加入,专门负责 Hadoop 的开发。但不久后,Doug Cutting 因内部斗争离开了 Yahoo,加入了致力于 Hadoop 商业化的公司 Cloudera。Yahoo 则投资了 Cloudera 的竞争对手 HortonWorks。
顶尖的公司和顶尖的高手一样,做事往往有着独特的美感。你可以看到 Google 一步步走来,从搜索引擎、Gmail、地图、Android 到无人驾驶,每一步都在推动技术边界的前进。相比之下,一些公司即使曾经有过辉煌,但如果失去了做事的美感和节奏感,在快速变化的时代,很快就会被淘汰。
Google 的论文最初吸引的是 Yahoo 这样的搜索引擎公司和 Doug Cutting 这样的开源搜索引擎开发者,其他公司则只是旁观者。然而,当 Facebook 推出 Hive 时,敏锐的科技公司意识到,大数据时代真的来了。
过去,我们进行数据分析和统计时,受限于数据库的能力,只能对最重要的数据进行分析,如财务数据。Hive 的出现改变了这一切,它可以在 Hadoop 上进行 SQL 操作,使得数据存储和计算成本大幅降低。我们能够整合运行日志、应用数据和数据库数据,进行更全面的分析,企业的数据仓库也因此呈指数级增长。
不仅是高层管理者,公司中的普通员工,如产品经理、运营人员和技术人员,只要有数据访问权限,都可以提出分析需求,从大数据仓库中获取所需的数据结果。
由此可见,在数据仓库时代,只要有数据,就需要进行统计分析,特别是大规模数据,更需要借助 Hadoop 等大数据技术。这推动了大数据技术的快速发展,也为后续的数据挖掘时代奠定了基础。
随着大数据技术的普及,人们对数据的期望也在提升。除了简单的数据统计,我们还希望挖掘出更多有价值的数据,从而进入了数据挖掘时代。
举个真实案例,商家通过数据分析发现,买尿不湿的人通常也会买啤酒,于是将这两种商品放在一起销售。这种关系可能通过数据挖掘发现,而不是靠直觉。在商业环境中,重要的是发现数据间的关联,而不是解释这些关联的意义。
除了商品间的关联,还可以利用人与人之间的关系进行商品推荐。如果两个人购买的商品相似,说明他们可能有某些共同特征,如教育背景、收入水平或兴趣爱好。通过这些关系,可以进行个性化推荐。
此外,大数据还能将每个人的特性挖掘出来,打上各种标签,如年龄、居住地、收入水平、生活习惯等,形成用户画像。这些标签可以帮助我们更好地了解用户,甚至比最亲近的人更准确。
大数据还可以用于人际关系挖掘。你知道“六度分隔理论”吗?它认为两个互不认识的人,只需很少的中间人就能联系起来。Facebook 研究了十几亿用户的数据,发现平均只需要 3.57 步就能联系上两个陌生人。这表明,通过数据挖掘,几乎可以描绘出世界上所有人际关系网。
现代生活离不开互联网,各种应用不断收集数据,这些数据在后台被分析和挖掘。这些分析和挖掘带来的影响既有美好也有担忧,但可以确定的是,这一进程只会加速,你我只能投入其中。
我们发现,数据中蕴藏着规律,这些规律不仅适用于过去的数据,也适用于未来的数据。一旦找到这些规律,就可以预测未来发生的事情。
过去,由于数据采集、存储和计算能力的限制,我们只能通过抽样获取小部分数据。而现在,有了大数据,可以收集全部历史数据,统计其规律,进而预测正在发生的事情。这就是机器学习。
例如,将历史上所有的围棋棋谱数据存储起来,记录每种盘面的最佳落子位置。通过统计这些规律,机器可以每一步都计算出最佳落子位置,从而击败人类顶尖棋手。这就是著名的 AlphaGo。
另一个例子是将人类的对话数据收集起来,记录每次对话的上下文。通过机器学习,可以统计出合适的回复。将来有人提问时,机器可以根据上下文自动回复,这就是聊天机器人。像 Siri、天猫精灵、小爱同学等语音聊天机器人已经非常普遍。
通过机器学习,可以从人类活动中提取规律,模拟人类行为,使机器表现出人类特有的智能,这就是人工智能 AI。
尽管有些人担心人工智能会变得越来越强大,甚至统治人类,但实际上,这只是大数据计算出来的统计规律。机器学习出的规律再智能,也无法理解其意义,而有意义才是人类智能的源泉。按目前的发展趋势,人工智能不可能超越人类,更不可能统治人类。
大数据从搜索引擎到机器学习,发展思路是一脉相承的,即发现数据中的规律并加以利用。许多人将数据比作金矿,大数据应用则是从这座金矿中挖掘有价值的资源。如何从海量数据中提取有价值的信息,正是当前大数据技术所要解决的问题。
美国西部淘金运动带来了大拓荒时代,如今大数据也发挥着类似的作用。无数的资源正在涌入大数据领域,一个更具划时代意义的大数据淘金时代正在到来,而你我正身处其中。