【大数据思索】混杂性,不是竭力避免,而是标准途径

图灵汇官网

大数据观察

在这个技术和社会迅速发展的时代,我们愈发依赖于复杂的数据体系。自古以来,人类便运用分类法和索引法来管理和检索信息资源。然而,这些传统的分类系统在数据量较小的情况下表现出色,一旦数据量激增,这些系统的局限性便显现出来。

例如,相片分享网站Flickr在2011年就已经积累了来自约一亿用户贡献的六亿张照片。在这种情况下,预先设定的分类方法变得毫无意义。于是,一种更为灵活的机制应运而生。用户上传照片时,可以为其添加多种标签,这使得搜索和整理资源变得更加便捷。

这些标签由用户自行创建和使用,因此没有任何固定的标准或类别。任何人都可以根据需要输入新的标签,这些标签实际上成为了网络资源的分类标准。这种做法在社交媒体平台如Facebook和博客中非常普遍。通过这种方式,互联网上的资源变得更加易于查找,尤其是那些难以用关键词描述的非文本资源,如图片、视频和音乐。

尽管有时候错误的标签可能会导致资源分类不准确,但这并不妨碍这种方法带来的诸多益处。通过合并多个搜索标签,我们可以更精准地筛选出所需的照片,这在传统分类系统中是无法实现的。更重要的是,我们接受不精确性的事实,这也意味着我们能够更好地应对复杂多变的世界。

如今,我们面临的是种类繁多、质量参差不齐的大数据。很少有数据能够完全符合预先设定的数据类型。此外,我们希望数据能够回答的问题,往往只有在实际收集和处理数据的过程中才能明确。因此,传统的关系数据库设计已经难以满足当前的需求。

在大数据时代,数据存储和分析的方法必须更加灵活。我们需要接受数据的多样性和复杂性,而不是一味追求精确。这种灵活性不仅体现在数据的收集过程中,也体现在数据的管理方式上。传统的数据库设计需要高度精确和准确的排列,而现代的数据处理方法则更加注重实用性和适应性。

本文来源: 图灵汇 文章作者: 信烁良金