哪些因素影响大数据准备策略

如果企业没有为获得最佳性能而预先准备数据,那将不会更好地为那些消耗数据的用户提供服务。实际上,不良的数据准备是导致大数据项目失败的主要原因,而管理此类项目的人负担不起,只是出于这个原因,对于企业来说,拥有大数据准备策略和方法并如实执行是至关重要的。

数据准备策略应包含以下元素:

1.对当前和将来的业务问题有透彻的了解,期望数据能为企业带来答案。

了解要应用大数据分析的业务领域可以为数据建立业务环境,并有助于制定数据收集和执行策略。此阶段的目标是确定企业中哪些数据与关键业务问题相关,哪些无关。企业还可以随着业务需求的变化扩展业务问题和要查找的数据,但是一开始最好还是密切关注数据。

2.数据集中化。

数据必须规范化以便一致,并且企业中的每个人都使用相同的数据。因此,即使可以选择针对特定业务领域填充此主数据的不同子集,也必须将所有分析数据存储在IT维护的集中式存储库中。

3.标识必须馈入中央分析信息存储库的数据源。

一旦确定了业务案例和问题,就应确定可用于汇总回答业务中紧迫问题的数据集和源。这些数据源可以来自企业内部或外部。

4.识别可能相关的未来数据源。

同时,现在开始识别将来业务可能需要的其他数据集或源还为时过早。这些数据源最初不会准备数据,但是它们的标识将为将来的数据准备提供一个路线图。

5.定义的数据准备方法。

有三个基本步骤可将干净数据移入中央数据存储库。首先,从数据源中提取数据。然后,将其转换为与其要到达的数据目标兼容的格式。最后,将其加载到目标存储库中。重要的部分是转型。如果相同的数据字段将流入新的目的地,但该目的地的格式不同于原始目的地,则必须将数据转换为新格式,以便数据正常工作并在目的地中保持一致。如果人工完成,这是一个繁琐的步骤,因此需要自动化工具。

6.选择有效的数据准备工具。市场上有许多数据准备工具,因此建议企业尝试使用它们,并与提供强大支持和培训的供应商合作。目标应该是准备数据以使其具有最高质量,并选择易于使用的工具,并提供自动执行数据准备步骤的工具。

大数据的价值当然可以通过将不同数据流中所获得的分析见解相结合的方式获取。所有的数据是如何被存储的、相关的分析见解又是如何被推导得出的、以及是从何处派生出的相关见解等因素都对最终总的回报有着重大的影响。