Elasticsearch实战 | 必要的时候，还得空间换时间!

sifeimeng

2020-08-03

1、应用场景
实时数据流通过kafka后，根据业务需求，一部分直接借助kafka-connector入Elasticsearch不同的索引中。
另外一部分，则需要先做聚类、分类处理，将聚合出的分类结果存入ES集群的聚类索引中。如下图所示：
业务系统的分层结构可分为：接入层、数据处理层、数据存储层、接口层。
那么问题来了？
我们需要基于聚合（数据处理层）的结果实现检索和聚合分析操作，如何实现更快的检索和更高效的聚合分析效果呢？
Elasticsearch实战 | 必要的时候，还得空间换时间!

2、方案选型
方案一：
只建立一个索引，aggs_index。
数据处理层的聚合结果存入ES中的指定索引，同时将每个聚合主题相关的数据存入每个document下面的某个field下。如下示意图所示：

Elasticsearch实战 | 必要的时候，还得空间换时间!
方案一示意图

方案二:
新建两个索引：aggs_index以及aggs_detail_index。
其中：
1）aggs_index存储事件列表信息。
2）aggs_detail_index存储事件关联的文章内容信息。
如下图所示：
Elasticsearch实战 | 必要的时候，还得空间换时间!
方案二示意图
3、方案对比
方案一优点：节省存储空间，只存储关联文章id，数据没有重复存储。
方案一缺点：检索、聚合慢，性能不能达标。
方案一后续的所有操作，都需要先遍历检索这一堆IDs，然后再进行检索、聚合分析操作。

操作实例如下（实际比这要复杂）：
第一步：通过事件id，获取关联文章id列表；
第二步：基于关联文章id列表，进行检索和聚合操作。

POST aggs_index/_search
{
"_source": {
"includes":[
"title",
"abstract",
"publish_time",
"author"
]},
"query":{
"terms":{
"_id":"["789b4cb872be00a04560d95bf13ec8f42c",
"792d9610b03676dc5644c2ff4db372dec4",
"817f5cff3dd0ec3564d45615f940cb7437",
"....."]
}
}
}
步骤2当id数量很多时，会有如下的错误提示：

{
"error": {
"root_cause": [
{
"type": "too_many_clauses",
"reason": "too_many_clauses:
maxClauseCount is set to 1024"
},
。。。

方案二优点：分开存储，便于一个索引中进行检索、聚合分析操作。
空间换时间，极大的提升检索效率、聚合速度。
方案二缺点：同样的数据，多存储了一份。
其对应的检索操作如下：

POST aggs_index/_search
{
"_source": {
"includes":[
"title",
"abstract",
"publish_time",
"author"
]},
"query":{
"term":{
"topic_id":"WIAEgRbI0k9s1D2JrXPC"
}
}
}
是真的吗？
用事实说话：
以下响应时间的单位为：ms。
方案一要在N个（N接近10）索引，每个索引近千万级别的数据中检索。

Elasticsearch实战 | 必要的时候，还得空间换时间!
两方案对比

Elasticsearch实战 | 必要的时候，还得空间换时间!
两方案响应时间对比效果图
4、小结
由以上图示，对比可知，方案二采取了空间换时间的策略，数据量多存储了一份，但是性能提升了10余倍。

在实战开发中，我们要理性的选择存储方案，在磁盘成本日渐低廉的当下，把性能放在第一位，用户才能用的"爽“！

elasticsearch 索引

安科网

Elasticsearch实战 | 必要的时候，还得空间换时间!

sifeimeng

sifeimeng

相关推荐

django 对接elasticsearch实现全文检索

Elasticsearch索引增量统计及定时邮件实现

.net core 如何向elasticsearch中创建索引，插入数据。

Elasticsearch－基础介绍及索引原理分析

elasticsearch 索引操作

Elasticsearch 面试专题

es 实战 —— spring boot 中使用 Elasticsearch

Elasticsearch py客户端库安装及使用方法解析

ElasticSearch最全详细使用教程

十张图说清Elasticsearch原理！

ElasticSearch 交互使用

Spring Boot 集成 Elasticsearch 实战

如何对 ElasticSearch 集群进行压力测试

操作ElasticSearch插件和可视化工具 Kibana

Elasticsearch实战 | match_phrase搜不出来，怎么办？

Elasticsearch聚合后分页深入详解

Elasticsearch大文件检索性能提升20倍实践（干货）

重磅 | 死磕Elasticsearch方法论认知清单（国庆更新版）

如何在Linux下安装部署分布式全文搜索引擎

ElasticSearch的下载、安装使用

sifeimeng