kafka高吞吐量之消息压缩

amwayy

2020-04-25

关注关注

kafka高吞吐量之消息压缩

背景

保证kafka高吞吐量的另外一大利器就是消息压缩。就像上图中的压缩饼干。

压缩即空间换时间，通过空间的压缩带来速度的提升，即通过少量的cpu消耗来减少磁盘和网络传输的io。

消息压缩模型

消息格式V1

kafka高吞吐量之消息压缩

kafka不会直接操作单条消息，而是直接操作一个消息集合。

消息格式V2:

kafka高吞吐量之消息压缩

1, 抽取了消息的公共部分放到消息集合中；去掉每条消息的公共部分，减少了总体积。

2，消息的CRC校验由对每一条消息，移动到了对消息集合进行校验，减少了校验次数，节省了cpu;

3, 对单个消息进行压缩，放到消息的body字段 pk 对消息集合整个进行压缩更好的压缩效果；

压缩过程模型

kafka高吞吐量之消息压缩

压缩算法比较

如何衡量一个压缩算法的好坏。

kafka高吞吐量之消息压缩

常见的压缩算法对比：

Zstandard 算法（简写为 zstd）。它是 Facebook 开源的一个压缩算法，能够提供超高的压缩比

kafka高吞吐量之消息压缩

启用压缩场景

如果cpu负载比较高，不适合启用压缩；

如果带宽不足，而cpu负载不高，最适合启用压缩，节约大量的带宽；

尽量避免消息格式不一致带来的解压缩消耗。

小结

压缩的目的是较少空间占用，带来传输速度的提升，但是需要消耗一定的cpu ；

是一种提高kafka消息吞吐量的有效办法。

本节回顾了新版的kafka是如何对消息进行压缩的，压缩和解压缩的流程是怎样的，

然后对比了常见的4种压缩算法，根据具体的使用场景来选择是否启用压缩，以及选择合适的压缩算法。

然后给出了压缩的配置参数，在producer和borker端都可以使用compression.type来设置。

原创不易，点赞关注支持一下吧！转载请注明出处，让我们互通有无，共同进步，欢迎沟通交流。
我会持续分享Java软件编程知识和程序员发展职业之路，欢迎关注，我整理了这些年编程学习的各种资源，关注公众号‘李福春持续输出’，发送‘学习资料‘分享给你！

吞吐量 kafka

amwayy

0 关注 0 粉丝 0 动态

关注关注

使用Keepalive提高吞吐量

keepalive 32指的是要保持的连接数,把一部分连接保持为长连接,那么就可以减少连接创建的消耗

luciuschan 2020-05-05

性能测试方法和应用

并发用户数、响应时间、系统吞吐量，这三个名词的含义可能就已经让你感觉云里雾里了，因此我会通过一个我们日常生活中的体检为例，再来解释一下它们到底是什么，以及它们之间的关系和约束。在体检中心做检查的过程，通常是先到前台登记个人信息并领取体检单，然后根据体检单的

today0 2020-05-04

kafka 吞吐量为什么这么大？

batch 发送，batch 存储，batch 拉取。kafka-consumer-groups.bat --bootstrap-server localhost:9092 --reset-offsets --execute --group zhang-w

amwayy 2020-05-01

浅谈架构：kafka高吞吐量之消息压缩

保证kafka高吞吐量的另外一大利器就是消息压缩。就像上图中的压缩饼干。压缩即空间换时间，通过空间的压缩带来速度的提升，即通过少量的cpu消耗来减少磁盘和网络传输的io。kafka不会直接操作单条消息，而是直接操作一个消息集合。1, 抽取了消息的公共部分放

那年夏天0 2020-04-26

服务器性能测试

首先对吞吐量（）、QPS、并发数、响应时间几个概念一直比较模糊，也不知道哪些指标可以较好的衡量系统的性能。今天特意查了些资料做一些记录：首先看一些概念。　　响应时间是指系统对请求作出响应的时间。当然，往往也需要对每个或每组功能讨论其平均响应时间和最大响应时

HappinessCat 2020-03-03

ActiveMQ、RabbitMQ、RocketMQ、Kafka有什么优点和缺点

　　　　现在社区以及国内应用都越来越少，官方社区现在对ActiveMQ 5.x维护越来越少，几个月才发布一个版本。　　　　erlang语言开发，性能极其好，延时很低；　　如果是大数据领域的实时计算、日志采集等场景，用Kafka是业内标准的，绝对没问题，社区

方新德 2019-12-14

网络测试工具--Iperf、Netperf 、MZ

可用性响应时间网络利用率网络吞吐量网络带宽容量。测试网络性能的第一步是确定网络是否正常工作，最简单的方法是使用 ping 命令。通过向远端的机器发送 icmp echo request，并等待接收 icmp echo reply 来判断远端的机器是否连通，

abdstime 2019-11-05

Kafka、RabbitMQ、RocketMQ等消息中间件的介绍和对比（转）

前言在分布式系统中,我们广泛运用消息中间件进行系统间的数据交换,便于异步解耦。现在开源的消息中间件有很多,前段时间产品 RocketMQ 也顺利开源,得到大家的关注。概念MQ简介MQ,Message queue,消息队列，就是指保存消息的一个容器。MQ特

qingyuerji 2019-11-04

jMeter 测试结果分析

我们可以看到，通过这份报告我们就可以得到通常意义上性能测试所最关心的几个结果了。90% Line -- 所有transaction中90%的transaction的响应时间都小于xx

Seleton 2018-09-20

jMeter 测试结果分析

我们可以看到，通过这份报告我们就可以得到通常意义上性能测试所最关心的几个结果了。90% Line -- 所有transaction中90%的transaction的响应时间都小于xx

xiechao000 2018-09-20

搭建高吞吐量 Kafka 分布式发布订阅消息集群

搭建高吞吐量 Kafka 分布式发布订阅消息集群简介Kafka 是一种高吞吐的分布式发布订阅消息系统，能够替代传统的消息队列用于解耦合数据处理，缓存未处理消息等，同时具有更高的吞吐率，支持分区、多副本、冗余，因此被广泛用于大规模消息数据处理应用。Kafk

xianyuxiaoqiang 2019-06-21

如何为Kafka集群选择合适的Topic/Partitions数量

猫咪的一生 2018-07-24

程序员，岂能被网站吞吐量难住？

吞吐量是指对网络、设备、端口、虚电路或其他设施，单位时间内成功地传送数据的数量。与吞吐量对应的衡量网站性能的还有响应时间、并发数、QPS每秒查询率。响应时间是指执行一个请求从开始到最后收到响应数据所花费的总体时间。

Walkerhau 2019-04-17

伯克利开源Confluo：吞吐量比Kafka高4到10倍！

伯克利 RISE 实验室又有新动作，最近开源了一个多数据流实时分布式分析系统 Confluo。作为时序数据库，它的性能比其他时序数据库高出数倍，而作为发布消息订阅系统，它的吞吐量比 Kafka 高出 4 到 10 倍。Confluo 通过为多数据流的一些专

liuxiaocong 2018-12-14

系统吞吐量（TPS）、用户并发量、性能测试概念和公式

一．系统吞度量要素：一个系统的吞度量与request对CPU的消耗、外部接口、IO等等紧密关联。单个reqeust 对CPU消耗越高，外部系统接口、IO影响速度越慢，系统吞吐能力越低，反之越高。关键路径是有CPU运算、IO、外部系统响应等等组成。我们在做系

老道长的测试生活 2018-11-14

高吞吐量的分布式发布订阅消息系统Kafka

Kafka是一种高吞吐量的分布式发布订阅消息系统，它可以处理消费者规模的网站中的所有动作流数据。这种动作是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。Kafka的目的是通过Hadoop的并行加载机

hannuotayouxi 2016-06-06

Kafka 高吞吐量性能揭秘

kafka作为时下最流行的开源消息系统，被广泛地应用在数据缓冲、异步通信、汇集日志、系统解耦等方面。相比较于RocketMQ等其他常见消息系统，Kafka在保障了大部分功能特性的同时，还提供了超一流的读写性能。如果在Heap内管理缓存，JVM的GC线程会频

luenxin 2016-03-09

高吞吐量系统设计优化建议

高吞吐量系统举一个例子，我们做项目需要安排计划，每一个模块可以由多人同时并行做多项任务，也可以一个人或者多个人串行工作，但始终会有一条关键路径，这条路径就是项目的工期。关键路径由 CPU 运算、IO、外部系统响应等等组成。缓冲缓冲区是一块特定的内存区域，

istupid 2015-08-28

redis通过pipeline提升吞吐量的方法

简单介绍 redis pipeline 的机制，结合一段实例说明pipeline 在提升吞吐量方面发生的效用。应用系统在数据推送或事件处理过程中，往往出现数据流经过多个网元；一次数据推送会对 redis 产生近30次读写操作！优化过程主要针对业务代码做的

零 2019-04-02

系统吞吐量、TPS（QPS）、用户并发量、性能測试概念和公式

一个系统的吞度量与request对CPU的消耗、外部接口、IO等等紧密关联。单个reqeust对CPU消耗越高，外部系统接口、IO影响速度越慢。一个典型的上班签到系统，早上8点上班。7点半到8点这30分钟的时间里用户会登录签到系统进行签到。公司员工为100

清醒疯子 2018-05-08

安科网

kafka高吞吐量之消息压缩

amwayy

背景

消息压缩模型

压缩算法比较

小结

amwayy

相关推荐

使用Keepalive提高吞吐量

性能测试方法和应用

kafka 吞吐量为什么这么大？

浅谈架构：kafka高吞吐量之消息压缩

服务器性能测试

ActiveMQ、RabbitMQ、RocketMQ、Kafka有什么优点和缺点

网络测试工具--Iperf、Netperf 、MZ

Kafka、RabbitMQ、RocketMQ等消息中间件的介绍和对比（转）

jMeter 测试结果分析

jMeter 测试结果分析

搭建高吞吐量 Kafka 分布式发布订阅消息集群

如何为Kafka集群选择合适的Topic/Partitions数量

程序员，岂能被网站吞吐量难住？

伯克利开源Confluo：吞吐量比Kafka高4到10倍！

系统吞吐量（TPS）、用户并发量、性能测试概念和公式

高吞吐量的分布式发布订阅消息系统Kafka

Kafka 高吞吐量性能揭秘

高吞吐量系统设计优化建议

redis通过pipeline提升吞吐量的方法

系统吞吐量、TPS（QPS）、用户并发量、性能測试概念和公式

amwayy