kafka集群原理介绍

时间 2019-11-11

标签 kafka 集群原理介绍栏目 Kafka 繁體版

原文原文链接

目录html

kafka集群原理介绍

@(博客文章)[kafka|大数据]java

本系统文章共三篇，分别为node

一、kafka集群原理介绍了如下几个方面的内容：linux

（1）kafka基础理论算法

（2）参数配置apache

（3）错误处理编程

（4）kafka集群在zookeeper集群中的内容数组

二、kafka集群操做介绍了kafka集群的安装与操做缓存

（1）单机版安装性能优化

（2）集群安装

（3）集群启停操做

（4）topic相关操做

（5）某个broker挂掉，重启本机器

（6）某个broker挂掉且没法重启，使用其它机器代替

（7）扩容

（8）数据迁移

（9）机器下线

（10）增长副本数量

（11）平衡leader

三、kafka集群编程介绍了...

（一）基础理论

一、相关资料
官方资料，很是详细：
http://kafka.apache.org/documentation.html#quickstart

如下部份内容来源于此文档。

二、kafka是什么？
（1）Kafka is a distributed, partitioned, replicated commit log service. It provides the functionality of a messaging system, but with a unique design.
Kafka是一个分布式的、可分区的、可复制的消息系统。它提供了普通消息系统的功能，但具备本身独特的设计。
（2）能够简单的理解为：kafka是一个日志集群，各类各样的服务器将它们自身的日志发送到集群中进行统一汇总和存储，而后其它机器从集群中拉取消息进行分析处理，如ELT、数据挖掘等。
（3）kafka使用scala语言实现，提供了JAVA API，同时对多种语言都提供了支持。

三、几个关键术语
topic: Kafka将消息以topic为单位进行概括。
producer: 将向Kafka topic发布消息的程序称为producers.
consumer: 将预订topics并消费消息的程序称为consumer.
broker: Kafka以集群的方式运行，能够由一个或多个服务组成，每一个服务叫作一个broker.

四、分区与副本
（1）一个topic是对一组消息的概括。对每一个topic，Kafka 对它的日志进行了分区。
（2）通常而言，一个topic会有多个分区，每一个分区会有多个副本。
分区是分了将一个topic分到多个地方存储，提升并行处理的能力。副本是为了容错，保证数据不丢失。
（3）对于每个分区，都会选取一个leader，这个分区的全部读取都在这个leader中进行，而其它副本会同步leader中的数据，且只作备份。
即leader只是针对一个分区而言，而非整个集群。一个服务器对于某个分区是leader，对于其它分区多是follower。
（4） Producer将消息发布到它指定的topic中,并负责决定发布到哪一个分区。一般简单的由负载均衡机制随机选择分区，但也能够经过特定的分区函数选择分区。
（5）发布消息一般有两种模式：队列模式（queuing）和发布-订阅模式(publish-subscribe)。队列模式中，consumers能够同时从服务端读取消息，每一个消息只被其中一个consumer读到；发布-订阅模式中消息被广播到全部的consumer中。
Consumers能够加入一个consumer 组，共同竞争一个topic，topic中的消息将被分发到组中的一个成员中。同一组中的consumer能够在不一样的程序中，也能够在不一样的机器上。若是全部的consumer都在一个组中，这就成为了传统的队列模式，在各consumer中实现负载均衡。
若是全部的consumer都不在不一样的组中，这就成为了发布-订阅模式，全部的消息都被分发到全部的consumer中。
更常见的是，每一个topic都有若干数量的consumer组，每一个组都是一个逻辑上的“订阅者”，为了容错和更好的稳定性，每一个组由若干consumer组成。这其实就是一个发布-订阅模式，只不过订阅者是个组而不是单个consumer。
（6）有序性

相比传统的消息系统，Kafka能够很好的保证有序性。
传统的队列在服务器上保存有序的消息，若是多个consumers同时从这个服务器消费消息，服务器就会以消息存储的顺序向consumer分发消息。虽然服务器按顺序发布消息，可是消息是被异步的分发到各consumer上，因此当消息到达时可能已经失去了原来的顺序，这意味着并发消费将致使顺序错乱。为了不故障，这样的消息系统一般使用“专用consumer”的概念，其实就是只容许一个消费者消费消息，固然这就意味着失去了并发性。

在这方面Kafka作的更好，经过分区的概念，Kafka能够在多个consumer组并发的状况下提供较好的有序性和负载均衡。将每一个分区分只分发给一个consumer组，这样一个分区就只被这个组的一个consumer消费，就能够顺序的消费这个分区的消息。由于有多个分区，依然能够在多个consumer组之间进行负载均衡。注意consumer组的数量不能多于分区的数量，也就是有多少分区就容许多少并发消费。

Kafka只能保证一个分区以内消息的有序性，在不一样的分区之间是不能够的，这已经能够知足大部分应用的需求。若是须要topic中全部消息的有序性，那就只能让这个topic只有一个分区，固然也就只有一个consumer组消费它。

五、数据持久化（本部份内容直接翻译自官方文档）

不要畏惧文件系统!

Kafka大量依赖文件系统去存储和缓存消息。对于硬盘有个传统的观念是硬盘老是很慢，这使不少人怀疑基于文件系统的架构可否提供优异的性能。实际上硬盘的快慢彻底取决于使用它的方式。设计良好的硬盘架构能够和内存同样快。

在6块7200转的SATA RAID-5磁盘阵列的线性写速度差很少是600MB/s，可是随即写的速度倒是100k/s，差了差很少6000倍。现代的操做系统都对次作了大量的优化，使用了 read-ahead 和 write-behind的技巧，读取的时候成块的预读取数据，写的时候将各类微小琐碎的逻辑写入组织合并成一次较大的物理写入。对此的深刻讨论能够查看这里，它们发现线性的访问磁盘，不少时候比随机的内存访问快得多。

为了提升性能，现代操做系统每每使用内存做为磁盘的缓存，现代操做系统乐于把全部空闲内存用做磁盘缓存，虽然这可能在缓存回收和从新分配时牺牲一些性能。全部的磁盘读写操做都会通过这个缓存，这不太可能被绕开除非直接使用I/O。因此虽然每一个程序都在本身的线程里只缓存了一份数据，但在操做系统的缓存里还有一份，这等于存了两份数据。

另外再来讨论一下JVM,如下两个事实是众所周知的：

•Java对象占用空间是很是大的，差很少是要存储的数据的两倍甚至更高。

•随着堆中数据量的增长，垃圾回收回变的愈来愈困难。

基于以上分析，若是把数据缓存在内存里，由于须要存储两份，不得不使用两倍的内存空间，Kafka基于JVM，又不得不将空间再次加倍,再加上要避免GC带来的性能影响，在一个32G内存的机器上，不得不使用到28-30G的内存空间。而且当系统重启的时候，又必需要将数据刷到内存中（ 10GB 内存差很少要用10分钟），就算使用冷刷新（不是一次性刷进内存，而是在使用数据的时候没有就刷到内存）也会致使最初的时候新能很是慢。可是使用文件系统，即便系统重启了，也不须要刷新数据。使用文件系统也简化了维护数据一致性的逻辑。

因此与传统的将数据缓存在内存中而后刷到硬盘的设计不一样，Kafka直接将数据写到了文件系统的日志中。

常量时间的操做效率

在大多数的消息系统中，数据持久化的机制每每是为每一个cosumer提供一个B树或者其余的随机读写的数据结构。B树固然是很棒的，可是也带了一些代价：好比B树的复杂度是O(log N)，O(log N)一般被认为就是常量复杂度了，但对于硬盘操做来讲并不是如此。磁盘进行一次搜索须要10ms，每一个硬盘在同一时间只能进行一次搜索，这样并发处理就成了问题。虽然存储系统使用缓存进行了大量优化，可是对于树结构的性能的观察结果却代表，它的性能每每随着数据的增加而线性降低，数据增加一倍，速度就会下降一倍。

直观的讲，对于主要用于日志处理的消息系统，数据的持久化能够简单的经过将数据追加到文件中实现，读的时候从文件中读就行了。这样作的好处是读和写都是 O(1) 的，而且读操做不会阻塞写操做和其余操做。这样带来的性能优点是很明显的，由于性能和数据的大小没有关系了。

既然可使用几乎没有容量限制（相对于内存来讲）的硬盘空间创建消息系统，就能够在没有性能损失的状况下提供一些通常消息系统不具有的特性。好比，通常的消息系统都是在消息被消费后当即删除，Kafka却能够将消息保存一段时间（好比一星期），这给consumer提供了很好的机动性和灵活性。

六、事务性

以前讨论了consumer和producer是怎么工做的，如今来讨论一下数据传输方面。数据传输的事务定义一般有如下三种级别：

最多一次: 消息不会被重复发送，最多被传输一次，但也有可能一次不传输。

最少一次: 消息不会被漏发送，最少被传输一次，但也有可能被重复传输.

精确的一次（Exactly once）: 不会漏传输也不会重复传输,每一个消息都传输被一次并且仅仅被传输一次，这是你们所指望的。

大多数消息系统声称能够作到“精确的一次”，可是仔细阅读它们的的文档能够看到里面存在误导，好比没有说明当consumer或producer失败时怎么样，或者当有多个consumer并行时怎么样，或写入硬盘的数据丢失时又会怎么样。kafka的作法要更先进一些。当发布消息时，Kafka有一个“committed”的概念，一旦消息被提交了，只要消息被写入的分区的所在的副本broker是活动的，数据就不会丢失。关于副本的活动的概念，下节文档会讨论。如今假设broker是不会down的。

若是producer发布消息时发生了网络错误，但又不肯定实在提交以前发生的仍是提交以后发生的，这种状况虽然不常见，可是必须考虑进去，如今Kafka版本尚未解决这个问题，未来的版本正在努力尝试解决。

并非全部的状况都须要“精确的一次”这样高的级别，Kafka容许producer灵活的指定级别。好比producer能够指定必须等待消息被提交的通知，或者彻底的异步发送消息而不等待任何通知，或者仅仅等待leader声明它拿到了消息（followers没有必要）。

如今从consumer的方面考虑这个问题，全部的副本都有相同的日志文件和相同的offset，consumer维护本身消费的消息的offset，若是consumer不会崩溃固然能够在内存中保存这个值，固然谁也不能保证这点。若是consumer崩溃了，会有另一个consumer接着消费消息，它须要从一个合适的offset继续处理。这种状况下能够有如下选择：

consumer能够先读取消息，而后将offset写入日志文件中，而后再处理消息。这存在一种可能就是在存储offset后还没处理消息就crash了，新的consumer继续从这个offset处理，那么就会有些消息永远不会被处理，这就是上面说的“最多一次”。

consumer能够先读取消息，处理消息，最后记录offset，固然若是在记录offset以前就crash了，新的consumer会重复的消费一些消息，这就是上面说的“最少一次”。

“精确一次”能够经过将提交分为两个阶段来解决：保存了offset后提交一次，消息处理成功以后再提交一次。可是还有个更简单的作法：将消息的offset和消息被处理后的结果保存在一块儿。好比用Hadoop ETL处理消息时，将处理后的结果和offset同时保存在HDFS中，这样就能保证消息和offser同时被处理了

七、关于性能优化

Kafka在提升效率方面作了很大努力。Kafka的一个主要使用场景是处理网站活动日志，吞吐量是很是大的，每一个页面都会产生好屡次写操做。读方面，假设每一个消息只被消费一次，读的量的也是很大的，Kafka也尽可能使读的操做更轻量化。

咱们以前讨论了磁盘的性能问题，线性读写的状况下影响磁盘性能问题大约有两个方面：太多的琐碎的I/O操做和太多的字节拷贝。I/O问题发生在客户端和服务端之间，也发生在服务端内部的持久化的操做中。
消息集（message set）
为了不这些问题，Kafka创建了“消息集（message set）”的概念，将消息组织到一块儿，做为处理的单位。以消息集为单位处理消息，比以单个的消息为单位处理，会提高很多性能。Producer把消息集一块发送给服务端，而不是一条条的发送；服务端把消息集一次性的追加到日志文件中，这样减小了琐碎的I/O操做。consumer也能够一次性的请求一个消息集。
另一个性能优化是在字节拷贝方面。在低负载的状况下这不是问题，可是在高负载的状况下它的影响仍是很大的。为了不这个问题，Kafka使用了标准的二进制消息格式，这个格式能够在producer,broker和producer之间共享而无需作任何改动。
zero copy
Broker维护的消息日志仅仅是一些目录文件，消息集以固定队的格式写入到日志文件中，这个格式producer和consumer是共享的，这使得Kafka能够一个很重要的点进行优化：消息在网络上的传递。现代的unix操做系统提供了高性能的将数据从页面缓存发送到socket的系统函数，在linux中，这个函数是sendfile.
为了更好的理解sendfile的好处，咱们先来看下通常将数据从文件发送到socket的数据流向：

操做系统把数据从文件拷贝内核中的页缓存中
应用程序从页缓存从把数据拷贝本身的内存缓存中
应用程序将数据写入到内核中socket缓存中
操做系统把数据从socket缓存中拷贝到网卡接口缓存，从这里发送到网络上。

这显然是低效率的，有4次拷贝和2次系统调用。Sendfile经过直接将数据从页面缓存发送网卡接口缓存，避免了重复拷贝，大大的优化了性能。
在一个多consumers的场景里，数据仅仅被拷贝到页面缓存一次而不是每次消费消息的时候都重复的进行拷贝。这使得消息以近乎网络带宽的速率发送出去。这样在磁盘层面你几乎看不到任何的读操做，由于数据都是从页面缓存中直接发送到网络上去了。

八、数据压缩
不少时候，性能的瓶颈并不是CPU或者硬盘而是网络带宽，对于须要在数据中心之间传送大量数据的应用更是如此。固然用户能够在没有Kafka支持的状况下各自压缩本身的消息，可是这将致使较低的压缩率，由于相比于将消息单独压缩，将大量文件压缩在一块儿才能起到最好的压缩效果。
Kafka采用了端到端的压缩：由于有“消息集”的概念，客户端的消息能够一块儿被压缩后送到服务端，并以压缩后的格式写入日志文件，以压缩的格式发送到consumer，消息从producer发出到consumer拿到都被是压缩的，只有在consumer使用的时候才被解压缩，因此叫作“端到端的压缩”。
Kafka支持GZIP和Snappy压缩协议。

九、producer和consumer

Kafka Producer

消息发送

producer直接将数据发送到broker的leader(主节点)，不须要在多个节点进行分发。为了帮助producer作到这点，全部的Kafka节点均可以及时的告知:哪些节点是活动的，目标topic目标分区的leader在哪。这样producer就能够直接将消息发送到目的地了。

客户端控制消息将被分发到哪一个分区。能够经过负载均衡随机的选择，或者使用分区函数。Kafka容许用户实现分区函数，指定分区的key，将消息hash到不一样的分区上(固然有须要的话，也能够覆盖这个分区函数本身实现逻辑).好比若是你指定的key是user id，那么同一个用户发送的消息都被发送到同一个分区上。通过分区以后，consumer就能够有目的的消费某个分区的消息。

异步发送

批量发送能够颇有效的提升发送效率。Kafka producer的异步发送模式容许进行批量发送，先将消息缓存在内存中，而后一次请求批量发送出去。这个策略能够配置的，好比能够指定缓存的消息达到某个量的时候就发出去，或者缓存了固定的时间后就发送出去（好比100条消息就发送，或者每5秒发送一次）。这种策略将大大减小服务端的I/O次数。

既然缓存是在producer端进行的，那么当producer崩溃时，这些消息就会丢失。Kafka0.8.1的异步发送模式还不支持回调，就不能在发送出错时进行处理。Kafka 0.9可能会增长这样的回调函数。见Proposed Producer API.

Kafka Consumer

Kafa consumer消费消息时，向broker发出"fetch"请求去消费特定分区的消息。consumer指定消息在日志中的偏移量（offset），就能够消费从这个位置开始的消息。customer拥有了offset的控制权，能够向后回滚去从新消费以前的消息，这是颇有意义的。

十、推仍是拉？

Kafka最初考虑的问题是，customer应该从brokes拉取消息仍是brokers将消息推送到consumer，也就是pull还push。在这方面，Kafka遵循了一种大部分消息系统共同的传统的设计：producer将消息推送到broker，consumer从broker拉取消息。
一些消息系统好比Scribe和Apache Flume采用了push模式，将消息推送到下游的consumer。这样作有好处也有坏处：由broker决定消息推送的速率，对于不一样消费速率的consumer就不太好处理了。消息系统都致力于让consumer以最大的速率最快速的消费消息，但不幸的是，push模式下，当broker推送的速率远大于consumer消费的速率时，consumer恐怕就要崩溃了。最终Kafka仍是选取了传统的pull模式。
Pull模式的另一个好处是consumer能够自主决定是否批量的从broker拉取数据。Push模式必须在不知道下游consumer消费能力和消费策略的状况下决定是当即推送每条消息仍是缓存以后批量推送。若是为了不consumer崩溃而采用较低的推送速率，将可能致使一次只推送较少的消息而形成浪费。Pull模式下，consumer就能够根据本身的消费能力去决定这些策略。
Pull有个缺点是，若是broker没有可供消费的消息，将致使consumer不断在循环中轮询，直到新消息到t达。为了不这点，Kafka有个参数可让consumer阻塞知道新消息到达(固然也能够阻塞知道消息的数量达到某个特定的量这样就能够批量发送)。

十一、消费状态跟踪

对消费消息状态的记录也是很重要的。
大部分消息系统在broker端的维护消息被消费的记录：一个消息被分发到consumer后broker就立刻进行标记或者等待customer的通知后进行标记。这样也能够在消息在消费后立马就删除以减小空间占用。
可是这样会不会有什么问题呢？若是一条消息发送出去以后就当即被标记为消费过的，一旦consumer处理消息时失败了（好比程序崩溃）消息就丢失了。为了解决这个问题，不少消息系统提供了另一个个功能：当消息被发送出去以后仅仅被标记为已发送状态，当接到consumer已经消费成功的通知后才标记为已被消费的状态。这虽然解决了消息丢失的问题，但产生了新问题，首先若是consumer处理消息成功了可是向broker发送响应时失败了，这条消息将被消费两次。第二个问题时，broker必须维护每条消息的状态，而且每次都要先锁住消息而后更改状态而后释放锁。这样麻烦又来了，且不说要维护大量的状态数据，好比若是消息发送出去但没有收到消费成功的通知，这条消息将一直处于被锁定的状态，
Kafka采用了不一样的策略。Topic被分红了若干分区，每一个分区在同一时间只被一个consumer消费。这意味着每一个分区被消费的消息在日志中的位置仅仅是一个简单的整数：offset。这样就很容易标记每一个分区消费状态就很容易了，仅仅须要一个整数而已。这样消费状态的跟踪就很简单了。
这带来了另一个好处：consumer能够把offset调成一个较老的值，去从新消费老的消息。这对传统的消息系统来讲看起来有些难以想象，但确实是很是有用的，谁规定了一条消息只能被消费一次呢？consumer发现解析数据的程序有bug，在修改bug后再来解析一次消息，看起来是很合理的额呀！

十二、离线处理消息

高级的数据持久化容许consumer每一个隔一段时间批量的将数据加载到线下系统中好比Hadoop或者数据仓库。这种状况下，Hadoop能够将加载任务分拆，拆成每一个broker或每一个topic或每一个分区一个加载任务。Hadoop具备任务管理功能，当一个任务失败了就能够重启而不用担忧数据被从新加载，只要从上次加载的位置继续加载消息就能够了。

1三、副本与主从关系（本部分直接翻译自官方文档）

Kafka容许topic的分区拥有若干副本，这个数量是能够配置的，你能够为每一个topci配置副本的数量。Kafka会自动在每一个个副本上备份数据，因此当一个节点down掉时数据依然是可用的。

Kafka的副本功能不是必须的，你能够配置只有一个副本，这样其实就至关于只有一份数据。

建立副本的单位是topic的分区，每一个分区都有一个leader和零或多个followers.全部的读写操做都由leader处理，通常分区的数量都比broker的数量多的多，各分区的leader均匀的分布在brokers中。全部的followers都复制leader的日志，日志中的消息和顺序都和leader中的一致。flowers向普通的consumer那样从leader那里拉取消息并保存在本身的日志文件中。
许多分布式的消息系统自动的处理失败的请求，它们对一个节点是否
着（alive）”有着清晰的定义。Kafka判断一个节点是否活着有两个条件：

节点必须能够维护和ZooKeeper的链接，Zookeeper经过心跳机制检查每一个节点的链接。
若是节点是个follower,他必须能及时的同步leader的写操做，延时不能过久。
符合以上条件的节点准确的说应该是“同步中的（in sync）”，而不是模糊的说是“活着的”或是“失败的”。Leader会追踪全部“同步中”的节点，一旦一个down掉了，或是卡住了，或是延时过久，leader就会把它移除。至于延时多久算是“过久”，是由参数replica.lag.max.messages决定的，怎样算是卡住了，怎是由参数replica.lag.time.max.ms决定的。
只有当消息被全部的副本加入到日志中时，才算是“committed”，只有committed的消息才会发送给consumer，这样就不用担忧一旦leader down掉了消息会丢失。Producer也能够选择是否等待消息被提交的通知，这个是由参数request.required.acks决定的。

Kafka保证只要有一个“同步中”的节点，“committed”的消息就不会丢失。

1四、Leader的选择

Kafka的核心是日志文件，日志文件在集群中的同步是分布式数据系统最基础的要素。

若是leaders永远不会down的话咱们就不须要followers了！一旦leader down掉了，须要在followers中选择一个新的leader.可是followers自己有可能延时过久或者crash，因此必须选择高质量的follower做为leader.必须保证，一旦一个消息被提交了，可是leader down掉了，新选出的leader必须能够提供这条消息。大部分的分布式系统采用了多数投票法则选择新的leader,对于多数投票法则，就是根据全部副本节点的情况动态的选择最适合的做为leader.Kafka并非使用这种方法。

Kafaka动态维护了一个同步状态的副本的集合（a set of in-sync replicas），简称ISR，在这个集合中的节点都是和leader保持高度一致的，任何一条消息必须被这个集合中的每一个节点读取并追加到日志中了，才回通知外部这个消息已经被提交了。所以这个集合中的任何一个节点随时均可以被选为leader.ISR在ZooKeeper中维护。ISR中有f+1个节点，就能够容许在f个节点down掉的状况下不会丢失消息并正常提供服。ISR的成员是动态的，若是一个节点被淘汰了，当它从新达到“同步中”的状态时，他能够从新加入ISR.这种leader的选择方式是很是快速的，适合kafka的应用场景。

一个邪恶的想法：若是全部节点都down掉了怎么办？Kafka对于数据不会丢失的保证，是基于至少一个节点是存活的，一旦全部节点都down了，这个就不能保证了。
实际应用中，当全部的副本都down掉时，必须及时做出反应。能够有如下两种选择:

等待ISR中的任何一个节点恢复并担任leader。
选择全部节点中（不仅是ISR）第一个恢复的节点做为leader.
这是一个在可用性和连续性之间的权衡。若是等待ISR中的节点恢复，一旦ISR中的节点起不起来或者数据都是了，那集群就永远恢复不了了。若是等待ISR意外的节点恢复，这个节点的数据就会被做为线上数据，有可能和真实的数据有所出入，由于有些数据它可能还没同步到。Kafka目前选择了第二种策略，在将来的版本中将使这个策略的选择可配置，能够根据场景灵活的选择。

这种窘境不仅Kafka会遇到，几乎全部的分布式数据系统都会遇到。

1五、副本管理

以上仅仅以一个topic一个分区为例子进行了讨论，但实际上一个Kafka将会管理成千上万的topic分区.Kafka尽可能的使全部分区均匀的分布到集群全部的节点上而不是集中在某些节点上，另外主从关系也尽可能均衡这样每一个几点都会担任必定比例的分区的leader.

优化leader的选择过程也是很重要的，它决定了系统发生故障时的空窗期有多久。Kafka选择一个节点做为“controller”,当发现有节点down掉的时候它负责在游泳分区的全部节点中选择新的leader,这使得Kafka能够批量的高效的管理全部分区节点的主从关系。若是controller down掉了，活着的节点中的一个会备切换为新的controller.

1六、消息格式

（1）消息格式

消息由一个固定长度的头部和可变长度的字节数组组成。头部包含了一个版本号和CRC32校验码。

/**

* 具备N个字节的消息的格式以下

*

* 若是版本号是0

*

* 1. 1个字节的 "magic" 标记

*

* 2. 4个字节的CRC32校验码

*

* 3. N - 5个字节的具体信息

*

* 若是版本号是1

*

* 1. 1个字节的 "magic" 标记

*

* 2.1个字节的参数容许标注一些附加的信息好比是否压缩了，解码类型等

*

* 3.4个字节的CRC32校验码

*

* 4. N - 6 个字节的具体信息

*

*/

（2）日志

一个叫作“my_topic”且有两个分区的的topic,它的日志有两个文件夹组成，my_topic_0和my_topic_1,每一个文件夹里放着具体的数据文件，每一个数据文件都是一系列的日志实体，每一个日志实体有一个4个字节的整数N标注消息的长度，后边跟着N个字节的消息。每一个消息均可以由一个64位的整数offset标注，offset标注了这条消息在发送到这个分区的消息流中的起始位置。每一个日志文件的名称都是这个文件第一条日志的offset.因此第一个日志文件的名字就是00000000000.kafka.因此每相邻的两个文件名字的差就是一个数字S,S差很少就是配置文件中指定的日志文件的最大容量。

消息的格式都由一个统一的接口维护，因此消息能够在producer,broker和consumer之间无缝的传递。存储在硬盘上的消息格式以下所示：

消息长度: 4 bytes (value: 1+4+n)

版本号: 1 byte

CRC校验码: 4 bytes

具体的消息: n bytes

（3）写操做

消息被不断的追加到最后一个日志的末尾，当日志的大小达到一个指定的值时就会产生一个新的文件。对于写操做有两个参数，一个规定了消息的数量达到这个值时必须将数据刷新到硬盘上，另一个规定了刷新到硬盘的时间间隔，这对数据的持久性是个保证，在系统崩溃的时候只会丢失必定数量的消息或者一个时间段的消息。

（4）读操做

读操做须要两个参数：一个64位的offset和一个S字节的最大读取量。S一般比单个消息的大小要大，但在一些个别消息比较大的状况下，S会小于单个消息的大小。这种状况下读操做会不断重试，每次重试都会将读取量加倍，直到读取到一个完整的消息。能够配置单个消息的最大值，这样服务器就会拒绝大小超过这个值的消息。也能够给客户端指定一个尝试读取的最大上限，避免为了读到一个完整的消息而无限次的重试。

在实际执行读取操纵时，首先须要定位数据所在的日志文件，而后根据offset计算出在这个日志中的offset(前面的的offset是整个分区的offset),而后在这个offset的位置进行读取。定位操做是由二分查找法完成的，Kafka在内存中为每一个文件维护了offset的范围。

下面是发送给consumer的结果的格式：

MessageSetSend (fetch result)

total length     : 4 bytes

error code       : 2 bytes

message 1        : x bytes

...

message n        : x bytes

MultiMessageSetSend (multiFetch result)



total length       : 4 bytes

error code         : 2 bytes

messageSetSend 1

...

messageSetSend n

（5）删除

日志管理器容许定制删除策略。目前的策略是删除修改时间在N天以前的日志（按时间删除），也可使用另一个策略：保留最后的N GB数据的策略(按大小删除)。为了不在删除时阻塞读操做，采用了copy-on-write形式的实现，删除操做进行时，读取操做的二分查找功能实际是在一个静态的快照副本上进行的，这相似于Java的CopyOnWriteArrayList。

（6）可靠性保证

日志文件有一个可配置的参数M，缓存超过这个数量的消息将被强行刷新到硬盘。一个日志矫正线程将循环检查最新的日志文件中的消息确认每一个消息都是合法的。合法的标准为：全部文件的大小的和最大的offset小于日志文件的大小，而且消息的CRC32校验码与存储在消息实体中的校验码一致。若是在某个offset发现不合法的消息，从这个offset到下一个合法的offset之间的内容将被移除。

有两种状况必须考虑：1，当发生崩溃时有些数据块未能写入。2，写入了一些空白数据块。第二种状况的缘由是，对于每一个文件，操做系统都有一个inode（inode是指在许多“类Unix文件系统”中的一种数据结构。每一个inode保存了文件系统中的一个文件系统对象,包括文件、目录、大小、设备文件、socket、管道, 等等），但没法保证更新inode和写入数据的顺序，当inode保存的大小信息被更新了，但写入数据时发生了崩溃，就产生了空白数据块。CRC校验码能够检查这些块并移除，固然由于崩溃而未写入的数据块也就丢失了

2、配置文件

（一）java调优

特别说明一下JVM配置在bin/kafka-server-start.sh中添加如下内容：

export KAFKA_HEAP_OPTS="-Xmx4G -Xms4G"

官方的推荐使用G1GC，但感受还不稳定，仍是先用CMS算了。如下为官方推荐内容

-Xms4g -Xmx4g -XX:PermSize=48m -XX:MaxPermSize=48m -XX:+UseG1GC -XX:MaxGCPauseMillis=20 -XX:InitiatingHeapOccupancyPercent=35

For reference, here are the stats on one of LinkedIn's busiest clusters (at peak): - 15 brokers - 15.5k partitions (replication factor 2) - 400k messages/sec in - 70 MB/sec inbound, 400 MB/sec+ outbound The tuning looks fairly aggressive, but all of the brokers in that cluster have a 90% GC pause time of about 21ms, and they're doing less than 1 young GC per second.

（二）参数说明

kafka中有不少的配置参数，大体能够分为如下4类：

Broker Configs
 Consumer Configs
 Producer Configs
 New Producer Configs

如下仅对部分重要参数说明并不断完善，所有的参数说明请参考http://kafka.apache.org/documentation.html#consumerconfigs

broker中的配置只有3个参数是必须提供的：broker.id，log,dir, zookeeper.connect.

一、broker.id=0 用于区分broker，确保每台机器不一样,要求是正数。当该服务器的IP地址发生改变时，broker.id没有变化，则不会影响consumers的消息状况

二、log.dirs=/home/data/kafka kafka用于放置消息的目录，默认为/tmp/kafka-logs。它能够是以逗号分隔的多个目录，建立新分区时，默认会选择存在最少分区的目录。

三、zookeeper.connect=192.168.169.91:2181,192.168.169.92:2181,192.168.169.93:2181/kafka zk用于放置kafka信息的地方。注意通常状况下，直接使用192.168.169.91:2181,192.168.169.92:2181,192.168.169.93:2181便可，此时kafka的相关信息会放在zk的根目录下，但若是这个zk集群同时为多个kafka集群，或者其它集群服务，则信息会很混乱，甚至有冲突。所以通常会建一个目录用于放置kafka集群信息的目录，此处的目录为/kafka。注意，这个目录必须手工建立，kafka不会自动建立这个目录。此外，在conusmer中也必须使用192.168.169.91:2181,192.168.169.92:2181,192.168.169.93:2181/kafka来读取topic内容。

四、num.partitions=1 建立topic时，默认的分区数

五、num.network.threads=10 broker用于处理网络请求的线程数，如不配置默认为3

六、zookeeper.connection.timeout.ms=6000

七、message.max.bytes=1000000000

replica.fetch.max.bytes=1073741824

一条消息的最大字节数，说明以下：

kafka中出现如下异常：

[2015-06-09 17:03:05,094] ERROR [KafkaApi-0] Error processing ProducerRequest with correlation id 616 from client kafka-client on partition [test3,0] (kafka.server.KafkaApis)
kafka.common.MessageSizeTooLargeException: Message size is 2211366 bytes which exceeds the maximum configured message size of 1000012.

缘由是集群默认每次只能接受约1M的消息，若是客户端一次发送的消息大于这个数值则会致使异常。
在server.properties中添加如下参数

message.max.bytes=1000000000
replica.fetch.max.bytes=1073741824

同时在consumer.properties中添加如下参数：

fetch.message.max.bytes=1073741824

而后重启kafka进程便可，如今每次最大可接收100M的消息。

八、delete.topic.enable=true 默认为false，即delete topic时只是marked for deletion，但并不会真正删除topic。

九、关于日志的保存时间或量：
（1）log.retention.hours=24 消息被删除前保存多少小时，默认1周168小时
（2）log.retention.bytes 默认为-1，即不限制大小。注意此外的大小是指一个topic的一个分区的最大字节数。
当超出上述2个限制的任何一个时，日志均会被删除。

也能够在topic级别定义这个参数：

retention.bytes＝3298534883328   #3T
retention.bytes与retention.ms

十、同步发送仍是异步发送，异步吞吐量较大，但可能引入错误，默认为sync
producer.type＝sync|async
This parameter specifies whether the messages are sent asynchronously in a background thread. Valid values are (1) async for asynchronous send and (2) sync for synchronous send. By setting the producer to async we allow batching together of requests (which is great for throughput) but open the possibility of a failure of the client machine dropping unsent data.

十一、batch.size 默认值为16384
在async模式下，producer缓存多少个消息后再一块儿发送

十二、compression.type 默认值为none，可选gzip snappy
The compression type for all data generated by the producer. The default is none (i.e. no compression). Valid values are none, gzip, or snappy. Compression is of full batches of data, so the efficacy of batching will also impact the compression ratio (more batching means better compression).

1三、default.replication.factor 消息副本的数量，默认为1，即没有副本

还有一些须要关注的配置项：
Replication configurations
用于follower从leader复制消息的线程数，默认为1
num.replica.fetchers=4
follower每次从leader复制消息的字节数，默认为1M，即1024*1024
replica.fetch.max.bytes=1048576
当follow向leader发送数据请求后，最大的等待时长，默认为500ms replica.fetch.wait.max.ms=500
每隔多久，follower会将其复制的highwater写到磁盘中，以便出错时恢复。 replica.high.watermark.checkpoint.interval.ms=5000
follower与leader之间的time out时长，默认为30秒 replica.socket.timeout.ms=30000
socket每次的buffer字节数 replica.socket.receive.buffer.bytes=65536
若是一个follower在这段时长内都没有向leader发出复制请求，则leader会认为其已经down掉，并从ISR中去掉。
replica.lag.time.max.ms=10000
若是一个follower比leader落后超过这个数据的消息数，则leader会将其从isr中去掉。 replica.lag.max.messages=4000 partition management controller 与replica之间的超时时长 controller.socket.timeout.ms=30000
The buffer size for controller-to-broker-channels
controller.message.queue.size=10
Log configuration
若是在建立topic时没有指定分区大小，默认的分区大小以下 num.partitions=8
kafka集群能够接收的最大消息字节数，默认为1M.注意，若是增大了这个数值，在consumer中也必须增大这个数值，不然consumer将没法消费这个消息。
message.max.bytes=1000000
当向一个不存在的topic发送消息时，是否容许自动建立topic auto.create.topics.enable=true
kafka保存多久的数据，单位是小时
log.retention.hours=72
The number of messages written to a log partition before we force an fsync on the log. Setting this lower will sync data to disk more
often but will have a major impact on performance. We generally recommend that people make use of replication for durability rather
than depending on single-server fsync, however this setting can be used to be extra certain.下面2个值默认都是Long.MaxValue。
log.flush.interval.ms=10000 log.flush.interval.messages=20000 log.flush.scheduler.interval.ms=2000 log.roll.hours=168 log.retention.check.interval.ms=300000 log.segment.bytes=1073741824 # ZK configuration zookeeper.connection.timeout.ms=6000 zookeeper.sync.time.ms=2000 # Socket server configuration
执行请求的线程数，至少与你的磁盘数量相同。 num.io.threads=8
服务器用于处理网络请求的线程数，通常不须要更改，默认为3. num.network.threads=8
服务器容许最大的请求大小。它能够预防out of memory，并且应该小于java 堆大小。 socket.request.max.bytes=104857600 socket.receive.buffer.bytes=1048576 socket.send.buffer.bytes=1048576 queued.max.requests=16 fetch.purgatory.purge.interval.requests=100 producer.purgatory.purge.interval.requests=100

3、错误处理

一、配置kafka时，若是使用zookeeper create /kafka建立了节点，kafka与storm集成时new ZkHosts(zks) 须要改为 new ZkHosts(zks,”/kafka/brokers”),否则会报

java.lang.RuntimeException: java.lang.RuntimeException: org.apache.zookeeper.KeeperException$NoNodeException: KeeperErrorCode = NoNode for /brokers/topics/my-replicated-topic5/partitions。

storm-kafka插件默认kafka的 zk_path以下：

public class ZkHosts implements BrokerHosts {
private static final String DEFAULT_ZK_PATH = “/brokers”;

二、若是出现如下问题，表明偏移量出错，建议从新开一个topic

ERROR [KafkaApi-3] Error when processing fetch request for partition [xxxxx,1] offset 112394 from consumer with correlation id 0 (kafka.server.KafkaApis)
kafka.common.OffsetOutOfRangeException: Request for offset 112394 but we only have log segments in the range 0 to 665.

三、当没有某个topic，或者是某个topic的node放置不在默认位置时，会有如下异常：

java.lang.RuntimeException: java.lang.RuntimeException: org.apache.zookeeper.KeeperException$NoNodeException: KeeperErrorCode = NoNode for /kafka/brokers/topics/mytest/partitions at storm.kafka.Dynam

四、kafka中出现如下异常：
[2015-06-09 17:03:05,094] ERROR [KafkaApi-0] Error processing ProducerRequest with correlation id 616 from client kafka-client on partition [test3,0] (kafka.server.KafkaApis)
kafka.common.MessageSizeTooLargeException: Message size is 2211366 bytes which exceeds the maximum configured message size of 1000012.
缘由是集群默认每次只能接受约1M的消息，若是客户端一次发送的消息大于这个数值则会致使异常。
在server.properties中添加如下参数

message.max.bytes=1000000000
replica.fetch.max.bytes=1073741824

同时在consumer.properties中添加如下参数：

fetch.message.max.bytes=1073741824
``
而后重启kafka进程便可，如今每次最大可接收100M的消息。
 
五、open too many files
kafka出现异常，日志提示open too many file
查找文件打开数量
lsof -p 30353 | wc
若是在1000以上，通常都是不正常，走过65535就会出错。
缘由打开了太多producer，没关闭，调用producer.close()便可。
 

#4、zookeeper中的内容
默认状况，kafka在zk的/brokers目录下记录topic相关的信息，但若是在建立topic时，指定了路径，则放置到固定的路径中，如：

bin/kafka-topics.sh --create --zookeeper 192.168.169.91:2181,192.168.169.92:2181,192.168.169.93:2181/kafka --replication-factor 3 --partitions 5 --topic test_topic

建立的topic，其相关信息会放置到/kafka/brokers中，这个目录中主要包括2个子目录：ids 和 topics
一、ids：记录这个kafka集群中有多少个broker
如：
 
ls /kafka/brokers/ids/
3   2   5   4
 
这个集群有4个节点，节点id分别为2，3，4，5。 咱们看一下内容

[zk: localhost:2181(CONNECTED) 27] get /kafka/brokers/ids/2
{"jmx_port":-1,"timestamp":"1435833841290","host":"kafka02-log.i.nease.net","version":1,"port":9092}
cZxid = 0x1000e8a68
ctime = Thu Jul 02 18:44:01 HKT 2015
mZxid = 0x1000e8a68
mtime = Thu Jul 02 18:44:01 HKT 2015
pZxid = 0x1000e8a68
cversion = 0
dataVersion = 0
aclVersion = 0
ephemeralOwner = 0x44e440d0bdf06eb
dataLength = 104
numChildren = 0

记录着这个节点的一些基本状况。

 
二、topics
先看一下有哪些内容：

[zk: localhost:2181(CONNECTED) 29] ls /kafka/brokers/topics/test30/partitions
[3, 2, 1, 0, 4]
[zk: localhost:2181(CONNECTED) 30] ls /kafka/brokers/topics/test30/partitions/0
[state]
[zk: localhost:2181(CONNECTED) 1] get /kafka/brokers/topics/test30/partitions/0/state
{"controller_epoch":4,"leader":5,"version":1,"leader_epoch":2,"isr":[5]}
cZxid = 0x100017c5e
ctime = Wed Jul 01 14:54:24 HKT 2015
mZxid = 0x1000e8a84
mtime = Thu Jul 02 18:44:01 HKT 2015
pZxid = 0x100017c5e
cversion = 0
dataVersion = 2
aclVersion = 0
ephemeralOwner = 0x0
dataLength = 72
numChildren = 0

能够看某个分区的leader是哪一个，从而读取kafka消息时，能够从这个leader中读取数据。


如下内容来自官方文档：

下面给出了zk中用于保存consumber与brokers相关信息的目录结构与算法介绍。

关于目录结构的前提说明：默认状况下，kafka相关的信息放在zk根目录下的某个路径中，但也能够设置为单独的路径，设置方法见配置选项部分。在咱们的集群中，咱们创建了一个目录/kafka做为全部kafka相关信息的保存位置。所以咱们在这里所列的/kafka/xyz，对于默认状况应该是/xyz。

broker节点的注册

[zk: localhost:2181(CONNECTED) 140] get /kafka/brokers/ids/2
{"jmx_port":-1,"timestamp":"1437460315901","host":"gdc-kafka02-log.i.nease.net","version":1,"port":9092}

在zk中，有一个broker节点的列表，列表中的每一项表示一个逻辑broker。在启动时，broker节点会在zk中的/kafka/broker/ids/目录下建立一个znode，名称为配置文件中定义的broker id，如上面所示的/kafka/brokers/ids/2。创建逻辑broker id的目的是容许一个broker节点迁移到另外一台机器上，而不会影响到consumer的消费。若是想注册一个已经存在的broker id会引发错误（好比说有2个broker的配置文件都写了同一个broker id）。

因为broker在zk中注册的是一个ephemeral znodes，所以当这个broker关机或者挂掉的时候，这个注册信息会自动删除，从而会通知consumer这个节点已经不可用。

Topic注册

ls /kafka/brokers/topics/testtopic/partitions/

3 2 1 0 4

get /kafka/brokers/topics/testtopic/partitions/0/state

{"controller_epoch":9,"leader":5,"version":1,"leader_epoch":26,"isr":[5]}

每一个topic都会在zk中注册，如上面的testtopic有5个分区。

consumer与consumer组
为了彼此协调以及平衡数据的消费，consumer也会在zk中注册信息。经过设置offsets.storage=zookeeper，能够将consumer的offset保存在zk中，不过这种作法会被逐步淘汰。如今推荐使用kafka做为offset的保存。

一个组内的consumer能够共同消费一个topic，它们拥有同一个group_id。组内的consumer会尽量公平的将topic的分区切分。

consumer id注册
每个consumer都会在zk注册信息，如：

get /kafka/consumers/console-consumer-30094/ids/console-consumer-30094_gdc-kafka03-log.i.nease.net-1437029151314-d7cdc855
{"version":1,"subscription":{"streaming_ma30_sdc":1},"pattern":"white_list","timestamp":"1437459282749"}

consumer offset
conusumer会根据它已经消费的最大的offset，默念会存储在zk的目录下（也能够设置为kafka）。

get /kafka/consumers/testtopic/offsets/testtopic/0
1413950858

注意这是一个永久节点，所以当consumer挂掉重启时能够继续读取。

分区owner注册
每个broker分区会官能一个consumer组里的一个consumer消费，这个consumer必须创建它对这个分区的占有（ownership），再开始消费。为了创建这个占有关系，consumer会在zk中创建相关的信息。

/kafka/consumers/[group_id]/owners/[topic]/[broker_id-partition_id] --> consumer_node_id (ephemeral node)

```

1. RabbitMQ集群原理介绍
2. Kafka集群原理
3. Kafka原理介绍
4. 高可用Kubernetes集群原理介绍
5. redis-cluster 集群原理介绍
6. Memcached集群实现及原理介绍
7. kafka设计原理介绍
8. kafka工做原理介绍
9. kafka工作原理介绍
10. kafka原理详细介绍
更多相关文章...
• Swarm 集群管理 - Docker教程
• 网站主机介绍 - 网站主机教程
• ☆技术问答集锦（13）Java Instrument原理
• Java Agent入门实战（一）-Instrumentation介绍与使用