首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏王金龙的专栏

    Kafka系列1:Kafka概况

    Kafka系列1:Kafka概况 Kafka是当前分布式系统中最流行的消息中间件之一,凭借着其高吞吐量的设计,在日志收集系统和消息系统的应用场景中深得开发者喜爱。本篇就聊聊Kafka相关的一些知识点。 主要包括以下内容: Kafka简介 Kafka特点 Kafka基本概念 Kafka架构 Kafka的几个核心概念 分区Partition 复制Replication 消息发送 消费者组 消费偏移量 主要包括以下内容: Kafka简介 Kafka特点 Kafka基本概念 Kafka架构 Kafka的几个核心概念 分区Partition 复制Replication 消息发送 消费者组 消费偏移量 Kafka架构 Kafka一般以集群方式来部署,一个典型的Kafka集群架构如下图所示: ? Kafka的工程应用 Kafka主要用于三种场景: 基于Kafka的用户行为数据采集 基于Kafka的日志收集 基于Kafka的流量削峰 基于Kafka的用户行为数据采集 要获取必要的数据进行用户行为等的分析

    1.2K30发布于 2020-02-17
  • 来自专栏朱永胜的私房菜

    【Kafka系列】(一)Kafka入门

    此外,0.9版本还引入了Kafka Connect和Kafka Streams,使Kafka成为一个全面的流处理平台。 「Kafka 1.0版本」:2017年,发布了Kafka的1.0版本。 CDH/HDP Kafka 最后说说大数据云公司发布的 Kafka(CDH/HDP Kafka)。 最后说一说Kafka版本演进 「Kafka 0.8.x系列」:这是Kafka的初始版本系列。它引入了Kafka的基本功能,如高吞吐量、持久性、分布式消息传递等。 其中最显著的是引入了Kafka Connect和Kafka Streams。Kafka Connect提供了可插拔的连接器,用于将Kafka与外部系统集成。 此外,Kafka 0.11.x还引入了Kafka Admin Client,用于管理和配置Kafka集群。 「Kafka 1.0.x系列」:这个版本系列是Kafka的一个重要里程碑。

    90610编辑于 2023-09-06
  • 来自专栏北先生

    【Kafka】(一)Kafka的简介

    3.5、Kafka / Jafka Kafka 是 Apache 下的一个子项目,是一个高性能跨语言分布式发布 / 订阅消息队列系统,而 Jafka 是在 Kafka 之上孵化而来的,即 Kafka 的一个升级版 四、Kafka中的术语解释 4.1、概述 在深入理解 Kafka 之前,先介绍一下 Kafka 中的术语。 在实际生产环境中,尽量避免这种情况的发生,这种情况容易导致 Kafka 集群数据不均衡。 4.3、Topic 每条发布到 Kafka 集群的消息都有一个类别,这个类别被称为 Topic。 kafka 并没有提供其他额外的索引机制来存储 offset,因为在 kafka 中几乎不允许对消息进行 “随机读写”。 / 用户操作等信息发送到 kafka 中。

    3.1K21发布于 2021-08-09
  • 来自专栏用户4352451的专栏

    【kafka】kafka学习笔记(一)

    什么是kafka? 我们先看一下维基百科是怎么说的: Kafka是由Apache软件基金会开发的一个开源流处理平台,由Scala和Java编写。 此外,Kafka可以通过Kafka Connect连接到外部系统(用于数据输入/输出),并提供了Kafka Streams——一个Java流式处理库。 ,将发优惠卷和完成这个订单流程我们做一个异步操作,我们使用kafka 将这个订单的消息发给kafka,发优惠卷模块来消费这个队列。 kafka的系统架构图 ? kafka 设计特性 高吞吐、低延迟:kakfa 最大的特点就是收发消息非常快,kafka 每秒可以处理几十万条消息,它的最低延迟只有几毫秒。

    3.8K50发布于 2020-08-26
  • 来自专栏翰墨飘香

    Kafka入门——Kafka系列(一)

    一、 定义 Apache Kafka是一款开源的消息引擎系统 Apache Kafka是消息引擎系统,也是一个分布式流处理平台(Distributed Streaming Platform) Kafka 发布到topic的消息会被所有订阅者消费 kafka是发布订阅模式中消费者主动拉去(另一种是队列推) 维护一个长轮训,询问是否有新消息 三、 Kafka基础术语 消息 record Kafka是消息引擎 ,这里的消息就是指Kafka处理的主要对象。 Rebalance是Kafka消费者端实现高可用的重要手段。 四、kafka消息层级架构 至此我们能够完整地串联起Kafka的三层消息架构: 第一层是主题层,每个主题可以配置M个分区,而每个分区又可以配置N个副本。

    1.3K10编辑于 2025-02-08
  • 来自专栏运维小路

    Kafka-监控(Kafka Manager)

    我们上一个小节介绍Kafka的监控信息,但是这个监控适合接入到云原生的监控系统,如果没有云原生监控,光使用JVM监控则会更麻烦,而我们今天介绍另外一个监控:Kafka Manager,Kafka Manager 也是在云原生流行之前的普遍使用的Kafka监控。 Kafka Manager 是由 Yahoo 开源 的 Kafka 集群管理工具,最初由雅虎团队开发并维护。 CMAK(全称 Cluster Manager for Apache Kafka)是 Kafka Manager 的社区维护分支。 /kafka-manager  [clusters, configs, deleteClusters] [zk: localhost:2181(CONNECTED) 64] get /kafka/kafka-manager

    48900编辑于 2025-06-07
  • 来自专栏六个核弹的专栏

    kafka系列——kafka原理简介

    前文提到过 kafka 是一款基于发布订阅的消息队列。那么kafka是怎么去发布消息,怎么去保存消息,订阅消息的呢?首先我们从kafka的发布订阅模型开始分析。 下图为kafka的发布订阅模型: kafka 运行流程 kafka 总体流程可以粗略的归纳为:Producer 生产一个消息并指定消息的主题 Topic -> producer 将生产的消息投递给 kafka cluster -> kafka cluster 将消息根据 Topic 拆分成多个partition 存储到各个 broker 中 -> 消费者组订阅主题,负载均衡的消费消息。 接下来我们分析 kafka 的数据分区保存和记录消息消费与生产的方式。 生产者将数据写入到kafka主题后, kafka通过不同的策略将数据分配到不同分区中,常见的有三种策略,轮询策略,随机策略,和按键保存策略。

    1.1K20编辑于 2022-12-23
  • 来自专栏Flink落地

    Flink从Kafka到Kafka

    -- kafka 客户端 --> <dependency> <groupId>org.apache.kafka</groupId> <artifactId ; import org.apache.kafka.clients.producer.ProducerRecord; import org.apache.kafka.clients.producer.KafkaProducer ; /** * Desc: 从kafka中读数据,写到另一个kafka topic中 * Created by suddenly on 2020-05-05 */ public class } 运行效果 20200505210529.jpg 20200505210543.jpg 20200505210838.jpg 到此,我们实现了生成数据写到kafka,再把kafka的数据消费后,发到另一个 kafka中。

    3.7K00发布于 2020-05-05
  • 来自专栏正则

    kafka安装监控 kafka eagle

    -1.2.3.tar.gz 重命名:mv kafka-eagle-bin-1.2.3 kafka-eagle 进入Kafka Eagle目录,进入conf目录修改system-config.properties = kafka.eagle.mail.username= kafka.eagle.mail.password= kafka.eagle.mail.server.host= kafka.eagle.mail.server.port #kafka.eagle.password=123456 kafka.eagle.driver=org.sqlite.JDBC kafka.eagle.url=jdbc:sqlite:/Users/ dengjie/workspace/kafka-egale/db/ke.db kafka.eagle.username=root kafka.eagle.password=root 需要配置mysql 启动Kafka Eagle 配置完成后,可以执行Kafka Eagle脚本ke.sh。

    1.9K30编辑于 2022-03-18
  • 【kafka篇】什么是kafka?

    本篇文章是介绍kafka的第一篇,介绍kafka一些入门内容,后面还会持续更新关于kafka的内容。kafka101什么是kafka? kafka是一个分布式数据流平台,使应用程序能够实时发布、订阅、存储和处理消息流。发布/订阅 (pub/sub) 系统的特点是发送方将消息推送到一个中心点进行分类。kafka包含哪些组件? 在 Kafka 4.0 版本中,Kafka 彻底移除了 Zookeeper,并采用 KRaft(Kafka Raft) 作为新的元数据管理和集群协调机制什么是消息? kafka应用场景消息队列日志收集流式数据数据变更捕获监控kafka的优势高吞吐量 Kafka 采用 顺序写入磁盘 和 零拷贝(Zero Copy) 技术,使其比传统 MQ 具有更高的吞吐量可扩展性 Kafka Kafka 与 Kafka Streams、Flink、Spark Streaming 等流处理框架深度集成,适用于实时数据处理

    89710编辑于 2025-05-10
  • 来自专栏架构师高级俱乐部

    Kafka

    只保证分区内的记录是有序的,而不保证主题中不同分区的顺序 · Kafka作为一个集群,运行在一台或者多台服务器上. · Kafka 通过 topic 对存储的流数据进行分类。 为了提高读写硬盘的速度,Kafka就是使用顺序I/O。 完成映射之后你对物理内存的操作会被同步到硬盘上 Kafka高效文件存储设计特点 Kafka把topic中一个parition大文件分成多个小文件段,通过多个小文件段,就容易定期清除或删除已经消费完文件 Kafka数据存储 1.数据文件的分段 Kafka解决查询效率的手段之一是将数据文件分段,比如有100条Message,它们的offset是从0到99。 Kafka为什么这么快 https://www.freecodecamp.org/news/what-makes-apache-kafka-so-fast-a8d4f94ab145/

    85620编辑于 2022-04-27
  • 来自专栏大数据共享

    kafka(二)Kafka快速入门

    运行日志存放的路径 log.dirs=/opt/module/kafka/logs #配置连接Zookeeper集群地址 zookeeper.connect=hadoop102:2181,hadoop103 Kafka 命令行操作 topic 操作 脚本 kafka]$ bin\kafka-topics.sh 命令选项 选项 描述 --alter 更改分区数,副本分配,和/或主题的配置。 查看当前服务器中的所有 topic 语法: kafka-topics.sh --zookeeper <host>:<port> --list bin]$ kafka-topics.sh --zookeeper (默认:1000) --topic <String: topic> 生产的消息发送给定的主题 --version 显示Kafka版本 发送消息 语法:kafka-console-producer.sh --bootstrap-server hadoop103:9092 --topic abc #接收生产者推送的消息 hello ---- consumer操作 脚本 kafka]$ bin/kafka-console-consumer.sh

    1.2K30编辑于 2022-04-10
  • 来自专栏小工匠聊架构

    Apache Kafka - 重识Kafka

    概述 Kafka是一个高性能、分布式的消息队列系统,它的出现为大规模的数据处理提供了一种可靠、快速的解决方案。我们先初步了解Kafka的概念、特点和使用场景。 一、Kafka的概念 Kafka是由Apache软件基金会开发的一个开源消息队列系统,它主要由以下几个组件组成: Broker:Kafka集群中的每个节点都称为Broker,它们负责接收和处理生产者发送的消息 Producer:生产者是向Kafka Broker发送消息的客户端。 Consumer:消费者是从Kafka Broker获取消息的客户端。 二、Kafka的特点 高性能:Kafka通过将消息存储在磁盘上,可以支持大规模的消息处理,并且具有很高的吞吐量和低延迟。 三、Kafka的使用场景 日志收集:Kafka可以用于收集分布式系统中的日志数据,并将其存储在中心化的位置,以便进行分析和处理。

    90540编辑于 2023-05-21
  • 来自专栏扯编程的淡

    ​玩转Kafka—Spring整合Kafka

    > </dependencies> 2 项目结构 3 代码 3.1 配置文件和Kafka服务器所需配置 application.properties server.port=8080 #制定kafka spring.kafka.producer.batch-size=16384 #每次批量发送消息的缓冲区大小 spring.kafka.producer.buffer-memory=335554432 spring.kafka.producer.value-serializer=org.apache.kafka.common.serialization.StringSerializer # 指定默认消费者 :9092 spring.kafka.consumer.auto-offset-reset=earliest spring.kafka.consumer.enable-auto-commit=true =org.apache.kafka.common.serialization.StringDeserializer spring.kafka.consumer.value-deserializer=org.apache.kafka.common.serialization.StringDeserializer

    1.4K20编辑于 2022-10-31
  • 来自专栏北先生

    【Kafka】(二)Kafka 的架构

    1、持久性 kafka 使用文件存储消息,这就直接决定 kafka 在性能上严重依赖文件系统的本身特性。且无论任何 OS 下,对文件系统本身的优化几乎没有可能。 exactly once: kafka 中并没有严格的去实现 (基于 2 阶段提交,事务), 我们认为这种策略在 kafka 中是没有必要的。 kafka。 例如 “00000000000.kafka”; 其中 “最小 offset” 表示此 segment 中起始消息的 offset。 Kafka 并不是使用这种方法。 Kafka 通过 Zookeeper 管理 Kafka 集群配置:选举 Kafka broker 的 leader,以及在 Consumer Group 发生变化时进行 rebalance,因为 consumer

    1.5K10发布于 2021-08-09
  • 来自专栏小道

    Kafka

    1.1 Producer发送数据流程 1.2 Kafka Broker总体工作流程 1.3 消费者组初始化流程 2 Kafka的机器数量    Kafka机器数量 = 2 *(峰值生产速度 * 副本数 副本的优势:提高可靠性;副本劣势:增加了网络IO传输 4 Kafka压测   Kafka官方自带压力测试脚本(kafka-consumer-perf-test.sh、kafka-producer-perf-test.sh 12 Kafka分区分配策略   在 Kafka内部存在两种默认的分区分配策略:Range和 RoundRobin。   Range是默认策略。 ;   了解:   Kafka幂等性原理(单分区单会话):producer重试引起的乱序和重复 15.2 重复问题的解决:   1)Kafka增加了pid和seq。 16 Kafka消息数据积压,Kafka消费能力不足怎么处理?   1 、如果是Kafka消费能力不足,则可以考虑增加Topic的分区数,并且同时提升消费组的消费者数量,消费者数 = 分区数。

    93640编辑于 2022-11-28
  • 来自专栏大数据架构

    Kafka设计解析(七)- Kafka Stream

    Kafka Stream背景 Kafka Stream是什么 Kafka Stream是Apache Kafka从0.10版本引入的一个新Feature。 目前(Kafka 0.11.0.0)Kafka Stream的数据源只能如上图所示是Kafka。但是处理结果并不一定要如上图所示输出到Kafka。 注意:Kafka Stream的并行模型,非常依赖于《Kafka设计解析(一)- Kafka背景及架构介绍》一文中介绍的Kafka分区机制和《Kafka设计解析(四)- Kafka Consumer设计解析 系列文章 Kafka设计解析(一)- Kafka背景及架构介绍 Kafka设计解析(二)- Kafka High Availability (上) Kafka设计解析(三)- Kafka High Availability (下) Kafka设计解析(四)- Kafka Consumer设计解析 Kafka设计解析(五)- Kafka性能测试方法及Benchmark报告 Kafka设计解析(六)- Kafka高性能架构之道

    2.9K40发布于 2018-06-20
  • 来自专栏简栈文化

    Kafka设计解析-Kafka High Availability

    Kafka简介 Kafka是一种分布式的,基于发布/订阅的消息系统。主要设计目标如下: 以时间复杂度为O(1)的方式提供消息持久化能力,即使对TB级以上数据也能保证常数时间复杂度的访问性能 高吞吐率。 Kafka架构 Broker:Kafka集群包含一个或多个服务器,这种服务器被称为broker Topic:每条发布到Kafka集群的消息都有一个类别,这个类别被称为Topic。 Producer:负责发布消息到Kafka broker Consumer:消息消费者,向Kafka broker读取消息的客户端。 Kafka HA设计解析 5.1 Replica复制算法 为了更好的做负载均衡,Kafka尽量将所有的Partition均匀分配到整个集群上。 对于Kafka而言,Kafka存活包含两个条件,一是它必须维护与Zookeeper的session(这个通过Zookeeper的Heartbeat机制来实现)。

    63640发布于 2021-11-04
  • 来自专栏实时计算

    Kafka学习(二)-------- 什么是Kafka

    通过Kafka的快速入门 https://www.cnblogs.com/tree1123/p/11150927.html 能了解到Kafka的基本部署,使用,但他和其他的消息中间件有什么不同呢? Kafka的基本原理,术语,版本等等都是怎么样的?到底什么是Kafka呢? kafka官网最新的定义:Apache Kafka® is a distributed streaming platform 也就是分布式流式平台。 作为存储系统 作为流处理系统 二、常见使用 http://kafka.apache.org/uses 消息 Kafka可以替代更传统的消息代理。 /confluence/display/KAFKA/Ecosystem kafka connect stream management kafka考虑的几个问题: 吞吐量: 用到了page cache

    95830发布于 2019-08-08
  • 来自专栏黑泽君的专栏

    大数据技术之_10_Kafka学习_Kafka概述+Kafka集群部署+Kafka工作流程分析+Kafka API实战+Kafka Producer拦截器+Kafka Streams

    在流式计算中,Kafka 一般用来缓存数据,Storm通过消费Kafka的数据进行计算。   Kafka 是基于点对点模式的消息队列。    8)启动Kafka集群 依次在hadoop102、hadoop103、hadoop104节点上启动kafka [atguigu@hadoop102 kafka]$ bin/kafka-server-start.sh 9)关闭Kafka集群 [atguigu@hadoop102 kafka]$ bin/kafka-server-stop.sh stop [atguigu@hadoop103 kafka]$ bin/kafka-server-stop.sh 第4章 Kafka API实战 4.1 环境准备 1)启动zk集群和kafka集群,在kafka集群中打开一个消费者 [atguigu@hadoop102 kafka]$ bin/kafka-console-consumer.sh /tmp/kafka-logs Kafka 数据存放的目录。

    1.7K20发布于 2019-03-15
领券