0%

Bigdata outline

1 基础技术栈

1.1 Java

Java 全栈知识体系

1.2 数据结构

1.2.1 LSM Tree

1.2.2 B-Tree

1.3 底层存储引擎

1.3.1 LevelDB

1.3.2 RocksDB

https://github.com/facebook/rocksdb/wiki/
https://alexstocks.github.io/html/rocksdb.html

1.4 硬件与存储

1.4.1 OSS 对象存储

2 分布式协调

2.1 Zookeeper

3 存储层

3.1 HDFS

分布式文件系统,大数据存储的基础设施

4 消息队列

4.1 Kafka

4.2 Pulsar

详情

5 批处理引擎

5.1 Spark

深入理解 Spark(Spark SQL 优化、数据倾斜处理)和 Hive(调优、存储格式如 Parquet/ORC)。

5.1.1 Spark Core

5.1.2 Spark SQL

5.1.3 性能优化

  • 数据倾斜处理
  • 算子优化
  • 资源调优

6 流处理引擎

需要掌握其状态管理(State)、容错机制(Checkpoint)以及 Exactly-once 语义。

详情

6.1.1 Runtime 架构

6.1.1.1 Memory Management

6.1.3 State & Checkpoint

6.1.3.1 状态管理

6.1.3.2 容错机制

6.1.3.3 Exactly-once 语义

6.1.4 RocksDB State Backend

7 湖仓一体架构

存储与湖仓一体: 掌握 Data Lakehouse 架构(如 Iceberg、Hudi、Delta Lake),解决近实时更新和流批统一的问题。

7.1 Apache Iceberg

7.2 Apache Hudi

7.3 Apache Paimon

7.4 Delta Lake

8 OLAP 分析引擎

为了满足秒级响应的分析需求,架构师需要根据场景(并发量、延迟、数据量)选择合适的引擎:

8.1 ClickHouse

极致的单表查询性能

8.2 Apache Doris

优秀的国产自研引擎,支持高并发、流批一体和极简运维

Doris为什么那么快?

8.3 StarRocks

优秀的国产自研引擎,支持高并发、流批一体和极简运维

Apache Doris和Clickhouse的深度分析

8.4 Presto / Trino

适用于跨数据源的联邦查询

9 云原生大数据

9.1 容器化部署

9.2 Kubernetes 调度

9.3 资源弹性伸缩

9.4 Ray

10 数据治理与架构设计

10.1 数据治理与全生命周期管理

架构师的价值往往体现在”如何管好数据”而非仅仅”存下数据”。

10.1.1 元数据管理

构建数据字典,实现血缘追踪(Data Lineage)

10.1.2 数据质量

建立监控体系,涵盖完整性、准确性和一致性

10.1.3 数据安全

  • 权限控制(Ranger)
  • 数据脱敏
  • 数据加密
  • 隐私计算

10.1.4 数仓建模

  • 离线数仓建模
  • 实时数仓建模
  • 维度建模(Kimball)
  • Data Vault

10.2 架构设计思维

这是专家级与高级开发的本质区别:

10.2.1 选型能力

能够在不同的业务场景(如电商大促、金融风控、物联网监控)下给出最合适的方案

10.2.2 高可用与灾备

设计具备容错能力的多活架构

10.2.3 成本优化

通过冷热数据分级存储、资源弹性伸缩(FinOps)降低云账单成本

11 参考资料

Daily-0609~0615