1 基础技术栈
1.1 Java
1.2 数据结构
1.2.1 LSM Tree
1.2.2 B-Tree
1.3 底层存储引擎
1.3.1 LevelDB
1.3.2 RocksDB
https://github.com/facebook/rocksdb/wiki/
https://alexstocks.github.io/html/rocksdb.html
1.4 硬件与存储
1.4.1 OSS 对象存储
2 分布式协调
2.1 Zookeeper
3 存储层
3.1 HDFS
分布式文件系统,大数据存储的基础设施
4 消息队列
4.1 Kafka
4.2 Pulsar
5 批处理引擎
5.1 Spark
深入理解 Spark(Spark SQL 优化、数据倾斜处理)和 Hive(调优、存储格式如 Parquet/ORC)。
5.1.1 Spark Core
5.1.2 Spark SQL
5.1.3 性能优化
- 数据倾斜处理
- 算子优化
- 资源调优
6 流处理引擎
6.1 Flink
需要掌握其状态管理(State)、容错机制(Checkpoint)以及 Exactly-once 语义。
6.1.1 Runtime 架构
6.1.1.1 Memory Management
6.1.2 Flink SQL
6.1.3 State & Checkpoint
6.1.3.1 状态管理
6.1.3.2 容错机制
6.1.3.3 Exactly-once 语义
6.1.4 RocksDB State Backend
7 湖仓一体架构
存储与湖仓一体: 掌握 Data Lakehouse 架构(如 Iceberg、Hudi、Delta Lake),解决近实时更新和流批统一的问题。
7.1 Apache Iceberg
7.2 Apache Hudi
7.3 Apache Paimon
7.4 Delta Lake
8 OLAP 分析引擎
为了满足秒级响应的分析需求,架构师需要根据场景(并发量、延迟、数据量)选择合适的引擎:
8.1 ClickHouse
极致的单表查询性能
8.2 Apache Doris
优秀的国产自研引擎,支持高并发、流批一体和极简运维
8.3 StarRocks
优秀的国产自研引擎,支持高并发、流批一体和极简运维
8.4 Presto / Trino
适用于跨数据源的联邦查询
9 云原生大数据
9.1 容器化部署
9.2 Kubernetes 调度
9.3 资源弹性伸缩
9.4 Ray
10 数据治理与架构设计
10.1 数据治理与全生命周期管理
架构师的价值往往体现在”如何管好数据”而非仅仅”存下数据”。
10.1.1 元数据管理
构建数据字典,实现血缘追踪(Data Lineage)
10.1.2 数据质量
建立监控体系,涵盖完整性、准确性和一致性
10.1.3 数据安全
- 权限控制(Ranger)
- 数据脱敏
- 数据加密
- 隐私计算
10.1.4 数仓建模
- 离线数仓建模
- 实时数仓建模
- 维度建模(Kimball)
- Data Vault
10.2 架构设计思维
这是专家级与高级开发的本质区别:
10.2.1 选型能力
能够在不同的业务场景(如电商大促、金融风控、物联网监控)下给出最合适的方案
10.2.2 高可用与灾备
设计具备容错能力的多活架构
10.2.3 成本优化
通过冷热数据分级存储、资源弹性伸缩(FinOps)降低云账单成本