数据湖架构演进(二):Iceberg 的快照表内核
Hive 通过目录、分区和 Metastore 管理大规模数据,但当数据进入对象存储、单表扩展到数百万个文件,并由多个计算引擎并发读写时,目录 Listing、非原子 Rename、分区耦合和 Schema 演进等问题逐渐成为系统瓶颈。Iceberg 最初诞生于 Netflix,核心目标正是重新定义超大规模分析表的状态管理方式。
Iceberg 不再通过目录推断表中包含哪些文件,而是使用 Catalog、Snapshot、Manifest List 和 Manifest 构建不可变的元数据树,将一次表变更原子发布为新的快照。这套架构为数据湖补充了快照隔离、乐观并发控制、快速查询规划、时间旅行以及安全的 Schema 和 Partition Evolution。