分桶(Bucketing)
分桶是将数据按照某个字段的哈希值进行分组存储的一种技术。它的原理是将数据按照指定字段的哈希值分成固定数量的桶,将每条记录分配到对应的桶中。分桶可以帮助优化特定类型的查询,例如连接查询和聚合操作,因为它可以将数据分布得更加均匀,减少数据倾斜,提高查询效率。
在Hive中创建分桶表时,需要使用CLUSTERED BY
语句指定分桶字段,并且使用INTO
语句指定桶的数量。例如:
CREATE TABLE bucketed_table ( column1 INT, column2 STRING, ... ) CLUSTERED BY (column1) INTO 4 BUCKETS;
use itcast;
create table tb_test(
id int,
name string
)
row format delimited fields terminated by ',';
insert into tb_test values
(1,'张三'),
(2,'李四'),
(3,'沙和尚'),
(4