DISTINCT 算子用于为对数据行去重,包括去除重复的 NULL 值。

DISTINCT 算子包括 HASH DISTINCT 和 MERGE DISTINCT。

HASH DISTINCT

HASH DISTINCT 算子使用 HASH 算法执行 DISTINCT 运算。

示例 1:使用 HASH 算法执行 DISTINCT 运算,对 t1 表的 c1 列进行去重处理

  1. obclient>CREATE TABLE t1(c1 INT, c2 INT);
  2. Query OK, 0 rows affected (0.09 sec)
  3. obclient>CREATE TABLE t2(c1 INT, c2 INT);
  4. Query OK, 0 rows affected (0.09 sec)
  5. obclient>EXPLAIN SELECT /*+USE_HASH_AGGREGATION*/ DISTINCT c1 FROM t1\G;
  6. *************************** 1. row ***************************
  7. Query Plan:
  8. |=======================================
  9. |ID|OPERATOR |NAME|EST. ROWS|COST |
  10. ---------------------------------------
  11. |0 |HASH DISTINCT| |101 |99169|
  12. |1 | TABLE SCAN |t1 |100000 |66272|
  13. =======================================
  14. Outputs & filters:
  15. -------------------------------------
  16. 0 - output([t1.c1]), filter(nil),
  17. distinct([t1.c1])
  18. 1 - output([t1.c1]), filter(nil),
  19. access([t1.c1]), partitions(p0)

上述示例中,执行计划展示中 0 号算子 HASH DISTINCT 执行去重运算,outputs & filters 详细展示了 HASH DISTINCT 算子的具体输出信息如下:

信息名称

含义

output

该算子的输出列。

filter

该算子的过滤谓词。

由于示例中 HASH DISTINCT 算子没有设置 filter,所以为 nil。

partition

查询需要扫描的分区。

distinct

指定需要去重的列。

例如,distinct([t1.c1]) 的参数 t1.c1 指定对 t1 表的 c1 列进行去重处理,并且采用 HASH 算法。

MERGE DISTINCT

MERGE DISTINCT 算子使用 MERGE 算法执行 DISTINCT 运算。

示例 2:使用 MERGE 算法执行 DISTINCT 运算

  1. obclient>EXPLAIN SELECT /*+NO_USE_HASH_AGGREGATION*/ DISTINCT c1 FROM t1\G;
  2. *************************** 1. row ***************************
  3. Query Plan:
  4. |=======================================
  5. |ID|OPERATOR |NAME|EST. ROWS|COST|
  6. ---------------------------------------
  7. |0 |MERGE DISTINCT| |3 |40 |
  8. |1 | SORT | |3 |39 |
  9. |2 | TABLE SCAN |t1 |3 |37 |
  10. =======================================
  11. Outputs & filters:
  12. -------------------------------------
  13. 0 - output([t1.c1]), filter(nil),
  14. distinct([t1.c1])
  15. 1 - output([t1.c1]), filter(nil), sort_keys([t1.c1, ASC])
  16. 2 - output([t1.c1]), filter(nil),
  17. access([t1.c1]), partitions(p0)

上述示例中,0 号算子 MERGE DISTINCT 执行去重运算,采用了 MERGE 算法,并且由于 2 号算子输出的数据是无序的,而 MERGE DISTINCT 算子需要输入的数据有序,所以在执行去重运算前需要使用 SORT 算子对数据排序。执行计划展示中的 outputs & filters 详细展示了 MERGE DISTINCT 算子的输出信息如下:

信息名称

含义

output

该算子的输出列。

filter

该算子的过滤谓词。

由于示例中 MERGE DISTINCT 算子没有设置 filter,所以为 nil。

distinct

指定需要去重的列。

例如,distinct([t1.c1]) 的参数 t1.c1 指定对 t1 表的 c1 列进行去重处理,并且采用 MERGE 算法。