子查询

数据仓库 PALO

  • 功能发布记录
  • 操作手册1
    • LDAP认证
    • 时区
    • 使用S3-SDK访问对象存储
    • 权限管理
    • 物化视图
    • 变量
    • 资源管理
    • 数据更新与删除
      • 标记删除
      • Sequence-Column
      • 数据更新
      • 数据删除
    • 备份与恢复
      • 备份与恢复
    • 数据导出1
      • SELECT INTO OUTFILE
      • MySQL Dump
      • 数据导出概述
      • Export
    • 数据导出
      • 全量数据导出
      • 导出查询结果集
      • 导出总览
      • 导出数据到外部表
    • 查询加速1
      • 查询缓存
      • 物化视图
        • 同步物化视图
        • 物化视图概览
        • 异步物化视图
          • 异步物化视图常见问题
          • 最佳实践
          • 异步物化视图概述
          • 创建、查询与维护异步物化视图
    • 数据导入
      • JSON格式数据导入说明
      • 导入本地数据
      • 导入BOS中的数据
      • 导入事务和原子性
      • 通过外部表同步数据
      • 使用JDBC同步数据
      • 列的映射、转换与过滤
      • 订阅Kafka日志
      • 严格模式
      • 导入总览
    • 数据更新与删除1
      • 事务
      • 数据更新
        • 主键模型的导入更新
        • 主键模型的 Update 更新
        • 数据更新概述
        • 主键模型的更新并发控制
        • 聚合模型的导入更新
      • 数据删除
        • 删除操作概述
        • Truncate 操作
        • 表原子替换
        • Delete 操作
        • 基于导入的批量删除
        • 临时分区
    • 数据导入1
      • 高并发导入优化(Group Commit)
      • 导入概览
      • 异常数据处理
      • 导入高可用性
      • 导入时实现数据转换
      • 数据源
        • Kafka
        • S3 兼容存储
        • 从其他 TP 系统迁移数据
        • HDFS
        • 从其他 AP 系统迁移数据
        • Flink
        • 本地文件
      • 导入方式
        • Broker Load
        • MySQL Load
        • Insert Into Values
        • Stream Load
        • Insert Into Select
        • Routine Load
      • 文件格式
        • CSV
        • JSON
        • Parquet
        • ORC
      • 复杂数据类型
        • MAP
        • Variant
        • JSON
        • STRUCT
        • Bitmap
        • HLL
        • ARRAY
  • 开发指南
    • 迁移ClickHouse数据
    • Doris集群间数据迁移
    • 数据更新与删除
      • 事务
      • 数据更新
        • 主键模型的导入更新
        • 主键模型的 Update 更新
        • 数据更新概述
        • 主键模型的更新并发控制
        • 聚合模型的导入更新
      • 数据删除
        • 删除操作概述
        • Truncate 操作
        • 表原子替换
        • Delete 操作
        • 基于导入的批量删除
        • 临时分区
    • 查询加速
      • 查询缓存
      • Colocation Join
      • 高并发点查
      • Hint
        • Hint 概述
        • Leading Hint
        • Distribute Hint
      • 物化视图
        • 同步物化视图
        • 物化视图概览
        • 异步物化视图
          • 异步物化视图常见问题
          • 最佳实践
          • 异步物化视图概述
          • 创建、查询与维护异步物化视图
      • 高效去重
        • BITMAP 精准去重
        • HLL 近似去重
      • 优化技术原理
        • TOPN 查询优化
        • 统计信息
        • Pipeline 执行引擎
        • 查询优化器介绍
        • Runtime Filter
      • 查询调优概述
        • 调优概述
        • 诊断工具
        • 分析工具
        • 调优流程
      • 查询优化实践
        • 常见调优参数
        • 计划调优
          • 使用 Hint 控制代价改写
          • 使用异步物化视图透明改写
          • 使用 Leading Hint 控制 Join 顺序
          • 优化表 Schema 设计
          • 使用分区裁剪优化扫表
          • 优化索引设计和使用
          • 使用 Hint 调整 Join Shuffle 方式
          • DML 计划调优
          • 使用 Colocate Group 优化 Join
          • 使用同步物化视图透明改写
          • 使用 SQL Cache 加速查询
        • 执行调优
          • 数据倾斜处理
          • RuntimeFilter 的等待时间调整
          • 并行度调优
    • 数据查询
      • 连接(JOIN)
      • 子查询
      • 复杂类型查询
      • 列转行 (Lateral View)
      • MySQL 兼容性
      • 聚合多维分析
      • 分析函数(窗口函数)
      • 公用表表达式(CTE)
      • 自定义函数
        • 别名函数
        • Java UDF, UDAF, UDTF
    • 数据导出
      • SELECT INTO OUTFILE
      • MySQL Dump
      • 最佳实践
      • 数据导出概述
      • Export
    • 数据导入
      • 高并发导入优化(Group Commit)
      • 异常数据处理
      • 导入高可用性
      • 导入时实现数据转换
      • 导入最佳实践
      • 数据源
        • Kafka
        • Snowflake
        • S3 兼容存储
        • Google Cloud Storage
        • 从其他 TP 系统迁移数据
        • Azure Storage
        • 腾讯云 COS
        • MinIO
        • HDFS
        • 阿里云 OSS
        • 华为云 OBS
        • 从其他 AP 系统迁移数据
        • Flink
        • Redshift
        • Amazon S3
        • 本地文件
        • BigQuery
      • 导入方式
        • Broker Load
        • MySQL Load
        • Insert Into Values
        • Stream Load
        • Insert Into Select
        • Routine Load
      • 文件格式
        • CSV
        • JSON
        • Parquet
        • ORC
      • 复杂数据类型
        • MAP
        • Variant
        • JSON
        • STRUCT
        • Bitmap
        • HLL
        • ARRAY
    • BI工具接入
      • Sugar
      • Navicat
      • Tableau
      • DBeaver
      • 永洪BI
      • FineBI(帆软)
    • 数据库连接
      • 通过 MySQL 协议连接
      • 基于 Arrow Flight SQL 的高速数据传输链路
    • 湖仓一体
      • 分析 S3或HDFS 上的文件
      • 湖仓一体概述
      • SQL 方言兼容
      • 弹性计算节点
      • 云服务认证接入
      • 元数据缓存
      • 外表统计信息
      • 数据缓存
      • 数据库分析
        • MySQL
        • JDBC Catalog
        • Oracle
        • OceanBase
        • SAP HANA
        • 阿里云 MaxCompute
        • ClickHouse
        • PostgreSQL
        • IBM Db2
        • SQL Server
        • Elasticsearch
      • 湖仓一体最佳实践
        • 使用 PALO 和 Paimon
        • 使用 PALO 和 Iceberg
        • 使用 PALO 和 Hudi
        • 使用 PALO 和 LakeSoul
      • 数据湖构建
        • Iceberg
        • Hive
      • 数据湖分析
        • Hudi Catalog
        • 阿里云 DLF
        • Iceberg Catalog
        • Paimon Catalog
        • Hive Catalog
    • 数据表设计
      • 行业混存
      • 数据压缩
      • Schema 变更
      • 数据类型
      • 自增列
      • 概览
      • 数据库建表最佳实践
      • 冷热数据分层
        • SSD 和 HDD 层级存储
        • 远程存储
        • 冷热数据分层概述
      • 表索引
        • 倒排索引
        • 前缀索引与排序键
        • N-Gram 索引
        • BloomFilter 索引
        • 索引概述
      • 数据划分
        • 数据分桶
        • 数据分布概念
        • 动态分区
        • 自动分区
        • 手动分区
        • 常见文档
      • 数据模型
        • 使用注意
        • 模型概述
        • 主键模型
        • 明细模型
        • 聚合模型
  • 版本发布历史
    • 百度数据仓库 Palo 2.0 版本全新发布
  • SQL手册
    • 字面常量
    • 别名
    • SQL-手册
    • 数据类型
    • SQL语句
    • 注释
    • 内置函数
    • 白名单管理
    • SQL操作符
    • 内置函数
      • 聚合函数
      • 位操作函数
      • 字符串函数
      • 条件函数
      • 数学函数
      • JSON解析函数
      • 类型转换函数
      • 格式转换函数
      • 通用函数
      • 时间和日期函数
      • BITMAP函数
      • 窗口函数
      • 哈希函数
      • HLL函数
    • 语法帮助
      • DML
        • INSERT
        • ROUTINE-LOAD
        • RESTORE
        • SELECT-INTO-OUTFILE
        • ALTER-ROUTINE-LOAD
        • BROKER-LOAD
        • BACKUP
        • EXPORT
        • STREAM-LOAD
      • DDL
        • CREATE-FILE
        • DROP-RESOURCE
        • CREATE-RESOURCE
        • CREATE-MATERIALIZED-VIEW
        • DROP-RESROUCE
        • CREATE-TABLE
        • DROP-REPOSITORY
        • CREATE-REPOSITORY
        • CREATE-ODBC-TABLE
      • 信息查看语句
        • SHOW-BACKUP
        • SHOW-ALTER-TABLE-MATERIALIZED-VIEW
        • SHOW-SNAPSHOT
        • SHOW-ROUTINE-LOAD
        • SHOW-CREATE-ROUTINE-LOAD
        • SHOW-ROLES
        • SHOW-GRANTS
        • SHOW-EXPORT
        • SHOW-ROUTINE-LOAD-TASK
        • SHOW-REPOSITORIES
        • SHOW-LOAD
        • SHOW-RESOURCES
        • SHOW-RESTORE
        • SHOW-PROPERTY
        • SHOW-FILE
      • 辅助命令
        • PAUSE-ROUTINE-LOAD
        • STOP-ROUTINE-LOAD
        • ALTER-ROUTINE-LOAD
        • CANCEL-LOAD
        • RESUME-ROUTINE-LOAD
      • 账户管理
        • SET-PROPERTY
        • REVOKE
        • GRANT
        • CREATE-ROLE
        • DROP-ROLE
        • CREATE-USER
        • DROP-USER
        • SET-PASSWORD
  • 快速入门
    • 快速上手
    • 存算分离
    • 存算一体
  • 典型实践
    • 如何开启Debug日志
    • 导入分析
    • 查询分析
  • 操作手册
    • 权限和子用户
    • 存算一体
      • 连接集群
      • 查询分析
      • 监控告警
        • 监控指标
        • 告警配置
      • 备份恢复
        • 通过管理页面备份与恢复
        • 备份与恢复
      • 权限管理
        • 集群权限
        • 控制台权限
      • 集群管理
        • 集群创建
        • 停止与删除
        • 重置管理员密码
        • 集群扩缩容
        • 集群详情
    • 存算分离
      • 连接集群
      • 计算组管理
        • 重启计算组
        • 创建计算组
      • 监控告警
        • 监控指标
        • 告警配置
      • 权限管理
        • 集群权限
        • 控制台权限
      • 集群管理
        • 停止与删除
        • 创建集群
        • 重置管理员密码
        • 集群详情
  • 服务等级协议SLA
    • 服务等级协议(SLA)v1.0
  • 产品概述
    • 系统架构
    • 产品特点
    • 产品介绍
  • 视频专区
    • 操作指南
    • 产品简介
  • 产品定价
    • 预付费
    • 计费说明
    • 后付费
所有文档
menu
没有找到结果,请重新输入

数据仓库 PALO

  • 功能发布记录
  • 操作手册1
    • LDAP认证
    • 时区
    • 使用S3-SDK访问对象存储
    • 权限管理
    • 物化视图
    • 变量
    • 资源管理
    • 数据更新与删除
      • 标记删除
      • Sequence-Column
      • 数据更新
      • 数据删除
    • 备份与恢复
      • 备份与恢复
    • 数据导出1
      • SELECT INTO OUTFILE
      • MySQL Dump
      • 数据导出概述
      • Export
    • 数据导出
      • 全量数据导出
      • 导出查询结果集
      • 导出总览
      • 导出数据到外部表
    • 查询加速1
      • 查询缓存
      • 物化视图
        • 同步物化视图
        • 物化视图概览
        • 异步物化视图
          • 异步物化视图常见问题
          • 最佳实践
          • 异步物化视图概述
          • 创建、查询与维护异步物化视图
    • 数据导入
      • JSON格式数据导入说明
      • 导入本地数据
      • 导入BOS中的数据
      • 导入事务和原子性
      • 通过外部表同步数据
      • 使用JDBC同步数据
      • 列的映射、转换与过滤
      • 订阅Kafka日志
      • 严格模式
      • 导入总览
    • 数据更新与删除1
      • 事务
      • 数据更新
        • 主键模型的导入更新
        • 主键模型的 Update 更新
        • 数据更新概述
        • 主键模型的更新并发控制
        • 聚合模型的导入更新
      • 数据删除
        • 删除操作概述
        • Truncate 操作
        • 表原子替换
        • Delete 操作
        • 基于导入的批量删除
        • 临时分区
    • 数据导入1
      • 高并发导入优化(Group Commit)
      • 导入概览
      • 异常数据处理
      • 导入高可用性
      • 导入时实现数据转换
      • 数据源
        • Kafka
        • S3 兼容存储
        • 从其他 TP 系统迁移数据
        • HDFS
        • 从其他 AP 系统迁移数据
        • Flink
        • 本地文件
      • 导入方式
        • Broker Load
        • MySQL Load
        • Insert Into Values
        • Stream Load
        • Insert Into Select
        • Routine Load
      • 文件格式
        • CSV
        • JSON
        • Parquet
        • ORC
      • 复杂数据类型
        • MAP
        • Variant
        • JSON
        • STRUCT
        • Bitmap
        • HLL
        • ARRAY
  • 开发指南
    • 迁移ClickHouse数据
    • Doris集群间数据迁移
    • 数据更新与删除
      • 事务
      • 数据更新
        • 主键模型的导入更新
        • 主键模型的 Update 更新
        • 数据更新概述
        • 主键模型的更新并发控制
        • 聚合模型的导入更新
      • 数据删除
        • 删除操作概述
        • Truncate 操作
        • 表原子替换
        • Delete 操作
        • 基于导入的批量删除
        • 临时分区
    • 查询加速
      • 查询缓存
      • Colocation Join
      • 高并发点查
      • Hint
        • Hint 概述
        • Leading Hint
        • Distribute Hint
      • 物化视图
        • 同步物化视图
        • 物化视图概览
        • 异步物化视图
          • 异步物化视图常见问题
          • 最佳实践
          • 异步物化视图概述
          • 创建、查询与维护异步物化视图
      • 高效去重
        • BITMAP 精准去重
        • HLL 近似去重
      • 优化技术原理
        • TOPN 查询优化
        • 统计信息
        • Pipeline 执行引擎
        • 查询优化器介绍
        • Runtime Filter
      • 查询调优概述
        • 调优概述
        • 诊断工具
        • 分析工具
        • 调优流程
      • 查询优化实践
        • 常见调优参数
        • 计划调优
          • 使用 Hint 控制代价改写
          • 使用异步物化视图透明改写
          • 使用 Leading Hint 控制 Join 顺序
          • 优化表 Schema 设计
          • 使用分区裁剪优化扫表
          • 优化索引设计和使用
          • 使用 Hint 调整 Join Shuffle 方式
          • DML 计划调优
          • 使用 Colocate Group 优化 Join
          • 使用同步物化视图透明改写
          • 使用 SQL Cache 加速查询
        • 执行调优
          • 数据倾斜处理
          • RuntimeFilter 的等待时间调整
          • 并行度调优
    • 数据查询
      • 连接(JOIN)
      • 子查询
      • 复杂类型查询
      • 列转行 (Lateral View)
      • MySQL 兼容性
      • 聚合多维分析
      • 分析函数(窗口函数)
      • 公用表表达式(CTE)
      • 自定义函数
        • 别名函数
        • Java UDF, UDAF, UDTF
    • 数据导出
      • SELECT INTO OUTFILE
      • MySQL Dump
      • 最佳实践
      • 数据导出概述
      • Export
    • 数据导入
      • 高并发导入优化(Group Commit)
      • 异常数据处理
      • 导入高可用性
      • 导入时实现数据转换
      • 导入最佳实践
      • 数据源
        • Kafka
        • Snowflake
        • S3 兼容存储
        • Google Cloud Storage
        • 从其他 TP 系统迁移数据
        • Azure Storage
        • 腾讯云 COS
        • MinIO
        • HDFS
        • 阿里云 OSS
        • 华为云 OBS
        • 从其他 AP 系统迁移数据
        • Flink
        • Redshift
        • Amazon S3
        • 本地文件
        • BigQuery
      • 导入方式
        • Broker Load
        • MySQL Load
        • Insert Into Values
        • Stream Load
        • Insert Into Select
        • Routine Load
      • 文件格式
        • CSV
        • JSON
        • Parquet
        • ORC
      • 复杂数据类型
        • MAP
        • Variant
        • JSON
        • STRUCT
        • Bitmap
        • HLL
        • ARRAY
    • BI工具接入
      • Sugar
      • Navicat
      • Tableau
      • DBeaver
      • 永洪BI
      • FineBI(帆软)
    • 数据库连接
      • 通过 MySQL 协议连接
      • 基于 Arrow Flight SQL 的高速数据传输链路
    • 湖仓一体
      • 分析 S3或HDFS 上的文件
      • 湖仓一体概述
      • SQL 方言兼容
      • 弹性计算节点
      • 云服务认证接入
      • 元数据缓存
      • 外表统计信息
      • 数据缓存
      • 数据库分析
        • MySQL
        • JDBC Catalog
        • Oracle
        • OceanBase
        • SAP HANA
        • 阿里云 MaxCompute
        • ClickHouse
        • PostgreSQL
        • IBM Db2
        • SQL Server
        • Elasticsearch
      • 湖仓一体最佳实践
        • 使用 PALO 和 Paimon
        • 使用 PALO 和 Iceberg
        • 使用 PALO 和 Hudi
        • 使用 PALO 和 LakeSoul
      • 数据湖构建
        • Iceberg
        • Hive
      • 数据湖分析
        • Hudi Catalog
        • 阿里云 DLF
        • Iceberg Catalog
        • Paimon Catalog
        • Hive Catalog
    • 数据表设计
      • 行业混存
      • 数据压缩
      • Schema 变更
      • 数据类型
      • 自增列
      • 概览
      • 数据库建表最佳实践
      • 冷热数据分层
        • SSD 和 HDD 层级存储
        • 远程存储
        • 冷热数据分层概述
      • 表索引
        • 倒排索引
        • 前缀索引与排序键
        • N-Gram 索引
        • BloomFilter 索引
        • 索引概述
      • 数据划分
        • 数据分桶
        • 数据分布概念
        • 动态分区
        • 自动分区
        • 手动分区
        • 常见文档
      • 数据模型
        • 使用注意
        • 模型概述
        • 主键模型
        • 明细模型
        • 聚合模型
  • 版本发布历史
    • 百度数据仓库 Palo 2.0 版本全新发布
  • SQL手册
    • 字面常量
    • 别名
    • SQL-手册
    • 数据类型
    • SQL语句
    • 注释
    • 内置函数
    • 白名单管理
    • SQL操作符
    • 内置函数
      • 聚合函数
      • 位操作函数
      • 字符串函数
      • 条件函数
      • 数学函数
      • JSON解析函数
      • 类型转换函数
      • 格式转换函数
      • 通用函数
      • 时间和日期函数
      • BITMAP函数
      • 窗口函数
      • 哈希函数
      • HLL函数
    • 语法帮助
      • DML
        • INSERT
        • ROUTINE-LOAD
        • RESTORE
        • SELECT-INTO-OUTFILE
        • ALTER-ROUTINE-LOAD
        • BROKER-LOAD
        • BACKUP
        • EXPORT
        • STREAM-LOAD
      • DDL
        • CREATE-FILE
        • DROP-RESOURCE
        • CREATE-RESOURCE
        • CREATE-MATERIALIZED-VIEW
        • DROP-RESROUCE
        • CREATE-TABLE
        • DROP-REPOSITORY
        • CREATE-REPOSITORY
        • CREATE-ODBC-TABLE
      • 信息查看语句
        • SHOW-BACKUP
        • SHOW-ALTER-TABLE-MATERIALIZED-VIEW
        • SHOW-SNAPSHOT
        • SHOW-ROUTINE-LOAD
        • SHOW-CREATE-ROUTINE-LOAD
        • SHOW-ROLES
        • SHOW-GRANTS
        • SHOW-EXPORT
        • SHOW-ROUTINE-LOAD-TASK
        • SHOW-REPOSITORIES
        • SHOW-LOAD
        • SHOW-RESOURCES
        • SHOW-RESTORE
        • SHOW-PROPERTY
        • SHOW-FILE
      • 辅助命令
        • PAUSE-ROUTINE-LOAD
        • STOP-ROUTINE-LOAD
        • ALTER-ROUTINE-LOAD
        • CANCEL-LOAD
        • RESUME-ROUTINE-LOAD
      • 账户管理
        • SET-PROPERTY
        • REVOKE
        • GRANT
        • CREATE-ROLE
        • DROP-ROLE
        • CREATE-USER
        • DROP-USER
        • SET-PASSWORD
  • 快速入门
    • 快速上手
    • 存算分离
    • 存算一体
  • 典型实践
    • 如何开启Debug日志
    • 导入分析
    • 查询分析
  • 操作手册
    • 权限和子用户
    • 存算一体
      • 连接集群
      • 查询分析
      • 监控告警
        • 监控指标
        • 告警配置
      • 备份恢复
        • 通过管理页面备份与恢复
        • 备份与恢复
      • 权限管理
        • 集群权限
        • 控制台权限
      • 集群管理
        • 集群创建
        • 停止与删除
        • 重置管理员密码
        • 集群扩缩容
        • 集群详情
    • 存算分离
      • 连接集群
      • 计算组管理
        • 重启计算组
        • 创建计算组
      • 监控告警
        • 监控指标
        • 告警配置
      • 权限管理
        • 集群权限
        • 控制台权限
      • 集群管理
        • 停止与删除
        • 创建集群
        • 重置管理员密码
        • 集群详情
  • 服务等级协议SLA
    • 服务等级协议(SLA)v1.0
  • 产品概述
    • 系统架构
    • 产品特点
    • 产品介绍
  • 视频专区
    • 操作指南
    • 产品简介
  • 产品定价
    • 预付费
    • 计费说明
    • 后付费
  • 文档中心
  • arrow
  • 数据仓库PALO
  • arrow
  • 开发指南
  • arrow
  • 数据查询
  • arrow
  • 子查询
本页目录
  • 子查询的分类
  • 按照子查询返回数据的特性分类
  • 按照子查询是否引用了外部查询的列分类
  • PALO 支持的子查询
  • 关联子查询的限制
  • 关联的标量子查询的限制
  • 关联的 (not) exists 子查询的限制
  • 关联的 (not) in 子查询的限制
  • 嵌套子查询的限制
  • Mark Join
  • 常见问题
  • 对于关联的标量子查询
  • 对于非关联的标量子查询

子查询

更新时间:2025-08-21

子查询(Subquery)是嵌套在另一个查询(通常是 SELECT 语句)中的 SQL 查询。它可以用在 SELECT、FROM、WHERE 或 HAVING 子句中,为外部查询提供数据或条件。子查询的使用使得 SQL 查询变得更加灵活和强大,因为它们允许我们在单个查询中解决更复杂的问题。

子查询的一些重要特征如下:

  1. 子查询的位置:子查询可以放在多个 SQL 子句中,如 SELECT、WHERE、HAVING 和 FROM 子句。它们可以与 SELECT、UPDATE、INSERT、DELETE 语句以及表达式运算符(如比较运算符 =、>、<、<=,以及 IN、EXISTS 等)一起使用。
  2. 主查询与子查询的关系:子查询是嵌套在另一个查询内部的查询。外部查询被称为主查询,而内部查询则被称为子查询。
  3. 执行顺序:当子查询是独立的(即不依赖于外部查询的结果)时,它通常首先执行。当存在相关性时,解析器会根据需要实时决定先执行哪个查询,并相应地使用子查询的输出。
  4. 括号的使用:子查询必须用括号括起来,以区分它们是嵌套在另一个查询中。

下面我们分别用 t1 和 t2 表以及相关 SQL,介绍子查询的基本特性和用法。建表语句如下:

SQL
1create table t1
2(
3    c1 bigint, 
4    c2 bigint
5)
6DISTRIBUTED BY HASH(c1) BUCKETS 3
7PROPERTIES ("replication_num" = "1");
8
9create table t2
10(
11    c1 bigint, 
12    c2 bigint
13)
14DISTRIBUTED BY HASH(c1) BUCKETS 3
15PROPERTIES ("replication_num" = "1");

子查询的分类

按照子查询返回数据的特性分类

按照子查询返回数据的特性,可分为标量和非标量子查询:

1. 标量子查询

子查询一定返回一个单一的值(本质上等价于一个一行一列的 Relation)。如果子查询没有任何数据返回,则返回 NULL 值。标量子查询理论上可以出现在任何允许单值表达式出现的地方。

2. 非标量子查询

子查询返回一个 Relation(不同于标量子查询的返回值,该 Relation 可包含多行多列)。如果子查询没有任何数据返回,则返回空集(0 行)。非标量子查询理论上可以出现在任何允许关系(集合)出现的地方。

以下分别对标量和非标量子查询举例说明(对于两个括号内的子查询,当 t2 是空表时,两个子查询返回结果不同)。

SQL
1-- 标量子查询,当 t2 是空表时,子查询返回标量值 null  
2select * from t1 where t1.c1 > (select sum(t2.c1) from t2);  
3  
4-- 非标量子查询,当 t2 是空表时,子查询返回 empty set (0 rows)  
5select * from t1 where t1.c1 in (select t2.c1 from t2);

按照子查询是否引用了外部查询的列分类

按照子查询是否引用了外部查询的列,可分为关联子查询和非关联子查询

1. 非关联子查询

子查询没有引用外部查询的任何列。非关联子查询常常可以独立运算,并一次性返回相应结果供外部查询使用。

2. 关联子查询

子查询引用了主查询(又称为外部查询)的一个或多个列(引用的外部列常常在子查询的 WHERE 条件中)。关联子查询常常可以看做是对外部关联的表的一个过滤操作,因为对于外部表的每一行数据,都会对子查询进行运算,并返回相应结果。

以下分别对关联和非关联子查询举例说明:

SQL
1-- 关联子查询,子查询内部使用了外部表的列 t1.c2  
2select * from t1 where t1.c1 in (select t2.c1 from t2 where t2.c2 = t1.c2);  
3  
4-- 非关联子查询,子查询内部没有使用任何外部表 t1 的列  
5select * from t1 where t1.c1 in (select t2.c1 from t2);

PALO 支持的子查询

PALO 支持所有的非关联子查询,对关联子查询(有部分限制)的支持如下:

  • 支持在 WHERE和 HAVING子句中的关联标量子查询。
  • 支持在 WHERE和 HAVING子句中的关联的 IN、NOT IN、EXISTS、NOT EXISTS 非标量子查询。
  • 支持在SELECT列表中的关联标量子查询。
  • 对于嵌套子查询,PALO 只支持子查询关联到自己的直接父查询,不支持跨层级关联到父查询的更外层查询。

关联子查询的限制

关联的标量子查询的限制

  • 关联条件必须是等值条件。
  • 子查询的输出必须是单个聚合函数的结果,且没有 group by 子句。

    SQL
    1-- 单个聚合函数,且无 group by,支持  
    2select * from t1 where t1.c1 < (select max(t2.c1) from t2 where t1.c2 = t2.c2);  
    3  
    4-- 等价改写的 SQL 如下:  
    5select t1.* from t1 inner join (select t2.c2 as c2, max(t2.c1) as c1 from t2 group by t2.c2) tx on t1.c1 < tx.c1 and t1.c2 = tx.c2;  
    6  
    7-- 非等值条件,不支持  
    8select * from t1 where t1.c1 = (select max(t2.c1) from t2 where t1.c2 > t2.c2);  
    9  
    10-- 没有聚合函数,不支持  
    11select * from t1 where t1.c1 = (select t2.c1 from t2 where t1.c2 = t2.c2);  
    12  
    13-- 有聚合函数,但包含 group by,不支持  
    14select * from t1 where t1.c1 = (select max(t2.c1) from t2 where t1.c2 = t2.c2 group by t2.c2);

关联的 (not) exists 子查询的限制

  • 子查询不能同时有offset和 limit。

    SQL
    1-- 带 limit 但无 offset,支持  
    2select * from t1 where exists (select t2.c1 from t2 where t1.c2 = t2.c2 limit 2);  
    3  
    4-- 等价改写 SQL 如下:  
    5select * from t1 left semi join t2 on t1.c2 = t2.c2;  
    6  
    7-- 带 offset 和 limit,不支持  
    8select * from t1 where exists (select t2.c1 from t2 where t1.c2 = t2.c2 limit 2, 3);

关联的 (not) in 子查询的限制

  • 子查询的输出必须是单个列。
  • 子查询不能带有limit。
  • 子查询不能带有聚合函数或group by子句。

    SQL
    1-- 支持的子查询  
    2select * from t1 where t1.c1 in (select t2.c1 from t2 where t1.c2 = t2.c2);  
    3  
    4-- 改写的等价 SQL 如下:  
    5select * from t1 left semi join t2 on t1.c1 = t2.c1 and t1.c2 = t2.c2;  
    6  
    7-- 子查询输出为多列,不支持  
    8select * from t1 where (t1.a, t1.c) in (select t2.c1, t2.c from t2 where t1.c2 = t2.c2);  
    9  
    10-- 子查询带 limit,不支持  
    11select * from t1 where t1.c1 in (select t2.c1 from t2 where t1.c2 = t2.c2 limit 3);  
    12  
    13-- 带有 group by 子句,不支持  
    14select * from t1 where t1.c1 in (select t2.c1 from t2 where t1.c2 = t2.c2 group by t2.c1);  
    15  
    16-- 带有聚合函数,不支持  
    17select * from t1 where t1.c1 in (select sum(t2.c1) from t2 where t1.c2 = t2.c2);

嵌套子查询的限制

目前只支持子查询关联到自己直接的父查询,不支持关联到父查询的更外层查询。

假设还有一个t3表,其建表语句如下:

SQL
1create table t3  
2(  
3    c1 bigint,   
4    c2 bigint  
5)  
6DISTRIBUTED BY HASH(c1) BUCKETS 3  
7PROPERTIES ("replication_num" = "1");
  • 可以支持当子查询只使用了自己直接父查询的列

    SQL
    1select   
    2    t1.c1   
    3from   
    4    t1   
    5where not exists (  
    6    select   
    7        t2.c1   
    8    from   
    9        t2   
    10    where not exists (  
    11        select   
    12            t3.c1   
    13        from   
    14            t3   
    15        where   
    16            t3.c2 = t2.c2  
    17    ) and t2.c2 = t1.c2  
    18);
  • 不支持当最内层的子查询使用了直接父查询的列t2.c2,并使用了最外层查询的列t1.c1。

    SQL
    1select   
    2    t1.c1   
    3from   
    4    t1   
    5where not exists (  
    6    select   
    7        t2.c1   
    8    from   
    9        t2   
    10    where not exists (  
    11        select   
    12            t3.c1   
    13        from   
    14            t3   
    15        where   
    16            t3.c2 = t2.c2 and t3.c1 = t1.c1  
    17    )  
    18);

Mark Join

在 where 条件中,一些由 (not) in 或 (not) exists 的子查询和其他过滤条件组成的 or 关系子句,需要特殊处理才能生成正常结果。举例如下:

SQL
1select 
2    t1.c1, 
3    t1.c2 
4from t1 
5where exists (
6    select 
7        t2.c1 
8    from t2 
9    where 
10        t1.c2 = t2.c2
11    ) or t1.c1 > 0;

这个 SQL 中的 exists 子句部分如果直接使用 left semi join,根据 left semi join 的语义,将会只输出 t1 中满足 t1.c2 = t2.c2 的行。然而,实际满足 t1.c1 > 0 这个条件的行也应该输出。为了达到这个目的,引入了 Mark Join 的机制。

备注: right semi join 类似,只是左右表不同。在这里,我们用 left semi join 作为示例。

示例 SQL 如下:

SQL
1-- 此 SQL 不能实际执行,只作为演示使用  
2select   
3    tx.c1,   
4    tx.c2   
5from   
6    (  
7        select   
8            t1.c1,   
9            t1.c2,   
10            mark_join_flag   
11        from   
12            t1 left (mark) semi join t2 on t1.c2 = t2.c2  
13    ) tx  
14where   
15    tx.mark_join_flag or tx.c1 > 0;

Mark Join 相较于普通的 left semi join,区别在于普通的 left semi join 会直接输出左表满足条件的行,而 Mark Join 则输出原始的左表加上一个值为 true、false或 null 的标志位列(示例中的 mark_join_flag 标志)。标志位的值通过 join 条件表达式 t1.c2 = t2.c2 决定,每一行都对应一个标志位值。标志位值的计算参见下表:

t1.c2 t2.c2 mark_join_flag
1 1 TRUE
1 2 FALSE
1 NULL NULL
NULL 1 NULL
NULL NULL NULL

有了这个标志位之后,where 过滤条件就可以改写为 where mark_join_flag or t1.c1 > 0,从而得到正确结果。

常见问题

由于标量子查询的输出必须是一个单值,如果子查询返回的数据量超过一条记录,将会报告运行时错误。

对于关联的标量子查询

在使用关联标量子查询时,如果满足关联条件的子查询返回的数据量超过一条记录,将会报告运行时错误。

请参考以下 SQL 示例:

SQL
1-- 关联的标量子查询,如果 t2 表中满足 t1.c2 = t2.c2 的数据多于 1 条,则会报运行时错误
2select t1.*, (select t2.c1 from t2 where t1.c2 = t2.c2) from t1;
3
4-- 报错信息样例如下 
5ERROR 1105 (HY000): errCode = 2, detailMessage = (127.0.0.1)[INVALID_ARGUMENT][E33] correlate scalar subquery must return only 1 row

对于非关联的标量子查询

PALO 会在运行时添加一个assert num rows算子,如果子查询返回的数据量超过一条记录,将会报告运行时错误。

请参考以下 SQL 示例:

SQL
1-- 非关联的标量子查询,如果 t2 表有多于 1 条的数据,则可能报运行时错误  
2select t1.*, (select t2.c1 from t2) from t1;  
3
4-- 报错信息样例如下  
5ERROR 1105 (HY000): errCode = 2, detailMessage = (127.0.0.1)[CANCELLED]Expected EQ 1 to be returned by expression

上一篇
连接(JOIN)
下一篇
复杂类型查询