Amazon Athena

Looker 支持连接到 Amazon Athena,这是一种交互式查询服务,可让您使用标准 SQL 分析 Amazon S3 中的数据。Amazon Athena 是无服务器服务,因此您无需管理基础设施。您只需为运行的查询付费。

加密网络流量

对 Looker 应用与数据库之间的网络流量进行加密是一种最佳实践。可以考虑启用安全的数据库访问文档页面上介绍的某个选项。

配置 Amazon Athena 连接

本页介绍了如何将 Looker 连接到 Amazon Athena 实例。

  1. 确保您具有以下各项:

    • 一对 Amazon AWS 访问密钥。
    • 包含您想要在 Looker 中使用 Amazon Athena 查询的数据的 S3 存储桶。Amazon AWS 访问密钥必须具有对此存储桶的读写权限。

      Amazon Athena 必须通过角色或权限集以及防火墙规则访问此 S3 存储桶。请勿为 Looker IP 向 S3 存储桶添加安全规则,因为这可能会无意中阻止 Amazon Athena 访问 S3 存储桶。(对于 Amazon Athena 以外的其他方言,用户可能希望使用 IP 许可名单限制从网络层对数据的访问,如启用安全的数据库访问文档页面中所述。)

    • 了解 Amazon Athena 实例数据的位置。您可以在 Amazon 控制台的右上角找到区域名称。

  2. 在 Looker 的 Admin (管理)部分中,选择 Connections (连接),然后点击 Add Connection (添加连接)。

  3. 填写连接详情:

    • Name(名称):指定连接的名称。您将在 LookML 项目中以此名称引用连接。
    • Dialect(方言):选择 Amazon Athena
    • Host(主机)和 Port(端口):按照 Athena 文档中有关 JDBC 网址格式的说明,指定主机和端口的名称。主机应为有效的 Amazon 端点(例如 athena.eu-west-1.amazonaws.com),端口应保持为 443。如需查看支持 Athena 的最新端点列表,请访问此 AWS 一般参考 页面。
    • Database(数据库):指定您要建模的默认数据库。您可以访问其他数据库,但 Looker 会将此数据库视为默认数据库。
    • Username(用户名):指定 AWS 访问密钥 ID。
    • Password(密码):指定 AWS 私有访问密钥。
    • 启用 PDT:使用此开关启用永久性派生表 (PDT)。启用 PDT 后,系统会显示其他 PDT 字段以及连接的 PDT Overrides (PDT 覆盖)部分。
    • Temp Database(临时数据库):指定 S3 存储桶中您希望 Looker 将 PDT 写入其中的输出目录的名称。您必须在 Additional JDBC parameters(其他 JDBC 参数)字段中指定输出目录的完整路径;请参阅本页面的 指定 S3 存储桶以输出查询结果和 PDT 部分。
    • Max number of PDT builder connections(PDT 构建器连接数上限):指定此连接上可能同时进行的 PDT 构建数。将此值设置得过高可能会对查询时间产生负面影响。如需了解详情,请参阅将 Looker 连接到数据库文档页面。
    • Additional JDBC parameters(其他 JDBC 参数):指定连接的其他参数:
      • s3_staging_dir 参数是 Looker 应用于输出查询结果和 PDT 的 S3 存储桶;请参阅本页面的 指定 S3 存储桶以输出查询结果和 PDT 部分。
      • 用于流式传输结果的标志。如果您已将 athena:GetQueryResultsStream 政策 附加到 Athena 用户,则可以在其他 JDBC 参数的末尾添加 ;UseResultsetStreaming=1,以显著提升提取大型结果集的性能。此参数默认设置为 0
      • 要添加到 JDBC 连接字符串的可选其他参数。如需查看 Looker 支持的参数列表,请参阅本页面的支持的 JDBC 参数部分。
    • SSL:忽略;默认情况下,与 AWS API 的所有连接都将加密。
    • Max connections per node(每个节点的最大连接数):默认情况下,此值设置为 5。如果 Looker 是针对 Athena 运行的主要查询引擎,您可以将此值增加到 20。如需详细了解服务限制,请参阅 Athena 服务限制文档。如需了解详情,请参阅将 Looker 连接到数据库文档页面。
    • Connection Pool Timeout(连接池超时时间):指定连接池超时时间。默认情况下,超时时间设置为 120 秒。如需了解详情,请参阅将 Looker 连接到数据库文档页面。
    • SQL Runner Precache(SQL Runner 预缓存):如果您希望 SQL Runner 仅在选择表时加载表信息,请取消选择此选项。如需了解详情,请参阅将 Looker 连接到数据库文档页面。
    • Database Time Zone(数据库时区):指定数据库中使用的时区。如果您不想进行时区转换,请将此字段留空。如需了解详情,请参阅使用时区设置文档页面。

如需验证连接是否成功,请点击 Test (测试)。如需了解问题排查信息,请参阅测试数据库连接文档页面。

如需保存这些设置,请点击 Connect (连接)。

指定 S3 存储桶以输出查询结果和 PDT

使用 Additional JDBC parameters (其他 JDBC 参数)字段配置 Looker 将用于存储查询结果输出的 S3 存储桶的路径,并指定 S3 存储桶中您希望 Looker 将 PDT 写入其中的输出目录的名称。使用 s3_staging_dir 参数指定此信息。

s3_staging_dir JDBC 参数是配置 Amazon Athena S3OutputLocation 属性的另一种方法,该属性是 Athena JDBC 连接所必需的。如需了解详情并查看所有可用 JDBC 驱动程序选项的列表,请参阅 Athena 文档中的 JDBC 驱动程序选项

Additional JDBC parameters (其他 JDBC 参数)字段中,使用以下格式指定 s3_staging_dir 参数:

`s3_staging_dir=s3://<s3-bucket>/<output-path>`

其中:

  • <s3-bucket> 是 S3 存储桶的名称。
  • <output-path> 是 Looker 将在其中写入查询结果输出的路径。

AWS 访问密钥对必须具有对 <s3-bucket> 目录的写入权限。

如需配置 Looker 将在其中写入 PDT 的目录,请在 Temp Database (临时数据库)字段中输入 S3 存储桶中目录的路径。 例如,如果您希望 Looker 将 PDT 写入 s3://<s3-bucket>/looker_scratch,请在 Temp Database 字段中输入以下内容:

`looker_scratch`

仅输入 目录的路径。Looker 会从您在 Additional JDBC Parameters (其他 JDBC 参数)字段中输入的 s3_staging_dir 参数获取 S3 存储桶名称。

S3 存储桶注意事项

建议您配置 Amazon S3 对象生命周期,以定期清理指定 S3 存储桶中不需要的文件。原因如下:

  • Athena 会将每个查询的查询结果存储在 S3 存储桶中。请参阅 Athena 查询
  • 如果您启用了 PDT,则在构建 PDT 时,系统会将有关所创建表的元数据存储在 S3 存储桶中。

资源

支持的 JDBC 参数

对于 Amazon Athena,Looker 支持在连接的 Additional JDBC parameters (其他 JDBC 参数)字段中使用以下 JDBC 参数。如需了解这些参数,请参阅数据库的相关文档。

  • ApplicationName
  • AwsCredentialsProviderArguments
  • AwsCredentialsProviderClass
  • AwsRegion
  • Catalog
  • Database
  • EnableResultReuseByAge
  • EndPointOverride
  • LogLevel
  • MaxQueryExecutionPollingInterval
  • maxResultReuseAgeInMinutes
  • MetadataRetrievalMethod
  • MinQueryExecutionPollingInterval
  • OutputLocation
  • password
  • ProxyHost
  • ProxyPort
  • ProxyPWD
  • ProxyUID
  • QueryExecutionPollingIntervalMultiplier
  • Region
  • ResultFetcher
  • ResultReuseByAgeConfiguration
  • s3_staging_dir
  • S3OutputEncOption
  • S3OutputLocation
  • Schema
  • user
  • UseResultsetStreaming
  • WorkGroup

功能支持

如需让 Looker 支持某些功能,您的数据库方言也必须支持这些功能。

截至 Looker 26.12,Amazon Athena 支持以下功能:

功能 是否支持?
Looker (Google Cloud Core)
对称聚合
派生表
基于 SQL 的永久性派生表
原生永久性派生表
稳定视图
终止查询
基于 SQL 的数据透视
时区
SSL
小计
其他 JDBC 参数
区分大小写
位置类型
名单类型
百分位
不同值百分位
SQL Runner “Show Processes”
SQL Runner “Describe Table”
SQL Runner “Show Indexes”
SQL Runner “Select 10”
SQL Runner “Count”
SQL “Explain”
OAuth 2.0 凭证
上下文注释
连接池
HLL 草图
汇总感知
增量 PDT
毫秒
微秒
具体化视图
与前一时间段相比的指标
近似计数不同
数据库内分析模型
自定义日历

后续步骤

完成数据库连接后,请配置身份验证选项