Whale与Amundsen集成:打造更强大的数据发现平台
【免费下载链接】whale🐳 The stupidly simple CLI workspace for your data warehouse.项目地址: https://gitcode.com/gh_mirrors/wha/whale
Whale是一个简单易用的CLI工作区工具,专为数据仓库设计。通过与Amundsen集成,Whale能够充分利用Amundsen的元数据管理能力,为用户提供更强大的数据发现体验。这种集成不仅可以加速数据探索过程,还能让用户轻松访问已有的元数据和文档资源。
为什么选择Whale与Amundsen集成?
Amundsen作为一款优秀的数据发现平台,已经帮助许多组织建立了完善的元数据管理体系。而Whale则专注于提供简洁高效的CLI工作流,让数据从业者能够更快速地与数据仓库进行交互。将两者结合,可以充分发挥各自的优势:
- 快速入门:借助Amundsen已有的Neo4j实例,用户可以迅速搭建起数据发现环境
- 丰富的元数据:直接获取Amundsen中存储的所有文档和元数据信息
- 高效的CLI体验:通过Whale的命令行工具,快速检索和操作数据资产
集成准备工作
在开始集成之前,请确保您已经:
- 安装了Whale工具
- 拥有一个运行中的Amundsen Neo4j实例
- 具备适当的访问权限
如果您使用Kubernetes部署Amundsen,可以通过以下命令进行端口转发,以便Whale能够访问Neo4j实例:
k port-forward pod-name-@@@@@-@@@@@ 7474:7474 7687:7687配置连接信息
集成的核心步骤是在Whale中配置Amundsen Neo4j连接。这需要编辑您的connections.yaml文件,添加Neo4j连接信息。主要配置项包括:
- name:连接名称,用于在Whale中标识此连接
- host:Neo4j实例的主机地址和端口(如
localhost:7687) - username:Neo4j访问用户名(可选)
- password:Neo4j访问密码(可选)
- 包含/排除规则:通过正则表达式控制哪些数据资产被索引
配置示例:
- type: neo4j name: amundsen_neo4j host: localhost:7687 username: neo4j password: your_password excluded_key_regex: 'presto://hive.looker_l.*'上述配置将创建一个名为amundsen_neo4j的连接,并排除所有Looker PDT生成的临时表。
执行数据提取
配置完成后,只需运行以下命令即可从Amundsen Neo4j提取元数据:
mf etlWhale将连接到Neo4j数据库,根据您的配置提取并索引元数据。提取完成后,您就可以通过Whale的CLI工具快速搜索和访问这些数据资产了。
高级配置选项
Whale提供了多种高级配置选项,帮助您精确控制元数据的提取和索引过程:
- included_keys:指定仅包含的关键字列表
- excluded_keys:指定需要排除的关键字列表
- included_key_regex:使用正则表达式定义包含规则
- excluded_key_regex:使用正则表达式定义排除规则
这些选项特别适用于大型数据仓库环境,可以帮助您过滤掉不需要的临时表或测试数据,确保搜索结果的相关性和准确性。
总结
通过Whale与Amundsen的集成,您可以将强大的数据发现能力直接带入命令行环境,显著提升数据探索和分析的效率。无论是快速查找表结构、了解数据血缘关系,还是访问数据文档,这种集成都能为您提供简洁而强大的工具支持。
要了解更多关于集成配置的细节,请参阅官方文档:docs/connection-setup/amundsen-neo4j.md。
如果您是开发人员,想要深入了解集成实现,可以查看相关源代码:pipelines/whale/extractor/amundsen_neo4j_metadata_extractor.py。
现在就尝试将Whale与Amundsen集成,体验更高效的数据发现工作流吧! 🚀
【免费下载链接】whale🐳 The stupidly simple CLI workspace for your data warehouse.项目地址: https://gitcode.com/gh_mirrors/wha/whale
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考