
找不到表、没人认领、不敢动手改这套 DataHub 元数据平台十分钟跑通【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub你有没有过这种经历一张核心表到底是谁建的、口径是什么、下游谁在用全得靠群里人问一圈改个字段前不敢确认影响范围干脆不敢改。这类数据没人说得清的问题往往不是数据本身有问题而是缺一层统一的上下文。DataHub 元数据平台就是干这个的——它是一个开源的数据目录Data Catalog把你的表、仪表盘、任务、负责人、标签和血缘关系收进同一个地方让找数据、认责任、看影响变成一次搜索的事。DataHub 是干什么的一句话定位DataHub 是你整个数据栈的上下文平台核心能力有三块——发现跨 Snowflake、BigQuery、MySQL、Airflow 等平台的统一搜索和实体页面治理负责人ownership、标签tags、业务术语表glossary即把业务黑话变成可筛选的元数据、域名与数据产品划分血缘与影响分析画出数据从源头到消费端的流转路径改动前先看清波及面。整体架构大致长这样左侧各种数据源通过摄入管道把元数据送进来中间是存储与事件层Kafka 数据库 搜索引擎右侧对外提供 UI、REST 和 GraphQL API项目采用 Apache 2.0 协议Java 写服务端、Python 写摄入层、React 写前端各模块在仓库里都有独立目录想读源码可以按图索骥。十分钟跑通你的第一个实例部署前置条件很简单装好 Docker 和 Docker Compose v2Python 3.10给 Docker 至少 2 核 CPU、8GB 内存官方验证过的配置。先装上 CLIDataHub 的命令行工具后面所有操作都靠它python3 -m pip install --upgrade acryl-datahub datahub version然后一条命令拉起整套服务——它会自动下载 compose 文件、拉镜像、把 GMS元数据服务、前端、Kafka、MySQL、OpenSearch 全部跑起来datahub docker quickstart等终端提示 DataHub is now running浏览器打开 http://localhost:9002用默认账号datahub/datahub登录。想固定版本可加--version v1.6.0日常启停和清理用这几个命令就够datahub docker quickstart --stop # 停止 datahub docker nuke # 清空状态重来 datahub docker quickstart --backup # 备份数据⚠️ 提示升级跨大版本前先--backup避免老数据不兼容丢失。加载示例数据体验搜索和血缘空目录不好看官方准备了一个showcase-ecommerce数据包约 1000 实体覆盖 Snowflake、Looker、PowerBI、Tableau含血缘、术语表和负责人。两条命令就能灌进来datahub init --username datahub --password datahub datahub datapack load showcase-ecommerce这时候值得花十分钟在 UI 里玩一下全局搜索支持按平台、标签、负责人、业务术语等维度过滤不用翻文档就能把哪张表算 revenue这类问题查出来语法细节可以看 搜索文档实体页面每张表的 schema、负责人、描述、文档、标签都集中在一个页面这就是 DataHub 实体注册表的设计——数据集、仪表盘、用户、术语都是实体DataHub 数据血缘点开数据集的 Lineage 页签能看到上游任务、下游报表的完整链路做影响分析就是沿着这条链往上往下数。血缘功能的详细说明见 lineage 指南。接入 MySQL 只需改这几行体验完示例数据接下来接你自己的库。DataHub 的摄入ingestion靠一个 YAML 配方描述从哪读、往哪写MySQL 的核心配置就几行完整可运行版本见 mysql_recipe.ymlsource: type: mysql config: host_port: localhost:3306 database: dbname username: root password: examplesink 部分声明写入datahub-rest填上 GMS 地址和 token 即可。跑起来datahub ingest -c recipe.yml几个实用点加include_usage_statistics: true可以顺带从查询历史里解析出使用统计和查询级血缘数据源不止 MySQLingestion 目录下有几十种平台的配方文档改法几乎一样想在页面上直接配置摄入源不写 YAML可以看 UI 摄入文档。让治理真正落地而不只是挂标签目录灌满数据后价值靠治理动作兑现。DataHub 元数据治理常见的四件事动作解决的问题在哪做指派 owner表出问题有人接实体页面 Ownership打标签如 PII敏感数据可检索、可管控实体页面 Tags / 批量编辑建术语表GMV活跃用户口径统一左侧导航 Glossary划分域名/数据产品团队之间资产有边界左侧导航 Domains这些元数据本身也会走 Kafka 事件流所以可以配合 DataHub Actions事件驱动的动作框架做自动化比如有人给表打上 PII 标签后自动同步到别的系统示例配置在 docker/datahub-actions 下。新手最容易踩的几个坑把常见故障摊开说排查思路基本就这两类——服务没起来或数据没进来现象先查什么页面打不开docker ps看哪些容器没 healthydocker logs datahub-frontend看日志9002/8080 端口被占用DATAHUB_MAPPED_FRONTEND_PORT等环境变量改映射端口摄入报连不上目标库先在命令行验证库本身连通性再检查配方里 host_port 写法搜不到刚摄入的数据确认 sink 的 server 指向的是你这套实例而不是另一台更细的排查步骤在 quickstart 排障文档容器日志、端口、ES 状态都有对应命令。走向生产环境的几点建议部署方式quickstart 面向本地验证生产上推荐按 Kubernetes 部署文档 用 K8s 编排组件GMS、前端、Kafka、MySQL、OpenSearch可独立伸缩认证上线前务必改掉默认账号文档见 修改默认凭据 和 OIDC 单点登录指南调度摄入把摄入任务接进 Airflow 等调度系统做周期性同步Airflow 插件就在 metadata-ingestion-modules/airflow-plugin/数据质量可以叠加断言assertion规则校验数据新鲜度、空值等规格说明在 open-assertions-spec。想继续深挖入门与实例管理快速上手文档摄入全貌所有 source/sinkmetadata-ingestion README血缘功能细节lineage 指南从源码构建和二次开发克隆仓库 https://gitcode.com/GitHub_Trending/da/datahub 后用./gradlew build构建开发指南见 CONTRIBUTING从群里问人到一次搜索出结果中间隔的往往就是一个跑起来的目录。先把 quickstart 跑通、把自己的库接进去剩下的治理能力可以按需慢慢长出来。【免费下载链接】datahubThe Context Platform for your Data and AI Stack项目地址: https://gitcode.com/GitHub_Trending/da/datahub创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考