
文章目录Ceph 集群部署交付文档(离线内网 · Docker · 供 K8s RBD 使用)目录0. 先看这一页:三个必须知道的前提⚠️ 前提一:无独立裸盘 → 这是"功能可用"而非"生产就绪"⚠️ 前提二:完全离线 → 镜像必须"外地带入",且要关掉 digest 转换⚠️ 前提三:Tentacle 20.2.4 的新密钥类型 vs Rocky 9.5 的老内核1. Ceph 基础知识1.1 Ceph 是什么1.2 核心组件1.3 数据是怎么存的(CRUSH 与 PG)1.4 什么是 cephadm2. 本次集群设计3. 阶段一:三节点系统准备3.1 主机名与 hosts 解析3.2 时间同步(硬性要求)3.3 防火墙与 SELinux3.4 Docker 配置(本节最关键)3.5 免密 SSH(root)3.6 跑预检脚本4. 阶段二:离线镜像与 cephadm 二进制准备4.1 需要准备的镜像4.2 在联网机器上拉取并打包4.3 导入三台目标机5. 阶段三:bootstrap 引导集群5.1 引导5.2 bootstrap 后必须立刻做的配置(离线关键)5.3 验证第一个 MON / MGR6. 阶段四:扩容到三节点 + MON/MGR 高可用6.1 分发集群 SSH 公钥并添加节点6.2 部署 MON / MGR / crash7. 阶段五:创建 OSD(loop 设备方案)7.1 为什么这样设计,以及它的代价7.2 在三台机器上创建 loop 设备7.3 让 Ceph 接管 loop 设备7.4 日后加了真盘如何迁移8. 阶段六:创建 RBD 池与 CephX 用户采集 K8s 对接需要的两个信息9. 阶段七:K8s 对接(ceph-csi RBD)9.1 前置:所有 K8s 节点加载 nbd 模块9.2 导入 ceph-csi 镜像到所有 K8s 节点9.3 创建 ConfigMap 与 Secret9.4 部署 ceph-csi 驱动9.5 创建 StorageClass9.6 端到端验证10. 验收清单11. 日常运维与开关机顺序11.1 常用命令11.2 集群停机顺序(**顺序错了会触发不必要的数据迁移**)11.3 容量监控(单盘环境尤其重要)11.4 版本升级(同样需要离线带镜像)12. 排障速查附录 A:文件清单部署顺序速记版本与来源Ceph 集群部署交付文档(离线内网 · Docker · 供 K8s RBD 使用)目标环境项值节点hanyw200172.16.15.200、hanyw201172.16.15.201、hanyw202172.16.15.202系统Rocky Linux 9.5 (Blue Onyx)容器运行时Docker Engine 29.7.2(不装 Podman,cephadm 全程--docker)网络完全内网离线,无外网、无代理磁盘只有系统盘,无独立裸盘(→ 用 loop 设备模拟 OSD)用途为 K8s 提供R