电脑死机服务继续?集群原来用起来这么有安全感!——PVE集群初体验

Description
集群好好玩~

Comments

立白立白立 2024-04-23

第一天看图图:虚拟机跑unraid体验 看图图一个月:蜗牛星际组nas划算诶 现在:您的IDC机房已准备好上门安装

♥ 314 ↩ 9

芊芊老猫的日常 2024-04-23

[妙啊]秒啊,我觉得家里的设备又不够了

♥ 239 ↩ 17

221_202_158_xx 2024-04-24

千万不要组CEPH,不管是家用还是生产环境!!!!!! 3个月前我们刚刚把网关迁入CEPH 然后大半个月后,意外断电,ceph直接崩溃,不是只读! 在没有任何物理硬件损坏的时,却无法恢复数据 CEPH涉及到仲裁节点,如果你能保证仲裁节点100%在线当我没说 没事干别折腾ceph,数据不重要也别,不稳定性能也不强 血的教训,这东西也是块存储,不要尝试! 低于3台千万别尝试,这就是我们3月份可用性跌倒个位数的罪魁祸首 包括备份文件都无法导出了,哭死[笑哭]

♥ 184 ↩ 29

Runto 2024-04-23

家用不要组ceph,如果使用过程中断电,会有集群崩掉的风险,以前公司测试ceph的时候,有测试过,模拟极端情况下,直接断电集群有崩过

♥ 158 ↩ 17

郭家小助手 2024-04-23

再出个esxi集群,对比下两者优劣[呲牙]

♥ 98 ↩ 26

三敬闲人 2024-04-23

巧了,今天中午刚玩了下集群,发现了点问题,你的视频就来了。 说点pve集群添加事项吧。 1 各节点HOSTNAME不可重复冲突。 2 各节点hosts和hostname文件中的主机名和IP需要和最新信息统一,改过hostname和IP的容易历史遗留导致出错。 表现为hostname -i得到的IP为非最新IP和各种集群节点添加失败报错。 nano /etc/hosts nano /etc/hostname 3 分节点不能有已建虚拟机,需要空系统。 4 排除上面的可能还报错,SSH删除节点集群后重启再重试。 PVE删除集群 集群不需要了,在web管理页无法直接删除,这时用到以下步骤删除 1、节点上停止 pve-cluster 服务 systemctl stop pve-cluster.service systemctl stop corosync.service ———————————————— 2、将节点的集群文件系统设置为本地模式的命令 pmxcfs -l ———————————————— 3、删除 corosync 配置文件 rm /etc/pve/corosync.conf rm -rf /etc/corosync/* ———————————————— 4、将文件系统作为正常服务重新启动 killall pmxcfs systemctl start pve-cluster

♥ 70 ↩ 1

奇怪的摆摆鱼 2024-04-23

妙啊,买的 730xd,两个月了还没通电,请诸位引以为戒[doge]

♥ 69 ↩ 21

TOTORO625 2024-04-23

来早了,加入集群容易退出集群可就难了

♥ 66 ↩ 6

shugen 2024-04-23

05:03 balenaEther: 我改名叫 Rufus 好了

♥ 49 ↩ 2

WaleyHU 2024-04-23

看到集群我就来啦~

♥ 45 ↩ 14

灯塔_LightHouz 2024-04-24

科普一下03:56提到的“脑裂”: 在HA集群系统中,假设节点A和节点B通过心跳检测对方的存活状态。在正常情况下,如果节点A检测不到节点B,就会接管B的资源,同理B也可能接管A的资源。如果出现网络故障,就会导致A和B同时检测不到对方的存活状态,互相接管对方的资源,这样就导致了同一个资源被多个节点访问,这种情况就是脑裂。 脑裂导致的问题: 1)数据不完整性(同时读写共享资源,导致数据损坏)。 2)服务异常(共享资源被瓜分,服务起不来)。 如何解决脑裂: 1)添加冗余的心跳线,减少脑裂出现的机会。 2)启用磁盘锁,在发生脑裂的时候协助控制资源访问。 3)设置仲裁机制。 4)fence机制(当不确定某个节点的状态时,通过fence设备强行关闭该心跳节点,确保共享资源被释放)。 备注: 对于无状态服务的HA,无所谓脑裂不脑裂,但对有状态服务(比如MySQL)的HA,必须要严格防止脑裂。 ———————————————— 版权声明:本文为博主原创文章,遵循 CC 4.0 BY 版权协议,转载请附上原文出处链接和本声明。 原文链接:https://blog.csdn.net/troubleshooter/article/details/122340747

♥ 43 ↩ 6

大狮球bobo 2024-04-23

我做了集群加ceph,千万不要在caph容器里放sqlserver,会越来越慢越来越慢,最终拖累到系统不可用,mysql没有这个问题,我的ceph版本是18.2.2,该问题依然没有解决,目前我的方法是把虚拟机存储数据库的分区单独放在lvm分区,解决卡顿问题

♥ 43 ↩ 10

早安狮叔吃嘛呀ToBeFrank 2024-04-23

上周我 PVE 刚炸了,里面只有 TrueNAS(SMB 备份盘) 和 DSM(Docker 媒体盘),结果 PVE 找不到系统盘了。感觉是PVE 直通Nvme磁盘把系统盘给复写了。重装 WePE 检查Nvme 磁盘没有错误,系统结构也都在。重装 PVE 正常,挂载备份盘都在。就是 DMS 需要重新配置家庭影院,耽误 2 天,太难受了。除了数据备份,系统备份也很关键。

♥ 25 ↩ 8

谁予谬赞 2024-04-23

都集群化了,那下面存算分离?[doge]

♥ 25 ↩ 5

SaltWood_233 2024-04-23

fallen_breath?是我想的那只狐狸吗[doge]

♥ 20 ↩ 2

风铃_2 2024-08-06

身为PC厂商我们直接拿自己的笔记本搭建PVE节点,笔记本有一个好处,即使断电了还有电池可以支撑4个小时以上,只需要把交换机加上UPS即可,几千台拆掉屏幕的笔记本在机房中看起来也是非常滑稽[吃瓜] ,每个笔记本两个2TB nvme 存储节点 64GB内存,成本算下来比买服务器划算多了,都是产线上淘汰下来经过维修后的笔记本。

♥ 15 ↩ 5

平凡平庸平平凡庸 2024-04-23

[笑哭][笑哭][笑哭]也是刚接触集群,期间遇到一些坑,友情提醒下入坑的小伙伴,少走弯路。加入集群的节点机器要没有虚拟机的情况下加入否则会报错,无法正常加入集群。解决方法也简单,备份虚拟机后删除虚拟机,加入集群后再还原虚拟机即可(主节点无需这么操作)。 对于删除local-kvm空间的玩家,在升级pve版本后会出现集群内虚拟机无法正常启动。解决方法是删除集群及节点,删除后节点的虚拟机才能正常启动。想弄集群就再重新从最开始折腾的时候来一遍。

♥ 15

AI全文总结 2024-04-23

## 课代表总结 视频介绍了如何使用Proxmox VE(PVE)构建一个集群,以实现虚拟机服务的高可用性和故障切换。作者展示了在PVE集群中部署虚拟机,以及如何通过HA(高可用性)设置确保服务在主机故障时仍能继续运行。 ## 要点 - 📡 PVE集群功能:使用PVE创建集群,将多台物理主机的处理能力和存储聚合,提供超融合架构。 - 💻 硬件需求:至少三台物理主机,每台至少两块硬盘(一块安装系统,另一块作为分布式存储)。 - 🌐 网络配置:使用单一交换机连接所有节点,每个节点单网卡连接,建议增加冗余交换机和网线。 - 💾 安装PVE:下载ISO,用RUFUS写入,安装到系统盘,注意时区、主机名和IP设置。 - 🔧 换源与更新:通过web界面更改软件源,增加非订阅源,更新到最新状态。 - 🔄 集群设置:在任意节点的web界面创建集群,添加节点信息,同步时间。 - 💻 虚拟机迁移:在节点间迁移虚拟机,但不挂载光盘,否则无法迁移。 - 🏗️ 安装Ceph(cf):提高存储效率和冗余,安装并配置Ceph存储系统。 - 🛡️ 高可用性(HA):创建HA群组,将节点和虚拟机加入,实现故障恢复。 - 📁 文件系统:讨论如何高效地访问Ceph存储池,不同的挂载和管理方式的性能比较。 - 💭 思考与提问:探讨用户访问Ceph的最优方式,分布式存储系统的其他应用。 - 💬 未来计划:作者计划分享更多分布式存储的使用方案和优化策略。 AI观点:视频内容详细且实用,有助于对PVE集群有兴趣的用户学习和实践。随着技术的不断发展,分布式存储在高可用性和数据保护上具有很大潜力,对于内容创作者和企业来说,保持关注和尝试新技术是非常有价值的。 --本消息由@AI视频总结 召唤成功

♥ 13

banbu1118 2024-04-23

https://banbu1118.github.io/posts/ops/pve-ceph%E8%B6%85%E8%9E%8D%E5%90%88%E6%90%AD%E5%BB%BA/pve-ceph%E8%B6%85%E8%9E%8D%E5%90%88%E7%8E%AF%E5%A2%83%E9%83%A8%E7%BD%B2/这是我写的pve超融合教程,感兴趣的可以参考一下

♥ 12 ↩ 1

五彩斑斓的淡灰 2024-04-23

[doge]现在是高可用下一步是不是本地云了

♥ 11 ↩ 1