Openshift:在一個控制平面節點上重新啟動電源後,叢集無法運作

摘要: 一個控制平面節點未正常關機,開啟電源後,將進入「未就緒」狀態,並導致叢集無法運作。

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

直接電源週期一個控制平面節點,節點開機後,叢集無法復原。
UI 頁面將顯示錯誤或空白資訊,例如:
image.png

image.png

原因

不支援直接重新啟動一個控制平面節點的電源。這是一個災難恢復方案。
當控制平面節點未正常關閉時,容器存儲介面 (CSI) 驅動程式不會自動分離卷,這將導致 Pod 處於「容器正在創建」狀態。當控制平面節點在不正常關閉后啟動時,它將丟失任何 docker 映射本地緩存並嘗試從 depo 管理器中檢索,而控制平面節點重新啟動後 depo 管理器 pod 未處於“正在運行”狀態,因此控制平面節點將進入“未就緒”狀態並導致集群無法運行。

解析度

在非正常節點關機後,請遵循以下指示分離 CSI 磁碟區。

1.檢測到節點運行狀況不佳后,關閉工作線程節點。
2.執行下列命令,並檢查狀態為 NotReady,以確定節點已關閉
oc get node <node name>
重要:如果節點未完全關機,請勿繼續污染節點。如果節點仍在運行並應用了污點,則可能發生文件系統損壞。

3.執行下列命令,污染對應的節點物件:
oc adm taint node <node name> node.kubernetes.io/out-of-service=nodeshutdown:NoExecute
4.重新啟動節點。
5.執行下列命令以移除污點:
oc adm taint node <node name> node.kubernetes.io/out-of-service-

注意:在上述命令中, <節點名稱> = 非正常關閉節點的名稱

受影響的產品

APEX Cloud Platform for Red Hat OpenShift
文章屬性
文章編號: 000217678
文章類型: Solution
上次修改時間: 18 9月 2026
版本:  4
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。