香港流量型服務器RAID10故障通知

  • 星期日, 8 日 十一月, 2020
  • 17:36下午

尊貴的客戶您好:

 

香港流量型HKAX02節點發生故障,我們正在對這一緊急事件進行處理。相關問題工單、咨詢由於過多,回復時間可能會延長。我們會盡力去搶救數據恢復,請耐心等待我們處理。有關處理結果如下,在完成處理之前我們會實時更新動態:

 

11月06號22:00:接系統監控程序通知RAID10故障1個盤,鑒於RAID10的冗餘能力及機房現場已下班放假,我們計劃于週一進行更換。

11月07號02:00:接系統監控程序通知HKAX02節點下線,技術通過遠程檢查確認RAID10已故障2個盤,且處於同一個Span(每個Span 2個盤),RAID10的0壞了导致列陣失效。

11月07號14:00:因SSD備用件在11.02號用完,還未補充採購,緊急由灣仔採購快送至機房。

11月07號22:00:因機房現場未上班,僱傭了外援前往機房調試;測試常規方式上線SSD失敗,我們初步判斷SSD顆粒寫完壽命屬於硬件故障,我們無法恢復SSD上線。

11月08號:我們聯絡了持有全球頂尖數據恢復設備生產商ACELab 發出的 Flash NAND (記憶卡) 及 Raid 陣列數據恢復技術認證的公司,但星期日該公司未營業,我們會在9號週一把硬盤送去檢修確認是否可提取數據恢復。

11月09號:現場技術進行了最後的嘗試依然無法上線SSD,我們包裝好硬盤後送到了數據恢復公司做檢查。

11月10:收數據恢復公司通知,可能最遲在本週日通知我們數據是否可恢復。如果您有VPS服務器備份數據、亦或者不需要數據,可與客服聯絡直接開通新的VPS在其他節點,不必繼續等待維修。

11月11:目前已經開工在嘗試維修SSD硬件恢復RAID10數據,預計在本週內通知我們是否能成功提取。

11月14:數據恢復公司檢查確認可恢復,預計在下週一完成,若數據正常,我們會在週二啟動節點。

11月17號14:00:已安排人員前往數據恢復公司確認數據恢復情況、取盤,若正常預計在17:00取回到機房安裝調試預計在18:00左右啟動節點。

11月17號17:30:系統已啟動,該VPS節點內故障SSD及和故障SSD同品牌的盤都已替換為Samsung,未來新節點我們會採用Intel DC系列,其他節點和故障盤同品牌的SSD也會在今年內使用Intel DC系列SSD無感知完成替換,後續工作很快公佈。

 

11月17號19:30:感謝故障維修期間客戶的理解,我們十分榮幸能為您提供產品、服務!同時我們非常抱歉此事件給您帶來的損失,我們會給出所能承受的補償方案;但由於維修費用高昂加上利潤限制,我司的補償方案可能無法令您非常滿意,希望可以得到諒解。如下:

**已放棄數據開通同款配置VPS在其他節點的客戶:

1、替換VPS開通日期在07-11號,替換VPS到期日期統一順延10天;

2、替換VPS開通日期在12-16號,替換VPS到期日期統一順延20天;

3、故障Node VPS到期日期統一順延至11月25日,以供登入提取數據。

**未放棄數據等待維修的客戶:到期日期統一順延一個月。

RAID10雖然相對有非常高的冗餘,但仍然無法預防同時故障多個硬盤導致列陣數據丟失的問題,而電子元器件均有一定概率發送故障。即便是Ceph等分佈式存儲,也無法應對同時硬盤故障數量大於冗餘的情況,雖然其故障概率大大降低,但基於分佈式存儲的阿里雲、騰訊雲亦曾發生過數據丟失無法恢復事件。限於價格、利潤,目前我們無能力、計劃在RAID5/6/10的基礎上提供免費的異地備份,我們的補償亦可能無法彌補您數據丟失的損失,我們並沒有、也不會承諾對硬件的故障承擔責任。希望您可以理解並自行對數據安全負責、重視重要數據、定期進行異地備份,避免在此類事件上受到較大影響、損失,我們亦無法保證每一次的硬盤故障均可以像本次一樣維修成功、或提取數據。

11月21號03:00:更新RAID列陣卡固件版本至最新版本,以提高RAID列陣卡可靠性。升級過程會重啟宿主服務器中斷服務,預計在30分鐘內啟動恢復。

 

 

野草雲
LucidaCloud Limited
2020年11月08日

« 返回