🗺️ 資安考證地圖

RTO、RPO 與備份還原

系統停擺時,要多快修好、最多能丟掉多少資料,這兩個數字決定了你該怎麼備份、該準備哪一種備援站點。

RTO/RPO/MTD 怎麼分 增量與差異備份的還原份數 熱站、溫站、冷站的取捨

💡 先搞懂問題

公司開會討論「系統掛了怎麼辦」,最常聽到的答案是「越快恢復越好,資料一筆都不能丟」。這句話聽起來沒錯,卻完全無法執行。要做到幾分鐘內恢復,就得在異地養一整套隨時待命的設備;要做到資料完全不掉,就得即時同步到另一個地方。每把時間縮短一點,花費就往上跳一截。如果沒有明確的數字,資訊部門不知道該買什麼,主管也無法判斷錢花得值不值得。

所以營運持續規劃會先問兩個問題,並把答案寫成數字:服務中斷後,最晚要在多久內恢復?恢復的時候,最多可以接受遺失多久以前的資料?另外還有一條不能碰的底線:業務停多久就撐不下去了?

用一個比喻來想:趕截稿的報告

假設你在寫一份週五中午要交給客戶的報告,軟體設定每 30 分鐘自動存一次檔到雲端。某天下午筆電突然壞掉:

第一個問題是你會丟掉多少進度。上一次自動存檔在 14:00,筆電在 14:25 壞掉,這 25 分鐘寫的內容就沒了。最壞的情況是剛好在下一次存檔前一刻壞掉,會丟掉將近 30 分鐘的內容。你願意承受的上限,決定了存檔要多頻繁。

第二個問題是多久能繼續工作。借一台電腦、登入雲端、把檔案抓回來,大約要一小時。檔案回來後,你還得把遺失的那幾段重寫、確認格式沒跑掉,才算真正回到原本的進度。

第三個問題是底線在哪。週五中午一過,報告就沒有意義了。不管用什麼方法,檔案恢復加上補寫的時間都必須在截止時間之前完成。

回到資安,剛才的三個問題分別對應三個指標:

「最多能丟掉多少進度」是 RPO(Recovery Point Objective,復原點目標),它往過去看,決定備份或同步要多頻繁;「多久能讓電腦恢復可用」是 RTO(Recovery Time Objective,復原時間目標),它往未來看,決定需要多即時的備援;「截止時間」是 MTD(Maximum Tolerable Downtime,最大可容忍中斷時間,也寫作 MTPD),由營運衝擊分析(BIA)訂出。至於「檔案回來後補寫、檢查」的那段時間,叫做 WRT(Work Recovery Time,工作復原時間),RTO 加上 WRT 不能超過 MTD。

比喻容易誤解的地方:報告的自動存檔通常和正本在同一個帳號裡,誤刪也可能一起被同步掉,真正的備份必須能退回到過去某個時間點,並且至少有一份放在異地或離線。另外,企業系統的恢復不只是一個人換電腦,還牽涉相依的系統、人員與供應商,所以 RTO 要由業務單位參與訂定,不是資訊部門自己決定。

🎮 互動實驗室

兩個實驗室分別練習「數字怎麼看」與「備份怎麼還原」。所有時間、容量與成本都是教學用的示意數字,實務上要依各組織的 BIA 結果訂定。

1災難時間軸

事故發生點在正中央。左半邊往回看,比較「實際遺失的資料」和 RPO;右半邊往前看,比較「實際停機時間」和 RTO、MTD。左右兩邊的比例尺不同,方便同時看清楚短的與長的時間。你可以直接在圖上拖曳藍色的「上次備份」與綠色的「系統恢復」標記,也可以用下方滑桿。

選一種備援站點,看看系統恢復時間和成本怎麼變(恢復時間與成本皆為示意):

實際資料遺失 vs RPO
系統停機時間 vs RTO
停機+WRT vs MTD

2備份還原拼圖

某部門的檔案伺服器每晚 23:00 執行備份,週日晚上做完整備份。先選一種備份策略和硬碟故障的時間點,再依序點選你要拿來還原的備份(點的順序就是還原順序),最後按「檢查答案」。目標是還原到故障前最新的狀態。

備份策略
故障時間

三種策略的每日備份量與還原份數

示意假設:資料總量 100 GB,每天有 10 GB 不同的資料被修改。淡色的長條是故障之後才會做的備份。

📘 原理補完

三個時間指標的關係

營運衝擊分析(BIA,Business Impact Analysis)會先評估每個關鍵業務中斷後,營收損失、額外支出、信譽與法律責任怎麼隨時間擴大,找出業務撐不下去的時間點,這就是 MTD。接著才依 MTD 往回推出 RTO:系統必須在 RTO 內恢復,而且 RTO 加上 WRT 仍要落在 MTD 之內。如果 RTO 本身就比 MTD 還長,代表計畫從一開始就不合理,需要換更快的復原方式,或重新檢討業務流程。

RPO 則和時間長短無關,它問的是資料。備份或同步的間隔就是最壞情況下的資料遺失量,因為事故可能剛好發生在下一次備份的前一刻。所以備份間隔必須小於或等於 RPO。例如 RPO 是 4 小時,每 3 小時備份一次可以滿足,每 6 小時備份一次就會在運氣不好時超標,即使某一次事故剛好只掉了 1 小時的資料,也不代表設計是對的。

另一組常一起出現的指標是可用性百分比,計算方式是(約定服務時間減去停機時間)除以約定服務時間;MTRS(Mean Time to Restore Service)則是平均恢復服務所需的時間,屬於事後統計的實際表現,RTO 是事前訂的目標。

完整、增量、差異備份

三種方式的差別在於「跟誰比較」。完整備份不比較,每次都複製全部;增量備份跟上一次任何備份比,只存那之後的變動;差異備份永遠跟上一次完整備份比,所以會越存越多。這個基準的不同,直接決定了還原時需要幾份。

項目完整備份 Full增量備份 Incremental差異備份 Differential
比較基準不比較,全部複製上一次任何備份上一次完整備份
每次備份量最大最小隨天數累積變大,但大於或等於同期的增量
備份速度最慢最快介於兩者之間
還原需要最近一份完整備份最近完整備份,加上之後每一份增量,依時間順序套用最近完整備份,加上最新一份差異
還原速度最快最慢較快
主要風險耗時、佔空間,難以頻繁執行中間任何一份損毀,之後的都接不上越接近下一次完整備份,每份越大

傳統 Windows 備份軟體是用檔案的封存位元(archive bit)來判斷檔案有沒有變動:檔案被修改時位元會被設起來,完整備份與增量備份完成後會把它清掉,差異備份則不清。這就是為什麼差異備份每次都會把「上次完整備份之後」的所有變動再存一次。

還有一個計算時容易漏掉的細節:備份如果在晚上或凌晨執行,那一份記錄的是當天白天的變更。像實驗室 2 的情境,週四早上故障時,最新的一份是週三晚上的備份,週四凌晨到早上之間新增的資料仍然會遺失,這段遺失量就要拿去和 RPO 比較。

熱站、溫站、冷站

備援站點是主機房無法使用時接手的地方。它們的差別在於平時準備到什麼程度,準備得越完整,恢復越快,平時花的錢也越多。

站點平時準備恢復時間(示意)成本資料狀態
熱站 Hot Site專屬設備、系統完整鏡像分鐘到數小時最高通常即時或近即時同步,遺失最少
溫站 Warm Site有合適設備,需補齊設定與資料數小時到數天中等資料有時間差,復原後會遺失部分資料
冷站 Cold Site只有電力、空調、網路等基本設施數天到數週最低要把設備搬入並從備份還原

選站點看的是 RTO:RTO 只有一兩個小時的系統,通常只有熱站來得及;可以停好幾天的系統,用冷站較符合成本。此外還有鏡像站、設在車輛上的行動站點,以及和其他組織簽訂的互惠協定。不論哪一種,主站與備援站都不應位在同一個災害影響範圍,備援站的安全等級也要和正式環境相當,而且必須定期演練,才知道切換是否真的可行。

容易混淆的地方

RTO 與 RPO 不是同一件事的兩種說法。一個系統可以 RTO 很長、RPO 很短,例如每 15 分鐘就同步交易資料,但可以接受停機一天;也可以反過來。RTO 決定備援站點的等級,RPO 決定備份與同步的頻率。

即時同步與 RAID 不等於備份。熱站的即時同步、資料庫抄寫(Replication)與 RAID 都是為了不停機,但誤刪或被勒索軟體加密的資料也會被同步過去。能救回被破壞資料的,是保留過去時間點、並且至少一份離線或不可竄改的備份,這也是 3-2-1 原則(3 份資料、2 種媒體、1 份異地)要搭配離線副本的原因。

MTD 是「最大」可容忍中斷時間。它是 BIA 的產出,不是資訊部門估計修復要多久的數字。有了備份也不代表一定救得回來,備份必須定期做實際的還原測試。

✅ 自我檢測

以下是原創情境題,點選答案後會立即顯示對錯與解析。

🎯 重點整理