💡 先搞懂問題
公司開會討論「系統掛了怎麼辦」,最常聽到的答案是「越快恢復越好,資料一筆都不能丟」。這句話聽起來沒錯,卻完全無法執行。要做到幾分鐘內恢復,就得在異地養一整套隨時待命的設備;要做到資料完全不掉,就得即時同步到另一個地方。每把時間縮短一點,花費就往上跳一截。如果沒有明確的數字,資訊部門不知道該買什麼,主管也無法判斷錢花得值不值得。
所以營運持續規劃會先問兩個問題,並把答案寫成數字:服務中斷後,最晚要在多久內恢復?恢復的時候,最多可以接受遺失多久以前的資料?另外還有一條不能碰的底線:業務停多久就撐不下去了?
用一個比喻來想:趕截稿的報告
假設你在寫一份週五中午要交給客戶的報告,軟體設定每 30 分鐘自動存一次檔到雲端。某天下午筆電突然壞掉:
第一個問題是你會丟掉多少進度。上一次自動存檔在 14:00,筆電在 14:25 壞掉,這 25 分鐘寫的內容就沒了。最壞的情況是剛好在下一次存檔前一刻壞掉,會丟掉將近 30 分鐘的內容。你願意承受的上限,決定了存檔要多頻繁。
第二個問題是多久能繼續工作。借一台電腦、登入雲端、把檔案抓回來,大約要一小時。檔案回來後,你還得把遺失的那幾段重寫、確認格式沒跑掉,才算真正回到原本的進度。
第三個問題是底線在哪。週五中午一過,報告就沒有意義了。不管用什麼方法,檔案恢復加上補寫的時間都必須在截止時間之前完成。
回到資安,剛才的三個問題分別對應三個指標:
「最多能丟掉多少進度」是 RPO(Recovery Point Objective,復原點目標),它往過去看,決定備份或同步要多頻繁;「多久能讓電腦恢復可用」是 RTO(Recovery Time Objective,復原時間目標),它往未來看,決定需要多即時的備援;「截止時間」是 MTD(Maximum Tolerable Downtime,最大可容忍中斷時間,也寫作 MTPD),由營運衝擊分析(BIA)訂出。至於「檔案回來後補寫、檢查」的那段時間,叫做 WRT(Work Recovery Time,工作復原時間),RTO 加上 WRT 不能超過 MTD。
🎮 互動實驗室
兩個實驗室分別練習「數字怎麼看」與「備份怎麼還原」。所有時間、容量與成本都是教學用的示意數字,實務上要依各組織的 BIA 結果訂定。
1災難時間軸
事故發生點在正中央。左半邊往回看,比較「實際遺失的資料」和 RPO;右半邊往前看,比較「實際停機時間」和 RTO、MTD。左右兩邊的比例尺不同,方便同時看清楚短的與長的時間。你可以直接在圖上拖曳藍色的「上次備份」與綠色的「系統恢復」標記,也可以用下方滑桿。
選一種備援站點,看看系統恢復時間和成本怎麼變(恢復時間與成本皆為示意):
2備份還原拼圖
某部門的檔案伺服器每晚 23:00 執行備份,週日晚上做完整備份。先選一種備份策略和硬碟故障的時間點,再依序點選你要拿來還原的備份(點的順序就是還原順序),最後按「檢查答案」。目標是還原到故障前最新的狀態。
三種策略的每日備份量與還原份數
示意假設:資料總量 100 GB,每天有 10 GB 不同的資料被修改。淡色的長條是故障之後才會做的備份。
📘 原理補完
三個時間指標的關係
營運衝擊分析(BIA,Business Impact Analysis)會先評估每個關鍵業務中斷後,營收損失、額外支出、信譽與法律責任怎麼隨時間擴大,找出業務撐不下去的時間點,這就是 MTD。接著才依 MTD 往回推出 RTO:系統必須在 RTO 內恢復,而且 RTO 加上 WRT 仍要落在 MTD 之內。如果 RTO 本身就比 MTD 還長,代表計畫從一開始就不合理,需要換更快的復原方式,或重新檢討業務流程。
RPO 則和時間長短無關,它問的是資料。備份或同步的間隔就是最壞情況下的資料遺失量,因為事故可能剛好發生在下一次備份的前一刻。所以備份間隔必須小於或等於 RPO。例如 RPO 是 4 小時,每 3 小時備份一次可以滿足,每 6 小時備份一次就會在運氣不好時超標,即使某一次事故剛好只掉了 1 小時的資料,也不代表設計是對的。
另一組常一起出現的指標是可用性百分比,計算方式是(約定服務時間減去停機時間)除以約定服務時間;MTRS(Mean Time to Restore Service)則是平均恢復服務所需的時間,屬於事後統計的實際表現,RTO 是事前訂的目標。
完整、增量、差異備份
三種方式的差別在於「跟誰比較」。完整備份不比較,每次都複製全部;增量備份跟上一次任何備份比,只存那之後的變動;差異備份永遠跟上一次完整備份比,所以會越存越多。這個基準的不同,直接決定了還原時需要幾份。
| 項目 | 完整備份 Full | 增量備份 Incremental | 差異備份 Differential |
|---|---|---|---|
| 比較基準 | 不比較,全部複製 | 上一次任何備份 | 上一次完整備份 |
| 每次備份量 | 最大 | 最小 | 隨天數累積變大,但大於或等於同期的增量 |
| 備份速度 | 最慢 | 最快 | 介於兩者之間 |
| 還原需要 | 最近一份完整備份 | 最近完整備份,加上之後每一份增量,依時間順序套用 | 最近完整備份,加上最新一份差異 |
| 還原速度 | 最快 | 最慢 | 較快 |
| 主要風險 | 耗時、佔空間,難以頻繁執行 | 中間任何一份損毀,之後的都接不上 | 越接近下一次完整備份,每份越大 |
傳統 Windows 備份軟體是用檔案的封存位元(archive bit)來判斷檔案有沒有變動:檔案被修改時位元會被設起來,完整備份與增量備份完成後會把它清掉,差異備份則不清。這就是為什麼差異備份每次都會把「上次完整備份之後」的所有變動再存一次。
還有一個計算時容易漏掉的細節:備份如果在晚上或凌晨執行,那一份記錄的是當天白天的變更。像實驗室 2 的情境,週四早上故障時,最新的一份是週三晚上的備份,週四凌晨到早上之間新增的資料仍然會遺失,這段遺失量就要拿去和 RPO 比較。
熱站、溫站、冷站
備援站點是主機房無法使用時接手的地方。它們的差別在於平時準備到什麼程度,準備得越完整,恢復越快,平時花的錢也越多。
| 站點 | 平時準備 | 恢復時間(示意) | 成本 | 資料狀態 |
|---|---|---|---|---|
| 熱站 Hot Site | 專屬設備、系統完整鏡像 | 分鐘到數小時 | 最高 | 通常即時或近即時同步,遺失最少 |
| 溫站 Warm Site | 有合適設備,需補齊設定與資料 | 數小時到數天 | 中等 | 資料有時間差,復原後會遺失部分資料 |
| 冷站 Cold Site | 只有電力、空調、網路等基本設施 | 數天到數週 | 最低 | 要把設備搬入並從備份還原 |
選站點看的是 RTO:RTO 只有一兩個小時的系統,通常只有熱站來得及;可以停好幾天的系統,用冷站較符合成本。此外還有鏡像站、設在車輛上的行動站點,以及和其他組織簽訂的互惠協定。不論哪一種,主站與備援站都不應位在同一個災害影響範圍,備援站的安全等級也要和正式環境相當,而且必須定期演練,才知道切換是否真的可行。
容易混淆的地方
RTO 與 RPO 不是同一件事的兩種說法。一個系統可以 RTO 很長、RPO 很短,例如每 15 分鐘就同步交易資料,但可以接受停機一天;也可以反過來。RTO 決定備援站點的等級,RPO 決定備份與同步的頻率。
即時同步與 RAID 不等於備份。熱站的即時同步、資料庫抄寫(Replication)與 RAID 都是為了不停機,但誤刪或被勒索軟體加密的資料也會被同步過去。能救回被破壞資料的,是保留過去時間點、並且至少一份離線或不可竄改的備份,這也是 3-2-1 原則(3 份資料、2 種媒體、1 份異地)要搭配離線副本的原因。
MTD 是「最大」可容忍中斷時間。它是 BIA 的產出,不是資訊部門估計修復要多久的數字。有了備份也不代表一定救得回來,備份必須定期做實際的還原測試。
✅ 自我檢測
以下是原創情境題,點選答案後會立即顯示對錯與解析。
🎯 重點整理
- RPO 看資料:最多能遺失多久的資料,決定備份或同步頻率;備份間隔必須小於或等於 RPO。
- RTO 看時間:中斷後多久內要恢復服務,決定備援站點等級;RTO 越短成本越高。
- MTD 是底線:來自 BIA,RTO 必須小於 MTD,RTO 加上 WRT 也不能超過 MTD。
- 增量跟上一次任何備份比,備份最快、最省空間,還原要完整備份加之後每一份增量,依序套用,缺一份就接不上。
- 差異跟上一次完整備份比,檔案越來越大,還原只要完整備份加最新一份差異。
- 熱站最快最貴,冷站最慢最便宜,溫站居中;依 RTO 與預算選擇,並定期演練。
- 即時同步、抄寫與 RAID 不等於備份;要有離線或不可竄改的副本,並定期實際還原測試。