本日主題:機房基礎環境 + 整週複習 預計時間:1.5 小時 對應主教材:第 3.6 節 + 第 3 章整合
一、今日學習目標
- [ ] 認識機房環境要素(UPS、溫濕度、監控)
- [ ] 複習本週重點並通過測驗
- [ ] 完成備份規劃練習
二、教材內容
2.1 機房環境要素
UPS(不斷電系統)
UPS(Uninterruptible Power Supply) 在市電中斷時提供緩衝電力,讓伺服器安全關機,避免硬碟與資料毀損。
電力供應架構圖:
市電 (台電)
│
▼
┌─────────┐
│ UPS │ ← 電池緩衝(5分鐘~30分鐘不等)
│ │ 市電正常時持續充電
└────┬─────┘
│
├─── 發電機啟動(大型機房)
│ 通常需要 30 秒~幾分鐘啟動
│
▼
┌─────────┐
│ PDU │ ← 電源分配單元(Power Distribution Unit)
│ │ 分配電力到各機架
└────┬─────┘
│
▼
伺服器、網路設備、儲存設備
UPS 的類型:
| 類型 | 說明 | 適用場景 |
|---|---|---|
| 離線式 (Offline/Standby) | 平時直接用市電,停電才切換到電池。切換有幾毫秒中斷 | 家用/小型辦公室 |
| 在線互動式 (Line-Interactive) | 有穩壓功能,切換更快 | 中小企業伺服器 |
| 在線式 (Online/Double Conversion) | 永遠從電池供電(市電→充電→電池→設備),零切換時間 | 企業機房、關鍵系統 |
面試加分:企業機房通常使用在線式 UPS + 柴油發電機的雙重保護。UPS 撐住停電後的前幾分鐘,發電機啟動後接手長時間供電。
溫濕度控制
- 伺服器運作時會產生大量熱能,機房要空調維持適當溫度。
- 建議溫度:18-27°C(ASHRAE 標準)
- 建議濕度:40-60%(太乾會靜電、太濕會凝結)
機房散熱架構(熱通道/冷通道):
冷通道 機架 熱通道 機架 冷通道
┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐
│ 冷氣 │ │ 伺服器 │ │ 熱氣 │ │ 伺服器 │ │ 冷氣 │
│ 吹出 │←─│ 前面吸冷│─►│ 從後 │←─│ 前面吸冷│─►│ 吹出 │
│ 冷氣 │ │ │ │ 面排出│ │ │ │ 冷氣 │
└────────┘ └────────┘ └────────┘ └────────┘ └────────┘
實體安全
- 門禁控制:刷卡、密碼、生物辨識(指紋/虹膜)
- 進出記錄:所有進出機房的人員要有紀錄(誰、何時、何事)
- 監視器(CCTV):7×24 錄影,保存至少 30 天
- 機架鎖:重要的機架上鎖,鑰匙由專人保管
這些都屬於實體資安,呼應第 1 週學的 CIA 三要素中的「可用性」和「機密性」。
監控系統
用監控軟體監控伺服器、網路、磁碟空間、服務狀態,主動發現問題比等使用者抱怨好。
| 軟體 | 類型 | 特色 |
|---|---|---|
| Zabbix | 開源 | 功能最完整的開源監控,支援 SNMP、Agent 等多種方式 |
| PRTG | 商業 | 簡單易用、100 個感應器免費 |
| Nagios | 開源 | 歷史最悠久的監控系統 |
| Prometheus + Grafana | 開源 | 現代化監控,圖表漂亮,適合容器/雲端環境 |
| LibreNMS | 開源 | SNMP 為主的網路設備監控 |
監控的關鍵指標:
| 監控項目 | 警告閾值 | 危急閾值 |
|---|---|---|
| CPU 使用率 | > 80% 持續 5 分鐘 | > 95% 持續 2 分鐘 |
| 記憶體使用率 | > 85% | > 95% |
| 磁碟使用率 | > 80% | > 90% |
| 網路丟包率 | > 1% | > 5% |
| 服務回應時間 | > 3 秒 | > 10 秒或無回應 |
2.2 為什麼這些重要?
航太 MRO 的系統「不能停」,所以從電力(UPS)、環境(空調)、到主動監控,都是為了確保高可用性,呼應第 1 週學的產業特性。
2.3 機房管理 SOP 與文件
一個好的 IT 部門,機房相關的 SOP 至少要有:
| SOP | 內容 |
|---|---|
| 機房進出管理辦法 | 誰有權進、如何申請、紀錄保存 |
| 設備上下架流程 | 新設備如何安裝、舊設備如何移除 |
| 停電應變 SOP | UPS 告警後的處理步驟、發電機啟動流程 |
| 空調異常處理 | 溫度超標的緊急處置 |
| 備份與還原 SOP | 備份排程、還原步驟、測試記錄 |
| 資安事件處理 | 發現入侵/勒索/異常的處理流程 |
2.4 常見誤解
| 誤解 | 正確觀念 |
|---|---|
| 機房有冷氣就夠了 | 需要精密空調(PAC),不是家用冷氣。還要監控溫度、設定告警 |
| UPS 可以撐很久 | 一般 UPS 只能撐 5-30 分鐘,目的是緩衝讓伺服器安全關機或等發電機啟動 |
| 伺服器放桌上就好 | 專業機房要有機架、理線、標籤、散熱規劃 |
| 監控裝了就好 | 監控要設定閾值、告警通知(Email/Line/Slack),還要有人值班看 |
三、本週重點總複習
心智圖
第 4 週總整理
│
├── Linux 基礎
│ ├── 檔案目錄:pwd, ls, cd, cp, mv, rm, mkdir
│ ├── 查看檔案:cat, less, head, tail -f, grep
│ ├── Pipe & Redirect:|, >, >>, 2>
│ ├── vi 編輯器:i/ESC/:wq/:q!
│ ├── 系統資源:top, df -h, free -h, ps aux, uptime
│ ├── 服務管理:systemctl start/stop/restart/enable/status
│ ├── 權限:chmod 755, chown, r=4/w=2/x=1
│ ├── 使用者:useradd, passwd, usermod, sudo
│ └── 排程:cron(分 時 日 月 星期 指令)
│
├── 虛擬化
│ ├── 概念:一台實體跑多 VM,Hypervisor
│ ├── Type 1(ESXi/Hyper-V)vs Type 2(VirtualBox)
│ ├── 好處:省成本、彈性、快建置、易備份、隔離
│ ├── VMware vs Hyper-V 比較
│ ├── 快照管理:72小時內合併、不超過3層、≠備份
│ └── 容器 vs VM:容器更輕量但共用核心
│
├── 備份
│ ├── 3-2-1 原則:3份/2媒體/1異地
│ ├── 備份類型:完整/增量/差異
│ ├── RPO 與 RTO
│ ├── 還原測試!(沒測過的備份等於沒有)
│ ├── 備份軟體:Veeam、Windows Server Backup、rsync
│ └── 保存年限(法規要求)
│
├── RAID
│ ├── RAID 0:快但無容錯
│ ├── RAID 1:鏡像、容量減半
│ ├── RAID 5:條帶+同位元、可壞1顆、(N-1)容量
│ ├── RAID 6:雙同位元、可壞2顆、(N-2)容量
│ ├── RAID 10:鏡像+條帶、高效能高容錯
│ ├── 容量公式與 Hot Spare
│ └── ⚠️ RAID ≠ 備份!!!
│
└── 機房環境
├── UPS:停電緩衝(離線/互動/在線式)
├── 溫濕度:18-27°C, 40-60%
├── 實體安全:門禁、CCTV、進出記錄
└── 監控:Zabbix/PRTG/Nagios,主動發現問題
Linux 指令速查表
# === 檔案與目錄 ===
pwd # 目前目錄
ls -la # 詳細列出含隱藏檔
cd /path # 切換目錄
mkdir -p a/b/c # 建立多層目錄
cp -r src dst # 複製目錄
mv old new # 移動/改名
rm -r dir # 刪除目錄
# === 查看檔案 ===
cat file # 印出全檔
less file # 分頁瀏覽
tail -f file # 即時跟看
tail -n 50 file # 最後 50 行
grep -i "keyword" file # 不分大小寫搜尋
grep -rn "keyword" /path # 遞迴搜尋含行號
# === 系統資源 ===
top / htop # 即時監控
df -h # 磁碟空間
free -h # 記憶體
du -sh /path # 目錄大小
ps aux | grep xxx # 找程序
uptime # 運行時間與負載
# === 服務管理 ===
systemctl status/start/stop/restart/enable svc
journalctl -u svc -f # 即時看服務日誌
# === 權限 ===
chmod 755 file # 改權限
chown user:group file # 改擁有者
# r=4, w=2, x=1 → 755=rwxr-xr-x, 644=rw-r--r--
# === 使用者 ===
sudo useradd -m -s /bin/bash user01
sudo passwd user01
sudo usermod -aG sudo user01
# === vi 編輯器 ===
# i=插入 ESC=命令 :wq=存檔離開 :q!=不存離開 dd=刪行 /key=搜尋
# === cron 排程 ===
crontab -e # 編輯
crontab -l # 查看
# 格式:分 時 日 月 星期 指令
四、自我測驗
Q1. 看即時 log、查磁碟空間、改權限為 755,分別什麼指令? Q2. 虛擬化三個好處? Q3. 完整解釋 3-2-1。 Q4. RAID 5 可壞幾顆?它能取代備份嗎? Q5. UPS 的作用? Q6. VMware 和 Hyper-V 各適合什麼環境? Q7. 5 顆 4TB 硬碟做 RAID 5,可用容量多少?做 RAID 6 呢? Q8. RPO 和 RTO 分別代表什麼? Q9. 寫出一個 cron 排程:每天凌晨 1 點執行 /opt/cleanup.sh。 Q10. 快照和備份有什麼不同?為什麼快照不能長期保留?
參考解答
**A1.** `tail -f 檔`、`df -h`、`chmod 755 檔`。 **解題說明**:這三個指令是 Linux 管理的日常基本功。`tail -f` 即時追蹤日誌是排錯第一步;`df -h` 用 human-readable 格式顯示磁碟使用狀況;`chmod 755` 設定擁有者可讀寫執行、群組和其他人可讀執行。 **A2.** 省成本、資源彈性、快速建置(易備份/隔離也可)。 **解題說明**:面試時建議加上實際數字:「一台實體伺服器 20-30 萬,如果虛擬化後跑 5-10 台 VM,等於省了 100-300 萬的硬體成本,加上電費和機房空間的節省。」 **A3.** 3 份資料、2 種媒體、1 份異地,外加定期還原測試。 **解題說明**:回答時要能展開每一個數字的意義,並在最後補充「還原測試」。很多面試者能講出 3-2-1,但能主動提到還原測試的加分很多。 **A4.** 可壞 1 顆;不能取代備份(只防硬碟故障)。 **解題說明**:RAID 5 透過同位元(Parity)機制,壞一顆硬碟時可以從其他硬碟計算出遺失的資料。但 RAID 無法防禦:誤刪(刪了就同步刪了)、勒索病毒(加密會同步)、火災(整機都毀)、RAID 控制器故障。所以 RAID 提升可用性,備份提供可恢復性,兩者目的不同、缺一不可。 **A5.** 停電時提供緩衝電力讓伺服器安全關機,避免資料毀損。 **解題說明**:UPS 不是用來長時間供電的(通常只有 5-30 分鐘),主要功能是: 1. 防止突然斷電導致硬碟寫入中斷(可能造成資料損壞或檔案系統損毀) 2. 給管理員時間執行安全關機程序 3. 在大型機房中,撐住等柴油發電機啟動的空檔(發電機需要 30 秒到幾分鐘才能啟動) 企業機房通常使用在線式(Online)UPS,市電通過 UPS 轉換再供電給設備,切換時零中斷。 **A6.** - **VMware**:功能最完整(vMotion、DRS、vSAN)、市場佔有率最高,適合大型企業、混合 OS 環境(同時有 Windows 和 Linux VM) - **Hyper-V**:與 Windows 整合度高、授權含在 Windows Server 中,適合以 Windows 為主的中小企業,不需額外授權費 **A7.** - RAID 5:(5-1) × 4TB = **16TB** - RAID 6:(5-2) × 4TB = **12TB** RAID 5 容量較大但只能壞 1 顆;RAID 6 容量較小但能壞 2 顆。4TB 以上的大容量硬碟,建議用 RAID 6,因為重建時間長、期間再壞一顆的風險較高。 **A8.** - **RPO(Recovery Point Objective)**:可接受的最大資料遺失量(時間)。例如 RPO = 1 小時表示最多丟 1 小時的資料,所以至少每小時要備份一次 - **RTO(Recovery Time Objective)**:災難發生後系統恢復正常的最大可接受時間。例如 RTO = 4 小時表示系統必須在 4 小時內恢復運作 **A9.** `0 1 * * * /opt/cleanup.sh` 分 = 0(整點)、時 = 1(凌晨 1 點)、日 = *、月 = *、星期 = *(每天)。建議加上日誌輸出:`0 1 * * * /opt/cleanup.sh >> /var/log/cleanup.log 2>&1` **A10.** - **快照**:保存 VM 在某個時間點的狀態,依賴原始磁碟。類似「遊戲存檔」,快速還原到特定時間點。快照使用差異磁碟(只記錄變動),不是獨立的副本。 - **備份**:完整複製資料到獨立的儲存裝置/位置。是獨立的資料副本,不依賴原始環境。 快照不能長期保留的原因: 1. 差異磁碟會持續增長,越來越大 2. I/O 要先寫差異磁碟再查原始磁碟,效能逐漸下降 3. 多層快照會形成快照鏈(Snapshot Chain),增加管理複雜度和故障風險 4. 建議 72 小時內合併或刪除五、本週結算檢核
- [ ] 自我測驗 10 題全對
- [ ] 完成 Linux 虛擬機與指令練習(Day 6)
- [ ] 完成一頁備份規劃(為「存維修紀錄的伺服器」設計 3-2-1)
- [ ] 完成 Linux 指令速查表
- [ ] 能自信地解釋 RAID ≠ 備份
備份規劃練習範例
為「TAMECO 維修紀錄伺服器」設計 3-2-1 備份策略:
系統:Windows Server 2022 + SQL Server(存放維修紀錄資料庫)
RAID:4 顆 2TB SAS 硬碟,RAID 5(可用 6TB)+ 1 顆 Hot Spare
備份策略:
┌──────────────────────────────────────────────┐
│ 3 份資料 │
│ ① 正本:伺服器本機 RAID 5 │
│ ② 備份 1:NAS(每日增量 + 每週完整) │
│ ③ 備份 2:雲端 Azure Backup(每日) │
│ │
│ 2 種媒體 │
│ ① 本地 NAS(磁碟陣列) │
│ ② 雲端儲存(Azure Blob Storage) │
│ │
│ 1 份異地 │
│ ① Azure 雲端(資料中心在新加坡/日本) │
└──────────────────────────────────────────────┘
排程:
- 每天 22:00:SQL 資料庫增量備份 → NAS + Azure
- 每週日 02:00:完整備份 → NAS + Azure
- 每月 1 日:完整備份 → Azure(長期保存)
保留期限:
- 每日備份:保留 14 天
- 每週備份:保留 8 週
- 每月備份:保留 24 個月
- 每年備份:保留 7 年(符合航太法規)
還原測試:
- 每季做一次完整還原演練(還原到測試環境)
- 記錄還原時間和結果
完成 → 第 4 週結束!下週進入採購、資產、預算與資安。
六、延伸閱讀
⬅️ 上一天:Day 6 | 🏠 本週總覽 | ➡️ 下一週:第 5 週 Day 1