本日主題:機房基礎環境 + 整週複習 預計時間:1.5 小時 對應主教材:第 3.6 節 + 第 3 章整合


一、今日學習目標

  • [ ] 認識機房環境要素(UPS、溫濕度、監控)
  • [ ] 複習本週重點並通過測驗
  • [ ] 完成備份規劃練習

二、教材內容

2.1 機房環境要素

UPS(不斷電系統)

UPS(Uninterruptible Power Supply) 在市電中斷時提供緩衝電力,讓伺服器安全關機,避免硬碟與資料毀損。

電力供應架構圖:

市電 (台電)
     │
     ▼
┌─────────┐
│   UPS    │ ← 電池緩衝(5分鐘~30分鐘不等)
│          │    市電正常時持續充電
└────┬─────┘
     │
     ├─── 發電機啟動(大型機房)
     │    通常需要 30 秒~幾分鐘啟動
     │
     ▼
┌─────────┐
│  PDU     │ ← 電源分配單元(Power Distribution Unit)
│          │    分配電力到各機架
└────┬─────┘
     │
     ▼
  伺服器、網路設備、儲存設備

UPS 的類型:

類型 說明 適用場景
離線式 (Offline/Standby) 平時直接用市電,停電才切換到電池。切換有幾毫秒中斷 家用/小型辦公室
在線互動式 (Line-Interactive) 有穩壓功能,切換更快 中小企業伺服器
在線式 (Online/Double Conversion) 永遠從電池供電(市電→充電→電池→設備),零切換時間 企業機房、關鍵系統

面試加分:企業機房通常使用在線式 UPS + 柴油發電機的雙重保護。UPS 撐住停電後的前幾分鐘,發電機啟動後接手長時間供電。

溫濕度控制

  • 伺服器運作時會產生大量熱能,機房要空調維持適當溫度。
  • 建議溫度:18-27°C(ASHRAE 標準)
  • 建議濕度:40-60%(太乾會靜電、太濕會凝結)
機房散熱架構(熱通道/冷通道):

    冷通道        機架        熱通道        機架        冷通道
  ┌────────┐  ┌────────┐  ┌────────┐  ┌────────┐  ┌────────┐
  │  冷氣  │  │ 伺服器  │  │  熱氣  │  │ 伺服器  │  │  冷氣  │
  │  吹出  │←─│ 前面吸冷│─►│  從後  │←─│ 前面吸冷│─►│  吹出  │
  │  冷氣  │  │        │  │  面排出│  │        │  │  冷氣  │
  └────────┘  └────────┘  └────────┘  └────────┘  └────────┘

實體安全

  • 門禁控制:刷卡、密碼、生物辨識(指紋/虹膜)
  • 進出記錄:所有進出機房的人員要有紀錄(誰、何時、何事)
  • 監視器(CCTV):7×24 錄影,保存至少 30 天
  • 機架鎖:重要的機架上鎖,鑰匙由專人保管

這些都屬於實體資安,呼應第 1 週學的 CIA 三要素中的「可用性」和「機密性」。

監控系統

用監控軟體監控伺服器、網路、磁碟空間、服務狀態,主動發現問題比等使用者抱怨好。

軟體 類型 特色
Zabbix 開源 功能最完整的開源監控,支援 SNMP、Agent 等多種方式
PRTG 商業 簡單易用、100 個感應器免費
Nagios 開源 歷史最悠久的監控系統
Prometheus + Grafana 開源 現代化監控,圖表漂亮,適合容器/雲端環境
LibreNMS 開源 SNMP 為主的網路設備監控

監控的關鍵指標:

監控項目 警告閾值 危急閾值
CPU 使用率 > 80% 持續 5 分鐘 > 95% 持續 2 分鐘
記憶體使用率 > 85% > 95%
磁碟使用率 > 80% > 90%
網路丟包率 > 1% > 5%
服務回應時間 > 3 秒 > 10 秒或無回應

2.2 為什麼這些重要?

航太 MRO 的系統「不能停」,所以從電力(UPS)、環境(空調)、到主動監控,都是為了確保高可用性,呼應第 1 週學的產業特性。

2.3 機房管理 SOP 與文件

一個好的 IT 部門,機房相關的 SOP 至少要有:

SOP 內容
機房進出管理辦法 誰有權進、如何申請、紀錄保存
設備上下架流程 新設備如何安裝、舊設備如何移除
停電應變 SOP UPS 告警後的處理步驟、發電機啟動流程
空調異常處理 溫度超標的緊急處置
備份與還原 SOP 備份排程、還原步驟、測試記錄
資安事件處理 發現入侵/勒索/異常的處理流程

2.4 常見誤解

誤解 正確觀念
機房有冷氣就夠了 需要精密空調(PAC),不是家用冷氣。還要監控溫度、設定告警
UPS 可以撐很久 一般 UPS 只能撐 5-30 分鐘,目的是緩衝讓伺服器安全關機或等發電機啟動
伺服器放桌上就好 專業機房要有機架、理線、標籤、散熱規劃
監控裝了就好 監控要設定閾值、告警通知(Email/Line/Slack),還要有人值班看

三、本週重點總複習

心智圖

第 4 週總整理
│
├── Linux 基礎
│   ├── 檔案目錄:pwd, ls, cd, cp, mv, rm, mkdir
│   ├── 查看檔案:cat, less, head, tail -f, grep
│   ├── Pipe & Redirect:|, >, >>, 2>
│   ├── vi 編輯器:i/ESC/:wq/:q!
│   ├── 系統資源:top, df -h, free -h, ps aux, uptime
│   ├── 服務管理:systemctl start/stop/restart/enable/status
│   ├── 權限:chmod 755, chown, r=4/w=2/x=1
│   ├── 使用者:useradd, passwd, usermod, sudo
│   └── 排程:cron(分 時 日 月 星期 指令)
│
├── 虛擬化
│   ├── 概念:一台實體跑多 VM,Hypervisor
│   ├── Type 1(ESXi/Hyper-V)vs Type 2(VirtualBox)
│   ├── 好處:省成本、彈性、快建置、易備份、隔離
│   ├── VMware vs Hyper-V 比較
│   ├── 快照管理:72小時內合併、不超過3層、≠備份
│   └── 容器 vs VM:容器更輕量但共用核心
│
├── 備份
│   ├── 3-2-1 原則:3份/2媒體/1異地
│   ├── 備份類型:完整/增量/差異
│   ├── RPO 與 RTO
│   ├── 還原測試!(沒測過的備份等於沒有)
│   ├── 備份軟體:Veeam、Windows Server Backup、rsync
│   └── 保存年限(法規要求)
│
├── RAID
│   ├── RAID 0:快但無容錯
│   ├── RAID 1:鏡像、容量減半
│   ├── RAID 5:條帶+同位元、可壞1顆、(N-1)容量
│   ├── RAID 6:雙同位元、可壞2顆、(N-2)容量
│   ├── RAID 10:鏡像+條帶、高效能高容錯
│   ├── 容量公式與 Hot Spare
│   └── ⚠️ RAID ≠ 備份!!!
│
└── 機房環境
    ├── UPS:停電緩衝(離線/互動/在線式)
    ├── 溫濕度:18-27°C, 40-60%
    ├── 實體安全:門禁、CCTV、進出記錄
    └── 監控:Zabbix/PRTG/Nagios,主動發現問題

Linux 指令速查表

# === 檔案與目錄 ===
pwd                          # 目前目錄
ls -la                       # 詳細列出含隱藏檔
cd /path                     # 切換目錄
mkdir -p a/b/c               # 建立多層目錄
cp -r src dst                # 複製目錄
mv old new                   # 移動/改名
rm -r dir                    # 刪除目錄

# === 查看檔案 ===
cat file                     # 印出全檔
less file                    # 分頁瀏覽
tail -f file                 # 即時跟看
tail -n 50 file              # 最後 50 行
grep -i "keyword" file       # 不分大小寫搜尋
grep -rn "keyword" /path     # 遞迴搜尋含行號

# === 系統資源 ===
top / htop                   # 即時監控
df -h                        # 磁碟空間
free -h                      # 記憶體
du -sh /path                 # 目錄大小
ps aux | grep xxx            # 找程序
uptime                       # 運行時間與負載

# === 服務管理 ===
systemctl status/start/stop/restart/enable svc
journalctl -u svc -f         # 即時看服務日誌

# === 權限 ===
chmod 755 file               # 改權限
chown user:group file        # 改擁有者
# r=4, w=2, x=1 → 755=rwxr-xr-x, 644=rw-r--r--

# === 使用者 ===
sudo useradd -m -s /bin/bash user01
sudo passwd user01
sudo usermod -aG sudo user01

# === vi 編輯器 ===
# i=插入 ESC=命令 :wq=存檔離開 :q!=不存離開 dd=刪行 /key=搜尋

# === cron 排程 ===
crontab -e                   # 編輯
crontab -l                   # 查看
# 格式:分 時 日 月 星期 指令

四、自我測驗

Q1. 看即時 log、查磁碟空間、改權限為 755,分別什麼指令? Q2. 虛擬化三個好處? Q3. 完整解釋 3-2-1。 Q4. RAID 5 可壞幾顆?它能取代備份嗎? Q5. UPS 的作用? Q6. VMware 和 Hyper-V 各適合什麼環境? Q7. 5 顆 4TB 硬碟做 RAID 5,可用容量多少?做 RAID 6 呢? Q8. RPO 和 RTO 分別代表什麼? Q9. 寫出一個 cron 排程:每天凌晨 1 點執行 /opt/cleanup.sh。 Q10. 快照和備份有什麼不同?為什麼快照不能長期保留?

參考解答 **A1.** `tail -f 檔`、`df -h`、`chmod 755 檔`。 **解題說明**:這三個指令是 Linux 管理的日常基本功。`tail -f` 即時追蹤日誌是排錯第一步;`df -h` 用 human-readable 格式顯示磁碟使用狀況;`chmod 755` 設定擁有者可讀寫執行、群組和其他人可讀執行。 **A2.** 省成本、資源彈性、快速建置(易備份/隔離也可)。 **解題說明**:面試時建議加上實際數字:「一台實體伺服器 20-30 萬,如果虛擬化後跑 5-10 台 VM,等於省了 100-300 萬的硬體成本,加上電費和機房空間的節省。」 **A3.** 3 份資料、2 種媒體、1 份異地,外加定期還原測試。 **解題說明**:回答時要能展開每一個數字的意義,並在最後補充「還原測試」。很多面試者能講出 3-2-1,但能主動提到還原測試的加分很多。 **A4.** 可壞 1 顆;不能取代備份(只防硬碟故障)。 **解題說明**:RAID 5 透過同位元(Parity)機制,壞一顆硬碟時可以從其他硬碟計算出遺失的資料。但 RAID 無法防禦:誤刪(刪了就同步刪了)、勒索病毒(加密會同步)、火災(整機都毀)、RAID 控制器故障。所以 RAID 提升可用性,備份提供可恢復性,兩者目的不同、缺一不可。 **A5.** 停電時提供緩衝電力讓伺服器安全關機,避免資料毀損。 **解題說明**:UPS 不是用來長時間供電的(通常只有 5-30 分鐘),主要功能是: 1. 防止突然斷電導致硬碟寫入中斷(可能造成資料損壞或檔案系統損毀) 2. 給管理員時間執行安全關機程序 3. 在大型機房中,撐住等柴油發電機啟動的空檔(發電機需要 30 秒到幾分鐘才能啟動) 企業機房通常使用在線式(Online)UPS,市電通過 UPS 轉換再供電給設備,切換時零中斷。 **A6.** - **VMware**:功能最完整(vMotion、DRS、vSAN)、市場佔有率最高,適合大型企業、混合 OS 環境(同時有 Windows 和 Linux VM) - **Hyper-V**:與 Windows 整合度高、授權含在 Windows Server 中,適合以 Windows 為主的中小企業,不需額外授權費 **A7.** - RAID 5:(5-1) × 4TB = **16TB** - RAID 6:(5-2) × 4TB = **12TB** RAID 5 容量較大但只能壞 1 顆;RAID 6 容量較小但能壞 2 顆。4TB 以上的大容量硬碟,建議用 RAID 6,因為重建時間長、期間再壞一顆的風險較高。 **A8.** - **RPO(Recovery Point Objective)**:可接受的最大資料遺失量(時間)。例如 RPO = 1 小時表示最多丟 1 小時的資料,所以至少每小時要備份一次 - **RTO(Recovery Time Objective)**:災難發生後系統恢復正常的最大可接受時間。例如 RTO = 4 小時表示系統必須在 4 小時內恢復運作 **A9.** `0 1 * * * /opt/cleanup.sh` 分 = 0(整點)、時 = 1(凌晨 1 點)、日 = *、月 = *、星期 = *(每天)。建議加上日誌輸出:`0 1 * * * /opt/cleanup.sh >> /var/log/cleanup.log 2>&1` **A10.** - **快照**:保存 VM 在某個時間點的狀態,依賴原始磁碟。類似「遊戲存檔」,快速還原到特定時間點。快照使用差異磁碟(只記錄變動),不是獨立的副本。 - **備份**:完整複製資料到獨立的儲存裝置/位置。是獨立的資料副本,不依賴原始環境。 快照不能長期保留的原因: 1. 差異磁碟會持續增長,越來越大 2. I/O 要先寫差異磁碟再查原始磁碟,效能逐漸下降 3. 多層快照會形成快照鏈(Snapshot Chain),增加管理複雜度和故障風險 4. 建議 72 小時內合併或刪除

五、本週結算檢核

  • [ ] 自我測驗 10 題全對
  • [ ] 完成 Linux 虛擬機與指令練習(Day 6)
  • [ ] 完成一頁備份規劃(為「存維修紀錄的伺服器」設計 3-2-1)
  • [ ] 完成 Linux 指令速查表
  • [ ] 能自信地解釋 RAID ≠ 備份

備份規劃練習範例

為「TAMECO 維修紀錄伺服器」設計 3-2-1 備份策略:

系統:Windows Server 2022 + SQL Server(存放維修紀錄資料庫)
RAID:4 顆 2TB SAS 硬碟,RAID 5(可用 6TB)+ 1 顆 Hot Spare

備份策略:
┌──────────────────────────────────────────────┐
│ 3 份資料                                      │
│   ① 正本:伺服器本機 RAID 5                   │
│   ② 備份 1:NAS(每日增量 + 每週完整)         │
│   ③ 備份 2:雲端 Azure Backup(每日)          │
│                                                │
│ 2 種媒體                                      │
│   ① 本地 NAS(磁碟陣列)                      │
│   ② 雲端儲存(Azure Blob Storage)            │
│                                                │
│ 1 份異地                                      │
│   ① Azure 雲端(資料中心在新加坡/日本)        │
└──────────────────────────────────────────────┘

排程:
  - 每天 22:00:SQL 資料庫增量備份 → NAS + Azure
  - 每週日 02:00:完整備份 → NAS + Azure
  - 每月 1 日:完整備份 → Azure(長期保存)

保留期限:
  - 每日備份:保留 14 天
  - 每週備份:保留 8 週
  - 每月備份:保留 24 個月
  - 每年備份:保留 7 年(符合航太法規)

還原測試:
  - 每季做一次完整還原演練(還原到測試環境)
  - 記錄還原時間和結果

完成 → 第 4 週結束!下週進入採購、資產、預算與資安。


六、延伸閱讀


⬅️ 上一天:Day 6 | 🏠 本週總覽 | ➡️ 下一週:第 5 週 Day 1