
專案設計目的:Cyber Exercise Service and Resource Health Monitor 旨在作為一套整合的監控與可觀測性工具集,以支援中等規模的網路演習和網路攻防演練活動。它旨在提供即時視覺化軟體,用於展示演習生命週期中資源(包括硬體、虛擬機器 (VMs)、容器、應用程式和軟體服務)的可用性、狀態和效能。
該系統旨在支援不同演習發起和參與團隊的一系列操作場景,特別是在網路安全訓練和模擬環境中:
-
演習資源監控:追蹤網路演習期間使用的節點和服務的健康狀況和可用性,確保環境保持穩定和功能正常。
-
攻擊偵測與影響感知:識別關鍵服務(例如 NTP servers)中的異常行為或中斷,這可能表明正在進行或已完成的潛在網路攻擊。
-
即時視覺化:在網路安全演練期間觀察節點和服務狀態的動態變化,使參與者和組織者能夠了解不斷演變的局勢。
此外,該系統整合了自動化機制,用於偵測和記錄攻擊活動以及相應的防禦行動,從而實現精確的事件追蹤和數位鑑識分析。
# Author: Yuancheng Liu
# Created: 2026/03/20
# Version: v_0.0.3
# Copyright: Copyright (c) 2026 LiuYuancheng
# License: MIT License
1. 簡介
該系統旨在持續評估節點、虛擬機器 (VMs)、服務和應用程式的執行狀態/進度,並根據使用者定義的要求或預設的評分模型生成健康評估分數。
1.1 摘要與概述
目前有許多軟體可以監控系統或叢集中不同服務的健康狀態,但專注於提供網路演習/演練可用性和操作狀態的即時可見性的軟體並不多。Cyber Exercise Service and Resource Health Monitor System 的關鍵設計目標是最大限度地減少部署複雜性。它避免了對現有網路路由配置(例如 switches)進行重大修改,並減少了在受監控節點上安裝額外函式庫的需求。這種輕量級且靈活的方法允許使用者將監控系統快速整合到現有的網路演習基礎設施中,特別是在網路靶場和網路演練環境中。
該系統支援演習團隊不同類型需求的多種使用案例,包括監控網路演習期間的基礎設施健康狀況、偵測對關鍵服務(例如 NTP servers)的潛在攻擊,以及視覺化網路安全演練和事件期間的系統狀態轉換。
1.2 開發與使用背景
網路演習團隊根據其在模擬、防禦或管理網路安全事件中的角色進行分類。該系統是根據不同團隊的使用需求回饋開發的,如下所示:

藉助監控系統提供的功能,網路演習/演練的組織者和參與者都能更好地了解演習進度,識別潛在問題並有效應對。這提高了態勢感知能力,增強了團隊間的協調,並確保了複雜網路靶場場景的順利執行。該系統的主要特性和功能旨在滿足參與網路演習的多個團隊的操作需求:
-
黑隊(判斷組):提供整個演習的概覽,包括團隊狀態、評分、資源可用性和整體防禦進度,從而實現準確的評估和決策。
-
綠隊(設定組):透過在準備和執行階段提供對系統健康狀況和服務就緒情況的詳細洞察,支援環境設定、測試和偵錯。
-
藍隊(防禦組):實現對防禦下的基礎設施和服務的即時監控,幫助防禦者快速偵測異常並評估系統狀況。
-
紅隊(攻擊組):協助報告攻擊進度並評估攻擊行動對目標環境的有效性和影響。
-
黃隊(操作組):促進模擬正常使用者行為,以增強真實性並提供演習環境中的基準活動。
-
紫隊(記錄組):記錄演習事件的完整時間線並歸檔日誌,以供演習後分析、學習和改進。
2. 系統概覽
2.1 三層系統架構
該系統將專注於監控網路演習的三個主要部分,從硬體到人員:網路演習基礎設施部分、網路靶場服務部分和參與者活動部分,如下圖所示:

-
Cyber Exercise Infrastructure:此「硬體、節點和線路」層包括
Resource Utilization、Network Latency & Throughput、Connectivity Status和Cluster Health/Uptime。 -
Cyber Range Resource and Services:此「軟體和功能服務」層包括
Core Network Services、Traffic Generation Integrity、Scenario Injection Delivery和Logging Pipeline。 -
Cyber Drill Participant Activities:此「使用者行動」層描述了參與者正在做的事情,例如
Command Line & Tool Usage、Incident Response Timeline、Communication Flow和Task Completion Rate。
2.2 服務健康監控結構
Cluster Service Health Monitor 將設置在第二層,評估網路安全計算叢集(節點、服務、系統功能和檔案系統)中關鍵元件的可用性和完整性。程式模組圖如下所示:

該系統由三個主要模組組成:
2.2.1 Service Prober Repository
一個集中式的服務探測功能函式庫,旨在驗證各種服務和協定(例如 NTP、FTP、VNC 和 SSH)的操作狀態。每個 prober 負責偵測特定服務或功能是否正常運作並按預期回應。
2.2.2 Prober Agent
Prober Agent 將從 service prober lib 導入模組,以完成整個叢集的檢查任務。主要功能包括:
-
基於設定檔的配置:使用者可以定義客製化的監控設定檔,根據特定要求對探測功能進行分組和組織。
-
靈活的部署模式:代理程式可以在內部(在節點內)運作,以監控系統級指標,例如資源使用情況、檔案系統變更、使用者活動和程序執行,或在外部運作以評估服務介面。
-
資料轉換與中繼:為避免修改現有的網路路由配置,代理程式可以從其他代理程式檢索和中繼資料,有效地形成一個分散式資料收集匯流排。
-
集中式報告:所有收集到的監控資料都會發送到 Monitor Hub 進行視覺化和進一步分析。
2.2.3 Monitor Hub
Monitor Hub 作為資料聚合、視覺化和評估的中心平台。它包括兩個資料庫,用於儲存監控資料和歷史原始記錄。該中心提供:
-
一個基於網頁的儀表板,用於即時視覺化叢集健康狀況和服務狀態。
-
用於整合客製化評分公式或評估功能的介面,允許使用者定義如何量化系統健康狀況。
-
分析功能,以支援網路演習期間的自動決策。
3. 系統設計
3.1 Service Prober Repository 設計
Service Prober Repository 是一個模組化函式庫,提供探測功能以驗證服務和系統元件的可用性和操作狀態。這些 prober 分為兩種主要類型:本地服務探測器和網路服務探測器。
3.1.1 本地服務探測器
本地服務探測器部署在目標節點內,以監控內部系統狀態。這些 prober 專注於主機級可觀測性,包括:
-
資源利用率 (CPU, memory, disk, network bandwidth)
-
使用者活動 (login, command execution, file modifications)
-
程式執行狀態 (running processes, service ports, logs)
-
網路介面和連線狀態
本地探測器範例:
| 探測器名稱 | 探測範圍 |
|---|---|
| 資源使用探測器 | CPU %、Memory %、Disk usage、Network bandwidth |
| 使用者行動探測器 | 使用者登入、命令執行、檔案系統修改 |
| 程式行動探測器 | 程序執行、連接埠狀態、應用程式日誌監控 |
3.1.2 網路服務探測器
網路服務探測器在外部運作,透過網路介面評估目標服務節點的可用性。這些 prober 模擬真實的客戶端互動並驗證服務級功能。
網路探測器範例:
| 探測器名稱 | 探測範圍 |
|---|---|
| 伺服器活動探測器 | ICMP (ping)、SSH、RDP、VNC、X11 access |
| 服務連接埠探測器 | 連接埠掃描(例如 Nmap)以驗證開放連接埠 |
| 服務功能探測器 | 服務的功能驗證,例如: |
| - NTP:延遲和時間同步準確性 | |
| - DNS:名稱解析正確性 | |
| - DHCP:廣播和租賃功能 | |
| - FTP:登入和目錄列表 | |
| - HTTP/HTTPS:網頁請求/回應驗證 | |
| - Email:郵件服務可用性 | |
| - TCP/UDP services:協定特定通訊 | |
| - Database:連線和查詢驗證 |
這種分層探測設計確保了受監控叢集中的系統級和服務級可見性。
3.2 Prober Agent 設計
Prober Agent 作為監控系統的執行和協調層。它負責根據使用者定義的配置排程、管理和執行多個 prober。它將從 Prober Repository 導入 lib 模組,如下面的模組導入圖所示:

3.2.1 主要功能
-
基於設定檔的配置:使用者可以定義客製化的監控設定檔,根據特定的監控要求對不同的 prober 進行分組。
-
靈活部署:代理程式可以在節點內部運作,以監控本地系統狀態,或從遠端節點外部運作,以評估服務介面。
-
透過客製化探測器擴展:使用者可以整合針對特定服務(例如,計費伺服器等專有系統)量身定制的客製化探測功能。
-
分散式資料中繼機制:為避免修改現有的網路路由配置,代理程式可以從其他代理程式檢索資料,形成一個資料轉換匯流排,以實現高效的資料收集。
-
集中式報告:所有收集到的監控資料都會傳輸到 Monitor Hub 進行聚合、分析和視覺化。
3.2.2 程式工作流程概覽
Prober Agent 按以下順序運作:
-
載入預定義的監控設定檔
-
排程和執行相關的 prober
-
收集本地和/或遠端監控資料
-
可選地從對等代理程式聚合資料
-
將結構化結果發送到 Monitor Hub
3.3 Service Monitor Hub 設計
Service Monitor Hub 是負責資料聚合、分析、評分和視覺化的核心元件。它透過基於網頁的儀表板(目前使用 Grafana 實作)為使用者提供可操作的洞察。
3.3.1 核心功能
-
叢集和服務健康狀況的即時視覺化
-
使用者定義評分模型的整合
-
歷史資料儲存和分析
-
支援網路演習期間的決策
3.3.2 資料庫架構
Monitor Hub 利用兩個專用資料庫:
-
原始資訊資料庫:儲存從 Prober Agents 收集的所有原始監控資料,用於歸檔和可追溯性目的。
-
評分資料庫:儲存處理後的資料,包括計算出的服務可用性分數和基於使用者定義評分功能的匯總系統狀態。
3.3.3 資料流架構
Monitor Hub 內的資料處理管道如下圖所示:

3.3.4 資料流描述
-
資料收集:Prober Agents 將原始監控資料發送到 Communication Manager。
-
資料儲存:原始資料儲存在原始資訊資料庫中。
-
資料處理:Data Manager 根據使用者要求檢索相關資料。
-
分數計算:Score Calculator 應用使用者定義的公式來計算服務健康分數。
-
資料視覺化:處理後的結果儲存在評分資料庫中,並透過 Grafana 儀表板即時顯示。
-
使用者互動:使用者透過直觀的網頁介面存取洞察。
4. 監控網頁儀表板入口
該系統提供了一套基於網頁的儀表板,用於視覺化即時演習資訊並支援不同團隊的操作需求。每個儀表板都設計有角色特定的視圖,以增強網路演習期間的態勢感知、協調和決策。螢幕截圖範例如下所示:

目前支援五種主要類型的儀表板:
-
演習概覽儀表板 - 黑隊(判斷組)
-
服務健康儀表板 - 藍隊
-
資源可用性儀表板 - 黑隊(判斷組)、紅隊、藍隊和紫隊
-
資訊與公告儀表板 - 紫隊(主要)、所有團隊(消費者)
-
輔助功能儀表板 - 綠隊和黃隊
4.1 演習概覽儀表板
Cyber Exercise Overview Dashboard 主要由黑隊(判斷組)使用,以監控、管理和控制網路演習的整體進度。它提供了一個集中、即時的關鍵操作指標和事件狀態視圖,從而實現有效的決策和協調。儀表板螢幕截圖範例如下所示:

儀表板包括以下資訊面板:
-
最新更新和即時動態:顯示來自演習現場的最新新聞、公告和即時影片。
-
攻擊與防禦狀態:視覺化演習環境中正在進行的攻擊和防禦活動的當前狀態。
-
團隊績效與評分:面板顯示所有藍隊的得分,以及演習期間提出和解決的工單摘要。
-
資源可用性概覽:提供所有參與團隊資源可用性和健康狀況的高級視圖。
-
即時事件時間軸:追蹤並顯示發生的關鍵演習事件,提供活動和事件的時間順序視圖。
4.2 服務健康儀表板
Cyber Exercise 服務健康儀表板旨在供 Blue Team 監控其負責的子演習環境或叢集的健康狀況、可用性和運行狀態。它提供即時洞察,使防禦者能夠分析系統狀況、檢測異常、提出事件工單並規劃適當的防禦行動。儀表板截圖如下所示:

每個 Blue Team 都會獲得一個專為其指定環境量身定制的專用儀表板。該儀表板提供以下關鍵資訊:
-
節點健康與可用性:叢集中節點的即時狀態,包括運行時間和運行健康狀況。
-
網路拓撲與流量狀態:環境網路結構的可視化,以及當前流量狀況和潛在異常。
-
服務與應用程式狀態:監控叢集中服務的可用性和程式執行狀態。
-
關鍵主機活動監控:追蹤關鍵節點上的登入活動和命令執行,用於安全審計和異常檢測。
-
系統日誌與防禦分數:存取叢集系統日誌和團隊當前的防禦分數,用於績效追蹤。
4.3 資源可用性儀表板
資源可用性儀表板提供所有演習資源(包括硬體、虛擬機器 (VMs)、容器、應用程式和服務)可用性和狀態的詳細即時視圖。它旨在支援參與 Cyber Exercise 的多個團隊的運營和分析需求。儀表板截圖如下所示:

此儀表板使不同團隊能夠執行以下功能:
-
Black (判斷) Team:透過分析資源可用性、系統狀態以及行動對整體評分和演習進度的影響來評估團隊績效。
-
Red Team:透過觀察目標環境中資源可用性和系統行為的變化,評估發動攻擊的有效性和影響。
-
Green Team:監控關鍵節點和主機的連線和健康狀況,支援演習期間的環境驗證、故障排除和問題調試。
-
Purple Team:歸檔和審查演習環境的整體資源狀態,用於事後分析、報告和知識保留。
4.4 資訊與公告儀表板
資訊與公告儀表板主要由 Purple Team 管理,作為 Cyber Exercise 的中央通訊和資訊入口網站。它用於發布公告、與參與團隊(尤其是 Blue Team)分享更新、歸檔演習相關材料,並作為首頁介面向公眾提供選定資訊。儀表板截圖如下所示:

此儀表板確保一致的通訊、提高資訊可訪問性,並支援即時協調和演習後文件。儀表板包括以下面板:
-
事件排程時間軸面板 :顯示演習的整體排程,包括關鍵里程碑和計劃活動。
-
演習進度時間軸面板 :使用新的時間軸系統提供演習事件的即時時間軸,允許用戶追蹤正在進行的活動和事件。
-
儀表板列表面板 :提供快速存取系統中所有可用監控儀表板的功能。
-
演習排程面板 :呈現詳細的排程資訊,包括會話分解和特定活動的時間安排。
-
組織委員會面板 :介紹參與演習的組織團隊和主要利益相關者。
-
演習文件下載面板 :提供參與者存取相關文件、指南和資源。
-
參與組織顯示面板 :展示參與演習的組織,支援可見性和協作。
4.5 輔助功能儀表板
輔助功能儀表板由一組定制儀表板組成,旨在可視化特定功能的執行狀態,這些功能滿足 Cyber Exercise 的額外操作要求。這些儀表板透過提供對輔助系統和活動的即時洞察,為專業團隊提供有針對性的支援。儀表板截圖如下所示:

儀表板包括:
-
用戶行為模擬儀表板 (Yellow Team) :顯示正常用戶行為模擬和流量生成活動的狀態,有助於在演習環境中維持真實的基準條件。
-
攻擊活動監控儀表板 (Red Team) :可視化正在進行的攻擊操作,包括已發動的攻擊和自動觸發的意外或潛在有害行動,從而更好地追蹤和報告攻擊活動。
-
連線與網路支援儀表板 (Green Team) :監控網際網路連線、VPN 狀態和頻寬使用情況,以確保整個演習期間的穩定基礎設施和網路支援。
5. 用例範例
Cluster Service Health Monitor 已成功部署在 NCL AS-06 cluster (COM1-AS06) 上,以展示其監控中型 Cyber Exercise 環境的能力。在此部署中,系統監控多個關鍵基礎設施組件中的總計 17 個節點和 71 項服務。詳細系統工作流程如下圖所示:

5.1 監控叢集概覽
監控的目標和服務總結如下:
| 探測目標服務叢集 | 節點數量 | 檢查的服務 |
|---|---|---|
| 防火牆 | 1 | icmp, ssh, http-alt, http-proxy, ident, blackice-icecap, http, https |
| Openstack | 4 | icmp, ssh, http-alt, upnp, mysql, https, vnc |
| Kypo-Crp | 3 | icmp, ssh, https, vnc, X11, X11:1-Win |
| CTF | 2 | icmp, ssh, http, vnc, X11, X11:1-Win |
| GPU | 3 | icmp, ssh, vnc, Nvidia-smi |
| 支援 | 4 | NTP, ftp, file. |
5.2 監控儀表板概覽
監控儀表板:


Project Github Link:
https://github.com/LiuYuancheng/Cluster_Service_Health_Monitor
Thanks for spending time to check the article detail, if you have any question and suggestion or find any program bug, please feel free to message me. Many thanks if you can give some comments and share any of the improvement advice so we can make our work better ~
最後編輯者:LiuYuancheng ([email protected]),於 2026/03/22。如果您有任何問題或發現任何錯誤,請發送訊息給我。
No comment for this article.