內建事件參照
「 事件 」頁面會顯示所有目前可用的事件清單; 現成可用的內建事件及任何使用者定義的自訂事件。 若要檢視「事件」頁面,請按一下 設定-> 事件。
清單可以依下列方式過濾:
- 類型: 內建 事件或 自訂 事件。
- 突發事件及嚴重性: 突發事件、 警告或 嚴重。
- 全文檢索。
重要事項: 無法修改內建事件。 您可以根據用於內建事件的相同實體及度量值來建立 自訂事件 。 自訂事件會根據任何給定實體的個別度量值臨界值來觸發問題或發生事件。
.NET 應用程式
| 事件 |
說明 |
度量 |
| 記憶體回收活動高。 |
監視 CLR 執行時期平台所花費的記憶體回收 (GC) 時間,並根據容許的百分比值上限來檢查它。 |
GC 時間 (mem.time_in_gc)。 |
如需此感應器的相關資訊,請參閱 。NET 文件。
ActiveMQ
| 事件 |
說明 |
度量 |
| 無法傳送郵件的佇列大小正在增加。 |
無法傳送郵件的佇列大小正在增加。 傳送的訊息不會遞送至正確的目的地。 |
ActiveMQ 佇列大小。 |
| 記憶體用量接近限制。 |
記憶體用量接近記憶體限制的 100%。 |
記憶體用量 (memoryPercentage)。 |
| 商店用量接近限制。 |
商店用量接近商店限制的 100%。 |
商店使用情形 (storePercentage)。 |
如需此感應器的相關資訊,請參閱 ActiveMQ 文件。
ActiveMQ Artemis
| 事件 |
說明 |
度量 |
| ActiveMQ Artemis 沒有連線。 |
在過去 5 秒內沒有連線。 現行連線數等於已配置的 NoConnections 計數。 |
連線總數 (totalConnectionCount)。 |
| ActiveMQ Artemis 沒有消費者。 |
過去 5 秒沒有消費者。 現行消費者數目等於已配置的 NoConsumers 計數。 |
消費者總計 (totalConsumerCount)。 |
| 位址記憶體用量接近限制。 |
所有位址的記憶體用量接近其記憶體限制的 100%。 |
位址記憶體用量 (addressMemoryPercentage)。 |
如需此感應器的相關資訊,請參閱 ActiveMQ Artemis 文件。
Apache HTTP
| 事件 |
說明 |
度量 |
| Apache 子程序在執行 DNS 查閱時停滯。 |
偵測 DNS 查閱是否大量使用伺服器工作者。 |
DNS (worker.dns)。 |
| 記載正在降低 Apache HTTP 效能。 |
偵測基於記載目的而大量使用伺服器工作者。 |
記載 (worker.logging)。 |
| 忙碌工作程式數目接近工作程式數目上限。 |
偵測高忙碌工作程式百分比。 |
忙碌工作程式 (busy_workers)。 |
如需此感應器的相關資訊,請參閱 Apache HTTPd 文件。
應用程式
| 事件 |
說明 |
度量 |
| 完成在呼叫中捨棄 |
在過去 30 分鐘內相對於值的呼叫值中偵測到快速下降至零 (基本上不再呼叫服務)。 在呼叫中捨棄的長度也應該超出列出的相對及絕對臨界值參數。 |
呼叫數/秒 (count) |
| 錯誤率太高 |
當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測到一致的高錯誤率。 |
錯誤率 (error_rate)。 |
| 錯誤率上升趨勢 |
此規則會檢查給定度量中是否存在上升趨勢。 規則已調整為偵測給定度量中的弱單調性增加。 不過,偵測器並不嚴格,並容許在趨勢候選項內的度量值減少一定數量。 |
錯誤率 (error_rate)。 |
| 電話突然下降 |
偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 在呼叫中捨棄的長度也應該超出列出的相對及絕對臨界值參數。 |
呼叫數/秒 (count)。 |
| 錯誤率突然增加 |
偵測過去 10 分鐘內相對於 KPI 值的錯誤 KPI 值快速增加。 錯誤增加的幅度也應該超出列出的相對及絕對臨界值參數。 |
錯誤率 (error_rate)。 |
| 延遲突然增加 |
偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出列出的相對及絕對臨界值參數。 |
延遲 50th (duration.50th)。 |
| 一小部分要求的延遲突然增加 |
偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出列出的相對及絕對臨界值參數。 |
延遲 99th (duration.99th)。 |
AWS DynamoDB
| 事件 |
說明 |
度量 |
| 已耗用及已佈建讀取的比例是重要的。 |
偵測高比例的已耗用及已佈建讀取。 |
耗用的讀取容量 (consumed_read)。 |
| 已耗用及已佈建寫入的比例是重要的。 |
偵測耗用及佈建寫入的高比例。 |
耗用的寫入容量 (consumed_write) 及佈建的寫入容量 (provisioned_write)。 |
如需此感應器的相關資訊,請參閱 AWS DynamoDB 說明文件。
AWS MSK
| 事件 |
說明 |
度量 |
| 作用中控制器計數。 |
檢查 Kafka 叢集中是否有異常數量的作用中控制器。 |
作用中控制器計數 (active_controller_count)。 |
| 離線分割區計數。 |
定義在指定時間範圍內容許的離線分割區違規比例上限。 |
離線分割區計數 (offline_partitions_count)。 |
| 網路處理器低閒置時間。 |
檢查 Kafka 網路執行緒是否處於高負載。 |
網路處理器閒置時間 (network_processor_idle)。 |
| 要求處理程式低閒置時間。 |
檢查 Kafka 要求處理程式是否處於高負載狀態。 |
要求處理程式閒置時間 (request_handler_idle)。 |
| 抄寫不足的分割區計數。 |
檢查抄寫不足的分割區數目是否超出預期數目。 |
抄寫不足的分割區 (under_replicated_partitions)。 |
如需此感應器的相關資訊,請參閱 AWS MSK 說明文件。
AWS RDS
| 事件 |
說明 |
度量 |
| CPU 額度平衡達到零。 |
檢查 CPU 額度餘額是否接近零。 |
CPU 貸方餘額 (cpu_credit_balance)。 |
| 耗用的 CPU 額度數目偏高。 |
檢查實例耗用的 CPU 額度百分比是否達到容量上限。 |
CPU 額度使用情形 (cpu_credit_usage) 及 CPU 額度平衡 (cpu_credit_balance)。 |
如需此感應器的相關資訊,請參閱 AWS RDS 說明文件。
Azure API Management Service
Azure API Management 感應器會每分鐘自動執行任何已配置的自訂性能檢查。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。
| 事件 |
說明 |
度量 |
| Azure Api Management 容量越來越接近容量上限。 |
檢查 Azure API Management 是否使用超過 90% 的可用容量。 |
容量 (metrics.Capacity)。 |
如需此感應器的相關資訊,請參閱 Azure Api 管理 文件。
Azure CosmosDB
| 事件 |
說明 |
度量 |
| Azure CosmosDb 儲存體容量越來越接近容量上限。 |
偵測 Azure CosmosDb 儲存體容量是否達到容量上限。 |
CosmosDb 儲存體容量。 |
如需此感應器的相關資訊,請參閱 Azure CosmosDB 文件。
Azure Redis
Azure Redis Cache 感應器會處理自訂性能檢查,並每分鐘執行一次。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。
| 事件 |
說明 |
度量 |
| Azure Redis 快取用戶端連線越來越接近連線數上限。 |
Azure Redis 快取使用超過 90% 的可用用戶端連線。 |
已連接用戶端 (connectedclients)。 |
| Azure Redis 快取記憶體用量越來越接近記憶體上限。 |
Azure Redis 快取使用超過 90% 的可用記憶體。 |
已用記憶體百分比 (usedmemorypercentage)。 |
如需此感應器的相關資訊,請參閱 Azure Redis 文件。
Azure SQL Database
Azure SQL Database 感應器將處理自訂性能檢查,並每分鐘執行一次。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。
| 事件 |
說明 |
度量 |
| 資料庫空間不足。 |
檢查 Azure SQL Database 是否耗盡空間。 警告限制為 80% ,而嚴重限制為已用大小的 90%。 |
metrics.storage_percent. |
| 資料庫狀態。 |
資料庫無法使用導致不健全狀態。 如果符合下列其中一個條件,則資料庫可能無法使用:
- 使用者已將資料庫設為離線
- 正在從備份還原資料庫
- 正在回復資料庫
- 資料庫已毀損
- 管理者已將資料庫設為「緊急」狀態
- 正在複製另一個資料庫來建立資料庫
|
metrics.statusCode. |
| 總 DTU 使用率越來越接近最大 DTU 限制。 |
檢查 Azure SQL Database DTU 使用率是否達到最大 DTU 限制。 警告限制為 75% ,嚴重限制為 85% 的 DTU 使用率。 |
metrics.dtu_consumption_percent. |
Azure MySQL 資料庫
Azure MySQL 資料庫感應器每分鐘執行一次自訂性能檢查。 如果檢查失敗至少一分鐘,則會提出問題來通知您。
| 事件 |
說明 |
度量 |
| 可用的伺服器連線越來越接近連線數上限 |
Azure MySQL Server 連線用量超過可用用戶端連線的 85%。 |
作用中連線數 (active_connections) |
如需此感應器的相關資訊,請參閱 Azure MySQL 文件。
Azure SQL 彈性儲存區
Azure SQL Elastic Pool 感應器將處理自訂性能檢查,並每分鐘執行一次。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。
| 事件 |
說明 |
度量 |
| eDTU 使用率總計越來越接近 eDTU 上限。 |
檢查 Azure SQL 彈性儲存區 eDTU 是否達到 eDTU 上限。 |
metrics.dtu_consumption_percent. |
Ceph
| 事件 |
說明 |
度量 |
| Ceph 叢集狀態。 |
Ceph 叢集正在報告問題; HEALTH_WARN 或 HEALTH_ERR。 |
Ceph 叢集的狀態 (overall_status)。 |
| 未達到監視器額定。 |
性能良好的監視器數目小於所有監視器的 50%。 |
監視器數目 (num_mons) 及作用中監視器數目 (num_active_mons)。 |
| Osd 完整容量狀態。 |
部分 OSD 正在報告完整狀態。 |
作用中 + 清除頁面數 (num_full_osds)。 |
| Osd (s) 接近完整容量狀態。 |
部分 OSD 正在報告接近完整狀態。 |
接近完全 osds 的數目 (num_near_full_osds)。 |
如需此感應器的相關資訊,請參閱 Ceph 文件。
Consul (HashiCorp)
| 事件 |
說明 |
度量 |
| Consul 叢集性能。 |
偵測叢集的整體性能,以及 Autopilot 是否將任何節點視為性能不佳。 |
Consul 自動駕駛性能狀態 (consul.autopilot.healthy)。 |
CRI-O
| 事件 |
說明 |
度量 |
| 記憶體已耗盡。 |
偵測容器記憶體用量是否超出指定的限制。 |
RSS (memory.total_rss)。 |
Docker
| 事件 |
說明 |
度量 |
| 記憶體已耗盡。 |
當容器記憶體用量超出指定的限制時,會顯示記憶體警告臨界值或記憶體嚴重臨界值警示。 |
RSS (memory.total_rss)。 |
如需此感應器的相關資訊,請參閱 Docker 說明文件。
端點
| 事件 |
說明 |
度量 |
| 完全捨棄通話。 |
偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值是否快速下降至零 (基本上不再呼叫服務)。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 |
呼叫數/秒 (count)。 |
| 錯誤率太高。 |
當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測到一致的高錯誤率。 |
錯誤率 (error_rate)。 |
| 綜合端點的錯誤率太高。 |
當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測 Synthetic 端點的一致高錯誤率。 |
綜合錯誤率 (synthetic_error_rate)。 |
| 錯誤率上升趨勢。 |
檢查給定度量中是否存在遞增趨勢。 規則已調整為偵測給定度量中的弱單調性增加。 不過,偵測器並不嚴格,並容許在趨勢候選項內的度量值減少一定數量。 |
錯誤率 (error_rate)。 |
| 電話突然掉了下來 |
偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 |
呼叫數/秒 (count)。 |
| 合成人電話突然下降 |
偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 |
綜合呼叫數/秒 (synthetic_count)。 |
| 錯誤率突然增加。 |
偵測過去 10 分鐘內相對於 KPI 值的錯誤 KPI 值快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 |
錯誤率 (error_rate)。 |
| 延遲突然增加。 |
偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 |
延遲 50th (duration.50th)。 |
| 一小部分要求的延遲突然增加。 |
偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 |
延遲 99th (duration.99th)。 |
etcd
| 事件 |
說明 |
度量 |
| 磁碟後端確定持續時間異常高。 |
偵測高光碟後端確定持續時間。 |
磁碟後端確定持續時間 (health.disk_backend_commit_duration)。 |
| 磁碟 wal fsync 持續時間異常高。 |
偵測高磁碟 wal fsync 持續時間。 |
磁碟 fsync 持續時間 (health.disk_wal_fsync_duration)。 |
| Snapshot 持續時間異常高。 |
偵測儲存 Snapshot 的高持續時間。 |
貼齊儲存持續時間總計 (health.debugging_snap_save_total_duration)。 |
| 在最後一分鐘看到頻繁的領導者變更。 |
偵測過去 1 分鐘的大量主導器變更。 |
伺服器主導器變更 (health.server_leader_changes)。 |
| 成員沒有領導者。 |
偵測沒有主導器 (無法使用) 的成員。 |
伺服器具有主導器 (health.server_has_leader)。 |
| 提案比例分析。 |
偵測已套用提案的異常下降,以及擱置及失敗提案的異常上升。 |
已確定的提案數 (health.server_proposals_committed)、已套用的提案數 (health.server_proposals_applied)、擱置的提案數 (health.server_proposals_pending) ,以及失敗的提案數 (health.server_proposals_failed)。 |
| 開啟檔案描述子的使用非常重要。 |
偵測大量使用開啟檔案描述子。 |
開啟檔案描述子數目 (health.process_open_fds) 及檔案描述子數目上限 (health.process_max_fds)。 |
如需此感應器的相關資訊,請參閱 etcd 文件。
Garden 儲存器
| 事件 |
說明 |
度量 |
| 記憶體已耗盡。 |
儲存器記憶體用量已接近其記憶體限制。 |
用法 (memory.usage)。 |
如需此感應器的相關資訊,請參閱 Garden 文件。
Glassfish
| 事件 |
說明 |
度量 |
| Glassfish 檔案快取命中率如下: 70%。 |
處理管線會檢查檔案快取命中率,並驗證它是否低於給定的臨界值。 |
命中率 (file_cache_rate)。 |
| 已達到 JDBC 連線數上限。 |
處理管線會檢查 JDBC 連線總數。 它會驗證它是否達到伺服器配置的上限。 |
已使用 (jdbc_connection_used)。 |
如需此感應器的相關資訊,請參閱 Glassfish 文件。
Google Cloud 資料儲存庫
| 事件 |
說明 |
度量 |
| 在過去 30 分鐘內,資料儲存庫要求計數大幅下降。 |
檢查要求計數是否突然減少。 |
要求 (request_count) |
| 在過去 30 分鐘內,資料儲存庫要求計數大幅增加。 |
檢查要求計數是否突然增加。 |
要求 (request_count) |
如需此感應器的相關資訊,請參閱 Google Cloud 資料儲存庫 文件。
Google Cloud Storage
| 事件 |
說明 |
度量 |
| 突然增加所有物件的大小 |
針對非空白儲存區檢查 24h 中所有物件的大小是否突然增加 |
儲存區中所有物件的大小總計。 |
如需此感應器的相關資訊,請參閱 Google Cloud Storage 文件。
Google Cloud Pub/Sub
| 事件 |
說明 |
度量 |
| 訂閱的推送要求延遲在過去 10 分鐘內已增加。 |
檢查訂閱是否突然增加推送要求延遲。 |
要求延遲時間 (push_request_latencies) |
| 主題最舊訊息。 |
檢查主題是否有比臨界值還舊的訊息。 |
最舊訊息 (oldest_unacked_message_age) |
如需此感應器的相關資訊,請參閱 Google Cloud Pub/Sub 文件。
Hadoop YARN
| 事件 |
說明 |
度量 |
| 資源管理程式正在報告遺失節點。 |
偵測資源管理程式是否報告遺失節點。 |
遺失節點 (lostNodes)。 |
| 資源管理程式正在報告不健全的節點。 |
偵測資源管理程式是否報告性能不佳的節點。 |
不健全節點 (unhealthyNodes)。 |
| 提交的應用程式失敗。 |
偵測提交的應用程式是否失敗。 |
應用程式失敗 (appsFailed)。 |
如需此感應器的相關資訊,請參閱 Hadoop YARN 文件。
HAProxy
| 事件 |
說明 |
度量 |
| HAProxy 後端平均佇列大小偏高。 |
HAProxy 後端平均佇列大小很大。 |
後端佇列大小。 |
| HAProxy 前端階段作業用量偏高。 |
HAProxy 前端階段作業用量偏高。 |
前端階段作業使用率。 |
| 平均回應時間突然增加。 |
檢查單一後端的平均回應時間是否突然增加。 |
平均回應時間度量。 |
如需此感應器的相關資訊,請參閱 HAProxy 文件。
Hazelcast
從 Hazelcast 3.3 開始,使用公用方法 HazelcastInstance::getPartitionService()::isLocalMemberSafe() 。 對於較舊的 Hazelcast 版本,性能狀態衍生自每個本端節點上的內部「具有進行中移轉」狀態。
從每一個 Hazelcast 節點聚集 Hazelcast 叢集性能狀態。 這正是 HazelcastInstance::getPartitionService()::isClusterSafe() 在內部執行的動作,但不會造成呼叫此方法的額外負擔。
Hazelcast 叢集
| 事件 |
說明 |
度量 |
| 叢集狀態。 |
檢查 Hazelcast的叢集狀態。 Hazelcast 3.3 或以上。 |
Hazelcast 叢集狀態旗標。 |
Hazelcast 節點
| 事件 |
說明 |
度量 |
| 節點狀態。 |
檢查本端成員的狀態。 Hazelcast 3.3 或以上。 |
Hazelcast 節點狀態旗標。 |
如需此感應器的相關資訊,請參閱 Hazelcast IMDG 文件。
HBase
| 事件 |
說明 |
度量 |
| 儲存庫數目與儲存庫檔案數目之間的差異很大。 |
偵測異常低或異常高數目的商店。 |
儲存計數 (rs_store_count) 和儲存檔案計數 (rs_store_file_count)。 |
| 區域伺服器區塊快取命中率偏低。 |
偵測低快取命中率。 |
區塊快取命中率 (rs_blk_cache_hit_rate) 及區塊快取命中計數 (rs_blk_cache_hit_count)。 |
| 壓縮佇列長度大幅增加。 |
檢查壓縮佇列的長度是否突然增加。 此規則指出所有區域都以類似的速率成長,且需要大約同時分割/壓縮。 可以透過預先分割或關閉自動壓縮來解決此問題。 |
壓縮佇列長度 (rs_comp_queue_length)。 |
| 清除佇列長度大幅增加。 |
檢查清除佇列的長度是否突然增加。 觸發時,這可能表示缺少 RAM ,或排清的速度比磁碟可以處理的快。 |
清除佇列長度 (rs_flush_queue_length)。 |
如需此感應器的相關資訊,請參閱 Apache HBase 說明文件。
主機
| 事件 |
說明 |
度量 |
| CPU 花費大量時間等待輸入/輸出。 |
檢查系統是否花費大量時間等待輸入/輸出 (在 60 秒的滑動視窗中取樣)。 |
等待 (cpu.wait)。 |
| 已超出 CPU 竊用時間。 |
檢查第二個移動視窗,是否在執行中處理程序之間或由 Hypervisor/主機 OS (在 60 秒的滑動視窗中取樣) 竊取太多 CPU。 |
竊用 (cpu.steal)。 |
| 裝置剩餘容量低或已滿。 |
偵測磁碟低容量問題,以提前 15 分鐘提供可能容量中斷的早期預測。 當剩餘磁碟空間超過 1GB 或容量總計的 1% 時,不會發動偵測器。 不過,如果剩餘磁碟空間是空的 (<1MB) ,或磁碟空間會根據現行趨勢在未來 15 分鐘內填滿,則會發動。 |
磁碟可用儲存體容量。 |
| 磁碟填滿的速度比被清除的快。 |
偵測長期磁碟容量問題,並在磁碟可能在接下來 48 小時內容量不足時發動。 當剩餘磁碟空間超過總容量的 20% 時,偵測器未發動。 不過,根據現行趨勢,當磁碟空間在未來 48 小時內填滿時,它將會發動。 此趨勢是根據一段時間內收集的本端最小值來計算。 當這些本端最小值定義至少 4 小時的時間範圍時,會在這些資料點上擬合線性迴歸模型,以最終執行長期預測。 |
磁碟可用儲存體容量。 |
| 經常發生 TCP 錯誤。 |
檢查主機是否有異常高的 TCP 錯誤數 (在滑動視窗中取樣 60 秒)。 |
In Segments/s (tcp.inSegs) and error (tcp.errors). |
| 頻繁 TCP 失敗。 |
檢查主機是否有異常高的 TCP 失敗數 (在滑動視窗中取樣 60 秒)。 |
失敗 (tcp.fails) 和開啟/秒 (tcp.opens)。 |
| 永久 TCP 重新傳輸。 |
檢查主機是否有異常大量 TCP 重新傳輸 (在滑動視窗中取樣 60 秒)。 |
重新傳輸 (tcp.retrans) 及輸出區段/秒 (tcp.outSegs)。 |
| 系統負載太高。 |
透過將負載與機器 CPU 核心的 2 倍進行比較 (在 120 秒的滑動視窗中取樣) ,來檢查系統負載是否過高。 |
載入 (load.1min)。 |
| 系統記憶體已耗盡。 |
檢查系統記憶體是否接近耗盡 (立即觸發)。 |
可用 (memory.free) 及已使用 (memory.used)。 |
| 開啟太多檔案。 |
處理程序開啟檔案的速度比它們關閉檔案的速度快 (現行與最大比例超出臨界值)。 |
已使用 (openFiles.used)。 |
| 太多使用 inode。 |
檔案系統上的低層次可用 inode 會觸發此性能規則 (現行與最大比例超出臨界值)。 |
Inode 使用情形。 |
| 使用者處理程序的 CPU 使用率過高。 |
檢查使用者處理程序的 CPU 使用率是否過高 (在 180 秒的滑動視窗中取樣)。 |
使用者 (cpu.user) 及 topPID。 |
| 您很快就會用盡磁碟空間。 |
偵測磁碟的短期容量問題,並在磁碟可能在下一個小時內容量不足時發動。 當磁碟在最近過去釋放大量空間 (>=100MB) 時,或當剩餘磁碟空間超過總容量的 20% 時,不會發動偵測器。 不過,根據現行趨勢,當磁碟空間在未來一小時內填滿時,它將會發動。 此趨勢是根據適合現行滑動視窗之資料點的線性迴歸模型來計算。 |
磁碟可用儲存體容量。 |
如需此感應器的相關資訊,請參閱 主機 文件。
IBM ACE
| 事件 |
說明 |
度量 |
| ACE Integration Server 的狀態 |
請檢查 ACE Integration Server 的狀態。 |
整合伺服器狀態 |
| ACE Integration Server 狀態數位格式 |
請檢查 ACE Integration Server 的數位狀態。 |
整合伺服器狀態度量 |
| 佇列管理程式連線狀態數位格式 |
請檢查 ACE Integration Server 與佇列管理程式之間的數位狀態。 |
佇列管理程式連線狀態度量 |
| 含有錯誤號碼的訊息 |
包含錯誤的訊息數。 |
有錯誤的訊息數 |
| 含有錯誤號碼的訊息流程 |
MQGET 錯誤數(MQInput 節點)或「Web 服務」錯誤數(HTTPInput 節點)。 |
MQGET 錯誤數 |
| 含有錯誤號碼的訊息處理 |
處理訊息時發生的錯誤數。 |
有錯誤的訊息數 |
| 訊息流程狀態 |
請檢查 ACE 訊息流程的狀態。 |
訊息流程狀態 |
| 訊息流程狀態數位格式 |
請檢查 ACE 訊息流程的數位狀態。 |
訊息流程狀態度量 |
如需此感應器的相關資訊,請參閱 IBM ACE 文件。
IBM Db2
| 事件 |
說明 |
度量 |
| 表格空間公用程式度量狀態 |
當啟用及停用自動調整大小功能時,請檢查與表格空間及其度量相關的事件。 |
表格空間公用程式 |
| HADR 連接狀態 |
檢查與 HADR 待命資料庫的連線狀態相關的事件。 待命 ID 可用作過濾器來產生 HADR_CONNECT_STATUS 事件,該事件特定於任何待命節點,並且可以使用相符操作員欄位中的待命 ID 進行設定。 事件可以根據下列項目來建立,這代表任何資料庫的現行狀態:
- 資料庫已連接 (
Connect State = CONNECTED 為 1)。
- 資料庫處於斷線狀態 (
Connect State = DISCONNECTED 為 0)。
|
HADR_CONNECT_STATUS (hadr.standbyId.HADR_CONNECT_STATUS)。 設定為 any 的相符運算子將產生與待命 ID 無關的事件。 |
如需此感應器的相關資訊,請參閱 IBM Db2 文件。
JBoss
| 事件 |
說明 |
度量 |
| 連接器上的平均錯誤數太高。 |
處理管線會偵測連接器在給定時間範圍內發生的錯誤數,並檢查錯誤數是否大於臨界值。 |
Jboss 連接器錯誤。 |
| ConnectionPool 正在耗盡連線。 |
處理管線會偵測已使用的連線比例,並檢查它是否即將達到臨界值。 |
JBoss 連線儲存區已用連線數比例。 |
| 資料來源上的連線已逾時。 |
處理管線會在給定時間範圍內偵測資料來源上可用的連線數,並檢查連線總數是否即將達到臨界值。 |
已使用 Jboss 資料來源連線,可用的資料來源連線。 |
| ThreadPool 執行緒已耗盡。 |
處理管線會偵測執行緒數目上限,並檢查現行執行緒計數是否即將達到臨界值。 |
JBoss 執行緒儲存區現行執行緒計數,執行緒儲存區執行緒數目上限。 |
如需此感應器的相關資訊,請參閱 JBoss AS 說明文件。
JBoss 資料網格
| 事件 |
說明 |
度量 |
| 快取不在執行中狀態。 |
檢查建立的快取數與在「Jboss 資料網格」中執行的快取數的比例。 如果比例遵循特定值,則會將它視為違規。 |
執行及建立快取管理程式的快取。 |
如需此感應器的相關資訊,請參閱 JBoss 資料網格 文件。
JVM
| 事件 |
說明 |
度量 |
| 記憶體回收活動高。 |
處理管線會監視「JVM 執行時期平台」所花費的「記憶體回收」時間,並根據臨界值進行驗證。 |
JVM 記憶體回收。 |
| JVM 程式碼快取已滿。 |
處理管線會監視「JVM 執行時期平台」的「程式碼快取」用量上限。 |
JVM 程式碼快取用量上限。 |
| Perm Gen 已滿 (CMS)。 |
處理管線會偵測所使用的 Perm Gen CMS 儲存區數目上限。 |
pools.CMS Perm Gen |
| Perm Gen 已滿 (G1)。 |
處理管線會偵測使用的 Perm Gen G1 儲存區數上限。 |
pools.G1 Perm Gen |
| Perm Gen 已滿 (PS)。 |
處理管線會偵測所使用的 Perm Gen PS Pools 上限。 |
pools.PS Perm Gen |
| 執行緒已死鎖。 |
偵測器會監視 JVM 執行時期平台,並偵測是否有任何「死鎖」執行緒。 |
死鎖的執行緒數 (threads.deadlocked)。 |
| J9VM 記憶體洩漏。 |
偵測器會檢查 GC 之後使用的資料堆 的增長率 (以每小時 MB 為單位) ,並偵測 JVM 中是否可能發生記憶體洩漏。 IBM J9 VM 記憶體洩漏偵測是選用特性,依預設會在 Instana 後端中停用。 若要啟用此選用特性,請參閱 Instana 部署的頁面: SaaS、 在 Kubernetes 或 Red Hat OpenShift上自行管理,或 在 Docker |
memory.gc.after memory.gc.before |
如需此感應器的相關資訊,請參閱 JVM 文件。
Memcached 節點
| 事件 |
說明 |
度量 |
| 清除所有已執行的指令。 |
偵測到大量 flush_all 指令。 |
清除 (cmd_flush)。 |
| 高索引鍵收回。 |
偵測大量金鑰收回。 |
收回 (evictions)。 |
| 已排入佇列的連線數目增加。 |
偵測是否有大量已排入佇列的連線。 |
已排入佇列 (conn_queued)。 |
| 產生的連線數目增加。 |
偵測大量已產生連線。 |
生產 (conn_yields)。 |
| Memcached 所使用的位元組數已達到 maxbytes 限制。 |
Memcached 所使用的位元組數已達到位元組數上限。 |
已用位元組數。 |
如需此感應器的相關資訊,請參閱 Memcached 文件。
MongoDB 節點
| 事件 |
說明 |
度量 |
| 持續增加背景清除延遲。 |
資料庫報告增加背景清除延遲 (在滑動視窗中取樣 150 秒)。 |
前次背景清除延遲 (backgroundFlushingLast)。 |
| 持續增加鎖定佇列長度。 |
監視「 MongoDb 鎖定佇列」度量,並驗證鎖定佇列大小是否增加得太快。 |
鎖定佇列長度 (lockQueue)。 |
| 增加尋頁錯失。 |
增加尋頁錯失 (在 150 秒的滑動視窗中取樣)。 |
尋頁錯失數 (pageFaults)。 |
| 寫入鎖定增長中的日誌登載確定 |
寫入鎖定增長中的日誌登載確定 (在滑動視窗中取樣 150 秒)。 |
日誌登載寫入鎖定 (journalWriteLock)。 |
| 非對映虛擬記憶體的比例太高 |
非對映虛擬記憶體的比例太高 (即時觸發並由 Instana 主機感應器報告)。 |
Virtual 及 mapped。 |
MongoDB 抄本集
| 事件 |
說明 |
度量 |
| ReplicaSet 已關閉成員。 |
無法呼叫到從集合的另一個成員看到的成員。 |
unreachableNodeCount. |
| ReplicaSet 監視狀態。 |
監視 MongoDB 抄本集所有成員的性能。 |
從屬延遲計數 (slaveDelaysCount)、作業時間計數 (optimesCount) 及受監視成員計數 (monitoredMembersCount)。 |
| 抄寫延遲正在增加。 |
抄寫延遲正在增加 (在滑動視窗中取樣 150 秒)。 |
從屬延遲 (slaveDelays) 和 Optimes (optimes)。 |
| 抄本集連線用量偏高。 |
作用中連線數超過連線數上限的 90%。 |
連線 ('connections ')。 |
如需此感應器的相關資訊,請參閱 MongoDB 文件。
MySQL DB
| 事件 |
說明 |
度量 |
| 可用的伺服器連線數已達到限制。 |
已用與連線限制之間的比例大於配置的比例臨界值。 |
連線 (status.THREADS_CONNECTED)。 |
如需此感應器的相關資訊,請參閱 MySQL 文件。
Nginx 伺服器
| 事件 |
說明 |
度量 |
| Nginx 有離線對等節點的問題。 |
非作用中對等節點 (僅適用於 NGINX Plus)。 |
Upstreams 失敗 (nginx_plus.http.upstreams.peers.failed)。 |
| Nginx 正在捨棄連線。 |
已捨棄連線。 |
已捨棄連線 (connections.dropped)。 |
| Nginx 因 SSL 信號交換而失敗。 |
SSL 信號交換失敗 (僅適用於 NGINX Plus)。 |
失敗的信號交換 (nginx_plus.ssl.handshakes_failed)。 |
| 作用中連線數接近上限。 |
已用連線比例超出已用連線的配置比例臨界值。 |
作用中連線 (connections.active)。 |
如需此感應器的相關資訊,請參閱 NGINX 文件。
Node.js 應用程式
| 事件 |
說明 |
度量 |
| 記憶體回收活動高。 |
檢查在給定時間範圍內 GC 所花費的時間是否高於給定的臨界值。 |
GC 暫停度量。 |
| 性能檢查失敗。 |
檢查是否有任何失敗的性能檢查。 如需相關資訊,請參閱 性能檢查支援。 |
性能檢查結果 (healthcheckResult)。 |
如需此感應器的相關資訊,請參閱 Node.js 文件。
OpenShift 部署配置
| 事件 |
說明 |
度量 |
| 可用的抄本數小於想要的抄本數。 |
檢查可用的抄本總數是否小於想要的抄本數。 這指出 OpenShift DeploymentConfig 遺漏抄本 Pod。 |
所需 (desiredReplicas) 及可用 (availableReplicas)。 |
如需此感應器的相關資訊,請參閱 Openshift 說明文件。
OracleDB
| 事件 |
說明 |
度量 |
| 「DB CPU 時間」與「DB 時間」之間的比例較低。 |
「DB CPU 時間」與「DB 時間」之間的比例如下所配置的臨界值。 |
資料庫 CPU 時間/資料庫時間比例 (stats.cpuTimeDbTimeRatio)。 |
| 表格空間空間使用情形偏高。 |
表格空間已用空間比已配置的最大空間量更重要。 |
表格空間已用空間百分比。 |
| 最大階段作業總數。 |
已用階段作業比例超出已配置的已用階段作業比例臨界值。 |
階段作業/階段作業限制 (stats.usedSessionsRatio)。 |
如需此感應器的相關資訊,請參閱 OracleDB 文件。
OS 處理程序
| 事件 |
說明 |
度量 |
| CPU 使用率 |
處理程序導致主機上的 CPU 使用率過高。 |
基礎主機上高 CPU 使用率規則評估的結果,以及給定處理程序的 CPU 使用者時間。 |
| 開啟檔案使用情形。 |
處理程序開啟檔案的速度比關閉檔案的速度快 (現行與最大比例超出臨界值) |
已使用 (openFiles.used)。 |
| 異常終止。 |
處理程序因未捕捉信號而終止。 |
|
| 異常終止。 |
處理程序已終止,且具有非零結束碼。 |
|
如需此感應器的相關資訊,請參閱 OS 處理程序 文件。
PHP-FPM 執行時期
| 事件 |
說明 |
度量 |
| 經常重新啟動 PHP-FPM 工作者節點儲存區。 |
透過針對給定臨界值評估 PHP-FPM 工作者節點儲存區在給定時間範圍內的重新啟動次數,來檢查 PHP-FPM 工作者節點儲存區是否頻繁重新啟動。 |
工作程式儲存區的開始時間。 |
| 接聽待辦事項已配置超過容量。 |
檢查工作者節點儲存區的接聽待辦事項是否超過配置的容量。 |
工作程式儲存區佇列長度。 |
| 重設太多連線。 |
檢查在給定時間範圍內的連線重設次數是否高於給定的臨界值。 |
連線會重設工作者節點儲存區的度量值。 |
| 在「接聽待辦事項」中累積太多要求。 |
檢查各種 PHP-FPM 工作者佇列的大小,並根據臨界值進行驗證。 |
各種 PHP-FPM 工作者佇列的接聽佇列大小度量值。 |
| 太多慢速要求。 |
檢查所有受監視 PHP-FPM 工作者節點儲存區上慢速要求的比例。 |
PHP-FPM 實例之工作者節點儲存區的慢速要求及已接受連線度量值。 |
如需此感應器的相關資訊,請參閱 PHP 文件。
虛構檢查
| 事件 |
說明 |
度量 |
| 無法聯繫遠端目標。 |
檢查給定滑動視窗中的失敗通訊嘗試百分比是否高於給定的臨界值。 |
連線測試的狀態 (status)。 介於 200-206 和 300-307 之間的 HTTP 狀態碼會導致性能健全狀態,對於 icmp ,結束值 0 會被視為性能健全,而值 1 會被視為不健全,此外還會設定 2 秒的執行時間上限 |
如需此感應器的相關資訊,請參閱 虛構檢查 文件。
PostgreSQL DB
| 事件 |
說明 |
度量 |
| 作用中連線使用情形。 |
作用中連線數超過連線數上限的 90%。 |
連線使用情形 (max_conn_pct)。 |
如需此感應器的相關資訊,請參閱 PostgreSQL 文件。
處理程序
| 事件 |
說明 |
度量 |
| 高 CPU 使用率。 |
評估給定的處理程序是否導致主機上的高 CPU 使用率。 |
基礎主機上的高 CPU 使用率規則評估結果,以及給定處理程序的 CPU 使用者時間。 |
| 開啟太多檔案。 |
開啟檔案百分比高於配置的臨界值。 |
已使用 (openFiles.used)。 |
服務
| 事件 |
說明 |
度量 |
| 完全捨棄通話。 |
偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值是否快速下降至零 (基本上不再呼叫服務)。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 |
呼叫數/秒 (count)。 |
| 錯誤率太高。 |
當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測到一致的高錯誤率。 |
錯誤率 (error_rate)。 |
| 錯誤率上升趨勢。 |
檢查給定度量中是否存在遞增趨勢。 規則已調整為偵測給定度量中的弱單調性增加。 不過,該偵測器並不嚴格,且容許在趨勢候選項內的度量值中有一定數量的減少。 |
錯誤率 (error_rate)。 |
| 電話突然掉了下來 |
偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 |
呼叫數/秒 (count)。 |
| 錯誤率突然增加。 |
偵測過去 10 分鐘內相對於 KPI 值的錯誤 KPI 值快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 |
錯誤率 (error_rate)。 |
| 延遲突然增加。 |
偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 |
延遲 50th (duration.50th)。 |
| 一小部分要求的延遲突然增加。 |
偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 |
延遲 99th (duration.99th)。 |
Spring Boot 應用程式
| 事件 |
說明 |
度量 |
| 作用中階段作業數已達到數目上限。 |
處理管線會偵測給定時間範圍內 SpringBoot 應用程式的作用中連線數。 它會驗證作用中階段作業數是否大於臨界值。 |
作用中階段作業 (metrics.httpsessions.active)。 |
| Spring Boot 應用程式關閉。 |
監視 SpringBoot 應用程式的狀態。 |
SpringBoot 應用程式的狀態 (metrics.status)。 |
如需此感應器的相關資訊,請參閱 Spring Boot 說明文件。
Sybase 伺服器
| 事件 |
說明 |
度量 |
| 可用的伺服器連線數已達到限制。 |
每個伺服器的連線數接近 100% 的連線限制。 |
連線 (stats.connCount)。 |
| 資料庫數目上限為限制。 |
每個伺服器的資料庫數接近 100% 的資料庫限制。 |
databasesCount. |
如需此感應器的相關資訊,請參閱 Sybase SQL Anywhere 文件。
虛構 PoP
| 事件 |
說明 |
度量 |
| 虛構蹦現狀態 |
檢查虛構 PoP 是否可以連接至 Instana 後端 |
虛構 PoP 的狀態 (status) |
| 播放引擎狀態 |
檢查播放引擎是否超載。 |
播放引擎 (browserscript.workloadStatus、 http.workloadStatus及 javascript.workloadStatus) 的工作量狀態。 |
| 擷取測試失敗 |
無法從 Instana 後端取得虛構測試。 |
pop_get_test_failed (error.pop_get_test_failed) 的錯誤碼和 URL。 |
| 報告測試結果失敗 |
無法將虛構測試結果公佈至 Instana 後端。 |
pop_report_result_failed (error.pop_report_result_failed) 的錯誤碼及 URL。 |
| 報告測試 Tesult 詳細資料失敗 |
無法將綜合測試結果詳細資料公佈至 Instana 後端。 |
pop_report_result_details_failed (error.pop_report_result_details_failed) 的錯誤碼及 URL。 |
| 報告結果佇列深度偏高 |
偵測結果佇列深度是否偏高 |
ResultQueueDepthHigh (resultQueueDepthHigh). |
如需此感應器的相關資訊,請參閱 虛構 PoP 文件。
Tibco EMS
| 事件 |
說明 |
度量 |
| 連線數超出可用連線數上限。 |
連線數上限幾乎已用完。 |
連線計數 (connectionCount)。 |
| 訊息記憶體用量超出限制。 |
訊息記憶體上限幾乎已用完。 |
訊息記憶體 (messagesMemory)。 |
| 佇列擱置訊息數超出限制。 |
佇列的擱置訊息數上限幾乎已用完。 |
佇列擱置訊息使用情形。 |
| 主題擱置訊息超出限制。 |
主題的擱置訊息數上限幾乎已用完。 |
主題擱置訊息使用情形。 |
如需此感應器的相關資訊,請參閱 Tibco EMS 文件。
Tomcat
| 事件 |
說明 |
度量 |
| 作用中連線數已達到上限。 |
偵測特定連接器的連線數是否達到其配置值上限。 |
連接器連線計數。 |
| 階段作業數目突然下降。 |
檢查階段作業數目是否大幅減少。 |
階段作業總數 (totalSessionCount)。 |
| 會期突然增加。 |
檢查階段作業數目是否大幅增加。 |
階段作業總數 (totalSessionCount)。 |
| 已達到執行緒數目上限。 |
偵測特定連接器的忙碌執行緒數目是否達到其配置值上限。 |
連接器忙碌執行緒數。 |
如需此感應器的相關資訊,請參閱 Tomcat 說明文件。
Varnish 節點
| 事件 |
說明 |
度量 |
| 要求數突然下降。 |
檢查用戶端要求數目是否突然下降。 |
已接收用戶端要求 (client_req)。 |
| 被叛逃的物體突然增加 |
檢查收回的物件數目是否突然增加。 |
Nuked 物件 (n_lru_nuked)。 |
| 執行緒建立失敗。 |
建立太多執行緒失敗。 |
失敗 (threads_failed) 且受限 (threads_limited)。 |
| 清漆後端標示為不健全。 |
清漆後端伺服器性能不佳或無法使用。 |
不健全 (backend_unhealthy)。 |
| 清漆命中率低。 |
清漆命中率非常低。 |
快取命中率 (cache_hit_rate)。 |
| 清漆沒有工作執行緒。 |
清漆沒有工作執行緒。 |
由於佇列已滿而捨棄連線 (sess_dropped)。 |
如需此感應器的相關資訊,請參閱 Varnish 文件。
儲存庫
| 事件 |
說明 |
度量 |
| Vault 已密封。 |
偵測密封狀態是否設為 true。 |
已密封 (sealed)。 |
| 突然增加的秘密閱讀 |
檢查所讀取的密鑰數目是否突然增加 (根據過去 5 分鐘的平均值增加 60%)。 |
密鑰讀取計數 (secret.read.count)。 |
如需此感應器的相關資訊,請參閱 Vault 文件。
WebLogic 伺服器
| 事件 |
說明 |
度量 |
| 資料來源錯誤狀態。 |
處理管線會監視 WebLogicApplications 資料來源的狀態碼,並檢查是否有任何資料來源性能不佳。 |
WebLogic 資料來源狀態。 |
| 性能狀態 |
根據報告的性能狀態來偵測整體系統退化。 |
性能狀態。 |
如需此感應器的相關資訊,請參閱 WebLogic 說明文件。
WebSphere
| 事件 |
說明 |
度量 |
| WebContainer 執行緒儲存區作用中執行緒已達到上限。 |
處理管線會驗證 WebContainer 執行緒儲存區中的作用中執行緒數目是否達到上限。 |
作用中執行緒 (threadPools.webContainer.activeThreads)。 |
| WebSphere 憑證即將到期。 |
憑證有效期限之前的剩餘天數小於臨界值。 |
到期之前的剩餘天數 (certificates.{certificate}.expDaysLeft) |
如需此感應器的相關資訊,請參閱 WebSphere Application Server 文件。
ZooKeeper
| 事件 |
說明 |
度量 |
| 要求延遲上限偏高。 |
處理管線會檢查要求延遲上限是否達到臨界值。 |
要求延遲上限 (max_request_latency)。 |
| 已排入佇列的要求數偏高。 |
處理管線會偵測已排入佇列的要求數目,並驗證該數目是否達到臨界值。 |
未完成的要求計數 (outstanding_requests)。 |
如需此感應器的相關資訊,請參閱 ZooKeeper 說明文件。