內建事件參照

事件 」頁面會顯示所有目前可用的事件清單; 現成可用的內建事件及任何使用者定義的自訂事件。 若要檢視「事件」頁面,請按一下 設定-> 事件

清單可以依下列方式過濾:

  • 類型: 內建 事件或 自訂 事件。
  • 突發事件及嚴重性: 突發事件警告嚴重
  • 全文檢索。

重要事項: 無法修改內建事件。 您可以根據用於內建事件的相同實體及度量值來建立 自訂事件 。 自訂事件會根據任何給定實體的個別度量值臨界值來觸發問題或發生事件。

.NET 應用程式

事件 說明 度量
記憶體回收活動高。 監視 CLR 執行時期平台所花費的記憶體回收 (GC) 時間,並根據容許的百分比值上限來檢查它。 GC 時間 (mem.time_in_gc)。

如需此感應器的相關資訊,請參閱 。NET 文件。

ActiveMQ

事件 說明 度量
無法傳送郵件的佇列大小正在增加。 無法傳送郵件的佇列大小正在增加。 傳送的訊息不會遞送至正確的目的地。 ActiveMQ 佇列大小。
記憶體用量接近限制。 記憶體用量接近記憶體限制的 100%。 記憶體用量 (memoryPercentage)。
商店用量接近限制。 商店用量接近商店限制的 100%。 商店使用情形 (storePercentage)。

如需此感應器的相關資訊,請參閱 ActiveMQ 文件。

ActiveMQ Artemis

事件 說明 度量
ActiveMQ Artemis 沒有連線。 在過去 5 秒內沒有連線。 現行連線數等於已配置的 NoConnections 計數。 連線總數 (totalConnectionCount)。
ActiveMQ Artemis 沒有消費者。 過去 5 秒沒有消費者。 現行消費者數目等於已配置的 NoConsumers 計數。 消費者總計 (totalConsumerCount)。
位址記憶體用量接近限制。 所有位址的記憶體用量接近其記憶體限制的 100%。 位址記憶體用量 (addressMemoryPercentage)。

如需此感應器的相關資訊,請參閱 ActiveMQ Artemis 文件。

Apache HTTP

事件 說明 度量
Apache 子程序在執行 DNS 查閱時停滯。 偵測 DNS 查閱是否大量使用伺服器工作者。 DNS (worker.dns)。
記載正在降低 Apache HTTP 效能。 偵測基於記載目的而大量使用伺服器工作者。 記載 (worker.logging)。
忙碌工作程式數目接近工作程式數目上限。 偵測高忙碌工作程式百分比。 忙碌工作程式 (busy_workers)。

如需此感應器的相關資訊,請參閱 Apache HTTPd 文件。

應用程式

事件 說明 度量
完成在呼叫中捨棄 在過去 30 分鐘內相對於值的呼叫值中偵測到快速下降至零 (基本上不再呼叫服務)。 在呼叫中捨棄的長度也應該超出列出的相對及絕對臨界值參數。 呼叫數/秒 (count)
錯誤率太高 當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測到一致的高錯誤率。 錯誤率 (error_rate)。
錯誤率上升趨勢 此規則會檢查給定度量中是否存在上升趨勢。 規則已調整為偵測給定度量中的弱單調性增加。 不過,偵測器並不嚴格,並容許在趨勢候選項內的度量值減少一定數量。 錯誤率 (error_rate)。
電話突然下降 偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 在呼叫中捨棄的長度也應該超出列出的相對及絕對臨界值參數。 呼叫數/秒 (count)。
錯誤率突然增加 偵測過去 10 分鐘內相對於 KPI 值的錯誤 KPI 值快速增加。 錯誤增加的幅度也應該超出列出的相對及絕對臨界值參數。 錯誤率 (error_rate)。
延遲突然增加 偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出列出的相對及絕對臨界值參數。 延遲 50th (duration.50th)。
一小部分要求的延遲突然增加 偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出列出的相對及絕對臨界值參數。 延遲 99th (duration.99th)。

AWS DynamoDB

事件 說明 度量
已耗用及已佈建讀取的比例是重要的。 偵測高比例的已耗用及已佈建讀取。 耗用的讀取容量 (consumed_read)。
已耗用及已佈建寫入的比例是重要的。 偵測耗用及佈建寫入的高比例。 耗用的寫入容量 (consumed_write) 及佈建的寫入容量 (provisioned_write)。

如需此感應器的相關資訊,請參閱 AWS DynamoDB 說明文件。

AWS MSK

事件 說明 度量
作用中控制器計數。 檢查 Kafka 叢集中是否有異常數量的作用中控制器。 作用中控制器計數 (active_controller_count)。
離線分割區計數。 定義在指定時間範圍內容許的離線分割區違規比例上限。 離線分割區計數 (offline_partitions_count)。
網路處理器低閒置時間。 檢查 Kafka 網路執行緒是否處於高負載。 網路處理器閒置時間 (network_processor_idle)。
要求處理程式低閒置時間。 檢查 Kafka 要求處理程式是否處於高負載狀態。 要求處理程式閒置時間 (request_handler_idle)。
抄寫不足的分割區計數。 檢查抄寫不足的分割區數目是否超出預期數目。 抄寫不足的分割區 (under_replicated_partitions)。

如需此感應器的相關資訊,請參閱 AWS MSK 說明文件。

AWS RDS

事件 說明 度量
CPU 額度平衡達到零。 檢查 CPU 額度餘額是否接近零。 CPU 貸方餘額 (cpu_credit_balance)。
耗用的 CPU 額度數目偏高。 檢查實例耗用的 CPU 額度百分比是否達到容量上限。 CPU 額度使用情形 (cpu_credit_usage) 及 CPU 額度平衡 (cpu_credit_balance)。

如需此感應器的相關資訊,請參閱 AWS RDS 說明文件。

Azure API Management Service

Azure API Management 感應器會每分鐘自動執行任何已配置的自訂性能檢查。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。

事件 說明 度量
Azure Api Management 容量越來越接近容量上限。 檢查 Azure API Management 是否使用超過 90% 的可用容量。 容量 (metrics.Capacity)。

如需此感應器的相關資訊,請參閱 Azure Api 管理 文件。

Azure CosmosDB

事件 說明 度量
Azure CosmosDb 儲存體容量越來越接近容量上限。 偵測 Azure CosmosDb 儲存體容量是否達到容量上限。 CosmosDb 儲存體容量。

如需此感應器的相關資訊,請參閱 Azure CosmosDB 文件。

Azure Redis

Azure Redis Cache 感應器會處理自訂性能檢查,並每分鐘執行一次。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。

事件 說明 度量
Azure Redis 快取用戶端連線越來越接近連線數上限。 Azure Redis 快取使用超過 90% 的可用用戶端連線。 已連接用戶端 (connectedclients)。
Azure Redis 快取記憶體用量越來越接近記憶體上限。 Azure Redis 快取使用超過 90% 的可用記憶體。 已用記憶體百分比 (usedmemorypercentage)。

如需此感應器的相關資訊,請參閱 Azure Redis 文件。

Azure SQL Database

Azure SQL Database 感應器將處理自訂性能檢查,並每分鐘執行一次。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。

事件 說明 度量
資料庫空間不足。 檢查 Azure SQL Database 是否耗盡空間。 警告限制為 80% ,而嚴重限制為已用大小的 90%。 metrics.storage_percent.
資料庫狀態。 資料庫無法使用導致不健全狀態。 如果符合下列其中一個條件,則資料庫可能無法使用:
  • 使用者已將資料庫設為離線
  • 正在從備份還原資料庫
  • 正在回復資料庫
  • 資料庫已毀損
  • 管理者已將資料庫設為「緊急」狀態
  • 正在複製另一個資料庫來建立資料庫
metrics.statusCode.
總 DTU 使用率越來越接近最大 DTU 限制。 檢查 Azure SQL Database DTU 使用率是否達到最大 DTU 限制。 警告限制為 75% ,嚴重限制為 85% 的 DTU 使用率。 metrics.dtu_consumption_percent.

Azure MySQL 資料庫

Azure MySQL 資料庫感應器每分鐘執行一次自訂性能檢查。 如果檢查失敗至少一分鐘,則會提出問題來通知您。

事件 說明 度量
可用的伺服器連線越來越接近連線數上限 Azure MySQL Server 連線用量超過可用用戶端連線的 85%。 作用中連線數 (active_connections)

如需此感應器的相關資訊,請參閱 Azure MySQL 文件。

Azure SQL 彈性儲存區

Azure SQL Elastic Pool 感應器將處理自訂性能檢查,並每分鐘執行一次。 如果檢查失敗至少一分鐘,則會提出問題來通知使用者。

事件 說明 度量
eDTU 使用率總計越來越接近 eDTU 上限。 檢查 Azure SQL 彈性儲存區 eDTU 是否達到 eDTU 上限。 metrics.dtu_consumption_percent.

Cassandra

Cassandra 叢集

事件 說明 度量
無法呼叫到 Cassandra 節點。 一或多個節點已關閉。 無法呼叫到的節點數 (unreachableNodes)。

Cassandra 節點

事件 說明 度量
已封鎖執行緒儲存區。 檢查是否有階段具有已封鎖的執行緒。 階段的已封鎖執行緒度量值。
已捨棄訊息。 檢查是否有執行緒儲存區正在捨棄訊息。 階段的已捨棄訊息度量值。
擱置壓縮。 檢查擱置壓縮是否正在增加。 寫入 (擱置中) (compaction.pending)。
等待突變。 檢查是否有擱置中的突變。 計數器突變 (stage.mutation.pending)。
擱置讀取。 擱置讀取。 讀取修復 (stage.read.pending)。
擱置要求回應。 擱置要求回應。 寫入 (突變) (stage.requestresponse.pending)。
寫入要求突然下降。 檢查 Cassandra 寫入要求數是否突然下降。 寫入 (clientrequests.write.count)。

如需此感應器的相關資訊,請參閱 Cassandra 說明文件。

Ceph

事件 說明 度量
Ceph 叢集狀態。 Ceph 叢集正在報告問題; HEALTH_WARNHEALTH_ERR Ceph 叢集的狀態 (overall_status)。
未達到監視器額定。 性能良好的監視器數目小於所有監視器的 50%。 監視器數目 (num_mons) 及作用中監視器數目 (num_active_mons)。
Osd 完整容量狀態。 部分 OSD 正在報告完整狀態。 作用中 + 清除頁面數 (num_full_osds)。
Osd (s) 接近完整容量狀態。 部分 OSD 正在報告接近完整狀態。 接近完全 osds 的數目 (num_near_full_osds)。

如需此感應器的相關資訊,請參閱 Ceph 文件。

Consul (HashiCorp)

事件 說明 度量
Consul 叢集性能。 偵測叢集的整體性能,以及 Autopilot 是否將任何節點視為性能不佳。 Consul 自動駕駛性能狀態 (consul.autopilot.healthy)。

CRI-O

事件 說明 度量
記憶體已耗盡。 偵測容器記憶體用量是否超出指定的限制。 RSS (memory.total_rss)。

Docker

事件 說明 度量
記憶體已耗盡。 當容器記憶體用量超出指定的限制時,會顯示記憶體警告臨界值或記憶體嚴重臨界值警示。 RSS (memory.total_rss)。

如需此感應器的相關資訊,請參閱 Docker 說明文件。

Elasticsearch

Elasticsearch 叢集

事件 說明 度量
叢集狀態。 監視 Elasticsearch 叢集的狀態。 Elasticsearch 節點數目 (node_count) ,以及 Elasticsearch 叢集的狀態 (cluster_status)。
Elasticsearch 處於核心分裂狀況。 檢查 Elasticsearch 叢集是否有多個主要節點。 Split Brain 是針對具有兩個同名 Elastic 叢集的環境所觸發。 Elasticsearch 叢集中的主要節點計數。

Elasticsearch 節點

事件 說明 度量
重新平衡時的容量限制。 檢查在達到容量限制時是否正在重新定位 Shard ,以將節點辨識為處於容量限制。 容量限制評估及 Shard 重新定位的結果。
資料堆過度配置。 評估 Elasticsearch 的資料堆大小設定是否太大。 基礎 JVM 的資料堆大小上限,以及基礎主機上的總記憶體。
高資料堆用量。 檢查節點的資料堆使用情形以及最近的工作量性質,以偵測資料堆使用情形是否過高。 基礎 JVM 和工作量特性的資料堆使用情形。
節點已達到容量限制。 檢查節點是否達到下列問題所決定的容量限制: 主機上的高負載及 CPU 使用率、 Elasticsearch JVM 中的高資料堆使用率及高 GC 時間。 主機上的高負載和高 CPU 時間、 Elasticsearch的高資料堆用量,以及基礎 JVM 上的高 GC 時間
節點狀態。 檢查 Elasticsearch所提供的叢集狀態。 主機上的高負載和高 CPU 時間、 Elasticsearch的高資料堆用量,以及基礎 JVM 上的高 GC 時間。
拒絕的動作。 檢查拒絕的執行緒數目是否太高。 索引 (threads.index_rejected)、搜尋 (threads.search_rejected)、大量 (threads.bulk_rejected) 及取得 (threads.get_rejected)。

如需此感應器的相關資訊,請參閱 Elasticsearch 說明文件。

端點

事件 說明 度量
完全捨棄通話。 偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值是否快速下降至零 (基本上不再呼叫服務)。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 呼叫數/秒 (count)。
錯誤率太高。 當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測到一致的高錯誤率。 錯誤率 (error_rate)。
綜合端點的錯誤率太高。 當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測 Synthetic 端點的一致高錯誤率。 綜合錯誤率 (synthetic_error_rate)。
錯誤率上升趨勢。 檢查給定度量中是否存在遞增趨勢。 規則已調整為偵測給定度量中的弱單調性增加。 不過,偵測器並不嚴格,並容許在趨勢候選項內的度量值減少一定數量。 錯誤率 (error_rate)。
電話突然掉了下來 偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 呼叫數/秒 (count)。
合成人電話突然下降 偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 綜合呼叫數/秒 (synthetic_count)。
錯誤率突然增加。 偵測過去 10 分鐘內相對於 KPI 值的錯誤 KPI 值快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 錯誤率 (error_rate)。
延遲突然增加。 偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 延遲 50th (duration.50th)。
一小部分要求的延遲突然增加。 偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 延遲 99th (duration.99th)。

etcd

事件 說明 度量
磁碟後端確定持續時間異常高。 偵測高光碟後端確定持續時間。 磁碟後端確定持續時間 (health.disk_backend_commit_duration)。
磁碟 wal fsync 持續時間異常高。 偵測高磁碟 wal fsync 持續時間。 磁碟 fsync 持續時間 (health.disk_wal_fsync_duration)。
Snapshot 持續時間異常高。 偵測儲存 Snapshot 的高持續時間。 貼齊儲存持續時間總計 (health.debugging_snap_save_total_duration)。
在最後一分鐘看到頻繁的領導者變更。 偵測過去 1 分鐘的大量主導器變更。 伺服器主導器變更 (health.server_leader_changes)。
成員沒有領導者。 偵測沒有主導器 (無法使用) 的成員。 伺服器具有主導器 (health.server_has_leader)。
提案比例分析。 偵測已套用提案的異常下降,以及擱置及失敗提案的異常上升。 已確定的提案數 (health.server_proposals_committed)、已套用的提案數 (health.server_proposals_applied)、擱置的提案數 (health.server_proposals_pending) ,以及失敗的提案數 (health.server_proposals_failed)。
開啟檔案描述子的使用非常重要。 偵測大量使用開啟檔案描述子。 開啟檔案描述子數目 (health.process_open_fds) 及檔案描述子數目上限 (health.process_max_fds)。

如需此感應器的相關資訊,請參閱 etcd 文件。

Garden 儲存器

事件 說明 度量
記憶體已耗盡。 儲存器記憶體用量已接近其記憶體限制。 用法 (memory.usage)。

如需此感應器的相關資訊,請參閱 Garden 文件。

Glassfish

事件 說明 度量
Glassfish 檔案快取命中率如下: 70%。 處理管線會檢查檔案快取命中率,並驗證它是否低於給定的臨界值。 命中率 (file_cache_rate)。
已達到 JDBC 連線數上限。 處理管線會檢查 JDBC 連線總數。 它會驗證它是否達到伺服器配置的上限。 已使用 (jdbc_connection_used)。

如需此感應器的相關資訊,請參閱 Glassfish 文件。

Google Cloud 資料儲存庫

事件 說明 度量
在過去 30 分鐘內,資料儲存庫要求計數大幅下降。 檢查要求計數是否突然減少。 要求 (request_count)
在過去 30 分鐘內,資料儲存庫要求計數大幅增加。 檢查要求計數是否突然增加。 要求 (request_count)

如需此感應器的相關資訊,請參閱 Google Cloud 資料儲存庫 文件。

Google Cloud Storage

事件 說明 度量
突然增加所有物件的大小 針對非空白儲存區檢查 24h 中所有物件的大小是否突然增加 儲存區中所有物件的大小總計。

如需此感應器的相關資訊,請參閱 Google Cloud Storage 文件。

Google Cloud Pub/Sub

事件 說明 度量
訂閱的推送要求延遲在過去 10 分鐘內已增加。 檢查訂閱是否突然增加推送要求延遲。 要求延遲時間 (push_request_latencies)
主題最舊訊息。 檢查主題是否有比臨界值還舊的訊息。 最舊訊息 (oldest_unacked_message_age)

如需此感應器的相關資訊,請參閱 Google Cloud Pub/Sub 文件。

Hadoop YARN

事件 說明 度量
資源管理程式正在報告遺失節點。 偵測資源管理程式是否報告遺失節點。 遺失節點 (lostNodes)。
資源管理程式正在報告不健全的節點。 偵測資源管理程式是否報告性能不佳的節點。 不健全節點 (unhealthyNodes)。
提交的應用程式失敗。 偵測提交的應用程式是否失敗。 應用程式失敗 (appsFailed)。

如需此感應器的相關資訊,請參閱 Hadoop YARN 文件。

HAProxy

事件 說明 度量
HAProxy 後端平均佇列大小偏高。 HAProxy 後端平均佇列大小很大。 後端佇列大小。
HAProxy 前端階段作業用量偏高。 HAProxy 前端階段作業用量偏高。 前端階段作業使用率。
平均回應時間突然增加。 檢查單一後端的平均回應時間是否突然增加。 平均回應時間度量。

如需此感應器的相關資訊,請參閱 HAProxy 文件。

Hazelcast

從 Hazelcast 3.3 開始,使用公用方法 HazelcastInstance::getPartitionService()::isLocalMemberSafe() 。 對於較舊的 Hazelcast 版本,性能狀態衍生自每個本端節點上的內部「具有進行中移轉」狀態。

從每一個 Hazelcast 節點聚集 Hazelcast 叢集性能狀態。 這正是 HazelcastInstance::getPartitionService()::isClusterSafe() 在內部執行的動作,但不會造成呼叫此方法的額外負擔。

Hazelcast 叢集

事件 說明 度量
叢集狀態。 檢查 Hazelcast的叢集狀態。 Hazelcast 3.3 或以上。 Hazelcast 叢集狀態旗標。

Hazelcast 節點

事件 說明 度量
節點狀態。 檢查本端成員的狀態。 Hazelcast 3.3 或以上。 Hazelcast 節點狀態旗標。

如需此感應器的相關資訊,請參閱 Hazelcast IMDG 文件。

HBase

事件 說明 度量
儲存庫數目與儲存庫檔案數目之間的差異很大。 偵測異常低或異常高數目的商店。 儲存計數 (rs_store_count) 和儲存檔案計數 (rs_store_file_count)。
區域伺服器區塊快取命中率偏低。 偵測低快取命中率。 區塊快取命中率 (rs_blk_cache_hit_rate) 及區塊快取命中計數 (rs_blk_cache_hit_count)。
壓縮佇列長度大幅增加。 檢查壓縮佇列的長度是否突然增加。 此規則指出所有區域都以類似的速率成長,且需要大約同時分割/壓縮。 可以透過預先分割或關閉自動壓縮來解決此問題。 壓縮佇列長度 (rs_comp_queue_length)。
清除佇列長度大幅增加。 檢查清除佇列的長度是否突然增加。 觸發時,這可能表示缺少 RAM ,或排清的速度比磁碟可以處理的快。 清除佇列長度 (rs_flush_queue_length)。

如需此感應器的相關資訊,請參閱 Apache HBase 說明文件。

主機

事件 說明 度量
CPU 花費大量時間等待輸入/輸出。 檢查系統是否花費大量時間等待輸入/輸出 (在 60 秒的滑動視窗中取樣)。 等待 (cpu.wait)。
已超出 CPU 竊用時間。 檢查第二個移動視窗,是否在執行中處理程序之間或由 Hypervisor/主機 OS (在 60 秒的滑動視窗中取樣) 竊取太多 CPU。 竊用 (cpu.steal)。
裝置剩餘容量低或已滿。 偵測磁碟低容量問題,以提前 15 分鐘提供可能容量中斷的早期預測。 當剩餘磁碟空間超過 1GB 或容量總計的 1% 時,不會發動偵測器。 不過,如果剩餘磁碟空間是空的 (<1MB) ,或磁碟空間會根據現行趨勢在未來 15 分鐘內填滿,則會發動。 磁碟可用儲存體容量。
磁碟填滿的速度比被清除的快。 偵測長期磁碟容量問題,並在磁碟可能在接下來 48 小時內容量不足時發動。 當剩餘磁碟空間超過總容量的 20% 時,偵測器未發動。 不過,根據現行趨勢,當磁碟空間在未來 48 小時內填滿時,它將會發動。 此趨勢是根據一段時間內收集的本端最小值來計算。 當這些本端最小值定義至少 4 小時的時間範圍時,會在這些資料點上擬合線性迴歸模型,以最終執行長期預測。 磁碟可用儲存體容量。
經常發生 TCP 錯誤。 檢查主機是否有異常高的 TCP 錯誤數 (在滑動視窗中取樣 60 秒)。 In Segments/s (tcp.inSegs) and error (tcp.errors).
頻繁 TCP 失敗。 檢查主機是否有異常高的 TCP 失敗數 (在滑動視窗中取樣 60 秒)。 失敗 (tcp.fails) 和開啟/秒 (tcp.opens)。
永久 TCP 重新傳輸。 檢查主機是否有異常大量 TCP 重新傳輸 (在滑動視窗中取樣 60 秒)。 重新傳輸 (tcp.retrans) 及輸出區段/秒 (tcp.outSegs)。
系統負載太高。 透過將負載與機器 CPU 核心的 2 倍進行比較 (在 120 秒的滑動視窗中取樣) ,來檢查系統負載是否過高。 載入 (load.1min)。
系統記憶體已耗盡。 檢查系統記憶體是否接近耗盡 (立即觸發)。 可用 (memory.free) 及已使用 (memory.used)。
開啟太多檔案。 處理程序開啟檔案的速度比它們關閉檔案的速度快 (現行與最大比例超出臨界值)。 已使用 (openFiles.used)。
太多使用 inode。 檔案系統上的低層次可用 inode 會觸發此性能規則 (現行與最大比例超出臨界值)。 Inode 使用情形。
使用者處理程序的 CPU 使用率過高。 檢查使用者處理程序的 CPU 使用率是否過高 (在 180 秒的滑動視窗中取樣)。 使用者 (cpu.user) 及 topPID。
您很快就會用盡磁碟空間。 偵測磁碟的短期容量問題,並在磁碟可能在下一個小時內容量不足時發動。 當磁碟在最近過去釋放大量空間 (>=100MB) 時,或當剩餘磁碟空間超過總容量的 20% 時,不會發動偵測器。 不過,根據現行趨勢,當磁碟空間在未來一小時內填滿時,它將會發動。 此趨勢是根據適合現行滑動視窗之資料點的線性迴歸模型來計算。 磁碟可用儲存體容量。

如需此感應器的相關資訊,請參閱 主機 文件。

IBM ACE

事件 說明 度量
ACE Integration Server 的狀態 請檢查 ACE Integration Server 的狀態。 整合伺服器狀態
ACE Integration Server 狀態數位格式 請檢查 ACE Integration Server 的數位狀態。 整合伺服器狀態度量
佇列管理程式連線狀態數位格式 請檢查 ACE Integration Server 與佇列管理程式之間的數位狀態。 佇列管理程式連線狀態度量
含有錯誤號碼的訊息 包含錯誤的訊息數。 有錯誤的訊息數
含有錯誤號碼的訊息流程 MQGET 錯誤數(MQInput 節點)或「Web 服務」錯誤數(HTTPInput 節點)。 MQGET 錯誤數
含有錯誤號碼的訊息處理 處理訊息時發生的錯誤數。 有錯誤的訊息數
訊息流程狀態 請檢查 ACE 訊息流程的狀態。 訊息流程狀態
訊息流程狀態數位格式 請檢查 ACE 訊息流程的數位狀態。 訊息流程狀態度量

如需此感應器的相關資訊,請參閱 IBM ACE 文件。

IBM Db2

事件 說明 度量
表格空間公用程式度量狀態 當啟用及停用自動調整大小功能時,請檢查與表格空間及其度量相關的事件。 表格空間公用程式
HADR 連接狀態 檢查與 HADR 待命資料庫的連線狀態相關的事件。 待命 ID 可用作過濾器來產生 HADR_CONNECT_STATUS 事件,該事件特定於任何待命節點,並且可以使用相符操作員欄位中的待命 ID 進行設定。 事件可以根據下列項目來建立,這代表任何資料庫的現行狀態:
  • 資料庫已連接 (Connect State = CONNECTED 為 1)。
  • 資料庫處於斷線狀態 (Connect State = DISCONNECTED 為 0)。
HADR_CONNECT_STATUS (hadr.standbyId.HADR_CONNECT_STATUS)。 設定為 any 的相符運算子將產生與待命 ID 無關的事件。

如需此感應器的相關資訊,請參閱 IBM Db2 文件。

IBM MQ

IBM MQ 佇列管理程式

事件 說明 度量
佇列管理程式連線數 檢查「佇列管理程式」目前是否沒有連線。 連線計數 (connectionCount)
佇列管理程式狀態 檢查「佇列管理程式」是否處於已停止或待命狀態,以觸發 DownSwitchover 事件。 佇列管理程式狀態 (statusMetric)
佇列管理程式的通道起始程式狀態 檢查「通道起始程式」是否處於執行中狀態。 通道起始程式狀態 (channelInitiatorStatus)
佇列管理程式的發佈/訂閱引擎狀態 檢查「發佈」或「訂閱」引擎是否處於執行中狀態。 發佈/訂閱引擎狀態 (pubsubStatus)
橋接器已停止[1] 指出 IMS 橋接器已停止。 從 IBM MQ 事件

IBM MQ 佇列

事件 說明 度量
佇列最舊訊息 檢查佇列是否有早於臨界值的訊息。 佇列上最舊的訊息 (oldestMessage)
佇列深度差異 檢查佇列深度是否接近佇列深度上限值。 佇列深度 (queueDepth) 及佇列深度上限 (maxQueueDepth)
佇列已滿 檢查佇列深度百分比是否已達到警告或嚴重值。 佇列深度百分比 (queueFullPercentage)
傳輸佇列高 檢查傳輸佇列訊息數是否太高。 佇列深度 (queueDepth)
佇列服務間隔高[1: 1] 偵測不到間隔內沒有成功的 GET 作業或 MQPUT 呼叫大於 QServiceInterval 屬性中指定的限制。 從 IBM MQ 事件
佇列深度高[1: 2] 指出透過 QDepthHighLimit 屬性中指定的 MQPUT 或 MQPUT1 呼叫,佇列深度已增加至預先定義的臨界值。 從 IBM MQ 事件
佇列已滿[1: 3] 指出呼叫失敗 (在 MQPUT 或 MQPUT1 呼叫上) ,因為佇列已滿。 也就是說,佇列已包含可能的訊息數目上限。 從 IBM MQ 事件

IBM MQ 通道

事件 說明 度量
通道狀態 檢查通道是否處於健全狀態。 通道狀態 (channelStatus)
通道 InDoubt 狀態 檢查通道是否處於不確定狀態。 通道狀態 (channelStatus)
通道轉換錯誤[1: 4] 指出當通道無法完成資料轉換及 MQGET 呼叫,以從傳輸佇列取得導致資料轉換錯誤的訊息時發生錯誤。 從 IBM MQ 事件
通道 SSL 錯誤[1: 5] 指出使用「傳輸層安全 (TLS)」或 Secure Sockets Layer (SSL) 的通道無法建立 MQ 連線時發生錯誤。 從 IBM MQ 事件

您可以針對處於 已停止InDoubt 狀態的通道使用內建事件。 您需要為處於其他狀態且具有內建度量值的通道建立自訂事件。 如需通道狀態的列舉值,請參閱 IBM MQ 通道度量參照

IBM MQ 接聽器

事件 說明 度量
接聽器狀態 檢查接聽器是否處於健全狀態。 接聽器狀態 (listenerStatus)

如需此感應器的相關資訊,請參閱 IBM MQ 文件。

IIS 網際網路 Information Server

事件 說明 度量
對 IIS 網站的要求突然下降。 檢查 IIS-site 的要求是否突然下降。 IIS 網站的要求度量總計。

如需此感應器的相關資訊,請參閱 Microsoft IIS 文件。

IBM Datapower

IBM DataPower 軟體驅動裝置

事件 說明 度量
CPU 使用率的應用裝置百分比 請檢查應用裝置的 CPU 使用率百分比是否太高。 CPU 使用率 (cpuUsage)
軟體驅動裝置記憶體用量百分比 請檢查應用裝置的記憶體用量百分比是否太高。 記憶體用量 (memoryUsage)
系統負載的應用裝置百分比 請檢查應用裝置的系統負載百分比是否太高。 系統負載 (systemLoad)
設備狀態 檢查應用裝置狀態是否處於健全狀態。 狀態 (status)

IBM DataPower 網域

事件 說明 度量
網域記憶體用量百分比 請檢查記憶體用量的網域百分比是否太高。 現行記憶體用量 (currentMemUsage)
IBM DataPower Gateway 對等作業狀態 檢查每一個實例的閘道同層級狀態是否岔斷。 岔斷狀態 ('brokenStatus')

IBM DataPower 服務

事件 說明 度量
記憶體用量的服務百分比 請檢查記憶體用量的服務百分比是否太高。 現行記憶體用量 (currentMemUsage)
服務狀態 檢查服務狀態是否處於健全狀態。 狀態 (status)

如需此感應器的相關資訊,請參閱 IBM Datapower 文件。

JBoss

事件 說明 度量
連接器上的平均錯誤數太高。 處理管線會偵測連接器在給定時間範圍內發生的錯誤數,並檢查錯誤數是否大於臨界值。 Jboss 連接器錯誤。
ConnectionPool 正在耗盡連線。 處理管線會偵測已使用的連線比例,並檢查它是否即將達到臨界值。 JBoss 連線儲存區已用連線數比例。
資料來源上的連線已逾時。 處理管線會在給定時間範圍內偵測資料來源上可用的連線數,並檢查連線總數是否即將達到臨界值。 已使用 Jboss 資料來源連線,可用的資料來源連線。
ThreadPool 執行緒已耗盡。 處理管線會偵測執行緒數目上限,並檢查現行執行緒計數是否即將達到臨界值。 JBoss 執行緒儲存區現行執行緒計數,執行緒儲存區執行緒數目上限。

如需此感應器的相關資訊,請參閱 JBoss AS 說明文件。

JBoss 資料網格

事件 說明 度量
快取不在執行中狀態。 檢查建立的快取數與在「Jboss 資料網格」中執行的快取數的比例。 如果比例遵循特定值,則會將它視為違規。 執行及建立快取管理程式的快取。

如需此感應器的相關資訊,請參閱 JBoss 資料網格 文件。

JVM

事件 說明 度量
記憶體回收活動高。 處理管線會監視「JVM 執行時期平台」所花費的「記憶體回收」時間,並根據臨界值進行驗證。 JVM 記憶體回收。
JVM 程式碼快取已滿。 處理管線會監視「JVM 執行時期平台」的「程式碼快取」用量上限。 JVM 程式碼快取用量上限。
Perm Gen 已滿 (CMS)。 處理管線會偵測所使用的 Perm Gen CMS 儲存區數目上限。 pools.CMS Perm Gen
Perm Gen 已滿 (G1)。 處理管線會偵測使用的 Perm Gen G1 儲存區數上限。 pools.G1 Perm Gen
Perm Gen 已滿 (PS)。 處理管線會偵測所使用的 Perm Gen PS Pools 上限。 pools.PS Perm Gen
執行緒已死鎖。 偵測器會監視 JVM 執行時期平台,並偵測是否有任何「死鎖」執行緒。 死鎖的執行緒數 (threads.deadlocked)。
J9VM 記憶體洩漏。 偵測器會檢查 GC 之後使用的資料堆 的增長率 (以每小時 MB 為單位) ,並偵測 JVM 中是否可能發生記憶體洩漏。 IBM J9 VM 記憶體洩漏偵測是選用特性,依預設會在 Instana 後端中停用。 若要啟用此選用特性,請參閱 Instana 部署的頁面: SaaS在 Kubernetes 或 Red Hat OpenShift上自行管理,或 在 Docker memory.gc.after memory.gc.before

如需此感應器的相關資訊,請參閱 JVM 文件。

Kafka

Kafka 叢集

事件 說明 度量
作用中控制器數目。 檢查 Kafka 叢集中是否有異常數量的作用中控制器。 分配管理系統作用中控制器計數 (broker.activeControllerCount)。

Kafka 節點

事件 說明 度量
Kafka 網路執行緒處於高負載狀態。 檢查 Kafka 網路執行緒是否處於高負載。 網路處理器 (broker.networkProcessorIdle)。
Kafka 要求處理程式執行緒處於高負載狀態。 檢查 Kafka 要求處理程式是否處於高負載狀態。 要求處理程式 (broker.requestHandlerIdle)。
領導人選舉太頻繁了。 檢查給定時間範圍內是否有太多領導者選舉。 主導器選取 (broker.leaderElections)。
由於領導人選舉不乾淨,可能導致資料流失。 檢查是否因領導人選舉不乾淨而造成潛在資料流失。 未清除領導人選舉 (broker.uncleanLeaderElections)。
已封鎖生產者和消費者。 檢查是否由於分割區離線而封鎖生產者及消費者。 離線分割區 (broker.offlinePartitionsCount)。
已壓縮同步抄本數。 檢查是否已壓縮同步抄本數目,且未在給定的間隔內回復。 ISR 收縮 (broker.isrShrinks) 及 ISR 擴充 (broker.isrExpansions)。
抄寫不足的分割區。 檢查抄寫不足的分割區數目是否超出預期數目。 抄寫不足的分割區 (broker.underReplicatedPartitions)。

如需此感應器的相關資訊,請參閱 Kafka 說明文件。

Kubernetes

Kubernetes 叢集

事件 說明 度量
Kubernetes 叢集元件狀態。 Kubernetes 報告「主要元件」(API-伺服器、排程器、控制器管理程式) 性能不佳。 由於 Kubernetes中的錯誤,無法一律可靠地報告性能。 我們嘗試只顯示在「叢集詳細資料」頁面上,以過濾掉這些項目,而不會導致警示。 Instana 低層次事件。

Kubernetes DaemonSet

事件 說明 度量
可用的抄本數小於想要的抄本數。 檢查可用的抄本總數是否小於想要的抄本數。 這表示 Kubernetes DaemonSet 遺漏抄本 Pod。 所需 (desiredReplicas) 及可用 (availableReplicas)。

Kubernetes 部署

事件 說明 度量
可用的抄本數小於想要的抄本數。 檢查可用的抄本總數是否小於想要的抄本數。 這表示 Kubernetes 部署遺漏抄本 Pod。 所需 (desiredReplicas) 及可用 (availableReplicas)。

Kubernetes 名稱空間

事件 說明 度量
可配置的 CPU 要求太低。 所要求的 CPU 接近容量上限 (所要求的 CPU/CPU 容量比例大於 80%)。 CPU 要求配置 (required_cpu_percentage)。
可配置記憶體要求太低。 所要求的記憶體接近容量上限 (所要求的記憶體/記憶體容量比例大於 80%) 記憶體要求配置 (required_mem_percentage)。
可配置 Pod 計數太低。 已配置的 Pod 接近容量上限 (已配置的 Pod/Pod 容量比例大於 80%)。 對於名稱空間,階段 PendingRunningUnknown 中的 Pod 會被視為已配置。 名稱空間容量值基於每個名稱空間可以設定的 ResourceQuotas。 如需相關資訊,請參閱 Kubernetes 文件。 Pod 配置 (used_pods_percentage)。

Kubernetes 節點

事件 說明 度量
可配置 CPU 太低。 所要求的 CPU 接近容量上限 (所要求的 CPU/CPU 容量比例大於 80%)。 CPU 要求配置 (required_cpu_percentage)。
可配置記憶體太低。 所要求的記憶體接近容量上限 (所要求的記憶體/記憶體容量比例高於 80%)。 記憶體要求配置 (required_mem_percentage)。
可配置 Pod 計數太低。 已配置的 Pod 接近容量上限 (已配置的 Pod/Pod 容量比例大於 80%)。 對於節點,階段 RunningUnknown 中的 Pod 會計算為已配置。 如需相關資訊,請參閱 Kubernetes 文件。 Pod 配置 (alloc_pods_percentage)。
Kubernetes 節點條件狀態。 節點報告未備妥超過一分鐘的狀況。 對於除了 Ready 條件以外的所有條件的節點。 如需相關資訊,請參閱 Kubernetes 文件。 Instana 低層次事件。

Kubernetes Pod

事件 說明 度量
Kubernetes Pod 條件狀態。 Pod 未備妥超過一分鐘,原因不是它已完成。 (PodCondition= Ready , Status=False , Reason! = PodCompleted)。 如需相關資訊,請參閱 Kubernetes 文件。 Instana 低層次事件。

如需此感應器的相關資訊,請參閱 Kubernetes 文件。

Memcached 節點

事件 說明 度量
清除所有已執行的指令。 偵測到大量 flush_all 指令。 清除 (cmd_flush)。
高索引鍵收回。 偵測大量金鑰收回。 收回 (evictions)。
已排入佇列的連線數目增加。 偵測是否有大量已排入佇列的連線。 已排入佇列 (conn_queued)。
產生的連線數目增加。 偵測大量已產生連線。 生產 (conn_yields)。
Memcached 所使用的位元組數已達到 maxbytes 限制。 Memcached 所使用的位元組數已達到位元組數上限。 已用位元組數。

如需此感應器的相關資訊,請參閱 Memcached 文件。

MongoDB 節點

事件 說明 度量
持續增加背景清除延遲。 資料庫報告增加背景清除延遲 (在滑動視窗中取樣 150 秒)。 前次背景清除延遲 (backgroundFlushingLast)。
持續增加鎖定佇列長度。 監視「 MongoDb 鎖定佇列」度量,並驗證鎖定佇列大小是否增加得太快。 鎖定佇列長度 (lockQueue)。
增加尋頁錯失。 增加尋頁錯失 (在 150 秒的滑動視窗中取樣)。 尋頁錯失數 (pageFaults)。
寫入鎖定增長中的日誌登載確定 寫入鎖定增長中的日誌登載確定 (在滑動視窗中取樣 150 秒)。 日誌登載寫入鎖定 (journalWriteLock)。
非對映虛擬記憶體的比例太高 非對映虛擬記憶體的比例太高 (即時觸發並由 Instana 主機感應器報告)。 Virtualmapped

MongoDB 抄本集

事件 說明 度量
ReplicaSet 已關閉成員。 無法呼叫到從集合的另一個成員看到的成員。 unreachableNodeCount.
ReplicaSet 監視狀態。 監視 MongoDB 抄本集所有成員的性能。 從屬延遲計數 (slaveDelaysCount)、作業時間計數 (optimesCount) 及受監視成員計數 (monitoredMembersCount)。
抄寫延遲正在增加。 抄寫延遲正在增加 (在滑動視窗中取樣 150 秒)。 從屬延遲 (slaveDelays) 和 Optimes (optimes)。
抄本集連線用量偏高。 作用中連線數超過連線數上限的 90%。 連線 ('connections ')。

如需此感應器的相關資訊,請參閱 MongoDB 文件。

MySQL DB

事件 說明 度量
可用的伺服器連線數已達到限制。 已用與連線限制之間的比例大於配置的比例臨界值。 連線 (status.THREADS_CONNECTED)。

如需此感應器的相關資訊,請參閱 MySQL 文件。

Nginx 伺服器

事件 說明 度量
Nginx 有離線對等節點的問題。 非作用中對等節點 (僅適用於 NGINX Plus)。 Upstreams 失敗 (nginx_plus.http.upstreams.peers.failed)。
Nginx 正在捨棄連線。 已捨棄連線。 已捨棄連線 (connections.dropped)。
Nginx 因 SSL 信號交換而失敗。 SSL 信號交換失敗 (僅適用於 NGINX Plus)。 失敗的信號交換 (nginx_plus.ssl.handshakes_failed)。
作用中連線數接近上限。 已用連線比例超出已用連線的配置比例臨界值。 作用中連線 (connections.active)。

如需此感應器的相關資訊,請參閱 NGINX 文件。

Node.js 應用程式

事件 說明 度量
記憶體回收活動高。 檢查在給定時間範圍內 GC 所花費的時間是否高於給定的臨界值。 GC 暫停度量。
性能檢查失敗。 檢查是否有任何失敗的性能檢查。 如需相關資訊,請參閱 性能檢查支援 性能檢查結果 (healthcheckResult)。

如需此感應器的相關資訊,請參閱 Node.js 文件。

OpenShift 部署配置

事件 說明 度量
可用的抄本數小於想要的抄本數。 檢查可用的抄本總數是否小於想要的抄本數。 這指出 OpenShift DeploymentConfig 遺漏抄本 Pod。 所需 (desiredReplicas) 及可用 (availableReplicas)。

如需此感應器的相關資訊,請參閱 Openshift 說明文件。

OracleDB

事件 說明 度量
「DB CPU 時間」與「DB 時間」之間的比例較低。 「DB CPU 時間」與「DB 時間」之間的比例如下所配置的臨界值。 資料庫 CPU 時間/資料庫時間比例 (stats.cpuTimeDbTimeRatio)。
表格空間空間使用情形偏高。 表格空間已用空間比已配置的最大空間量更重要。 表格空間已用空間百分比。
最大階段作業總數。 已用階段作業比例超出已配置的已用階段作業比例臨界值。 階段作業/階段作業限制 (stats.usedSessionsRatio)。

如需此感應器的相關資訊,請參閱 OracleDB 文件。

OS 處理程序

事件 說明 度量
CPU 使用率 處理程序導致主機上的 CPU 使用率過高。 基礎主機上高 CPU 使用率規則評估的結果,以及給定處理程序的 CPU 使用者時間。
開啟檔案使用情形。 處理程序開啟檔案的速度比關閉檔案的速度快 (現行與最大比例超出臨界值) 已使用 (openFiles.used)。
異常終止。 處理程序因未捕捉信號而終止。
異常終止。 處理程序已終止,且具有非零結束碼。

如需此感應器的相關資訊,請參閱 OS 處理程序 文件。

PHP-FPM 執行時期

事件 說明 度量
經常重新啟動 PHP-FPM 工作者節點儲存區。 透過針對給定臨界值評估 PHP-FPM 工作者節點儲存區在給定時間範圍內的重新啟動次數,來檢查 PHP-FPM 工作者節點儲存區是否頻繁重新啟動。 工作程式儲存區的開始時間。
接聽待辦事項已配置超過容量。 檢查工作者節點儲存區的接聽待辦事項是否超過配置的容量。 工作程式儲存區佇列長度。
重設太多連線。 檢查在給定時間範圍內的連線重設次數是否高於給定的臨界值。 連線會重設工作者節點儲存區的度量值。
在「接聽待辦事項」中累積太多要求。 檢查各種 PHP-FPM 工作者佇列的大小,並根據臨界值進行驗證。 各種 PHP-FPM 工作者佇列的接聽佇列大小度量值。
太多慢速要求。 檢查所有受監視 PHP-FPM 工作者節點儲存區上慢速要求的比例。 PHP-FPM 實例之工作者節點儲存區的慢速要求及已接受連線度量值。

如需此感應器的相關資訊,請參閱 PHP 文件。

虛構檢查

事件 說明 度量
無法聯繫遠端目標。 檢查給定滑動視窗中的失敗通訊嘗試百分比是否高於給定的臨界值。 連線測試的狀態 (status)。 介於 200-206 和 300-307 之間的 HTTP 狀態碼會導致性能健全狀態,對於 icmp ,結束值 0 會被視為性能健全,而值 1 會被視為不健全,此外還會設定 2 秒的執行時間上限

如需此感應器的相關資訊,請參閱 虛構檢查 文件。

PostgreSQL DB

事件 說明 度量
作用中連線使用情形。 作用中連線數超過連線數上限的 90%。 連線使用情形 (max_conn_pct)。

如需此感應器的相關資訊,請參閱 PostgreSQL 文件。

處理程序

事件 說明 度量
高 CPU 使用率。 評估給定的處理程序是否導致主機上的高 CPU 使用率。 基礎主機上的高 CPU 使用率規則評估結果,以及給定處理程序的 CPU 使用者時間。
開啟太多檔案。 開啟檔案百分比高於配置的臨界值。 已使用 (openFiles.used)。

RabbitMQ

RabbitMQ 叢集

事件 說明 度量
偵測到 RabbitMQ 網路分割區 偵測是否在 RabbitMQ 叢集內發生 網路分割區 (每 5 秒觸發一次)。 網路分割區總數 (net_partitions_count)。

RabbitMQ 伺服器

事件 說明 度量
佇列已填滿訊息 在 10 分鐘的期間內,佇列會填滿未遞送的訊息。 備妥的訊息 (overview.messages_ready) 及已確認的訊息 (overview.ack)。
RabbitMq 沒有消費者 在過去 5 秒內, RabbitMQ 沒有消費者。 消費者 (overview.consumers)。
RabbitMq 沒有連線 在過去 5 秒內, RabbitMQ 沒有連線。 連線 (overview.connections)。

RabbitMQ 節點

事件 說明 度量
RabbitMQ 檔案描述子使用情形非常重要。 特定節點上的檔案描述子使用率是嚴重的 (警告:> 90% ,嚴重:> 98%)。 每 5 秒會觸發一次。 RabbitMQ 檔案描述子使用率 (fd_used_rate)。
RabbitMQ 節點上的記憶體用量非常嚴重。 特定節點上的記憶體使用率為嚴重 (警告:> 90% ,嚴重:> 98%)。 每 5 秒會觸發一次。 RabbitMQ 記憶體使用率 (mem_used_rate)。
RabbitMQ Erlang 處理程序計數是嚴重的。 Erlang 處理程序計數在特定節點上是嚴重的 (警告:> 90% ,嚴重:> 98%)。 每 5 秒會觸發一次。 RabbitMQ 處理程序率。

RabbitMQ 佇列

事件 說明 度量
產生的訊息數超過耗用的訊息數。 發佈至佇列的訊息數超過消費者可以從佇列處理的訊息數。 RabbitMQ 佇列中未確認的訊息。

如需此感應器的相關資訊,請參閱 RabbitMQ 文件。

Redis

Redis 叢集

事件 說明 度量
Redis 叢集狀態不正常。 叢集處於不適當的狀態。 cluster_state.

Redis 節點

事件 說明 度量
記憶體配置分析。 Redis 伺服器導致外部記憶體片段化。 已用記憶體 (used_memory) 和記憶體片段化比例 (mem_fragmentation_ratio)。
Redis 命中率偏低。 Redis 命中率如下所示: 已配置臨界值。 快取命中率 (hit_rate)、索引鍵空間命中 (keyspace_hits)、索引鍵空間遺失 (keyspace_misses) 及 Redis 收回的索引鍵 (evicted_keys)。
Redis 記憶體用量越來越接近記憶體上限。 Redis 記憶體用量越來越接近記憶體上限。 已用記憶體 (used_memory)。
Redis 拒絕連線。 Redis 正在拒絕連線。 拒絕的連線數 (rejected_connections)。
Redis 從屬節點無法連接至主要節點。 Redis 從屬節點無法連接至主要節點。 master_downtime_seconds.

如需此感應器的相關資訊,請參閱 Redis 文件。

服務

事件 說明 度量
完全捨棄通話。 偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值是否快速下降至零 (基本上不再呼叫服務)。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 呼叫數/秒 (count)。
錯誤率太高。 當過去 4 分鐘內的平均錯誤 KPI 高於給定的臨界值時,偵測到一致的高錯誤率。 錯誤率 (error_rate)。
錯誤率上升趨勢。 檢查給定度量中是否存在遞增趨勢。 規則已調整為偵測給定度量中的弱單調性增加。 不過,該偵測器並不嚴格,且容許在趨勢候選項內的度量值中有一定數量的減少。 錯誤率 (error_rate)。
電話突然掉了下來 偵測呼叫 KPI 度量值相對於過去 30 分鐘內的值快速下降。 呼叫中的捨棄長度也應該超出相對及絕對臨界值參數,如下所示。 呼叫數/秒 (count)。
錯誤率突然增加。 偵測過去 10 分鐘內相對於 KPI 值的錯誤 KPI 值快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 錯誤率 (error_rate)。
延遲突然增加。 偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 延遲 50th (duration.50th)。
一小部分要求的延遲突然增加。 偵測給定延遲 KPI 百分位數相對於過去 30 分鐘內 KPI 值的快速增加。 錯誤增加的幅度也應該超出相對及絕對臨界值參數,如下所示。 延遲 99th (duration.99th)。

Solr

Solr 雲端叢集

事件 說明 度量
無法呼叫到 Solr 節點。 一或多個節點已關閉。 unreachableNodes.

Solr 節點

事件 說明 度量
Solr 快取命中率偏低。 在最後一分鐘, Solr 快取命中率如下: 80% ,可能是因為高收回或用戶端查詢錯誤資料。 Solr 命中率 (hitratio) 及 Solr 收回。

如需此感應器的相關資訊,請參閱 Apache Solr 文件。

Spark

Spark 應用程式

事件 說明 度量
執行程式上的失敗作業。 執行程式上失敗的作業數超出所配置的臨界值。 Spark 應用程式失敗作業。
排程延遲偏高。 排程延遲的增加太快或太高。 排程延遲 (schedulingDelay)。

Spark 獨立式

事件 說明 度量
驅動程式失敗。 失敗的驅動程式數目超出配置的臨界值。 失敗驅動程式數目 (drivers.failed)。
Spark 獨立式主節點正在報告已停用的工作者節點。 已停用的工作程式數目超出配置的臨界值。 死工 (workers.deadWorkers)。
Spark 獨立式主節點正在報告工作程式處於不明狀態。 處於不明狀態的工作者數目超出所配置的臨界值。
提交的應用程式失敗。 失敗的應用程式數目超出配置的臨界值。 工作程式處於不明狀態 (workers.workersInUnknownState)。

如需此感應器的相關資訊,請參閱 Apache Spark 說明文件。

Spring Boot 應用程式

事件 說明 度量
作用中階段作業數已達到數目上限。 處理管線會偵測給定時間範圍內 SpringBoot 應用程式的作用中連線數。 它會驗證作用中階段作業數是否大於臨界值。 作用中階段作業 (metrics.httpsessions.active)。
Spring Boot 應用程式關閉。 監視 SpringBoot 應用程式的狀態。 SpringBoot 應用程式的狀態 (metrics.status)。

如需此感應器的相關資訊,請參閱 Spring Boot 說明文件。

Sybase 伺服器

事件 說明 度量
可用的伺服器連線數已達到限制。 每個伺服器的連線數接近 100% 的連線限制。 連線 (stats.connCount)。
資料庫數目上限為限制。 每個伺服器的資料庫數接近 100% 的資料庫限制。 databasesCount.

如需此感應器的相關資訊,請參閱 Sybase SQL Anywhere 文件。

虛構 PoP

事件 說明 度量
虛構蹦現狀態 檢查虛構 PoP 是否可以連接至 Instana 後端 虛構 PoP 的狀態 (status)
播放引擎狀態 檢查播放引擎是否超載。 播放引擎 (browserscript.workloadStatushttp.workloadStatusjavascript.workloadStatus) 的工作量狀態。
擷取測試失敗 無法從 Instana 後端取得虛構測試。 pop_get_test_failed (error.pop_get_test_failed) 的錯誤碼和 URL。
報告測試結果失敗 無法將虛構測試結果公佈至 Instana 後端。 pop_report_result_failed (error.pop_report_result_failed) 的錯誤碼及 URL。
報告測試 Tesult 詳細資料失敗 無法將綜合測試結果詳細資料公佈至 Instana 後端。 pop_report_result_details_failed (error.pop_report_result_details_failed) 的錯誤碼及 URL。
報告結果佇列深度偏高 偵測結果佇列深度是否偏高 ResultQueueDepthHigh (resultQueueDepthHigh).

如需此感應器的相關資訊,請參閱 虛構 PoP 文件。

Tibco EMS

事件 說明 度量
連線數超出可用連線數上限。 連線數上限幾乎已用完。 連線計數 (connectionCount)。
訊息記憶體用量超出限制。 訊息記憶體上限幾乎已用完。 訊息記憶體 (messagesMemory)。
佇列擱置訊息數超出限制。 佇列的擱置訊息數上限幾乎已用完。 佇列擱置訊息使用情形。
主題擱置訊息超出限制。 主題的擱置訊息數上限幾乎已用完。 主題擱置訊息使用情形。

如需此感應器的相關資訊,請參閱 Tibco EMS 文件。

Tomcat

事件 說明 度量
作用中連線數已達到上限。 偵測特定連接器的連線數是否達到其配置值上限。 連接器連線計數。
階段作業數目突然下降。 檢查階段作業數目是否大幅減少。 階段作業總數 (totalSessionCount)。
會期突然增加。 檢查階段作業數目是否大幅增加。 階段作業總數 (totalSessionCount)。
已達到執行緒數目上限。 偵測特定連接器的忙碌執行緒數目是否達到其配置值上限。 連接器忙碌執行緒數。

如需此感應器的相關資訊,請參閱 Tomcat 說明文件。

Varnish 節點

事件 說明 度量
要求數突然下降。 檢查用戶端要求數目是否突然下降。 已接收用戶端要求 (client_req)。
被叛逃的物體突然增加 檢查收回的物件數目是否突然增加。 Nuked 物件 (n_lru_nuked)。
執行緒建立失敗。 建立太多執行緒失敗。 失敗 (threads_failed) 且受限 (threads_limited)。
清漆後端標示為不健全。 清漆後端伺服器性能不佳或無法使用。 不健全 (backend_unhealthy)。
清漆命中率低。 清漆命中率非常低。 快取命中率 (cache_hit_rate)。
清漆沒有工作執行緒。 清漆沒有工作執行緒。 由於佇列已滿而捨棄連線 (sess_dropped)。

如需此感應器的相關資訊,請參閱 Varnish 文件。

儲存庫

事件 說明 度量
Vault 已密封。 偵測密封狀態是否設為 true。 已密封 (sealed)。
突然增加的秘密閱讀 檢查所讀取的密鑰數目是否突然增加 (根據過去 5 分鐘的平均值增加 60%)。 密鑰讀取計數 (secret.read.count)。

如需此感應器的相關資訊,請參閱 Vault 文件。

WebLogic 伺服器

事件 說明 度量
資料來源錯誤狀態。 處理管線會監視 WebLogicApplications 資料來源的狀態碼,並檢查是否有任何資料來源性能不佳。 WebLogic 資料來源狀態。
性能狀態 根據報告的性能狀態來偵測整體系統退化。 性能狀態。

如需此感應器的相關資訊,請參閱 WebLogic 說明文件。

WebSphere

事件 說明 度量
WebContainer 執行緒儲存區作用中執行緒已達到上限。 處理管線會驗證 WebContainer 執行緒儲存區中的作用中執行緒數目是否達到上限。 作用中執行緒 (threadPools.webContainer.activeThreads)。
WebSphere 憑證即將到期。 憑證有效期限之前的剩餘天數小於臨界值。 到期之前的剩餘天數 (certificates.{certificate}.expDaysLeft)

如需此感應器的相關資訊,請參閱 WebSphere Application Server 文件。

ZooKeeper

事件 說明 度量
要求延遲上限偏高。 處理管線會檢查要求延遲上限是否達到臨界值。 要求延遲上限 (max_request_latency)。
已排入佇列的要求數偏高。 處理管線會偵測已排入佇列的要求數目,並驗證該數目是否達到臨界值。 未完成的要求計數 (outstanding_requests)。

如需此感應器的相關資訊,請參閱 ZooKeeper 說明文件。


  1. 事件擷取自 IBM MQ 事件。 Instana 代理程式會收集這些 IBM MQ 事件,並將它們報告為 Instana 事件。 附註: 若要收集這些事件,您需要啟用「佇列管理程式」效能事件及通道事件。 如需相關資訊,請參閱 額外 IBM MQ 配置↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎